Wei's banner
Wei's profile picture

Wei

@wei_wang • 6,046 subscribers

13y mobile vet | $100M EM | Building ecom brands with China supplier network | AI tools & cross-border ecom 🇺🇸 13年移动端老兵 | 美国电商创业 | 分享AI工具 & 出海实操

Shorts

有一种自己也断掉的心痛感

Sensitive content

有一种自己也断掉的心痛感

555,217 views

在我的 RTX PRO 6000 上部署的 Qwen3.8-Flash-Next 也测了一下鹈鹕骑车 感觉比降智的 Astra 还是要厉害一丢丢

在我的 RTX PRO 6000 上部署的 Qwen3.8-Flash-Next 也测了一下鹈鹕骑车 感觉比降智的 Astra 还是要厉害一丢丢

44,330 views

刚在我的RTX PRO 6000 96GB 上部署了 Qwen3.8-Flash-Next。 这是一个约 176B 总参数、每个 token 激活约 6B 的 MoE 模型,其中包括 125B 主模型和约 51B 的 PLE n-gram embedding table,同时保留完整 256K 上下文。 这么大的模型能跑进单张 96GB 显卡,靠的是分层处理。 MoE 专家权重使用 EXL3 混合 K4/K5 量化,平均约 4.25 bit。47.68GiB 的 PLE table 压成 FP8 后通过 mmap 放在 NVMe 上按需读取,Token embedding 放进系统内存,FP8 KV Cache 留给长上下文。 模型实际加载约占 71.99GiB 显存,整卡实测峰值约 91.4GiB,刚好控制在 96GB 以内。 Decode 和 prefill 速度超级猛,感觉在飞。 Prose c1 160.7 tok/s c2 268.1 tok/s c4 418.6 tok/s c8 645.3 tok/s c16 975.4 tok/s Prefill 在不同上下文长度下基本维持在每秒 7600 到 8240 tokens。 4K 上下文首字等待 543ms,8K 为 1.03 秒,16K 为 2.01 秒,32K 为 3.98 秒。 单用户生成超过 160 tok/s,16 路并发总吞吐接近 1000 tok/s。 给你们看看16路并发的的效果👇️

刚在我的RTX PRO 6000 96GB 上部署了 Qwen3.8-Flash-Next。 这是一个约 176B 总参数、每个 token 激活约 6B 的 MoE 模型,其中包括 125B 主模型和约 51B 的 PLE n-gram embedding table,同时保留完整 256K 上下文。 这么大的模型能跑进单张 96GB 显卡,靠的是分层处理。 MoE 专家权重使用 EXL3 混合 K4/K5 量化,平均约 4.25 bit。47.68GiB 的 PLE table 压成 FP8 后通过 mmap 放在 NVMe 上按需读取,Token embedding 放进系统内存,FP8 KV Cache 留给长上下文。 模型实际加载约占 71.99GiB 显存,整卡实测峰值约 91.4GiB,刚好控制在 96GB 以内。 Decode 和 prefill 速度超级猛,感觉在飞。 Prose c1 160.7 tok/s c2 268.1 tok/s c4 418.6 tok/s c8 645.3 tok/s c16 975.4 tok/s Prefill 在不同上下文长度下基本维持在每秒 7600 到 8240 tokens。 4K 上下文首字等待 543ms,8K 为 1.03 秒,16K 为 2.01 秒,32K 为 3.98 秒。 单用户生成超过 160 tok/s,16 路并发总吞吐接近 1000 tok/s。 给你们看看16路并发的的效果👇️

22,000 views