4× RTX 5090 32GB · Qwen3.8-Flash-Next-NVFP4

实测结果

125 GiB 级 MoE 大模型,四张消费级卡跑起来。以下数据来自对应测试环境,用于展示这套配置的真实性能边界与适用条件。

经过博原人工智能调优后的实测数据
4× RTX 5090128 GB 总显存规模:MoE · 512 专家(每次激活 10 个)权重:125.87 GiB(NVFP4 量化)上下文:262,144 tokens 原生支持
4,474 tok/s聚合输入吞吐6 万字 × 60 路 · 冷 prefill
916.6 tok/s聚合输出吞吐256 字短问答 × 20 路 · 关掉 MTP(开 MTP=3 时 533.55)
293 tok/s单路输出真实多 Agent 负载实测最高;受控口径(200K 输入)233
60 / 606 万字并发成功率0 失败 · 0 抢占 · 0 OOM
531,372KV 池生产配置;关掉投机解码后 682,759
0.14 s最低首 token256 字短问答单路;命中缓存的真实负载 1.20 s

模型概览

  • 规模MoE · 512 专家(每次激活 10 个)
  • 权重125.87 GiB(NVFP4 量化)
  • 上下文262,144 tokens 原生支持
  • 结构48 层 = 12 层全注意力 + 36 层线性注意力
  • KV 池531,372 tokens(关闭投机解码后 682,759)

适合做什么

  • 多人在线对话服务
  • Agent 与工具调用
  • 代码生成与重构
  • 25 万字长文一次性分析

使用时要注意

  • 同一台机器上关闭投机解码可把 KV 池从 531,372 提到 682,759 tokens(+28%),代价是单路速度下降。
  • 并发与投机解码的交叉点在 10–12 路:10 人以下开 MTP 更快,12 人以上关掉 MTP 反而更稳(20 路时首 token P95 从 5.753 s 降到 0.548 s)。

选型结论

这台机器的最佳区间是10–20 人同时在线:总计 580–604 tok/s,每人 29–40 tok/s,首 token 半秒左右。20 人以上建议上 8 卡。
获取企业部署建议
单卡

125 GiB 的模型,四张 32GB 的卡怎么装得下?

靠 Expert Parallel(专家并行):512 个专家分散到 4 张卡上,每张卡只背 19.86 GiB 权重,而不是 23.61 GiB —— 省下的显存全部变成 KV 池,扩大 63%。

28,343
单卡显存占用(MiB)
上限 32,607 MiB,占 86.9%
19.86
单卡权重(GiB)
开启专家并行后,原为 23.61 GiB
+63%
KV 池提升
省下的显存全部给了 KV
单卡账面数值说明
权重 + 非 Torch 开销24.36 GiB专家并行后单卡权重降到 19.86 GiB
峰值激活2.58 GiB与批大小相关
CUDA Graph0.34 GiB用于降低解码调度开销
KV Cache1.28 GiB缓存区本身很小,池子容量由总预算决定
单卡实际占用28,343 MiB余量充足,长期运行不紧张
同一台机器上关闭投机解码可把 KV 池从 531,372 提到 682,759 tokens(+28%),代价是单路速度下降。
单路

一个用户有多快?

短问答 0.17 秒出第一个字,单路接近 90 tok/s —— 比人阅读快得多。开启投机解码后单路最高 143.69 tok/s。

0.170 s
首 token(单路)
实测,标准生产配置
143.69
单路最高速度(tok/s)
开启投机解码 MTP=2
217.8
25 万字长文生成(tok/s)
输入 250K + 输出 6K
配置单路速度 tok/s首 token25 万字 + 6K 输出:首 token / 生成速度 / TPOT
生产推荐(不投机解码)88.500.170 s113.33 s / 93 tok/s / 10.73 ms
开启 MTP=1124.610.135 s—
开启 MTP=2143.690.142 s—
当前生产(EP + MTP=3)—59.85 s59.85 s / 217.8 tok/s / 4.58 ms
最后一行是"读 25 万字、输出 6 千字"的实测:相比原始配置(113.33 s / 93 tok/s / 10.73 ms),首 token 快 1.9 倍、生成快 2.3 倍、每字间隔从 10.73 ms 降到 4.58 ms。
多路

能同时服务多少人?

实测 20 路并发全部成功、无排队、无 OOM,总吞吐 605 tok/s 时每路仍有 29 tok/s。真实业务里 20 个人同时用,每个人的首字延迟 P95 只有 0.548 秒。

603.68
峰值总吞吐(tok/s)
15 路并发实测最高点
0.548 s
20 路时首 token P95
真实 20 并发实测
20 / 20
请求成功率
0 失败 · 0 排队 · 0 OOM
并发人数总吞吐 tok/s每人速度 tok/s首 token P50首 token P95
190.5090.500.170 s0.170 s
5288.1357.630.447 s0.454 s
10477.6747.770.443 s0.462 s
15603.6840.250.448 s0.484 s
20580.9529.050.523 s0.548 s
上表为固定口径阶梯测试(不同 prompt、输出 256 token)。下表是更接近真实业务的一次测试:20 个完全不同的请求同时提交,输出 512 token。
真实 20 并发(20 个不同请求)实测
成功 / 总数20 / 20
整体耗时16.493 s
总输出 / 总吞吐7,008 tokens / 424.92 tok/s
每人平均速度21.25 tok/s
首 token P50 / P950.527 s / 0.676 s
完成时间 P50 / P9513.743 s / 16.489 s
排队 / 失败 / OOM无 / 0 / 0
并发与投机解码的交叉点在 10–12 路:10 人以下开 MTP 更快,12 人以上关掉 MTP 反而更稳(20 路时首 token P95 从 5.753 s 降到 0.548 s)。

同配置其他模型

在相同硬件条件下,对比其他已完成实测的模型。