8× RTX 5090 32GB · Qwen3.8-Flash-Next-NVFP4

实测结果

两个互不干扰的完整副本,把八张卡用满。以下数据来自对应测试环境,用于展示这套配置的真实性能边界与适用条件。

经过博原人工智能调优后的实测数据
8× RTX 5090256 GB 总显存规模:MoE · 512 专家(每次激活 10 个)权重:125.87 GiB(NVFP4 量化)上下文:262,144 tokens
8,957 tok/s聚合输入吞吐6 万字 × 120 路 · 冷 prefill · 两副本合计
19.1 tok/s聚合输出吞吐6 万字 × 120 路 · 长上下文口径;本档没跑短问答档,所以远低于 4 卡的 916
未测单路输出本档只跑了长上下文 120 路口径,没有单路实测;实测上下文也只到 6 万字
120 / 1206 万字并发成功率0 失败 · 0 抢占 · 0 OOM
531,372KV 池两副本合计未记录,不做折算
44.35 s最低首 token6 万字 × 10 路 · 冷 prefill(p50)

模型概览

  • 规模MoE · 512 专家(每次激活 10 个)
  • 权重125.87 GiB(NVFP4 量化)
  • 上下文262,144 tokens
  • 部署形态两个独立副本(GPU 0–3 / GPU 4–7),各自绑定一个 NUMA 节点
  • KV 池每副本 531,372 tokens

适合做什么

  • 百人级在线推理
  • 团队共享的长上下文服务
  • 批量长文档处理

使用时要注意

  • 关键取舍:加卡带来的是线性扩容,不是效率提升。如果预算敏感,四张卡跑 27B 的每卡效率比八张卡跑 Flash-Next 高 5.8 倍。
  • 上面都是"冷启动读长文档"的口径。真实多轮对话场景下,缓存命中后首 token 约 2 秒,体验与普通对话无异。

选型结论

要的是人数而不是单人速度时选这一档:120 人同时在线、每人中等速度,整机功耗仅 1.68 kW。
获取企业部署建议
单卡

八张卡怎么组织?

做成两个各自独立的完整副本,而不是一个跨八卡的大模型 —— 跨卡通信的开销会吃掉加卡的收益。实测:单副本 ↔ 两副本严格 1:1 对照,比值收敛到精确的 2.00×,两个副本各自满速、零争抢。

2.00×
两副本 / 单副本
严格 1:1 对照实测
<3%
两个副本的耗时差异
说明没有互相抢资源
215 W
单卡功耗
上限 450W,余量充足
配置卡数单副本 prefill(tok/s)两副本合计对照比值
单副本 TP=444,403—基准
两副本(本配置)84,4748,9572.00×
四副本方案(每张卡一个完整副本)理论上可以再翻倍,但未实测,不作为承诺。
关键取舍:加卡带来的是线性扩容,不是效率提升。如果预算敏感,四张卡跑 27B 的每卡效率比八张卡跑 Flash-Next 高 5.8 倍。
单路

一个用户有多快?

单副本的吞吐已由自身内部的通信开销限死:加并发只增加等待,不会增加吞吐。因此这台机器适合"很多人同时用、每人中等速度",不适合"一个人追求极限速度"。

49.68 s
首 token p50(5 路)
冷 prefill 6 万字口径
4,403
单副本聚合吞吐(tok/s)
几乎不随并发变化
0.30
120 路时每路速度(tok/s)
长上下文批处理口径
上面都是"冷启动读长文档"的口径。真实多轮对话场景下,缓存命中后首 token 约 2 秒,体验与普通对话无异。
多路

能同时服务多少人?

实测 120 路 × 6 万字全部成功,聚合输入吞吐 8,957 tok/s,整机功耗稳定在 1,681 W。这是本档配置最强的能力。

120 / 120
6 万字并发成功率
0 失败 · 0 抢占 · 0 OOM
8,957
聚合输入吞吐(tok/s)
两副本合计
423.58 s
120 路首 token p50
冷 prefill 口径
并发路数成功 / 总数聚合输入 tok/s首 token p50首 token p95整机功耗
1010/108,38544 s67 s1,675 W
2020/208,69183 s134 s1,680 W
4040/408,844157 s252 s1,681 W
8080/808,928265 s523 s1,679 W
120120/1208,957424 s770 s1,681 W
功耗几乎不随并发变化(1,675–1,681 W),说明整机一直在满负荷稳定工作;KV 峰值占用 74.9%,仍有约 1/4 余量。