大规模高并发方案博原方案

8× RTX 5090 32GB

高并发档:6 万字上下文,120 人同时在线

把八张卡做成两个互不干扰的完整副本,实测 120 路 6 万字上下文请求全部成功,聚合输入吞吐 8,957 tok/s。

8 卡256 GB 总显存Blackwell sm120原生长上下文

适合场景

  • 大规模多人在线服务
  • 部门级/团队级共享推理
  • 长上下文批处理

实测模型

  • Qwen3.8-Flash-Next
  • 32 GB 单卡显存

选型限制

  • 跨 NUMA 的 TP=8 性能损失明显
  • 更适合多副本或单 NUMA 部署
  • 上下文总量仍受 KV 池容量约束

推荐理由

  • 适合百人级在线场景:6 万字上下文 120 路并发全部成功,整机功耗仅 1.68 kW。
  • 可查看对应模型的吞吐、并发与上下文实测结果

选择模型

以下模型已在这套硬件上完成实测,点击进入查看完整数据。

查看全部模型

Qwen3.8-Flash-Next-NVFP4

两个互不干扰的完整副本,把八张卡用满

查看完整实测
核心实测结果
8,957 tok/s聚合输入吞吐
19.1 tok/s聚合输出吞吐
未测单路输出
120 / 1206 万字并发成功率
531,372KV 池
44.35 s最低首 token
适用任务
百人级在线推理团队共享的长上下文服务批量长文档处理

要的是人数而不是单人速度时选这一档:120 人同时在线、每人中等速度,整机功耗仅 1.68 kW。

其他配置推荐

对比不同卡数和显存规模,找到更贴近业务目标的方案。