4× RTX PRO 6000 96GB · DeepSeek-V4-Flash-NVFP4

实测结果

96GB 单卡显存,把长上下文和并发同时拉满。以下数据来自对应测试环境,用于展示这套配置的真实性能边界与适用条件。

经过博原人工智能调优后的实测数据
4× RTX PRO 6000384 GB 总显存规模:未记录权重:未记录量化:NVFP4
≈18,900 tok/s聚合 prefill10 路 × 25 万字
3,245 tok/s聚合输出吞吐64 路短问题 · 640 个请求
290.05 tok/s单路输出三次单路实测最好成绩,均值 282
64 路短问题同时在线另有 10 路 × 25 万字长上下文全部成功
43.1%KV 占用池大小与 KV 类型未记录
140.97 ms最低首 token64 路短问题 · 中位

模型概览

  • 规模未记录
  • 权重未记录
  • 量化NVFP4
  • 单卡显存96 GB(是 RTX 5090 的 3 倍)
  • 总显存384 GB

适合做什么

  • 超长文档并发处理
  • 大规模办公/文档工作流
  • 对并发人数有硬要求的场景

使用时要注意

  • 博原实测数据。该次测试未完整保留启动参数,因此页面只展示已确认的性能结果与测试口径。
  • 实测结论(原文):这是受 GPU 计算能力限制、而不是受显存限制的配置 —— 继续加超长上下文并发,先恶化的是首 token 等待与单路速度,不是显存溢出。

选型结论

当你同时需要超长上下文和高并发人数时选这一档:10 路 25 万字 + 64 路短问题都能扛住,且显存仍有 57% 余量。
获取企业部署建议
数据口径说明博原实测数据。该次测试未完整保留启动参数,因此页面只展示已确认的性能结果与测试口径。
单卡

96GB 单卡意味着什么?

意味着瓶颈换了一个:在 5090 上限制你的是显存能装多少上下文,在这台机器上限制你的是 GPU 算力本身 —— 实测跑 10 路 25 万字时,KV 缓存只用了 43%。

96 GB
单卡显存
RTX 5090 的三倍
43.1%
10 路 25 万字时的 KV 占用
显存还有大量余量
384 GB
总显存
四张卡合计
实测结论(原文):这是受 GPU 计算能力限制、而不是受显存限制的配置 —— 继续加超长上下文并发,先恶化的是首 token 等待与单路速度,不是显存溢出。
单路

一个用户有多快?

单路实测 282 tok/s(三次 277.86 / 278.78 / 290.05),是本次全部配置里单路最快的。

282.23
单路速度(tok/s)
三次实测均值
290.05
单路最高(tok/s)
三次中的最好成绩
4.35
每字间隔(ms)
TPOT,越小越顺
多路

能同时服务多少人?

两种极端场景都实测过:64 路短问题(每人 65 字输入、2,048 字输出)输出吞吐 3,245 tok/s、首 token 中位仅 0.14 秒;10 路 25 万字超长上下文全部成功。

3,245
64 路输出吞吐(tok/s)
640 个请求
140.97 ms
64 路首 token 中位
0.14 秒,几乎无感
≈1,100
10 路 25 万字生成阶段(tok/s)
全部成功,0 失败
场景并发请求数单请求输入 / 输出吞吐首 token每字间隔
短问题高并发6464065 / 2,0483,245.17 tok/s140.97 ms19.09 ms
超长上下文1010258,048 / 4,096≈1,100 tok/s136.46 s35.07 ms
单路13—282.23 tok/s——
长上下文那一行的"成绩页 Output Throughput 142.45 tok/s"是把约 136 秒的 prefill 等待摊进平均值的结果,不能代表稳定生成速度 —— 真实生成阶段约 1,100 tok/s。
多 Agent 办公/文档工作流的并发退化实测
同时工作的 Agent 数总请求总输入 tokens平均输出吞吐首 token 中位每字间隔每人感受
4203,659,05487.33 tok/s12.59 s16.80 ms59.5 tok/s
8407,319,58992.69 tok/s18.02 s50.84 ms19.7 tok/s
105014,074,94153.34 tok/s38.10 s100.59 ms9.9 tok/s
10 个 Agent 时每人速度从 59.5 掉到 9.9 tok/s,但 KV 缓存峰值只有 43.1% —— 再次印证瓶颈在计算而非显存。建议按约 10 路规划满 25 万字的高性能并发。