专业级超长上下文方案博原方案

4× RTX PRO 6000 96GB

旗舰档:10 路 × 25 万字同时跑,64 路短问题高并发

单卡 96GB、总算力与显存都是消费级的三倍。10 路 25 万字长上下文同时进行全部成功,短问题高并发输出吞吐 3,245 tok/s。

4 卡384 GB 总显存Blackwell sm120原生长上下文

适合场景

  • 超长上下文 + 高并发同时要
  • 企业级共享推理池
  • 大批量文档处理

实测模型

  • DeepSeek-V4-Flash
  • 96 GB 单卡显存

选型限制

  • 384GB 总显存不代表计算吞吐无限提升
  • 超长上下文并发仍会明显拉高首 token 等待
  • 部署时仍需结合四卡调度、功耗与业务负载评估

推荐理由

  • 适合大模型与高并发兼顾的场景:单卡 96GB,10 路 × 25 万字长上下文同时进行。
  • 可查看对应模型的吞吐、并发与上下文实测结果

选择模型

以下模型已在这套硬件上完成实测,点击进入查看完整数据。

查看全部模型

DeepSeek-V4-Flash-NVFP4

96GB 单卡显存,把长上下文和并发同时拉满

查看完整实测
核心实测结果
≈18,900 tok/s聚合 prefill
3,245 tok/s聚合输出吞吐
290.05 tok/s单路输出
64 路短问题同时在线
43.1%KV 占用
140.97 ms最低首 token
适用任务
超长文档并发处理大规模办公/文档工作流对并发人数有硬要求的场景

当你同时需要超长上下文和高并发人数时选这一档:10 路 25 万字 + 64 路短问题都能扛住,且显存仍有 57% 余量。

其他配置推荐

对比不同卡数和显存规模,找到更贴近业务目标的方案。