企业级 AI 主力方案博原方案

4× RTX 5090 32GB

主力档:125 GiB 大模型 + 20 人同时在线

四张消费级卡跑起 125 GiB 的 MoE 大模型,实测支撑 20 路并发、每路仍有 29 tok/s,首 token P95 不到 0.55 秒。

4 卡128 GB 总显存Blackwell sm120原生长上下文

适合场景

  • 多人在线推理服务
  • Agent / 工具调用
  • 代码辅助
  • 25 万字长文分析

实测模型

  • Qwen3.8-Flash-Next
  • Qwen3.8-27B
  • 32 GB 单卡显存

选型限制

  • 超长上下文并发受 KV 池容量限制
  • 无 NVLink,跨卡通信需要专项调优
  • 不适合每路 20 万字的大规模并发

推荐理由

  • 适合高并发任务与多用户场景:20 人同时在线,每人仍有 29 tok/s,性价比最高的一档。
  • 可查看对应模型的吞吐、并发与上下文实测结果

选择模型

以下模型已在这套硬件上完成实测,点击进入查看完整数据。

查看全部模型

Qwen3.8-Flash-Next-NVFP4

125 GiB 级 MoE 大模型,四张消费级卡跑起来

查看完整实测
核心实测结果
4,474 tok/s聚合输入吞吐
916.6 tok/s聚合输出吞吐
293 tok/s单路输出
60 / 606 万字并发成功率
531,372KV 池
0.14 s最低首 token
适用任务
多人在线对话服务Agent 与工具调用代码生成与重构25 万字长文一次性分析

这台机器的最佳区间是10–20 人同时在线:总计 580–604 tok/s,每人 29–40 tok/s,首 token 半秒左右。20 人以上建议上 8 卡。

Qwen3.8-27B-NVFP4

同样四张卡,换成小模型 → 长上下文吞吐提升到 6 倍

查看完整实测
核心实测结果
26,049 tok/s聚合 prefill
未测聚合输出吞吐 / 单路输出
60 / 606 万字并发成功率
485,332KV 池
25 万字实测覆盖到
2.65 s最低首 token
适用任务
高并发长文档批处理多用户长上下文问答四张卡全部用满的性价比方案

如果你需要的是长文档批处理和高并发,同样四张卡换成 27B 能拿到 6 倍的吞吐;如果需要1.8 万字以上的一次性长读和更强的通用能力,用 Flash-Next。

其他配置推荐

对比不同卡数和显存规模,找到更贴近业务目标的方案。