4× RTX 5090 32GB · Qwen3.8-27B-NVFP4

实测结果

同样四张卡,换成小模型 → 长上下文吞吐提升到 6 倍。以下数据来自对应测试环境,用于展示这套配置的真实性能边界与适用条件。

经过博原人工智能调优后的实测数据
4× RTX 5090128 GB 总显存规模:dense 27B + 原生 VLM权重:23.44 GB(NVFP4 量化)上下文:262,144(数据并行方案下);约 120,000(单卡副本方案下)
26,049 tok/s聚合 prefill四副本各 1 路 · 单请求 1.8 万字单点测量;并发口径见 4,224(6 万字 × 60 路)
未测聚合输出吞吐 / 单路输出本档只测了 prefill 与长上下文,输出侧两项都没跑
60 / 606 万字并发成功率数据并行方案全部成功;12 万字饱和 28 路、25 万字 8 路
485,332KV 池每副本 121,333,单请求上限约 12 万字
25 万字实测覆盖到本档 25 万字并发 8 路;模型原生支持 26.2 万字
2.65 s最低首 token四副本 · 单请求 1.8 万字;6 万字 5 路冷 prefill 为 57.2 s

模型概览

  • 规模dense 27B + 原生 VLM
  • 权重23.44 GB(NVFP4 量化)
  • 上下文262,144(数据并行方案下);约 120,000(单卡副本方案下)
  • KV 池单卡副本 121,333 tokens;四副本合计 485,332

适合做什么

  • 高并发长文档批处理
  • 多用户长上下文问答
  • 四张卡全部用满的性价比方案

使用时要注意

  • 单路速度与上下文长度强相关:上下文越长,第一次读进去越慢;但读进去之后的多轮对话都能命中缓存。
  • 高上下文(20 万字以上)时加并发完全无效,只能加副本 —— 实测成功数在 20 万字饱和于 12、25 万字饱和于 8。

选型结论

如果你需要的是长文档批处理和高并发,同样四张卡换成 27B 能拿到 6 倍的吞吐;如果需要1.8 万字以上的一次性长读和更强的通用能力,用 Flash-Next。
获取企业部署建议
单卡

四张卡怎么用最划算?

把四张卡做成四个独立副本(每张卡一个完整模型)而不是拼成一张大卡:实测聚合 26,049 tok/s,是数据并行方案的 6.2 倍,而且四个实例互不干扰(最快与最慢只差 5%)。

26,049
四副本聚合 prefill(tok/s)
实测,四张卡全部满速
6,512
每张卡贡献(tok/s)
四副本方案的单位卡效率
485,332
四副本合计 KV(tokens)
每副本 121,333
方案卡数聚合 prefill(tok/s)单请求上下文建议
4× 单卡副本426,049≈ 120K✅ ≤12 万字场景的首选
2× 数据并行 × 双卡张量并行44,220262,144✅ 需要超长上下文时选它
单卡16,534≈ 120K单卡基线
4 卡张量并行4—262,144❌ 跨卡通信开销吃掉收益
四个副本的总功耗实测仅约 760 W(2 副本实测 381 W,按 2 倍推算),远低于 8×400W 的电源上限。
单路

一个用户有多快?

约 1.8 万字的输入,2.7 秒出第一个字;围绕同一份材料反复追问时首 token 约 2 秒。

2.73 s
首 token(1.8 万字输入)
单卡副本实测
≈2.0 s
多轮追问首 token
缓存命中
6,534
prefill 速度(tok/s)
单卡副本
单路速度与上下文长度强相关:上下文越长,第一次读进去越慢;但读进去之后的多轮对话都能命中缓存。
多路

能同时服务多少人?

数据并行方案下,6 万字上下文 60 路并发全部成功,聚合输入 4,224 tok/s —— 是单实例方案的 2.6 倍,首 token 快了 3.2 倍。

60 / 60
6 万字 60 路成功率
数据并行方案,全部成功
4,224
聚合输入吞吐(tok/s)
6 万字 60 路
2.59×
相比单实例的吞吐提升
同一批硬件、同一批 prompt
上下文并发成功 / 总数聚合输入 tok/s首 token p50
60K55/53,18157 s
60K1010/104,211106 s
60K2020/204,214140 s
60K4040/404,221306 s
60K6060/604,224442 s
120K2020/203,861390 s
120K6028/603,707521 s
200K1010/103,433257 s
250K108/102,765333 s
对比单实例方案:6 万字 40 路只能成功 19 个、60 路也只能成功 19 个;数据并行方案是 40/40、60/60。全程 0 抢占、0 OOM。
高上下文(20 万字以上)时加并发完全无效,只能加副本 —— 实测成功数在 20 万字饱和于 12、25 万字饱和于 8。

同配置其他模型

在相同硬件条件下,对比其他已完成实测的模型。