2× RTX 5090 32GB · Qwen3.8-27B-NVFP4

实测结果

dense 27B + 原生视觉,一张卡就装得下。以下数据来自对应测试环境,用于展示这套配置的真实性能边界与适用条件。

经过博原人工智能调优后的实测数据
2× RTX 509064 GB 总显存规模:dense 27B + 原生 VLM权重:23.44 GB(NVFP4 量化)上下文:262,144 tokens 原生支持
1,633 tok/s聚合输入吞吐6 万字 × 10 路 · 冷 prefill
未测聚合输出吞吐本机只跑了长上下文 prefill 口径,没测输出吞吐
157 tok/s单路输出他方 recipe 数据,本机栏写的是「未实测」;本机只复现了 KV 池
19 路6 万字最大并发提交 20 / 40 / 60 路时成功数都停在 19;25 万字只剩 1 路
833,295KV 池fp8 KV,可装下 3.18 × 26.2 万字
1.70 s最低首 token6 万字材料多轮追问 · 命中前缀缓存

模型概览

  • 规模dense 27B + 原生 VLM
  • 权重23.44 GB(NVFP4 量化)
  • 上下文262,144 tokens 原生支持
  • 结构64 层 = 48 层线性注意力(GDN)+ 16 层全注意力
  • KV 池双卡 833,295 tokens(3.18× @262K)

适合做什么

  • 长文档理解与批处理
  • 多轮长上下文问答
  • 图片 + 文本混合输入

使用时要注意

  • 单卡在 prefill 阶段功耗会顶到 400W 上限(实测 399.92 / 400.17 W)—— 也就是说这张卡的算力确实被吃满了,不是靠省电换速度。
  • 每种上下文长度的推荐并发(判据:首 token p50 ≤ 300 s):6 万字 5 路、12 万字 3 路、20 万字 2 路、25 万字 1 路。
单卡

一张卡够不够?

够。27B 量化后只有 23.44 GB,一张 32GB 的 5090 就能完整装下权重加 KV。而且单卡反而比双卡快 3.5 倍 —— 双卡要跨卡通信,单卡完全不需要。

6,534
单卡 prefill(tok/s)
实测输入 17,851 tokens
2.73 s
首 token 延迟
单卡单请求,输入 17,851 tokens
121,333
单卡 KV 池(tokens)
可支撑约 12 万字的单请求上下文
方案卡数聚合 prefill(tok/s)单请求上下文说明
单卡 TP=116,534≈ 120K零跨卡通信,速度最快
2 副本(2× TP=1)212,891≈ 120K/副本线性扩展,2.02×
4 副本(4× TP=1)426,049≈ 120K/副本线性扩展,4.0×
双卡 TP=221,723262,144要超长上下文才需要;代价是通信开销
实测提示:追求速度且上下文 ≤12 万字,请用单卡;需要 26 万字全上下文,才上双卡 TP=2。我们会按你的实际场景配。
单卡在 prefill 阶段功耗会顶到 400W 上限(实测 399.92 / 400.17 W)—— 也就是说这张卡的算力确实被吃满了,不是靠省电换速度。
单路

一个用户用起来是什么感觉?

要分两种用法看:一次性读完一整篇长文档是"等它读完"的批处理体验;围绕同一份材料反复追问时,缓存会命中,首 token 只要 2 秒,就是正常的对话体验。

≈2.0 s
多轮追问首 token
缓存命中后实测(p50 1.7–2.4 s)
≈195 s
一次读完 25 万字
冷启动,单请求
96.1%
纯重复提问命中率
prefix cache 实测
用法每轮要重新读的 token首 token 实测体验
多轮追问(12 万字材料)约 1,9003.16 / 2.41 s✅ 完全可交互
多轮追问(6 万字材料)约 1,900p50 ≈ 2.0 s✅ 完全可交互
同一问题纯重复1,9001.76 s(四轮一致)✅ 下限
冷启动读全新 6 万字60,000≈ 37 s⚠️ 适合离线批处理
冷启动读全新 25 万字250,000≈ 195 s⚠️ 适合离线批处理
prefix cache 命中率实测:6 万字多轮 71.8%、12 万字多轮 81.0%、纯重复 96.1%。命中率是决定首 token 的唯一关键变量。
多路

能同时服务几个人?

6 万字上下文的场景下,19 路是这台机器的天花板;再多加并发不会变快,只会让每个人多等 —— 因为引擎一次只能真正跑 2–3 个请求,其余都在排队。

1,630
聚合输入吞吐(tok/s)
6 万字 × 5 路,实测
19 路
6 万字最大并发
超过则只排队、不再增加成功数
5 路
推荐生产并发
判据:首 token 不超过 300 s
上下文并发成功 / 总数聚合输入 tok/s首 token p50
60K55/51,630184 s
60K1010/101,633303 s
60K2019/201,575441 s
60K4019/401,570440 s
60K6019/601,567287 s
120K109/101,490340 s
200K55/51,400313 s
250K54/51,107417 s
「成功数」停在 19(12 万字是 9)不是引擎崩了,而是排在后面的请求等待超过了客户端超时。全程 0 抢占、0 OOM。
每种上下文长度的推荐并发(判据:首 token p50 ≤ 300 s):6 万字 5 路、12 万字 3 路、20 万字 2 路、25 万字 1 路。