模型概览
- 规模MoE · 512 专家(每次激活 10 个)
- 权重125.87 GiB(NVFP4 量化)
- 上下文262,144 tokens
- 部署形态两个独立副本(GPU 0–3 / GPU 4–7),各自绑定一个 NUMA 节点
- KV 池每副本 531,372 tokens
两个互不干扰的完整副本,把八张卡用满。以下数据来自对应测试环境,用于展示这套配置的真实性能边界与适用条件。
做成两个各自独立的完整副本,而不是一个跨八卡的大模型 —— 跨卡通信的开销会吃掉加卡的收益。实测:单副本 ↔ 两副本严格 1:1 对照,比值收敛到精确的 2.00×,两个副本各自满速、零争抢。
| 配置 | 卡数 | 单副本 prefill(tok/s) | 两副本合计 | 对照比值 |
|---|---|---|---|---|
| 单副本 TP=4 | 4 | 4,403 | — | 基准 |
| 两副本(本配置) | 8 | 4,474 | 8,957 | 2.00× |
单副本的吞吐已由自身内部的通信开销限死:加并发只增加等待,不会增加吞吐。因此这台机器适合"很多人同时用、每人中等速度",不适合"一个人追求极限速度"。
实测 120 路 × 6 万字全部成功,聚合输入吞吐 8,957 tok/s,整机功耗稳定在 1,681 W。这是本档配置最强的能力。
| 并发路数 | 成功 / 总数 | 聚合输入 tok/s | 首 token p50 | 首 token p95 | 整机功耗 |
|---|---|---|---|---|---|
| 10 | 10/10 | 8,385 | 44 s | 67 s | 1,675 W |
| 20 | 20/20 | 8,691 | 83 s | 134 s | 1,680 W |
| 40 | 40/40 | 8,844 | 157 s | 252 s | 1,681 W |
| 80 | 80/80 | 8,928 | 265 s | 523 s | 1,679 W |
| 120 | 120/120 | 8,957 | 424 s | 770 s | 1,681 W |
根据你的模型、并发与业务场景,获取对应的算力部署建议。