模型共性规格
- 规模
- dense 27B + 原生 VLM
- 上下文
- 262,144 tokens 原生支持
- 结构
- 64 层 = 48 层线性注意力(GDN)+ 16 层全注意力
已完成 NVFP4、ATX-IQ4_XS-M GGUF · MTP-3 多条量化 / 部署路线实测。已在 3 档硬件配置上完成实测,可直接选择机型查看对应结果。
我们的建议先确定上下文和并发目标,再从下方已实测机型中选择。
以下配置均已完成该模型实测;选择后进入对应机型下的完整模型实测页。

NVFP4 · 入门档:一张卡解决 12 万字,两张卡顶到 26 万字

NVFP4 · 主力档:125 GiB 大模型 + 20 人同时在线
ATX-IQ4_XS-M GGUF · MTP-3 · 开源 SM86 专项优化:单卡运行 Qwen3.8-27B + MTP 长上下文
使用各机型已有实测指标进行横向整理。
| 配置 | 量化 / 变体 | 总显存 | 关键实测 | 上下文 | 推荐场景 |
|---|---|---|---|---|---|
| 2× RTX 5090 32GB | NVFP4 | 64 GB | 1,633 tok/s 聚合输入吞吐 | 262,144 tokens 原生支持 | 长文档批处理 |
| 4× RTX 5090 32GB | NVFP4 | 128 GB | 26,049 tok/s 聚合 prefill | 262,144(数据并行方案下);约 120,000(单卡副本方案下) | 多人在线推理服务 |
| 1× RTX 3090 Ti 24GB · llamAmpere | ATX-IQ4_XS-M GGUF · MTP-3 | 24 GB | 99.4 tok/s clean fixtures Decode | 详见实测 | 已有 RTX 3090 Ti 的单卡复用 |
根据不同业务需求快速选择。