模型概览
- 模型Qwen3.8-27B
- GPURTX 3090 Ti 24GB · 350W(公开主表测试卡)
- 量化ATX-IQ4_XS-M · 4.56 bpw
- 模型文件14.5 GiB;约 13.9 GiB GPU 权重占用
- 推理框架llamAmpere v0.3.1 · llama.cpp / TurboQuant 衍生 fork
单张 RTX 3090 Ti 24GB 上的 SM86 专项优化与 MTP 长上下文方案。以下数据来自对应测试环境,用于展示这套配置的真实性能边界与适用条件。
方案来源:JakeATX / llamAmpere · v0.3.1方案使用 ATX-IQ4_XS-M(4.56 bpw) 权重、SM86 专项 CUDA kernel、TurboQuant+ KV cache 与模型自带 MTP head。公开文档记录模型文件约 14.5 GiB、GPU 权重约 13.9 GiB,为 KV 和 drafter 留出显存。
| 项目 | 公开方案 |
|---|---|
| GPU | RTX 3090 Ti 24GB · 350W |
| 模型 | Qwen3.8-27B |
| 量化 | ATX-IQ4_XS-M · 4.56 bpw |
| KV | q8_0 K / turbo3 V |
| MTP | MTP-3 · exact p/q verification |
| 并发 | parallel 1 · 单用户 |
v0.3 在干净 agentic / coding fixtures 上平均 99.4 tok/s;100K KV 深度下仍有 93.16 tok/s。32K / 64K 单流分别公开为 112.4 / 100.7 tok/s。
| 场景 | llamAmpere | 对照 / 备注 |
|---|---|---|
| clean fixtures | 99.4 tok/s | stock llama.cpp 67.9;v0.2 77.9 |
| 100K KV depth | 93.16 tok/s | upstream TurboQuant 54.96 |
| 32K 单流 | 112.4 tok/s | tuned vLLM MTP-4 101.7 |
| 64K 单流 | 100.7 tok/s | tuned vLLM MTP-4 90.3 |
| 200K populated context(v0.1 测量) | 65 tok/s | prefill 694 tok/s |
不是。作者明确把主方案写为 Single-user configuration: --parallel 1。它重点优化的是 24GB 单卡上的单流 Decode、MTP speculative decoding 和长上下文保持能力。
根据你的模型、并发与业务场景,获取对应的算力部署建议。