1× RTX 3090 Ti 24GB · llamAmpere · Qwen3.8-27B · llamAmpere ATX-IQ4_XS-M

实测结果

单张 RTX 3090 Ti 24GB 上的 SM86 专项优化与 MTP 长上下文方案。以下数据来自对应测试环境,用于展示这套配置的真实性能边界与适用条件。

方案来源:JakeATX / llamAmpere · v0.3.1
1× RTX 3090 Ti 24GB24 GB 总显存模型:Qwen3.8-27BGPU:RTX 3090 Ti 24GB · 350W(公开主表测试卡)量化:ATX-IQ4_XS-M · 4.56 bpw
99.4 tok/sclean fixtures Decodev0.3 全部 clean fixtures 平均
93.16 tok/s100K KV Decode100K-token prompt · temperature 1 · MTP-3
112.4 tok/s32K 单流 Decodev0.3;同文档 tuned vLLM MTP-4 为 101.7
237,568桌面环境建议 Contextq8_0/turbo3 · whole-card 23GB budget
245,760最大实测窗口显卡基本独占 / headless 条件
14.5 GiBGGUF 文件大小ATX-IQ4_XS-M · 4.56 bpw

模型概览

  • 模型Qwen3.8-27B
  • GPURTX 3090 Ti 24GB · 350W(公开主表测试卡)
  • 量化ATX-IQ4_XS-M · 4.56 bpw
  • 模型文件14.5 GiB;约 13.9 GiB GPU 权重占用
  • 推理框架llamAmpere v0.3.1 · llama.cpp / TurboQuant 衍生 fork

适合做什么

  • 单用户 Agent / Coding
  • 100K+ 长会话
  • 3090 / 3090 Ti 存量卡复用
  • 开源性能优化复现

使用时要注意

  • 开源方案来源:JakeATX/llamAmpere。v0.3.1(2026-09-18)为格式扩展版本,文档明确说明 ATX IQ4_XS 路线与 v0.3 保持不变,因此本页主要性能数字来自其 v0.3 公开基准。博原尚未在本机复测这些结
  • 文档记录服务器侧 245,760-token 窗口可运行;若桌面还占用约 800MiB 显存,作者建议使用 237,568 以控制整卡峰值预算。
  • v0.3.1 没有改变 ATX IQ4_XS 主路线,release notes 明确写明 v0.3 的该路线成绩继续有效。
  • 网站将其归类为“开源单卡方案”,不把单用户成绩外推成多并发吞吐。

选型结论

如果已有 RTX 3090 Ti 24GB,并且目标是单用户 Qwen3.8-27B、长上下文和较高 Decode 速度,这是一条值得参考和复现的开源路线;它不是博原自测,也不是面向高并发的方案。
获取企业部署建议
数据口径说明开源方案来源:JakeATX/llamAmpere。v0.3.1(2026-09-18)为格式扩展版本,文档明确说明 ATX IQ4_XS 路线与 v0.3 保持不变,因此本页主要性能数字来自其 v0.3 公开基准。博原尚未在本机复测这些结果。
单卡

24GB 单卡怎么装下 Qwen3.8-27B 和长上下文?

方案使用 ATX-IQ4_XS-M(4.56 bpw) 权重、SM86 专项 CUDA kernel、TurboQuant+ KV cache 与模型自带 MTP head。公开文档记录模型文件约 14.5 GiB、GPU 权重约 13.9 GiB,为 KV 和 drafter 留出显存。

24 GB
单卡显存
RTX 3090 Ti
14.5 GiB
模型文件
ATX-IQ4_XS-M
237,568
桌面环境建议窗口
q8_0 / turbo3
项目公开方案
GPURTX 3090 Ti 24GB · 350W
模型Qwen3.8-27B
量化ATX-IQ4_XS-M · 4.56 bpw
KVq8_0 K / turbo3 V
MTPMTP-3 · exact p/q verification
并发parallel 1 · 单用户
仓库说明同时支持 RTX 3090 / 3090 Ti;这里的性能数字只按作者公开主表的 RTX 3090 Ti 测试口径展示。
文档记录服务器侧 245,760-token 窗口可运行;若桌面还占用约 800MiB 显存,作者建议使用 237,568 以控制整卡峰值预算。
单路

单路 Decode 能到多少?

v0.3 在干净 agentic / coding fixtures 上平均 99.4 tok/s;100K KV 深度下仍有 93.16 tok/s。32K / 64K 单流分别公开为 112.4 / 100.7 tok/s。

99.4
Clean Fixtures(tok/s)
MTP-3 · temperature 1
93.16
100K KV(tok/s)
100K prompt 深度
112.4
32K 单流(tok/s)
同口径 tuned vLLM 为 101.7
场景llamAmpere对照 / 备注
clean fixtures99.4 tok/sstock llama.cpp 67.9;v0.2 77.9
100K KV depth93.16 tok/supstream TurboQuant 54.96
32K 单流112.4 tok/stuned vLLM MTP-4 101.7
64K 单流100.7 tok/stuned vLLM MTP-4 90.3
200K populated context(v0.1 测量)65 tok/sprefill 694 tok/s
不同对照来自项目作者同一文档的公开基准;工作负载、版本和深度不同,不能把这些数字直接当成统一排行榜。
v0.3.1 没有改变 ATX IQ4_XS 主路线,release notes 明确写明 v0.3 的该路线成绩继续有效。
多路

这是多并发方案吗?

不是。作者明确把主方案写为 Single-user configuration: --parallel 1。它重点优化的是 24GB 单卡上的单流 Decode、MTP speculative decoding 和长上下文保持能力。

1 路
公开主配置
parallel 1
MTP-3
投机解码深度
v0.3 主成绩口径
245,760
最大实测窗口
显卡基本独占条件
网站将其归类为“开源单卡方案”,不把单用户成绩外推成多并发吞吐。