GPU 推理实测方案JakeATX / llamAmpere · v0.3.1

1× RTX 3090 Ti 24GB · llamAmpere

开源 SM86 专项优化:单卡运行 Qwen3.8-27B + MTP 长上下文

来源于 JakeATX/llamAmpere 的公开方案。面向 RTX 3090 / 3090 Ti 的 SM86 专项优化;公开主表数据在 RTX 3090 Ti 350W 上测得,Qwen3.8-27B 可在 24GB 单卡上运行长上下文并使用原生 MTP speculative decoding。

1 卡24 GB 总显存Ampere sm86原生长上下文

适合场景

  • 已有 RTX 3090 Ti 的单卡复用
  • Qwen3.8-27B 单用户 Agent / Coding
  • 100K+ 长上下文会话
  • 希望复现开源 SM86 优化路线的用户

实测模型

  • Qwen3.8-27B · llamAmpere ATX-IQ4_XS-M
  • 24 GB 单卡显存

选型限制

  • 请结合上下文长度和并发目标选型

推荐理由

  • JakeATX/llamAmpere v0.3.1:RTX 3090 Ti 24GB 上的 Qwen3.8-27B SM86 优化路线,公开成绩最高约 99 tok/s,支持 200K+ 上下文。
  • 可查看对应模型的吞吐、并发与上下文实测结果

选择模型

以下模型已在这套硬件上完成实测,点击进入查看完整数据。

查看全部模型

Qwen3.8-27B · llamAmpere ATX-IQ4_XS-M

单张 RTX 3090 Ti 24GB 上的 SM86 专项优化与 MTP 长上下文方案

查看完整实测
核心实测结果
99.4 tok/sclean fixtures Decode
93.16 tok/s100K KV Decode
112.4 tok/s32K 单流 Decode
237,568桌面环境建议 Context
245,760最大实测窗口
14.5 GiBGGUF 文件大小
适用任务
单用户 Agent / Coding100K+ 长会话3090 / 3090 Ti 存量卡复用开源性能优化复现

如果已有 RTX 3090 Ti 24GB,并且目标是单用户 Qwen3.8-27B、长上下文和较高 Decode 速度,这是一条值得参考和复现的开源路线;它不是博原自测,也不是面向高并发的方案。

其他配置推荐

对比不同卡数和显存规模,找到更贴近业务目标的方案。