适合场景
- 已有 RTX 3090 Ti 的单卡复用
- Qwen3.8-27B 单用户 Agent / Coding
- 100K+ 长上下文会话
- 希望复现开源 SM86 优化路线的用户
来源于 JakeATX/llamAmpere 的公开方案。面向 RTX 3090 / 3090 Ti 的 SM86 专项优化;公开主表数据在 RTX 3090 Ti 350W 上测得,Qwen3.8-27B 可在 24GB 单卡上运行长上下文并使用原生 MTP speculative decoding。
以下模型已在这套硬件上完成实测,点击进入查看完整数据。
单张 RTX 3090 Ti 24GB 上的 SM86 专项优化与 MTP 长上下文方案
如果已有 RTX 3090 Ti 24GB,并且目标是单用户 Qwen3.8-27B、长上下文和较高 Decode 速度,这是一条值得参考和复现的开源路线;它不是博原自测,也不是面向高并发的方案。
对比不同卡数和显存规模,找到更贴近业务目标的方案。




