适合场景
- 存量 2080 Ti 算力复用
- Qwen3.8-Flash-Next 私有化推理
- 128K 长上下文单路服务
- 预算敏感的旧卡集群改造
8 张 22GB RTX 2080 Ti 组成 176GB 显存池,使用 Qwen3.8-Flash-Next UD-Q4_K_XL GGUF 与 llama.cpp SM75/Qwen4Exp 优化路线,在 128K 上下文档稳定跑通。
以下模型已在这套硬件上完成实测,点击进入查看完整数据。
8×22GB Turing 老卡集群跑通 Flash-Next Q4,稳定单路约 37 tok/s
这套方案的价值不是和 5090 拼峰值,而是把已有的 8×2080 Ti 22GB 资产继续用起来:在 128K 上下文下稳定跑 Qwen3.8-Flash-Next Q4,单路约 37 tok/s,适合预算敏感的旧卡集群改造与私有化推理。
对比不同卡数和显存规模,找到更贴近业务目标的方案。



