适合场景
- 轻量模型高并发推理
- 老卡算力复用
- 批量短文本生成
单张 22GB RTX 2080 Ti 实测 Qwen3.5-0.8B,在 128 路并发、每路 500 tokens 输入 / 1000 tokens 输出的负载下,聚合输出吞吐达到 4,264.5 tok/s。
以下模型已在这套硬件上完成实测,点击进入查看完整数据。
22GB RTX 2080 Ti 单卡上的 128 路高并发实测
Qwen3.5-0.8B 在 22GB RTX 2080 Ti 上的并发吞吐表现很高,128 路并发下聚合输出吞吐达到 4,264.5 tok/s,总吞吐达到 6,448 tok/s。
对比不同卡数和显存规模,找到更贴近业务目标的方案。




