GPU 推理实测方案博原方案

1× RTX 2080 Ti 22GB

单卡高并发:Qwen3.5-0.8B 128 路并发,聚合输出 4,264.5 tok/s

单张 22GB RTX 2080 Ti 实测 Qwen3.5-0.8B,在 128 路并发、每路 500 tokens 输入 / 1000 tokens 输出的负载下,聚合输出吞吐达到 4,264.5 tok/s。

1 卡22 GB 总显存Turing sm75原生长上下文

适合场景

  • 轻量模型高并发推理
  • 老卡算力复用
  • 批量短文本生成

实测模型

  • Qwen3.5-0.8B
  • 22 GB 单卡显存

选型限制

  • 请结合上下文长度和并发目标选型

推荐理由

  • 22GB 单卡运行 Qwen3.5-0.8B,128 路并发实测总吞吐 6,448 tok/s。
  • 可查看对应模型的吞吐、并发与上下文实测结果

选择模型

以下模型已在这套硬件上完成实测,点击进入查看完整数据。

查看全部模型

Qwen3.5-0.8B

22GB RTX 2080 Ti 单卡上的 128 路高并发实测

查看完整实测
核心实测结果
876,207KV 池容量
128 路并发
≈2,183 tok/s聚合输入吞吐
4,264.5 tok/s聚合输出吞吐
6,448 tok/s总吞吐
30.015 s整轮完成时长
适用任务
高并发轻量问答批量文本生成老卡算力复用

Qwen3.5-0.8B 在 22GB RTX 2080 Ti 上的并发吞吐表现很高,128 路并发下聚合输出吞吐达到 4,264.5 tok/s,总吞吐达到 6,448 tok/s。

其他配置推荐

对比不同卡数和显存规模,找到更贴近业务目标的方案。