1× RTX 2080 Ti 22GB · Qwen3.5-0.8B

实测结果

22GB RTX 2080 Ti 单卡上的 128 路高并发实测。以下数据来自对应测试环境,用于展示这套配置的真实性能边界与适用条件。

经过博原人工智能调优后的实测数据
1× RTX 2080 Ti 22GB22 GB 总显存规模:0.8B版本:官方原版 · 无量化后缀模型标识:Qwen3.5-0.8B
876,207KV 池容量单卡实测
128 路并发500 入 / 1000 出
≈2,183 tok/s聚合输入吞吐128 路并发
4,264.5 tok/s聚合输出吞吐128 路并发
6,448 tok/s总吞吐输入 + 输出
30.015 s整轮完成时长128 路请求全部完成

模型概览

  • 规模0.8B
  • 版本官方原版 · 无量化后缀
  • 模型标识Qwen3.5-0.8B
  • 统计规则与 NVFP4 / GPTQ / AWQ / FP 等其他版本独立统计

适合做什么

  • 高并发轻量问答
  • 批量文本生成
  • 老卡算力复用

使用时要注意

  • 博原本机实测。单卡 RTX 2080 Ti 22GB;128 路并发,每路 500 tokens 输入 / 1000 tokens 输出。

选型结论

Qwen3.5-0.8B 在 22GB RTX 2080 Ti 上的并发吞吐表现很高,128 路并发下聚合输出吞吐达到 4,264.5 tok/s,总吞吐达到 6,448 tok/s。
获取企业部署建议
数据口径说明博原本机实测。单卡 RTX 2080 Ti 22GB;128 路并发,每路 500 tokens 输入 / 1000 tokens 输出。
单卡

单张 RTX 2080 Ti 22GB 能跑到什么规模?

Qwen3.5-0.8B 在这张 22GB RTX 2080 Ti 上的 KV 池容量达到 876,207 tokens,本轮提交 128 路请求全部完成。

22 GB
单卡显存
RTX 2080 Ti 魔改版
876,207
KV 池(tokens)
本次实测
128 / 128
请求完成
0 失败
单路

这一轮请求处理得有多快?

128 路并发、每路 500 tokens 输入 / 1000 tokens 输出,整轮完成时长约 30.015 秒。

30.015 s
整轮完成时长
128 路并发
≈2,183 tok/s
聚合输入吞吐
总输入速率
4,264.5 tok/s
聚合输出吞吐
总生成速率
多路

128 路并发时整机吞吐是多少?

本次 128 路并发的输入 + 输出聚合总吞吐为 6,448 tok/s,按全天满载粗略折算,日输出约 3.68 亿 tokens、日总吞吐约 5.57 亿 tokens。

128 路
并发
500 入 / 1000 出
6,448 tok/s
总吞吐
输入 + 输出
≈5.57 亿
日总 tokens
理论满载折算
KV 池并发负载输入吞吐输出吞吐总吞吐整轮完成日输出日总吞吐
876,207 tokens128×(500 入 / 1000 出)≈2,183 tok/s4,264.5 tok/s6,448 tok/s30.015 s≈3.68 亿 tokens≈5.57 亿 tokens
单卡实测。日 token 数为按对应吞吐持续满载 24 小时的理论折算值。