模型概览
- 规模0.8B
- 版本官方原版 · 无量化后缀
- 模型标识Qwen3.5-0.8B
- 统计规则与 NVFP4 / GPTQ / AWQ / FP 等其他版本独立统计
22GB RTX 2080 Ti 单卡上的 128 路高并发实测。以下数据来自对应测试环境,用于展示这套配置的真实性能边界与适用条件。
Qwen3.5-0.8B 在这张 22GB RTX 2080 Ti 上的 KV 池容量达到 876,207 tokens,本轮提交 128 路请求全部完成。
128 路并发、每路 500 tokens 输入 / 1000 tokens 输出,整轮完成时长约 30.015 秒。
本次 128 路并发的输入 + 输出聚合总吞吐为 6,448 tok/s,按全天满载粗略折算,日输出约 3.68 亿 tokens、日总吞吐约 5.57 亿 tokens。
| KV 池 | 并发负载 | 输入吞吐 | 输出吞吐 | 总吞吐 | 整轮完成 | 日输出 | 日总吞吐 |
|---|---|---|---|---|---|---|---|
| 876,207 tokens | 128×(500 入 / 1000 出) | ≈2,183 tok/s | 4,264.5 tok/s | 6,448 tok/s | 30.015 s | ≈3.68 亿 tokens | ≈5.57 亿 tokens |
根据你的模型、并发与业务场景,获取对应的算力部署建议。