模型概览
- 规模0.8B
- 版本官方原版 · 无量化后缀
- 模型标识Qwen3.5-0.8B
- 统计规则与 NVFP4 / GPTQ / AWQ / FP 等其他版本独立统计
16GB 单卡上的 80 路高并发轻量模型实测。以下数据来自对应测试环境,用于展示这套配置的真实性能边界与适用条件。
Qwen3.5-0.8B 可在单卡上稳定进行高并发推理。本次测试的 KV 池容量为 794,922 tokens,80 路请求全部完成。
80 路并发、每路 1000 tokens 输入 / 2000 tokens 输出,整轮在 44.8 秒左右完成。
本次 80 路并发的输入 + 输出聚合总吞吐为 3,284 tok/s,按全天满载粗略折算,日输出约 2.0 亿 tokens、日总吞吐约 2.84 亿 tokens。
| KV 池 | 并发负载 | 输入吞吐 | 输出吞吐 | 总吞吐 | 整轮完成 | 日输出 | 日总吞吐 |
|---|---|---|---|---|---|---|---|
| 794,922 tokens | 80×(1000 入 / 2000 出) | 970 tok/s | 2,314 tok/s | 3,284 tok/s | 44.8 s | ≈2.0 亿 tokens | ≈2.84 亿 tokens |
根据你的模型、并发与业务场景,获取对应的算力部署建议。