模型共性规格
- 规模
- 0.8B
16GB 单卡上的 80 路高并发轻量模型实测。已在 2 档硬件配置上完成实测,可直接选择机型查看对应结果。
我们的建议先确定上下文和并发目标,再从下方已实测机型中选择。
以下配置均已完成该模型实测;选择后进入对应机型下的完整模型实测页。
单卡轻量模型:Qwen3.5-0.8B 80 路并发,聚合输出 2,314 tok/s
单卡高并发:Qwen3.5-0.8B 128 路并发,聚合输出 4,264.5 tok/s
使用各机型已有实测指标进行横向整理。
| 配置 | 量化 / 变体 | 总显存 | 关键实测 | 上下文 | 推荐场景 |
|---|---|---|---|---|---|
| 1× RTX 3080 Laptop 16GB | — | 16 GB | 794,922 KV 池容量 | 详见实测 | 轻量模型高并发推理 |
| 1× RTX 2080 Ti 22GB | — | 22 GB | 876,207 KV 池容量 | 详见实测 | 轻量模型高并发推理 |
根据不同业务需求快速选择。