Qwen3.5-0.8B

热门模型

16GB 单卡上的 80 路高并发轻量模型实测。已在 2 档硬件配置上完成实测,可直接选择机型查看对应结果。

规模:0.8B2 条实测组合

模型共性规格

规模
0.8B

适合做什么

  • 高并发轻量问答
  • 批量文本生成
  • 本地轻量 AI 服务
  • 老卡算力复用

选型提醒

  • 模型表现会随并发人数和上下文长度变化
  • 不同量化方式不能直接横向比较
  • 第三方数据仅作量级参考
  • 请进入具体机型页查看完整测试口径

我们的建议先确定上下文和并发目标,再从下方已实测机型中选择。

选择机型

以下配置均已完成该模型实测;选择后进入对应机型下的完整模型实测页。

如何选择机型?

同一模型,不同配置差异

使用各机型已有实测指标进行横向整理。

配置量化 / 变体总显存关键实测上下文推荐场景
1× RTX 3080 Laptop 16GB—16 GB794,922 KV 池容量详见实测轻量模型高并发推理
1× RTX 2080 Ti 22GB—22 GB876,207 KV 池容量详见实测轻量模型高并发推理