Qwen3.8-27B

热门模型

已完成 NVFP4、ATX-IQ4_XS-M GGUF · MTP-3 多条量化 / 部署路线实测。已在 3 档硬件配置上完成实测,可直接选择机型查看对应结果。

规模:dense 27B + 原生 VLM上下文:262,144 tokens 原生支持结构:64 层 = 48 层线性注意力(GDN)+ 16 层全注意力3 条实测组合

模型共性规格

规模
dense 27B + 原生 VLM
上下文
262,144 tokens 原生支持
结构
64 层 = 48 层线性注意力(GDN)+ 16 层全注意力

适合做什么

  • 长文档理解与批处理
  • 多轮长上下文问答
  • 图片 + 文本混合输入
  • 高并发长文档批处理
  • 多用户长上下文问答
  • 四张卡全部用满的性价比方案
  • 单用户 Agent / Coding
  • 100K+ 长会话
  • 3090 / 3090 Ti 存量卡复用
  • 开源性能优化复现

选型提醒

  • 单卡在 prefill 阶段功耗会顶到 400W 上限(实测 399.92 / 400.17 W)—— 也就是说这张卡的算力确实被吃满了,不是靠省电换速度。
  • 每种上下文长度的推荐并发(判据:首 token p50 ≤ 300 s):6 万字 5 路、12 万字 3 路、20 万字 2 路、25 万字 1 路。
  • 单路速度与上下文长度强相关:上下文越长,第一次读进去越慢;但读进去之后的多轮对话都能命中缓存。
  • 高上下文(20 万字以上)时加并发完全无效,只能加副本 —— 实测成功数在 20 万字饱和于 12、25 万字饱和于 8。

我们的建议先确定上下文和并发目标,再从下方已实测机型中选择。

选择机型

以下配置均已完成该模型实测;选择后进入对应机型下的完整模型实测页。

如何选择机型?

同一模型,不同配置差异

使用各机型已有实测指标进行横向整理。

配置量化 / 变体总显存关键实测上下文推荐场景
2× RTX 5090 32GBNVFP464 GB1,633 tok/s 聚合输入吞吐262,144 tokens 原生支持长文档批处理
4× RTX 5090 32GBNVFP4128 GB26,049 tok/s 聚合 prefill262,144(数据并行方案下);约 120,000(单卡副本方案下)多人在线推理服务
1× RTX 3090 Ti 24GB · llamAmpereATX-IQ4_XS-M GGUF · MTP-324 GB99.4 tok/s clean fixtures Decode详见实测已有 RTX 3090 Ti 的单卡复用