Qwen3.8-Flash-Next

热门模型

已完成 NVFP4、UD-Q4_K_XL GGUF 多条量化 / 部署路线实测。已在 3 档硬件配置上完成实测,可直接选择机型查看对应结果。

规模:MoE · 512 专家(每次激活 10 个)上下文:262,144 tokens 原生支持结构:48 层 = 12 层全注意力 + 36 层线性注意力3 条实测组合

模型共性规格

规模
MoE · 512 专家(每次激活 10 个)
上下文
262,144 tokens 原生支持
结构
48 层 = 12 层全注意力 + 36 层线性注意力

适合做什么

  • 多人在线对话服务
  • Agent 与工具调用
  • 代码生成与重构
  • 25 万字长文一次性分析
  • 百人级在线推理
  • 团队共享的长上下文服务
  • 批量长文档处理
  • 存量老卡算力复用
  • 128K 长上下文问答
  • 私有化单路推理服务

选型提醒

  • 同一台机器上关闭投机解码可把 KV 池从 531,372 提到 682,759 tokens(+28%),代价是单路速度下降。
  • 并发与投机解码的交叉点在 10–12 路:10 人以下开 MTP 更快,12 人以上关掉 MTP 反而更稳(20 路时首 token P95 从 5.753 s 降到 0.548 s)。
  • 关键取舍:加卡带来的是线性扩容,不是效率提升。如果预算敏感,四张卡跑 27B 的每卡效率比八张卡跑 Flash-Next 高 5.8 倍。
  • 上面都是"冷启动读长文档"的口径。真实多轮对话场景下,缓存命中后首 token 约 2 秒,体验与普通对话无异。

我们的建议先确定上下文和并发目标,再从下方已实测机型中选择。

能力案例

通过真实应用案例,直观了解 Qwen3.8-Flash-Next 在实际场景中的表现。

查看更多案例

选择机型

以下配置均已完成该模型实测;选择后进入对应机型下的完整模型实测页。

如何选择机型?

同一模型,不同配置差异

使用各机型已有实测指标进行横向整理。

配置量化 / 变体总显存关键实测上下文推荐场景
4× RTX 5090 32GBNVFP4128 GB4,474 tok/s 聚合输入吞吐262,144 tokens 原生支持多人在线推理服务
8× RTX 5090 32GBNVFP4256 GB8,957 tok/s 聚合输入吞吐262,144 tokens大规模多人在线服务
8× RTX 2080 Ti 22GBUD-Q4_K_XL GGUF176 GB37.04 tok/s 稳定 Decode131,072 tokens(128K)存量 2080 Ti 算力复用