DeepSeek-V4-Flash-NVFP4

热门模型

96GB 单卡显存,把长上下文和并发同时拉满。已在 1 档硬件配置上完成实测,可直接选择机型查看对应结果。

规模:未记录1 条实测组合

模型共性规格

规模
未记录

适合做什么

  • 超长文档并发处理
  • 大规模办公/文档工作流
  • 对并发人数有硬要求的场景

选型提醒

  • 实测结论(原文):这是受 GPU 计算能力限制、而不是受显存限制的配置 —— 继续加超长上下文并发,先恶化的是首 token 等待与单路速度,不是显存溢出。

我们的建议先确定上下文和并发目标,再从下方已实测机型中选择。

选择机型

以下配置均已完成该模型实测;选择后进入对应机型下的完整模型实测页。

如何选择机型?

同一模型,不同配置差异

使用各机型已有实测指标进行横向整理。

配置量化 / 变体总显存关键实测上下文推荐场景
4× RTX PRO 6000 96GB—384 GB≈18,900 tok/s 聚合 prefill详见实测超长上下文 + 高并发同时要