模型概览
- 规模Qwen3.8-Flash-Next
- 主模型量化UD-Q4_K_XL GGUF
- 推理框架llama.cpp · SM75/Qwen4Exp 优化 fork
- 运行上下文131,072 tokens(128K)
- KV CacheQ8_0 K / Q8_0 V
8×22GB Turing 老卡集群跑通 Flash-Next Q4,稳定单路约 37 tok/s。以下数据来自对应测试环境,用于展示这套配置的真实性能边界与适用条件。
可以。主模型采用 UD-Q4_K_XL GGUF,8×22GB 共 176GB 显存;PLE / n-gram 查找表主要放在 CPU 内存,GPU 侧承担 Q4 主模型、QSA 计算、Q8 KV 与 CUDA workspace,在 128K 档稳定跑通。
| 项目 | 公开口径 | 说明 |
|---|---|---|
| GPU | 8× RTX 2080 Ti 22GB | Turing sm75 |
| 主模型 | UD-Q4_K_XL GGUF | 不是 NVFP4 |
| 推理框架 | llama.cpp SM75/Qwen4Exp 优化 fork | 针对老架构做专项优化 |
| 多卡方式 | Layer Split | 八卡均参与主模型分层 |
| MTP | 未计入稳定成绩 | v4 基线为 MTP OFF |
稳定 v4 基线下,Decode 已从最初约 32 tok/s 提升到 36.8~37.0 tok/s;4K Prompt Prefill 从约 87 tok/s 提升到 544.77 tok/s,TTFT 最优约 0.37 秒。
| 测试 | Decode TG | Prefill PP | 说明 |
|---|---|---|---|
| short | 36.92 tok/s | — | 短输入基线 |
| mid | 37.01 tok/s | — | 中等输入基线 |
| long 4K | 37.04 tok/s | 544.77 tok/s | 稳定版长输入实测 |
| 指标 | 初版 | 稳定 v4 | 变化 |
|---|---|---|---|
| Decode | 31.8~32 tok/s | 36.8~37.0 tok/s | 约 +15% |
| Prefill | 约 87 tok/s | 536~545 tok/s | 约 6.2× |
| TTFT | 约 0.6 s | 约 0.37 s | 明显下降 |
这版 v4 benchmark 主要用于 np=1 单路性能基线,当时没有形成可作为正式口径发布的 1 / 2 / 4 / 8 路完整并发矩阵,因此本页不虚构并发数据。
根据你的模型、并发与业务场景,获取对应的算力部署建议。