Qwen3.8-27B
已完成 NVFP4、ATX-IQ4_XS-M GGUF · MTP-3 多条量化 / 部署路线实测
1,633 tok/s聚合输入吞吐
未测聚合输出吞吐
157 tok/s单路输出
2× 5090 / 4× 5090 / 1× 3090 Ti 24GB已实测机型
先选择您关注的模型,查看该模型在不同机器配置下的真实实测数据、性能对比和可运行案例,再决定最适合的部署方案。
已完成 NVFP4、ATX-IQ4_XS-M GGUF · MTP-3 多条量化 / 部署路线实测
已完成 NVFP4、UD-Q4_K_XL GGUF 多条量化 / 部署路线实测
96GB 单卡显存,把长上下文和并发同时拉满
16GB 单卡上的 80 路高并发轻量模型实测
只展示项目中已有的同模型跨机型实测组合。
| 模型 | 配置 | 关键实测 | 适合场景 | 数据来源 |
|---|---|---|---|---|
| Qwen3.8-27B | 2× RTX 5090 32GB | 1,630 聚合输入吞吐 | 长文档批处理 | 博原实测 |
| Qwen3.8-27B | 4× RTX 5090 32GB | 60 / 60 6 万字 60 路成功率 | 多人在线推理服务 | 博原实测 |
| Qwen3.8-27B | 1× RTX 3090 Ti 24GB · llamAmpere | 1 路 公开主配置 | 已有 RTX 3090 Ti 的单卡复用 | 开源方案 |
| Qwen3.8-Flash-Next | 4× RTX 5090 32GB | 603.68 总吞吐 | 多人在线推理服务 | 博原实测 |
| Qwen3.8-Flash-Next | 8× RTX 5090 32GB | 120 / 120 6 万字并发成功率 | 大规模多人在线服务 | 博原实测 |
| Qwen3.8-Flash-Next | 8× RTX 2080 Ti 22GB | 1 路 稳定基线口径 | 存量 2080 Ti 算力复用 | 博原实测 |
| DeepSeek-V4-Flash | 4× RTX PRO 6000 96GB | 3,245 64 路输出吞吐 | 超长上下文 + 高并发同时要 | 博原实测 |
| Qwen3.5-0.8B | 1× RTX 3080 Laptop 16GB | 80 路 并发 | 轻量模型高并发推理 | 博原实测 |
| Qwen3.5-0.8B | 1× RTX 2080 Ti 22GB | 128 路 并发 | 轻量模型高并发推理 | 博原实测 |
从不同业务目标选择模型与配置。
从模型到实际应用,看看这些真实产物。