从模型到部署 · 真实数据帮您做选择

按模型看部署方案

先选择您关注的模型,查看该模型在不同机器配置下的真实实测数据、性能对比和可运行案例,再决定最适合的部署方案。

真实机器实测不是理论参数
多维性能对比吞吐量 / 延迟 / 并发
可运行案例验证从模型到应用
企业级选型建议结合场景给出推荐

模型清单

共 4 个模型

Qwen3.8-27B

已完成 NVFP4、ATX-IQ4_XS-M GGUF · MTP-3 多条量化 / 部署路线实测

3 档配置
长文档理解多轮长上下文问答图片 + 文本混合输入高并发长文档批处理
1,633 tok/s聚合输入吞吐
未测聚合输出吞吐
157 tok/s单路输出
2× 5090 / 4× 5090 / 1× 3090 Ti 24GB已实测机型

Qwen3.8-Flash-Next

已完成 NVFP4、UD-Q4_K_XL GGUF 多条量化 / 部署路线实测

3 档配置
多人在线对话服务Agent 与工具调用代码生成与重构25 万字长文
4,474 tok/s聚合输入吞吐
916.6 tok/s聚合输出吞吐
293 tok/s单路输出
4× 5090 / 8× 5090 / 8× 2080 Ti 22GB已实测机型

DeepSeek-V4-Flash-NVFP4

96GB 单卡显存,把长上下文和并发同时拉满

1 档配置
超长文档并发处理大规模办公/文档工作流对并发人数有硬要求的场景
≈18,900 tok/s聚合 prefill
3,245 tok/s聚合输出吞吐
290.05 tok/s单路输出
4× PRO 6000已实测机型

Qwen3.5-0.8B

16GB 单卡上的 80 路高并发轻量模型实测

2 档配置
高并发轻量问答批量文本生成本地轻量 AI 服务老卡算力复用
794,922KV 池容量
80 路并发
970 tok/s聚合输入吞吐
1× 3080 Laptop / 1× 2080 Ti 22GB已实测机型

同一个模型,不同配置差别有多大

只展示项目中已有的同模型跨机型实测组合。

模型配置关键实测适合场景数据来源
Qwen3.8-27B2× RTX 5090 32GB1,630 聚合输入吞吐长文档批处理博原实测
Qwen3.8-27B4× RTX 5090 32GB60 / 60 6 万字 60 路成功率多人在线推理服务博原实测
Qwen3.8-27B1× RTX 3090 Ti 24GB · llamAmpere1 路 公开主配置已有 RTX 3090 Ti 的单卡复用开源方案
Qwen3.8-Flash-Next4× RTX 5090 32GB603.68 总吞吐多人在线推理服务博原实测
Qwen3.8-Flash-Next8× RTX 5090 32GB120 / 120 6 万字并发成功率大规模多人在线服务博原实测
Qwen3.8-Flash-Next8× RTX 2080 Ti 22GB1 路 稳定基线口径存量 2080 Ti 算力复用博原实测
DeepSeek-V4-Flash4× RTX PRO 6000 96GB3,245 64 路输出吞吐超长上下文 + 高并发同时要博原实测
Qwen3.5-0.8B1× RTX 3080 Laptop 16GB80 路 并发轻量模型高并发推理博原实测
Qwen3.5-0.8B1× RTX 2080 Ti 22GB128 路 并发轻量模型高并发推理博原实测
卡数之外,张量并行方式、上下文长度和 KV 池配置也会显著改变结果,请进入详情查看完整口径。