关于
为什么我们要把这些数字公开
买显卡跑大模型,最容易踩的坑是「参数表看着都行,真跑起来差很远」:显存够不等于能装下、能装下不等于跑得快、跑得快不等于能同时服务很多人。
给不懂技术的人
直接看每个配置下面的生成案例 —— 实际跑出来什么效果、多快、能不能直接用于业务,一眼就能判断。
给懂技术的人
每个配置都有实测数据:单卡容量、单路速度、多路并发与测试口径都会公开展示。
给要采购的人
已收录配置都会写清适合什么、不适合什么,并展示我们实测出来的取舍与限制。
01 数据来源
杭州博原人工智能科技有限责任公司
站内既有显卡方案与测试结果默认均为博原方案 / 博原实测;若引用外部开源或第三方方案,会在配置页和实测页单独标注来源并给出可追溯链接。
✅ 博原方案 / 博原实测
站内既有 RTX 5090、RTX PRO 6000、RTX 3080 Laptop、RTX 2080 Ti 等方案与测试结果, 默认均为博原方案;页面会展示对应的吞吐、并发、上下文与限制。
↗ 外部开源方案(单独标注)
外部方案不会混入博原实测。例如 JakeATX / llamAmpere 会明确显示 GitHub 来源、版本与原作者测试口径; 这些数字只有在博原重新复测后才会转为“博原实测”。
◐ 我们主动写出来的限制
每档配置都写了「不适合什么」:例如同样的四张卡张量并行会因跨卡通信变慢、 长上下文超过 12 万字时单卡副本装不下、超配会变慢但不会崩。这些取舍都写在对应页面上。
02 怎么读这些数字
先看这一节,能避免大部分误读
- 「单卡」回答的是:一张卡能不能装下、一张卡能跑多快。它决定了你的起步成本。
- 「单路」回答的是:只有一个人用的时候,等多久、每秒出多少字。这是体验好不好。
- 「多路」回答的是:很多人同时用的时候,总体能扛多少、每个人还剩下多少。这是能不能上线。
- 「聚合输入吞吐(tok/s)」是长上下文批处理口径:输入 token ÷ 整轮耗时,已包含生成阶段,因此会低估真正的读取速度;它与「单路生成 tok/s」不是一回事,不能混着比。
- 长上下文场景区分两种用法:冷启动(第一次读一篇全新材料,首 token 从数十秒到数分钟)与多轮追问(同一份材料反复问,缓存命中后首 token 约 2 秒)。
- 既有配置与测试默认均为博原方案 / 博原实测;引用 GitHub 开源方案、第三方数据或网络资料时会单独标注来源、版本与链接,不与博原实测混用。
03 本站怎么看
三条入口,对应三种提问方式
配置看硬件性能,模型看部署实测,案例看模型能力;三条路径互相独立又可以交叉查看。
04 联系我们
告诉我们你的场景与并发规模,我们给一版实测过的配置建议
电话待填写
邮箱待填写
微信 / 企业微信待填写
地址浙江省杭州市(待填写详细地址)
以上为对外联系方式的占位,填入真实信息后即可上线(改
app/data/site.ts 的 contact)。 05 更新记录
数据更新
2026-09-27
覆盖范围
8 档配置 · 9 个模型实测组合 · 10 个生成案例
数据来源
数据来源:杭州博原人工智能科技有限责任公司
