做产品 PMaker
空格的键盘空格的键盘
基础认知

主流模型厂商的差异

主流模型厂商的差异 | 基础认知 | 做产品

主流模型厂商的差异

这一节不会给你一份「厂商排行榜」。榜单三个月就翻一遍,背下来没有意义。真正能重复使用的,是一套量的方法

你会遇到的现象

  • 看了一堆评测,还是不知道自己该用哪个

  • 按跑分选了最强的,实际用起来还不如便宜那个稳

  • 接完一家才发现数据合规过不了,得从头再来

为什么不给排名

三个原因。

**一、榜单和你的任务不是一回事。**公开评测测的是竞赛题、通用问答这些标准化任务,而你要它干的是「把这类工单按我们内部的五个类别打标」。跑分高不代表你的场景好用——这两件事经常反着来。

**二、差距在收窄,而且变动很快。**头部模型之间的公开基准差距一直在缩小,同时每隔几个月就有新版本、新定价。任何写死的排名,写下来的那天就开始过期。

**三、选型从来不只是选能力。**价格、稳定性、合规、迁移成本,任何一条不过关都能一票否决——哪怕它能力最强。

六个选型维度

把候选模型放进这张表,一个个打分。这份表下个季度还能接着用。

维度具体量什么怎么量 ① 任务表现在你那类任务上的准确率与稳定性。准 20–50 条真实样例,各模型跑同一套,人工判对错。 ② 上下文长度够不够装下你要塞的资料。拿最长的那份真实输入去试,别信标称值。 ③ 真实成本一次完整调用的钱,不是每百万 token 的单价。用真实请求量一遍 Token,算上输入、输出和多轮重发。 ④ 稳定性限流额度、超时率、故障时的表现、有没有 SLA。压一段时间,看 P95 延迟和错误率,别只看平均值。 ⑤ 合规数据是否出境、留存多久、是否用于训练、能否签协议。让法务看厂商的数据处理条款,别看营销页。 ⑥ 迁移成本换掉它要改多少东西。看是否兼容通用接口格式,提示词要重调多少。

资料基准:2026 年 8 月。前两条决定「能不能用」,中间两条决定「用不用得起」,后两条决定「敢不敢用」。任何一条不过关都是一票否决。

第 ① 条最花时间,也最值。准备一组真实样例、跑一遍、人工判对错——这件事做过一次,后面每次换模型都能复用,是整个选型里回报最高的投入。

几个阵营的性格

虽然不给排名,但阵营之间确实有稳定的性格差异,这些短期内不会变。

海外头部闭源厂商(OpenAI、Anthropic、Google 这一类):能力上限通常最高,工具调用和长任务的工程成熟度好,文档与生态完整。代价是价格偏高,且国内使用涉及网络与合规问题。

国内大厂平台(阿里、字节、腾讯、百度这一类):优势在中文场景、合规资质、企业合同与发票,以及和自家云的整合。它们通常既提供自研模型,也在平台上托管第三方模型。

国产高性价比阵营(DeepSeek、月之暗面、智谱、MiniMax 这一类):定价激进,部分开放权重,性价比是主要卖点。近年国产模型的价格底线一直被这一阵营拉低。

开放权重模型:可以自己部署,数据不出门、不怕下线涨价。代价是显卡、运维和并发都得自己扛——中小规模下通常比直接调 API 更贵,买到的是可控而不是便宜。

一个参考量级:2026 年 8 月,海外旗舰模型的输入价大致在每百万 token 几美元的水平,国产主力模型则在几元人民币甚至更低,头部产品还常配免费额度。但这些数字变动极快,务必以厂商当期报价页为准。

怎么做一次选型

四步,一两天能走完。

**第一步,先划掉不合规的。**把数据出境、留存策略、能不能签协议这几条摆出来,过不了的直接出局。这一步放最前面,能省掉后面全部白工。

**第二步,准备一组真实样例。**20 到 50 条,覆盖常见情况和几个刁钻的边界情况。这组样例是你之后所有决策的尺子。

**第三步,同一套样例跑所有候选。**同样的提示词、同样的参数,人工判对错。注意一个坑:不同厂商对同一段提示词的反应差别很大,所以一轮结果不理想时,先给它一次针对性调整提示词的机会,再下结论。

**第四步,选两个,不是一个。**一个主力,一个备用,而且备用的接入要真的跑通过。模型限流、故障、下线都是常态,不能把产品可用性押在单一供应商身上。

四步,一两天能走完。顺序很重要

第一步 先划掉不合规的 数据出境、留存策略、能不能签协议——过不了的直接出局 放最前面,能省掉后面全部白工

第二步 准备一组真实样例 20 到 50 条,覆盖常见情况和几个刁钻的边界情况 整个选型里回报最高的投入

第三步 同一套样例跑所有候选 同样的提示词、同样的参数,人工判对错 结果差时先给它一次调提示词的机会

第四步 选两个,不是一个 一个主力,一个备用,而且备用的接入要真的跑通过 限流、故障、下线都是常态

第一步之所以排在最前面,是因为它是一票否决:能力再强,合规过不了就是零。而第二步那组样例做过一次,后面每次换模型、换渠道都能复用。

资料来源

  • Claude Platform — Pricing:海外闭源模型定价的一手来源

  • OpenRouter — Models:多家模型的价格与上下文长度横向对照

  • Stanford HAI — AI Index Report:关于「头部模型基准差距收窄」的公开数据依据

  • LMArena:基于人类偏好投票的对比榜,适合看趋势,不适合替代你自己的实测

资料基准:2026 年 8 月。本文刻意不写具体排名与单价明细,因为这两项过期最快;文中提到的阵营性格是结构性归纳。任何采购决策前,请以厂商官方文档与当期报价页为准。

从哪里拿到模型 选完厂商,下一个问题是从哪个渠道接进来。

参数量与跑分怎么看 为什么跑分高不等于你的场景好用。

AI 行业的四层 这些厂商都站在模型层,那一层的生意逻辑决定了他们的定价行为。