做产品 PMaker
空格的键盘空格的键盘
大模型

参数量与跑分怎么看

参数量与跑分怎么看 | 大模型 | 做产品

参数量与跑分怎么看

参数量、上下文长度、跑分,是三件不相干的事。三个都高的模型未必适合你,三个都不出众的模型可能刚好够用。

你会遇到的现象

  • 换了一个榜单排名更高的模型,你们的场景反而变差了

  • 技术同学说这个模型「更大」,你不知道大在哪、意味着什么

  • 给了 100 万上下文,你把整个知识库塞进去,答案却更含糊了

三个不同的数字

参数量是模型里权重的个数,7B 就是 70 亿个。它决定的是这个模型能装下多少统计规律,也就是能力的上限。但上限不等于表现:同样是 70B,训练数据的质量、后训练的手法不同,出来的东西能差出一大截。而且现在主流模型基本都不公布参数量了,你能拿到的通常只有一个档位名。

上下文长度是一次请求能装多少 token。它跟聪明程度没关系,只跟「能不能一次读完」有关。而且能装进去不代表能用好——长上下文里,中间那一段被忽略的概率会明显上升。这一条对做 AI 产品的人非常现实:窗口大是给了你余量,不是给了你随便塞的许可。

跑分是它在若干标准题库上的正确率。它回答的问题是「这个模型在这些题上考得怎么样」,仅此而已。

数字回答的问题不回答的问题 参数量能力上限有多高这次任务做得好不好 上下文长度一次能读多少读进去的能不能被用上 跑分标准题上考得好不好你的题上考得好不好 价格贵不贵值不值 延迟快不快用户能不能忍

右边那一列才是你真正关心的问题,而左边任何一个数字都答不了。这就是为什么必须自己测。

跑分为什么会骗人

  • **题库会泄漏进训练集。**公开题库放在网上,新模型训练时很难完全排除。分数高有一部分是因为它见过题。这个问题没法从外部证伪,只能对高分保持一点保留。

  • **题型和你的场景对不上。**大多数榜单考的是知识问答和标准推理,而你的产品可能是「从一堆客服记录里抽出结构化字段」。这两件事的强弱排序完全可以是反的。

  • **分数差几个点没有意义。**88.4 和 87.9 之间的差距,小于换个提示词带来的波动。只有拉开一个档位的差距才值得当回事。

  • **榜单不测你最在乎的东西。**输出格式稳不稳定、能不能守住不许做的事、长对话会不会崩、并发下延迟多少——这些没有榜,但它们才是产品上线后出问题的地方。

该怎么选

把选型变成一件可执行的事,就四步。

**一、先攒一份你自己的题。**从真实场景里挑 20 到 50 条,覆盖典型情况、边界情况和你们最怕出错的情况。每条要写清楚什么算合格。这份题库是你选型的唯一依据,也是以后每次换模型的回归测试。

**二、先测能不能过,再测哪个更好。**很多任务其实有一条明确的及格线。先用便宜的档位跑一遍,如果已经过线,更强的模型只是在浪费钱。能用小的就别用大的,这条在成本上的杠杆比任何提示词优化都大。

**三、把不同任务分开选。**一个产品里通常有好几类调用:分类、抽取、改写、复杂推理。前三类用便宜快的档位,最后一类才上贵的。分流做好,账单能砍掉大半。

**四、把可替换性设计进去。**模型半年就换一代,把调用封在一层里,换模型时只改一个地方。选型不是一锤子买卖,是一件每隔几个月要重做一次的事。

一个产品里通常有好几类调用,它们不该共用一个档位

全都走最强档

分类

抽取

改写

复杂推理 账单 = 四份贵的

按任务分流

分类

抽取

改写

复杂推理 账单能砍掉大半

绿色 = 便宜快的档位  红色 = 贵档

选型四步 ① 先攒一份你自己的题(20–50 条,写清什么算合格)——它是唯一依据,也是以后的回归测试 ② 先测能不能过线,再测哪个更好——已经过线的话,更强的模型只是在浪费钱 ③ 把不同任务分开选,就是上面那张分流图 ④ 把调用封在一层里——模型半年换一代,选型不是一锤子买卖

**能用小的就别用大的,这条在成本上的杠杆比任何提示词优化都大。**而做到它的前提只有一个:你得有一份自己的题,能判断便宜那档到底过没过线。

接着看

训练与推理的区别 选型是你在训练侧唯一能做的动作。剩下的全在推理侧调。

Token 与计费单位 上下文长度和价格都是按 token 算的。先搞清楚这个单位。

上下文是怎么回事 「窗口大不等于用得上」这句话的展开:长了之后到底是哪一段先失灵。