做产品 PMaker
空格的键盘空格的键盘
大模型

模型的六种类型

模型的六种类型 | 大模型 | 做产品

模型的六种类型

日常说的「大模型」通常只指文本模型。但你要做的产品,很可能同时用到好几类。它们的能力边界不同,计费单位更是完全不同——这一点比能力差异更容易让你在预算上翻车。

你会遇到的现象

  • 按文本模型的经验估了个成本,做语音功能时账单差了十几倍

  • 想做「上传视频自动剪辑」,不知道该找哪种模型

  • 听说「向量」很贵,其实它是这六类里最便宜的

六种分别是什么

**文本模型。**文字进、文字出,就是你最熟的那种。按 Token 计费,输入一个价、输出一个价,输出通常贵几倍。绝大多数 AI 功能的主力。

**图片模型。**给一段描述(也可以再给一张参考图),生成一张图。按张计费,分辨率越高越贵,而且是跳档式的——分辨率调一档,单价可能翻好几倍。

**视频模型。**给文字或图,生成一段视频。按秒计费,这是它和其他所有类型最不一样的地方。一段十几秒的视频,成本可能顶得上几百次文本调用。做预算时务必单独算这一项。

**语音合成(TTS)。**文字进、音频出。按字符数计费,不是按 Token。所以文本模型那套换算在这里不适用。音色克隆、情感控制通常另外收费。

**语音识别(ASR)。**音频进、文字出。按音频时长计费,跟说了多少字无关——一段沉默的录音和一段密集对话,只要时长一样,价钱就一样。

向量模型(Embedding)。文字进,出来一串数字坐标。它不生成任何内容,只负责把「意思」变成可以计算距离的坐标。这是整套语义检索和知识库的地基,而且是六类里最便宜的,通常比文本模型便宜一两个数量级。名词地图里也提到过它。

计费单位才是重点

能力差异你大概能猜到,计费单位的差异才是真正会伤到你的地方。

看那张图右边的条形:**同样是「调用一次模型」,成本能差出两个数量级。**向量最便宜,视频最贵,中间隔着好几档。

这带来一条很实际的纪律:**估成本时,六类必须分开算,不能用同一套心算。**做一个「上传录音 → 转文字 → 摘要 → 生成配图」的功能,你要同时算 ASR 的时长费、文本模型的 Token 费、图片模型的张数费。任何一项用错单位,整个预算就废了。

还有一个常被忽略的点:**非文本模型往往还有并发和时长的硬限制。**视频生成一次可能要等几十秒到几分钟,这不只是成本问题,更是产品设计问题——你得设计一个像样的等待体验,而不是让用户对着转圈干等。

真实产品是拼出来的

实际产品很少只用一类模型。举个具体的:一个「会议纪要」功能,链路通常是这样——

录音先交给 ASR 转成文字(按时长计费);文字交给文本模型做摘要和待办提取(按 Token);如果要做语义搜索,还要把纪要切段后过一遍向量模型存进库里(按 Token,但很便宜);要是产品还想生成一张分享卡片,再叫一次图片模型(按张)。

四类模型,四种计费单位,四条独立的失败路径。拆开看,每一段的成本和风险才算得清楚。

选型时也一样:这四段可以来自不同厂商,没必要绑在一家。ASR 挑准确率和中文表现好的,文本模型挑你那类任务上实测好的,向量模型挑便宜稳定的就行。怎么把它们统一接进来是另一个话题。

「会议纪要」这一个功能,就用掉了四类模型

录音

ASR 转文字

文本模型 摘要与待办

向量模型 切段入库

图片模型 分享卡片

按音频时长

按 Token

按 Token(极便宜)

按张

四类模型,四种计费单位,四条独立的失败路径

同样是「调用一次模型」,成本能差出两个数量级

向量 文本 语音 图片 视频 便宜

非文本模型还有并发和时长的硬限制:视频生成一次要等几十秒到几分钟——这是产品设计问题,不只是成本问题。

估成本时六类必须分开算,任何一项用错单位,整个预算就废了。这四段也不必绑在一家厂商:ASR 挑中文表现好的,文本模型挑你那类任务实测好的,向量模型挑便宜稳定的就行。

Token 与计费单位 文本模型这一类的计费细节,以及为什么中英文差价从切分方式来。

多模态:图片怎么被读懂 一个模型同时吃多种输入时,图片是怎么被塞进同一条序列的。

主流模型厂商的差异 六类模型可以来自不同厂商,选型维度是同一套。