模型的六种类型 | 大模型 | 做产品
模型的六种类型
日常说的「大模型」通常只指文本模型。但你要做的产品,很可能同时用到好几类。它们的能力边界不同,计费单位更是完全不同——这一点比能力差异更容易让你在预算上翻车。
你会遇到的现象
-
按文本模型的经验估了个成本,做语音功能时账单差了十几倍
-
想做「上传视频自动剪辑」,不知道该找哪种模型
-
听说「向量」很贵,其实它是这六类里最便宜的
六种分别是什么
**文本模型。**文字进、文字出,就是你最熟的那种。按 Token 计费,输入一个价、输出一个价,输出通常贵几倍。绝大多数 AI 功能的主力。
**图片模型。**给一段描述(也可以再给一张参考图),生成一张图。按张计费,分辨率越高越贵,而且是跳档式的——分辨率调一档,单价可能翻好几倍。
**视频模型。**给文字或图,生成一段视频。按秒计费,这是它和其他所有类型最不一样的地方。一段十几秒的视频,成本可能顶得上几百次文本调用。做预算时务必单独算这一项。
**语音合成(TTS)。**文字进、音频出。按字符数计费,不是按 Token。所以文本模型那套换算在这里不适用。音色克隆、情感控制通常另外收费。
**语音识别(ASR)。**音频进、文字出。按音频时长计费,跟说了多少字无关——一段沉默的录音和一段密集对话,只要时长一样,价钱就一样。
向量模型(Embedding)。文字进,出来一串数字坐标。它不生成任何内容,只负责把「意思」变成可以计算距离的坐标。这是整套语义检索和知识库的地基,而且是六类里最便宜的,通常比文本模型便宜一两个数量级。名词地图里也提到过它。
计费单位才是重点
能力差异你大概能猜到,计费单位的差异才是真正会伤到你的地方。
看那张图右边的条形:**同样是「调用一次模型」,成本能差出两个数量级。**向量最便宜,视频最贵,中间隔着好几档。
这带来一条很实际的纪律:**估成本时,六类必须分开算,不能用同一套心算。**做一个「上传录音 → 转文字 → 摘要 → 生成配图」的功能,你要同时算 ASR 的时长费、文本模型的 Token 费、图片模型的张数费。任何一项用错单位,整个预算就废了。
还有一个常被忽略的点:**非文本模型往往还有并发和时长的硬限制。**视频生成一次可能要等几十秒到几分钟,这不只是成本问题,更是产品设计问题——你得设计一个像样的等待体验,而不是让用户对着转圈干等。
真实产品是拼出来的
实际产品很少只用一类模型。举个具体的:一个「会议纪要」功能,链路通常是这样——
录音先交给 ASR 转成文字(按时长计费);文字交给文本模型做摘要和待办提取(按 Token);如果要做语义搜索,还要把纪要切段后过一遍向量模型存进库里(按 Token,但很便宜);要是产品还想生成一张分享卡片,再叫一次图片模型(按张)。
四类模型,四种计费单位,四条独立的失败路径。拆开看,每一段的成本和风险才算得清楚。
选型时也一样:这四段可以来自不同厂商,没必要绑在一家。ASR 挑准确率和中文表现好的,文本模型挑你那类任务上实测好的,向量模型挑便宜稳定的就行。怎么把它们统一接进来是另一个话题。
「会议纪要」这一个功能,就用掉了四类模型
录音
ASR 转文字
文本模型 摘要与待办
向量模型 切段入库
图片模型 分享卡片
按音频时长
按 Token
按 Token(极便宜)
按张
四类模型,四种计费单位,四条独立的失败路径
同样是「调用一次模型」,成本能差出两个数量级
向量 文本 语音 图片 视频 便宜
非文本模型还有并发和时长的硬限制:视频生成一次要等几十秒到几分钟——这是产品设计问题,不只是成本问题。
估成本时六类必须分开算,任何一项用错单位,整个预算就废了。这四段也不必绑在一家厂商:ASR 挑中文表现好的,文本模型挑你那类任务实测好的,向量模型挑便宜稳定的就行。
Token 与计费单位 文本模型这一类的计费细节,以及为什么中英文差价从切分方式来。
多模态:图片怎么被读懂 一个模型同时吃多种输入时,图片是怎么被塞进同一条序列的。
主流模型厂商的差异 六类模型可以来自不同厂商,选型维度是同一套。
