AI 名词地图 | 基础认知 | 做产品
AI 名词地图
名词多,不是因为这件事复杂,是因为它们分别长在一次调用的不同段落上。把这四段走一遍,绝大多数词自己就落位了。
你会遇到的现象
-
一篇 AI 报道里四个词不认识,读完不确定它到底说了什么
-
会上有人说「这个上 RAG 就行了」,你不知道该追问什么才不露怯
-
Token、Agent、微调你都能单独解释,但说不出它们之间是什么关系
一次调用发生了什么
你的产品每问模型一次,都要走完四段。这四段就是上面那张图。
第一段,把东西装进去。模型不会自己去找资料,所有它该知道的,都得由你的代码在这一次请求里一起发过去:产品的设定与规则(系统提示)、之前聊过的内容(历史对话)、从你的文档库里捞出来的相关片段(检索,也就是 RAG)、以及用户刚说的这句话。这四样打包在一起,装在一个有上限的盒子里,这个盒子叫上下文窗口,容量按 Token 算。
第二段,模型开始算。它做的事只有一件:算下一个词最可能是什么,抽一个接上去,再把接好的整段从头算一遍。重复几百次,一段回答就写完了。这一段里你能调的只有温度之类的旋钮;参数量、能力上限、知道多少东西,在训练的时候就定死了。
**第三段,它把字吐出来。**注意这是现场生成的,不是从某个库里查出来的——这是它和搜索引擎最根本的区别。生成机制决定了它遇到不知道的地方会用「最像的内容」补上,语气和真话完全一样,这就是幻觉;也决定了它不知道训练之后发生的事。
**第四段,它想动手。**光会说话不够。你把一组工具的说明书写进第一段,它就能输出「我要调这个工具、参数是这些」,然后由你的代码去执行,再把执行结果塞回第一段,让它接着算。这一来一回反复几十轮,就是 Agent 循环。
关键在最后这个回流箭头:**每转一圈,前三段全部重算一遍。**上下文越滚越长,每一轮都要把之前所有内容重新发一次、重新计一次费。Agent 为什么又慢又贵,答案就在这条线上。它也解释了为什么省钱的功夫全在控制上下文长度,而不在挑一个便宜模型。
最容易混淆的六组
记住定义没什么用。真正会让你在会上判断失误的,是下面这六组——它们听起来像同一件事,实际上差得很远。
**一、Token 不是字。**它是模型自己统计出来的一套切法,一个常见英文单词可能占 1 个,一个生僻汉字可能占 3 个。计费、上下文长度、限流全按 Token 算。所以「这份文档两万字,应该不贵」这句话是估不准的,得实际切一遍。
**二、参数量不是上下文长度。**一个是模型有多大(写成 7B、70B),一个是它一次能读多少(写成 128K、1M)。两个数字毫无关系,可以一大一小任意组合。选型时最常被混着说。
**三、微调不是喂资料。**微调改的是模型「怎么说话」的倾向,要花钱训练、要准备成千上万条样本,而且教不会它新知识。你要让它知道公司的规章制度,正确答案几乎总是 RAG——把文档检索出来放进第一段,而不是去微调。这一条误判的代价最贵,很多团队花几个月微调,最后发现做个检索就解决了。
**四、Agent 不是更聪明的模型。**Agent 是模型外面那一层:循环、工具、权限、终止条件。同一个模型,套上好的循环就能干活,套上坏的循环就会绕圈子。所以「它老是漏步骤」多半不是模型笨,是你的流程没定义清楚,或者没给它一个能验证结果的工具。
**五、Skill 不是 MCP。**Skill 是一包写好的知识和流程,用到的时候才加载进上下文,解决的是「每次都要重新交代一遍」;MCP 是一套让 Agent 连外部系统的接口协议,解决的是「怎么接上你的数据库和第三方服务」。一个装知识,一个装接口,不能互相替代。
六、开源不等于免费。「开源模型」通常只公开权重,训练数据和训练代码一般不给。你可以下载下来自己跑,但要自备显卡、自己运维、自己扛并发。算总账,中小规模下自部署往往比直接调 API 更贵。开源真正买到的是可控——数据不出门、模型不会某天被下线或涨价。
这六组听起来像同一件事,会上判断失误多半出在这里
Token ≠
字 常见英文词占 1 个,生僻汉字可能占 3 个
参数量 ≠
上下文长度 一个是模型多大,一个是一次能读多少
微调 ≠
喂资料 改的是说话倾向,教不会它新知识
Agent ≠
更聪明的模型 是模型外面那层循环、工具和权限
Skill ≠
MCP 一个装知识,一个装接口,不能互相替代
开源 ≠
免费 买到的是可控,中小规模自部署往往更贵
第三组的误判代价最贵:很多团队花几个月微调,最后发现做个检索就解决了。要让它知道公司的规章制度,正确答案几乎总是 RAG。
名词对照表
按上面四段的顺序排。每个词一句话说清是什么,再一句话说清跟你有什么关系。已经写成文章的带链接。
名词一句话是什么为什么你要关心
① 装进去 —— 上下文这一侧 提示词 Prompt你这一次发过去的全部文字。它不是咒语,是需求文档。你没写清的地方,它一定会自己补一个。 系统提示放在最前面、每轮都带上的设定与规则。产品的性格、边界、禁区都写在这。它也是最该做缓存的一段。 上下文窗口一次请求能装下的内容上限,按 Token 算。超了就得截断或压缩。被截掉的部分它真的看不见,而且不会告诉你。 Token模型眼里的最小单位,既不是字也不是词。计费、上下文长度、限流全按它算。估成本必须先换算。 中段丢失上下文太长时,开头结尾记得清楚,中间容易被忽略。关键指令放最前或最后,别埋在一堆资料中间。 向量 Embedding把文字变成一串坐标,意思相近的靠得近。整套语义检索建在它上面。它算的是「像不像」,不是「对不对」。 RAG / 知识库先从你的资料里检索相关片段,再连问题一起交给模型。治幻觉最有效的一招,也是绝大多数「企业知识库」的真身。 上下文压缩对话太长时把前文摘要成一小段,替换原文。省了钱也丢了细节,丢的常常正是早期定下的约束。 长期记忆把该记的事存在外部,下次对话再注入。模型本身没有记忆,所谓记忆都是你的系统在替它存取。
② 模型算 —— 模型本身 下一个词预测每一步只算下一个 token 最可能是什么,抽一个接上,再重复。这是唯一的机制。它所有的能与不能都要回到这句话解释。 训练 / 推理训练是一次性喂出来,推理是每次调用时用起来。你的账单全在推理侧,能力边界在训练侧就定死了。 训练数据训练时喂进去的全部文本、图片与代码。语料里没有的,它只能靠猜。你们的内部概念就属于这一类。 参数量模型内部权重的数量,写成 7B、70B。跟聪明程度不是一回事,跟上下文长度更是毫无关系。 温度控制抽样随机性的旋钮:低就稳,高就野。要稳定输出就调低。默认值往往不是你要的那档。 推理模型回答前先生成一大段思考过程,再给结论。难题上更准,但那段思考也要按输出价计费。简单任务上纯属浪费。 开源模型权重公开、可以自己部署的模型。买到的是可控,不是便宜。中小规模自部署往往更贵。
③ 吐出来 —— 输出与它的边界 幻觉把不知道的部分用最像的内容补上,语气和真话一样。机制的必然产物,不是 bug。只能防,不能等它被修好。 知识截止训练语料的最后时间点,之后的事一概不知。凡是涉及「最新」的功能,都得由你把最新信息喂进去。 多模态能读图、音频、视频的模型,这些能力多半是后来加装的。小字、表格线、精确坐标是高发失败区。
④ 动手 —— Agent 这一侧 Agent能自己决定下一步、并调工具去做的一套程序。它不是更聪明的模型,是模型外面那层循环和权限。 工具调用你给它工具说明书,它输出调哪个、参数是什么,由你的代码执行。工具给到哪,它的能力边界就到哪。 Agent 循环想一步、做一步、看结果、再想,反复到收敛。成本和延迟按轮数翻倍。不收敛的循环是最贵的故障。 Skill一包写好的知识和流程,用到时才加载。把「每次都要交代一遍」的经验固化下来,平时还不占窗口。 MCP让 Agent 接外部系统的标准接口协议。接一次多处可用。选第三方 MCP 要当成开权限来审。 多 Agent把任务拆给几个各管一摊的 Agent,再合并结果。确实更稳,但上下文要复制好几份,成本涨得很快。 提示注入它读到的资料里藏了一句指令,它照做了。模型分不清指令和数据。原理层面的漏洞,靠提示词补不上。 API / 网页版一个给程序调用,一个给人使用。数据留存策略、可控参数、计费方式都不同。谈合规先分清这两个。
这张表不用背。开完会回来查一眼,先确认这个词落在哪一段,比记住定义有用得多。
听不懂时问哪一句
还有一件事得说明白:**这些词的边界在业内本来就不统一。**同一个「Agent」,供应商说的、工程师说的、你在报道里读到的,经常不是一回事。有人管一个带工具的对话框叫 Agent,也有人非要能跑几十轮才算。
所以真正管用的不是背定义,是在会上追问一句:**「你说的这个,具体是指哪一步?」**让对方把它落到上面那四段里的某一段上。大部分误会在这一句里就解掉了。
如果你只带走一句话,带走这个:模型只会预测下一个词,其余所有名词,都是人们为了绕开这个限制而发明出来的东西。知道每个词在绕哪一个限制,你就不需要记它的定义了。
AI 发展简史 这些词是怎么一层层长出来的,看完更知道它们各自在解决谁留下的问题。
大模型的运作原理 这张地图的第一站。看懂预测下一个词,后面三段才立得住。
AI 目前到了哪一步 哪些已经能放心用,哪些演示很好但落地还不稳。
