训练数据从哪来 | 大模型 | 做产品
训练数据从哪来
它的能力不是凭空来的,是语料的形状。哪一类文本多,它在哪一类上就强;哪一类没有,它在那一块就只能编。
你会遇到的现象
-
让它写 React 代码又快又准,让它写你们内部框架的代码全是瞎编
-
问英文技术问题答得很好,同一个问题换成中文答案明显变浅
-
它默认给出的方案总是最主流的那一种,冷门但更合适的选项它想不到
语料里有什么
各家配比不公开,但大结构是清楚的:网页占大头,书和论文占一块,代码占一块,对话和问答占一块。后面还有一轮人工标注的偏好数据,那一轮决定的是它说话的姿态,不是它的知识。
-
**网页给了它广度。**百科、论坛、新闻、博客、商品页。什么都懂一点,但也把网上的错误、过时信息、营销话术一起吃了进去。它说的「业界最佳实践」,很多时候只是被写得最多的那种说法。
-
**书和论文给了它长程推理。**连贯几千字的论证、层层递进的结构,只有长文本里才有。这部分数据受版权限制,实际拿到的比你想象的少,这也是为什么它在通俗话题上比在专业深水区靠谱得多。
-
**代码给了它结构感。**代码强不只是因为它能写代码。有严格语法、能被机器判对错的文本,训练价值特别高。它能稳定吐出合法 JSON、能照着格式填表,很大程度上是代码语料喂出来的。
-
**对话给了它说人话的能力。**也顺带给了它顺着你说的毛病。你说「是不是这样」,它倾向于说「是的」——这不是它懂了,是这种回答在语料和标注里被奖励得更多。
于是它偏向谁
语料不是世界的均匀采样,是「有多少人把这件事写到网上」的采样。写得多的,它熟;写得少的,它生。这个偏差是系统性的,落到具体场景里就是这几条:
语料里多的语料里少的对你的影响 英文中文,以及更小的语种同一问题换语言问,深度不一样 流行框架、大厂技术栈小众方案、国内自研工具它默认推荐的未必最合适 面向大众的通俗解释行业内部的真实做法答案听着对,落地全是坑 成功案例、正面叙述失败复盘、负面细节它对风险的估计天然偏乐观
最后一行做产品时要特别留意:让它评估一个方案,它给的往往是这个方案在网上被宣传的样子,不是它在真实项目里的样子。
应对的动作很朴素:**把「用哪一套」这个判断从它手里拿回来。**不要问「该用什么方案」,而是告诉它用哪个方案,让它在这个约束下干活。它擅长的是执行你定的路线,不是替你选路线。
缺的那一块
还有一整块东西从来没有进过语料:你公司的内部文档、你们的业务口径、没公开的行业数据、客户名单、上周才改的流程。这些不是「它了解得不够」,是它一次都没见过。
危险在于,**它对「没见过」和「见得少」的反应是一样的:照样给你一个答案。**问它一个只有你们内部才知道的字段含义,它会根据字段名的字面推一个出来,语气和它答一个真懂的问题时毫无区别。
所以这一块只能靠你补进去,途径就三条:写进提示、挂检索、给工具让它去查。**选哪条取决于这块知识有多大、多久变一次。**几百字的固定口径,直接写进提示;几百页会更新的文档,挂检索;实时变化的数据,给工具。
最后一条判断:如果一个场景里,正确答案完全依赖语料里没有的信息,那这个场景不该由模型直接回答,应该由你的系统把信息取出来、再让模型做加工。分不清这一点,做出来的功能一定是幻觉重灾区。
它对「没见过」和「见得少」的反应完全一样:照样给你一个答案
写进提示 几百字的固定口径 业务定义、语气规范、 绝不能说的几句话 最简单,但每轮都占窗口
挂检索 几百页、会更新的文档 产品手册、历史工单、 规章制度 用到才取,不占常驻窗口
给工具 每分钟都在变的数据 库存、价格、订单状态、 账户余额 检索也不够,得现查
体量越大、变得越快 →
一条判断底线 正确答案完全依赖语料里没有的信息时,这个场景就不该由模型直接回答——先由你的系统把信息取出来,再让它加工。
还有一条同样重要:**把「用哪一套」这个判断从它手里拿回来。**让它评估方案,它给的往往是这个方案在网上被宣传的样子,不是它在真实项目里的样子。它擅长执行你定的路线,不擅长替你选路线。
接着看
幻觉产生的原因 「没见过也照样答」这件事的机制,以及能防住的四个动作。
大模型与搜索引擎的区别 语料在训练之后就被扔掉了,剩下的只有权重。所以它给不出出处。
它会做的和不会做的 「选路线归你,执行归它」这条分工的完整版。
