做产品 PMaker
空格的键盘空格的键盘
基础认知

AI 目前到了哪一步

AI 目前到了哪一步 | 基础认知 | 做产品

AI 目前到了哪一步

今天的模型在语言、代码、图像和一部分工具操作上,已经能干完不少真活。但它的能力分布是坑坑洼洼的——这才是做产品时最该先知道的一件事。

你会遇到的现象

  • 演示里它能自动做完整个任务,换成你们的真实数据就频频卡住

  • 同一个模型能写出复杂代码,却数错表格里有几条记录

  • 团队在争「AI 能不能替代某个岗位」,但没人定义过任务、质量线和出错代价

锯齿状的能力

我们判断一个人的能力,靠的是一条平滑的线:他能解奥数题,那算个百分比肯定没问题。这个推断对人成立,是因为人的能力是层层垒起来的。

对模型不成立。它的能力来自训练语料里的统计分布,哪一块语料多、反馈密,哪一块就强。这跟人类眼里的「难易」几乎没关系。于是就出现了那张图里的锯齿:竞赛数学题做得漂亮,数表格行数却会错;能写完整模块,看不清截图里的小字。业内把这个叫锯齿状智能

这不矛盾,也不是模型「不认真」。它只说明一件事:每一格能力都得单独验证,不能从旁边那一格推过来。

还有第二层落差同样重要:能做出一次和能稳定做一万次是两回事。演示只需要跑通一条成功路径,产品要面对全部失败路径。中间隔着任务拆分、评估、权限、回退和人工复核——这一整段工作,才是把模型变成产品的真正内容。

三档成熟度

与其问「AI 行不行」,不如把你要做的事放进这张表里对号入座。

成熟度典型任务该怎么用

已经好用 改写、摘要、翻译、分类、信息抽取、代码补全、内容草稿 当副驾驶用。输出能被快速检查,错了重试的成本也低。

有条件可用 企业知识问答、文档分析、多模态识别、受控的工具调用、短流程 Agent 给权威资料、明确工具、固定步骤,配上自动评估和人工兜底。

仍需谨慎 长时间无人值守、高风险审批、医疗法律结论、开放网页操作、通用机器人 严格限制权限和作用范围。关键动作必须人工确认,别把输出当事实。

资料基准:2026 年 8 月。分档依据不是技术名称,而是三件事的组合:失败概率、失败后果、验证成本。同一个技术用在不同场景,档位可以完全不同。

注意最后那句。「用大模型做客服」这句话本身没有档位——回答产品咨询是第一档,自动给客户退款是第三档。决定档位的是后果,不是技术。

最容易误判的一档

Agent 是这三档里最容易被高估的。

它并不是模型突然有了「主观能动性」。它是模型在一个循环里反复做同一件事:选一个工具、读取结果、决定下一步。所以它的成功率是连乘的——单步九成的准确率,跑十步就只剩三成半。

这就是为什么 Agent 的演示和落地之间落差最大。演示展示的是一次成功路径;你的产品要面对的是每一步都可能出错、而且错误会往后累积的现实。链条越长,这个差距越大。

可行的做法不是等模型变强,是把链条截短:把长任务拆成几段,每段结束有一个能自动验证的检查点,过不了就停下来找人。

Agent 的成功率是连乘的,不是平均的

100% 50% 0%

10 步后只剩 35% 单步 95% 的话,还有 60%

1 步 5 步 10 步 15 步 单步 90%

所以可行的做法不是等模型变强,是把链条截短 把长任务拆成几段,每段结束设一个能自动验证的检查点,过不了就停下来找人。

这条曲线解释了为什么 Agent 的演示和落地之间落差最大:演示只需要跑通一条成功路径,产品要面对每一步都可能出错、而且错误会往后累积的现实。

四个判断问题

拿不准某个功能该不该做、该做到哪一档时,问这四个。

**一、答案能不能被验证?**有数据库、有规则、或者有人能核对,才适合自动化。无法验证又后果严重的结论,不该直接交付给用户。

**二、失败是不是可逆?**生成一版草稿写砸了可以重来;自动付款、删数据、对外发布则必须设闸。可逆的地方可以放手,不可逆的地方必须卡人工。

**三、任务边界清不清楚?**输入格式、可用工具、什么算完成——越明确,成功率越高。「帮我经营公司」不是一个可执行任务,「把这批工单按这五类打标」才是。

**四、经济账算不算得过来?**把模型费用、延迟、人工复核时间、以及失败损失一起算。技术上能做,不代表比现在的流程更划算——这条被跳过的次数最多。

最稳的起点,是同时满足高频、耗时、可验证、可逆的任务。然后按这个顺序放权:先让它提建议,再让它填草稿,最后才开放执行。自治不是一个开关,是一段一段交出去的。

资料来源

  • Stanford HAI — AI Index Report:年度报告,模型能力、基准表现与产业投入的公开数据基线

  • Stanford HAI — 2026 AI Index Report:本文关于「前沿模型间基准差距收窄」的判断来自该报告

  • Claude Platform — Pricing:算经济账时的一手价格来源

资料基准:2026 年 8 月。「锯齿状智能」是业内对这一现象的通行说法,非某一家的专有术语;三档成熟度的划分是本文的归纳,不是任何报告的原文结论。模型能力与价格变动很快,做决策前请以厂商当前的官方文档为准。

AI 行业的四层 这些能力最后是被算力、模型、平台和应用一层层交付出来的。

主流模型厂商的差异 从「能做什么」走到「那我该选谁」。

幻觉产生的原因 为什么可靠性不能靠等下一代模型来解决。