做产品 PMaker
空格的键盘空格的键盘
Agent 与 Skill

Agent 评测

Agent 评测 | Agent 与 Skill | 做产品

Agent 评测

普通问答有标准答案,可以自动打分。Agent 是多步的、没有标准答案的、过程会漂移的——所以大多数人干脆不评测,靠感觉。「感觉变好了」和「真的变好了」之间,差一套能跑的评测。

你会遇到的现象

  • 调完一个参数,感觉好了一些,说不清好在哪

  • 上了新功能,不知道有没有让别的任务变差

  • 它多跑了好几轮,你没注意到账单在变厚

为什么评测难

难点有三个:

一、没有标准答案。「帮我整理这份会议的待办」——正确输出是什么?没有唯一答案,无法机器判分。

**二、过程也重要。**结果对了,但绕了 30 轮、调了 8 次工具、差点删错数据——这算成功吗?只测结果,你会漏掉这些。

**三、改动影响面大。**Agent 是系统——改一个提示词、加一个工具,可能让整个流程行为变化。不评测,你无法知道「这次改动有没有让别的任务变差」。

但这些「难」都是程度问题,不是「所以别做」的理由。最小的评测,比没有评测好一百倍。

三层指标

**① 结果层:任务完成得怎么样。**这一层最接近产品目标。由于没有标准答案,做法是人工打分——或者让更强的模型辅助打分、人再抽检。分数可以有多个维度:完成度、正确性、是否造成了副作用。

**② 过程层:它是怎么完成的。**这一层往往比结果层更早暴露问题。看运行日志:调用了哪些工具、顺序对不对、重试了几次、有没有绕路、有没有触发被拦截的动作。过程指标可以自动化统计,比结果层便宜得多。

**③ 成本层:花了多少代价。**轮数、Token 总量、时长、工具调用次数。**同一个功能,两种实现的成本可能差 10 倍。**成本要和结果、过程一起看——一个又快又省但结果平庸的方案,和一个又贵又慢但结果完美的方案,是两种不同的产品决策。

三个层次各有各的作用:成本层高频自动跑,过程层每次改动跑,结果层定期人工判。

越往下越便宜,也就越该跑得勤

① 结果层 完成度 · 正确性 · 有没有副作用 人工打分,或强模型辅助 + 人抽检 没有标准答案,这一层只能贵

定期人工判

② 过程层 工具顺序 · 重试次数 · 被拦的动作 读运行日志,可自动统计 往往比结果层更早暴露问题

每次改动跑

③ 成本层 轮数 · Token 总量 · 时长 · 调用次数 全自动,几乎零成本 同一功能,两种实现可能差 10 倍

高频自动跑

跑完第一遍,最关键的一步是把记录留作基线——没有基线,之后每次改动都无法对比。

三层不是可选项里挑一个,而是不同频率的三条线。只看结果层,你会因为太贵而干脆不测;只看成本层,你会把一个又快又省但结果平庸的方案当成进步。

最小评测集

不用等完美,按这个起步:

**准备 20 个代表性任务。**覆盖三类:常见任务(用户最常做的 80%)、边界情况(缺参数、异常输入)、危险场景(会触发高风险动作的)。宁可少而代表,不要多而随意。

**给每个任务写一份「打分卡」。**不是标准答案,是「完成到什么程度算合格」:结果是否达成、过程是否可接受(比如「允许一次重试,不允许反复试」)、成本上限(比如「不超过 10 轮」)。

**跑一遍,记录三层数据。**然后这是最关键的一步:**把这份记录留作基线。**没有基线,之后的每一次改动都无法对比。

**每次改动后重跑。**改提示词、换模型、加工具、调整循环逻辑——都跑一遍这 20 个任务,和基线对比。看三层指标各自的变化。

什么时候重测

不是所有改动都要全量评测,按改动的影响面分级:

**小改动(改一句提示词、调一个参数)→ 跑过程层和成本层。**便宜、自动、高频。结果层可以抽查几个关键任务。

**中改动(加工具、改循环逻辑、换模型)→ 全量三层。**这类改动最容易「解决 A 搞坏 B」,必须看全部 20 个任务。

**大改动(换架构、多 Agent 重新分工)→ 全量 + 上线后监控。**上线后还要继续看真实日志里的过程指标——很多跑偏只在真实流量里出现。

最后一条:**评测是产品的一部分,不是上线的门槛。**把它做成日常——有基线、有对比、有记录。跑偏不可怕,可怕的是跑偏了你不知道。

提示词迭代 普通问答的评测怎么做,Agent 评测是它的延伸。

Agent 跑偏的三种形态 过程层指标最能暴露的,就是这三种失控。

权限分级与人工断点 评测里「触发拦截」本身就是要统计的指标。