「能解出来」和「每次都解出来」是两件事
IBM Research 团队在 Hugging Face 博客上发布了这项研究。一个基于 GPT-4.1 的 ReAct 智能体,在 AppWorld 基准的常规测试分割上跑五次,平均成功率 77.4%;但如果按「五次全部成功」来算,只有 53.0% 的任务达标。两者相差 24.4 个百分点,在困难任务上这个差距接近 30 个百分点。
团队把这个差称为「一致性缺口」,并给出了配套的诊断工具 Consistency Analyzer,以及一类新的可注入准则。按团队口径,准则把缺口从 24.4 个百分点压到 12.0 个百分点。
缺口的定义:三个指标不能混用
标准评测报的是 Mean@k——跑 k 次,把通过率取平均。它回答的是「这个智能体平均有多强」,不回答「同一个请求再来一遍,它还成不成」。
另外两个指标常被忽略。Pass@k 是乐观口径:k 次里至少有一次成功就算过,适合结果可以被验证并重试的场景。Pass^k 是悲观口径:k 次每一次都要成功才算过,适合用户只问一次、且期待确定答案的场景。三者的关系恒定为 Pass^k 不高于 Mean@k,Mean@k 不高于 Pass@k。平均值与悲观口径之间的差,就是那些「能做对、但做不稳」的任务。
团队点出了两个具体领域:财务交易对账与合同义务检查。在这类工作流里,同一类请求会被反复提交,如果一次成功、下一次同样的请求失败,那不是一个可以接受的瑕疵,而是一个能直接卡住上线的障碍。
根因在「平局」上,不在模型大小上
一致性缺口不是靠换更大的模型解决的,因为它不是能力问题。论文的解释是:智能体每一步决策——调哪个接口、传什么参数、要不要重试——都是从 token 概率分布里采样出来的。分布「尖」的时候,概率集中在一个选项上,多跑几次答案稳定;分布「平」的时候,几个选项的概率接近,就成了平局。
平局最怕微小扰动。图形处理器浮点运算的非结合性、请求批处理的差异,这类平台层面的噪声在尖分布下不足以改变赢家,在平分布下却足以把排名换掉。一个任务里串着几十个这样的决策,至少翻一次的概率会迅速累积。
更反直觉的是,把温度调到 0 并不解决这个问题。贪心解码和固定随机种子控制的是「如何把分布变成一个 token」,并不改变分布本身。在托管接口上,概率的轻微漂移足以让一个平局在两次运行之间倒向不同结果,哪怕温度设成 0。
诊断方式:一条轨迹就够,不需要重跑任务
Consistency Analyzer 的思路是把一致性问题变成一个可搜索的问题。给它一条已经记录下来的轨迹,它逐步重放,在每一步向模型请求多次补全,默认是五次——注意,这不是重新跑整个任务,也不与工具或环境交互,只是在已经固定的上下文上再采几次样。
由此得到每一步的一致性分数,写成一张记分卡,指出哪些决策点在下一次运行里最容易翻盘。整个过程是黑盒的:不需要模型内部的概率输出,只需要你手里已经有的那份轨迹。对需要在规模化场景下评估智能体的团队来说,这个成本约束很关键——它把「评估一致性」从重跑基准,变成了对既有轨迹的一次加工。
修复方式:把「容易翻盘」写成准则
被标记出来的步骤会转成一条条可注入的准则,进入团队此前开源的智能体演化框架已有的存储与检索管线,在推理时回灌给智能体。值得注意的是这些准则不写具体答案,而是写反复出现的失稳模式。
论文给出的两个例子很具体。统计笔记里的复选框式标记时,要用按行锚定的正则匹配,而不是普通子串计数,因为笔记标题行常常会在图例里重复出现同一个符号;查询笔记类内容时,要检查是否存在多个匹配、确认找对了那一条再往下走。这类问题在各个任务里反复出现,属于典型的「这次做对了,但下次很容易做错」。
效果按团队口径是:一致性缺口从 24.4 个百分点降到 12.0 个百分点,同任务的五次全过率提升 16.0 个百分点,相似任务提升 13.0 个百分点,平均准确率没有下降(另一处口径称平均准确率从 77.4% 提升到 81.0%)。相似任务也能提升,说明准则不只在生成它的那批轨迹上起作用,带有一定泛化性;研究还报告准则迁移到了更小的开源权重模型上。
口径与局限
需要说明的是,这些数字来自 IBM Research 自己的基准、自己的方法,尚未被第三方独立复现。AppWorld 的测试集规模、任务分布与真实企业工作流之间的距离,也需要读者自行判断。
另外,一致性准则解决的是「同样的输入不要给出不同结果」,它不解决「本来就做不对」。能力上限与稳定性是两个独立维度:一个智能体可以既能力不足又高度稳定,也可以能力强但每次都走不同的路。这项研究处理的是后者带来的可操作性,而不是前者。
对采购与工程的意义
最直接的用途是给评测清单加一列。对重复性强的业务流,一次成功没有意义,需要看的是同一请求反复提交时的达标率。团队的建议是:向厂商索要指标时把悲观口径与平均值并列要求,并把只报平均值的智能体默认视为「可复现性未经验证」。
对已经上线的团队,工具层面的启示是翻盘点可以定位,而且定位成本不高——一条轨迹、几次重采样,不需要重跑整套基准。这意味着一致性可以从「上线后靠运气发现问题」变成「发布前的一张检查表」。这与九月里另一批关于评测与可观测性的工作方向一致:评测正在从「打一个分」转向「找出不稳的那几步」。
结语
「演示成功、复现失败」长期被当作智能体落地过程中的玄学,被归因为模型随机性或运气。IBM 这次做的事情,是把它变成一个有名有姓、有指标、有诊断工具的量。24.4 个百分点这个数字的价值不在于它有多大,而在于它此前一直藏在平均值里,没有被报出来。