智能体领域有个朴素但长期被忽略的事实:大家都在比谁的 agent 最终把任务做对了,却很少系统地把「它是怎么失败的」存下来、用起来。一份新发布的 Agent Error Dataset,试图把这件事变成可训练、可评测的数据资产,量级不小——五万多对错误诊断。

Agent Error Dataset 覆盖广度 50,228 错误诊断对 来自失败轨迹 9,961 个任务 跨 33 个环境 19 套 agent harness 工程实现差异 23 个策略模型 覆盖多家底座
图 1|数据集把失败轨迹拆成「错误 → 诊断」配对,横跨多种环境、harness 与策略模型,使「它怎么错的」自此有了可规模化的样本。

具体来说,这份数据集包含 50,228 条错误诊断对,来源是 9,961 个任务里跑出来的失败轨迹,覆盖 33 个环境、19 套 agent harness 和 23 个策略模型。它的关键不在于「又多了一个基准」,而在于把「任务最终奖励是不是零」这种粗糙信号,升级成结构化的错误样本:每一条都对应一个失败片段和对其成因的诊断。换句话说,agent 的进步正从「看终点得分」转向「从它怎么失败的里学」,这份数据集是把这条路铺平的基础设施。

为什么这步重要?因为现在组织积累智能体经验,大多停留在「这次又挂了」的日志层面,真正能反哺训练和评测的结构化数据很少。一旦失败被标准化成配对数据,就能直接喂进监督微调与强化学习,也能用来评估一个 agent 是不是真的「懂错在哪」而不是碰运气。它和本站覆盖过的 SIFT(1604,用评委介导把自改进 agent 的评测成本压到约 150 美元)是同一大方向的不同切面:SIFT 解决的是「怎么便宜地评」,这份数据集解决的是「拿什么去学」。两者合起来,描出的是一条更清晰的趋势——智能体的后训练(post-training)正在从只优化最终结果,走向显式地吃失败证据。

从更宽的视角看,这份数据集也是智能体评测范式迁移的一个注脚。过去几年评测几乎都在追「终局得分」,比谁在 benchmark 上多几个点;但当 agent 真的进生产,企业关心的往往是「它为什么又挂了、挂在了哪一步、下次能不能不挂」。把失败当成结构化对象去采集和标注,等于承认一个事实:评分只是结果,诊断才是能力。那些能把失败归因而非只记红叉的团队,迭代速度会明显快过只看仪表盘的人。这也解释了为什么大厂和头部创业公司近年都在悄悄攒自己的失败库——公开数据集只是把这件事摆上了台面,真正的竞赛在各自的专有轨迹里,谁能把踩过的坑变成可复用的训练信号,谁就拥有更难抄的作业,这比再去刷几个公开基准的分数线更有长期价值。

后训练的重心迁移 旧:终局奖励 0 或 1,信息稀薄 失败只是个红叉 新:错误诊断对 结构化成因 喂进 SFT / RL 从「看最后得分」到「从怎么失败的里学」
图 2|后训练素材从稀疏的终局信号,转向稠密的错误诊断配对;这对靠自有轨迹沉淀能力的团队,是更划算的投入方向。

战略层面,这份公开数据集还点出了一块会被低估的竞争壁垒。公开的只是通用样本,真正值钱的是各家自己业务里跑出来的专有失败轨迹——谁的线上 agent 踩过的坑多、归得清,谁就拥有更难复制的训练资产。它和本站覆盖的记忆架构(1622,从压缩摘要走向结构化可溯源)也是互补关系:一个负责「记住对的」,一个负责「学会错的」,两者一起把 agent 从一次性跑通推向可持续迭代。对做智能体平台或后训练服务的团队,提前把失败数据工程化、合规化地攒起来,很可能比多训几个基座模型更实在。

当然也要留一份清醒:这份数据来自 9,961 个任务,能否代表真实生产环境里的失败分布,目前还缺独立验证;公开数据集和某家企业的专有场景之间,也存在领域错配的风险。但方向是清楚的——当行业从「能不能跑」进入「怎么越跑越好」,结构化失败数据会从边角料变成核心资产。对普通团队更现实的建议是:现在就开始把每一次 agent 失败的原因、上下文、修复动作规范化地记下来,哪怕暂时不训练,也是在为未来的后训练攒弹药,而不是等 benchmark 数字难看时才临时翻日志。