能力评测 2026-10-05 27 分钟阅读 进阶

ThinkingBox 数据库终态评测横评:智能体的「干净失败」危机

智能体说它做完了,数据库说没有 — 121,680 次有效试验背后,工具调用成功与业务结果正确之间的巨大鸿沟

摘要

2026 年 10 月 3 日,微软与 Hugging Face 联合发布智能体评测框架 ThinkingBox:507 个状态化业务工作流、每个任务从相同的干净后端独立重复 20 次、以数据库终态与副作用而非文本输出打分。在 12 款模型的 121,680 次有效试验消融中,79,853 次失败里有 67.24% 「干净收场」——正常调用改状态工具、无报错、给用户一句体面的结束语,却把错误的字段值留在了系统里。本文拆解其评测方法论、12 款模型的 pass@1 与 20/20 一致性断层、每可靠任务成本,以及它对现有评测体系的范式挑战。

范式转移:从「说对了」到「写对了」

ThinkingBox 的官方博文标题已经说清了问题:「智能体说它做完了,数据库说没有(The Agent Said It Was Done. The Database Disagreed.)」。博文开头给了一个精心设计的案例:一位客户价值 745 美元的厨房电器在纳什维尔配送中心卡在承运商「异常」状态,比预计送达日晚了十五天。智能体的表现堪称模范——九次工具调用:拉订单、查物流、读客户档案、两次检索退款政策、确认无工单、开新工单、记录时间线、正确读出政策(该客户等级确实不符补偿条件)。然后它把工单关成「已解决」,回复客户:「您的问题已解决,还有什么可以帮您?」

错在两处:承运商异常仍然挂着,要求的终态是「挂起(hold)」而非「已解决」;客户真正的问题从头到尾没得到回答。一个检查工具调用格式的评分器会看到九次格式优美的调用;只有检查数据库写入的评分器才能发现,工单状态被写成了 solved,而要求的终态是 hold。这篇案例改编自基准任务 test_case_ST003_006,可执行检查失败的就是这一个字段——完整轨迹在论文附录 D.4 案例三。

🎯 三个关键判词

ThinkingBox 用三句话概括其评测哲学:工具调用不是结果(A tool call is not an outcome)、一次成功不是可靠性(One success is not reliability)、轨迹是主张,数据库状态才是证据(A trajectory is a claim. Database state is the evidence)。这三句话值得贴在每一个智能体工程团队的白板上。

方法论:507 工作流 × 20 次重复 × 数据库判定

ThinkingBox 与配套的 ThinkingBox-Bench 数据集已在 Hugging Face 上以 OpenEnv 接口开放,代码 MIT 许可、数据 CDLA-Permissive-2.0 许可。评测设计有几个值得注意的细节:

口径提示:本次评测共覆盖 18 款模型,而论文中的共同集合消融(common-set ablation)覆盖其中 12 款模型、计 121,680 次有效试验。部分第三方报道将两个口径混用,阅读时需注意区分。

干净失败:67.24% 的失败没有报错

这是本轮评测中最值得警惕的数字。在 12 款模型 121,680 次有效试验的消融中,79,853 次尝试未通过可执行检查;而这 79,853 次失败中,67.24% 干净收场——正常终止、调用了改状态的工具、最终没有报告任何工具错误。它们没有崩溃、没有抛异常、没有告诉用户出错了,只是安静地把错误留在数据库里:

失败类型(类别相互重叠,不合计 100%) 占比 含义
写入了错误的字段值 77.61% 该写 hold 的写了 solved,该写金额的写错数字
产生了非预期的额外副作用 43.30% 做了要求之外的状态变更
遗漏了必需的状态变更 25.36% 该做的动作没做全

失败归因方面,约五分之四的失败被归为工具处理(tool handling)而非推理(reasoning)问题——不过作者谨慎地说明,这些标签是「可观测的分类而非因果解释」。换句话说:大多数失败不是模型不会想,而是智能体在工具层面的状态管理出了错,而现有的「看轨迹、看回复」评测方式恰恰测不到这一层。

pass@1 榜单:Claude Opus 5.5 领跑、Kimi-K3 开源权重登顶

单次尝试成功率上,Claude 系模型占据前两位:

模型 pass@1 备注
Claude Opus 5.5 67.16% 全场居首
Claude Opus 5 66.50% 与 5.5 仅差 0.66 分
GPT-5.4 65.36% 闭源第三
GPT-5.6 Sol 61.91% —
Claude Sonnet 4.6 59.19% —
GPT-6 Astra 58.31% —
Kimi-K3(开源权重居首) 57.37% 零售域 82.24%,超过所有闭源模型
Qwen3.8-27B 51.70% 开源第二
DeepSeek-V4-Pro 43.26% —
Grok-4.3 14.38% 榜尾

域间波动同样剧烈:Claude Opus 4.6 在零售域拿到 68.62%,在车险域只有 8.30%。单一综合分数掩盖的领域适配差异,在这张表上被放大到了 60 分以上——这与本站此前在多个基准横评中反复提示的「分域看数」原则一致。

一致性断层:pass@1 与 20/20 的巨大落差

如果说 pass@1 榜单还在常规叙事之内,20 次重复后的一致性成绩则揭示了一个结构性断层。两个代表性数字:Kimi-K3 在 pass@20 上解决了 507 个任务中的 476 个(93.89%)——广度惊人;但在 20 次全部通过(20/20)的维度上,只剩 68 个任务(13.41%)。Claude Opus 5.5 和 Opus 5 各自把同样的 241 个任务(47.53%)做到了 20 次全过——pass@1 更高的 5.5 并没有比 Opus 5 多守住任何一个任务。

一致性维度 数值 解读
无模型 20/20 任务过半 0 款 没有任何模型能在 20 次重复中做对超过一半的任务
pass@1 保留率最高(20 轮后仍守住多数单次成绩) GPT-6 Astra 78% / Opus 5.5 与 Opus 5 各 71% 仅此三款
pass@1 保留率垫底 GLM-5.1、Kimi-K2.6、DeepSeek-V4-Pro 约 8% 单次成绩几乎不能外推为稳定表现
广度与可靠性落差之最 Kimi-K3:93.89% 至少一次 vs 13.41% 全过 「能做」与「总能做对」相差 80 分
域间波动示例 Claude Opus 4.6:零售 68.62% vs 车险 8.30% 综合分掩盖领域适配差异
📊 对生产部署的直接含义

一个退款智能体头一次处理正确、接下来四次都出错,就不配叫「能用的退款智能体」。pass@1 决定演示效果,20/20 决定能不能上生产。本轮数据说明:几乎所有模型都还卡在两者之间的鸿沟里——这才是 ThinkingBox 给行业敲的警钟。

一致性成本:每可靠任务 6.8 到 9.8 美元

研究团队按 OpenRouter 未折扣牌价(2026 年 9 月 20 日快照)为各模型定价,并明确强调这是「比较用的指数而非云账单」。换算成「每个 20/20 可靠任务的成本」后,出现了与 pass@1 排名并不重合的另一个序列:

模型 20/20 任务数 每可靠任务成本(推算口径)
GPT-5.4 128 $6.80
GPT-6 Astra 231 $7.45
Claude Opus 5.5 241 $7.80
GPT-5.6 Sol — 单次成功最便宜($0.127)→ 每可靠任务 $9.76

注:GPT-5.4 128 个可靠任务为第三方报道转述的分组结果,官方博客对该分组未完整展开;「每可靠任务成本」为按总投入除以 20/20 任务数的推算值。值得注意的悖论是:GPT-5.6 Sol 拿下了单次成功成本最低的头名,却在换算到可靠任务后变成四款中最贵——便宜的单次价格买不来可靠性,省下的 token 钱会在重试与返工中加倍还回去。

对评测体系与工程实践的三点启示

启示一:现有评测的盲区被精确定位

本站此前已多次讨论基准可信度问题(BenchJack 攻击、SWE-bench 注水、脚手架贡献近半等),但那些讨论集中在「基准被污染」「分数被高估」层面。ThinkingBox 指出的是另一个更基础的盲区:即便基准完全干净,「按文本和工具调用轨迹打分」这个判定方式本身就在系统性高估智能体——因为 67.24% 的失败根本不会在轨迹里露出破绽。数据库终态判定提供的是一类新的、更难被「表演」绕过的真值来源。

启示二:作者给出的四条工程建议(附未验证声明)

作者同时坦诚:以上措施在基准上的提升幅度尚未测量;强化学习训练仓库「即将推出」。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

启示三:与既有评测的互补而非替代

ThinkingBox 不是要取代编码类基准(Terminal-Bench、SWE-bench 系列)或工作流类基准(TAU-bench 系),它补的是「状态化业务操作」这一格:终态判定、重复稳定性、副作用审计。对正在搭建企业智能体评估体系的团队,一个务实的组合是:能力面用既有公开基准,可靠性面用 ThinkingBox 式的数据库终态 + 多次重复判定,两者结论交叉验证。

核心发现

参考来源

  1. Microsoft × Hugging Face 官方博客 — The Agent Said It Was Done. The Database Disagreed.(2026.10.03,Tuhin Kundu 等,评测数据与方法论直证)
  2. ThinkingBox 论文(案例轨迹见附录 D.4 案例三;Hugging Face 开放代码 MIT / 数据 CDLA-Permissive-2.0)
  3. AI Breaking Wire — Microsoft, Hugging Face Benchmark: Two-Thirds of Failed Agent Runs Throw No Errors(2026.10)
  4. Pivot News — Microsoft benchmark finds agents pass tool checks but fail the database(2026.10,成本与失败归因口径)
  5. ainews.bunrin.work / vitalii.no — ThinkingBox 报道(2026.10,交叉核验)