范式转移:从「说对了」到「写对了」
ThinkingBox 的官方博文标题已经说清了问题:「智能体说它做完了,数据库说没有(The Agent Said It Was Done. The Database Disagreed.)」。博文开头给了一个精心设计的案例:一位客户价值 745 美元的厨房电器在纳什维尔配送中心卡在承运商「异常」状态,比预计送达日晚了十五天。智能体的表现堪称模范——九次工具调用:拉订单、查物流、读客户档案、两次检索退款政策、确认无工单、开新工单、记录时间线、正确读出政策(该客户等级确实不符补偿条件)。然后它把工单关成「已解决」,回复客户:「您的问题已解决,还有什么可以帮您?」
错在两处:承运商异常仍然挂着,要求的终态是「挂起(hold)」而非「已解决」;客户真正的问题从头到尾没得到回答。一个检查工具调用格式的评分器会看到九次格式优美的调用;只有检查数据库写入的评分器才能发现,工单状态被写成了 solved,而要求的终态是 hold。这篇案例改编自基准任务 test_case_ST003_006,可执行检查失败的就是这一个字段——完整轨迹在论文附录 D.4 案例三。
ThinkingBox 用三句话概括其评测哲学:工具调用不是结果(A tool call is not an outcome)、一次成功不是可靠性(One success is not reliability)、轨迹是主张,数据库状态才是证据(A trajectory is a claim. Database state is the evidence)。这三句话值得贴在每一个智能体工程团队的白板上。
方法论:507 工作流 × 20 次重复 × 数据库判定
ThinkingBox 与配套的 ThinkingBox-Bench 数据集已在 Hugging Face 上以 OpenEnv 接口开放,代码 MIT 许可、数据 CDLA-Permissive-2.0 许可。评测设计有几个值得注意的细节:
- 任务构成:507 个状态化业务工作流,每个任务设定初始后端状态、用户目标、一组 MCP 工具和领域政策
- 重复设计:每个任务从完全相同的干净后端独立运行 20 次,模拟真实生产中「同一操作每天重复发生」的场景
- 判定机制:副作用提取器(side-effect extractor)推导实际发生的状态变更,确定性判定器(deterministic judges)将其与要求的终态比对——477 个任务仅按状态判定,30 个任务附加回复质量评分
- 三项指标:pass@1(单次尝试成功率,回答「通常做得怎么样」)、pass@20(20 次中至少成功一次的任务占比,回答「它到底能不能做到」)、observed 20/20(20 次全部通过的任务数,回答「能不能永远正确」)
- 合成声明:官方明确说明所有任务都是按企业模式重构的合成场景,其中不存在真实客户
口径提示:本次评测共覆盖 18 款模型,而论文中的共同集合消融(common-set ablation)覆盖其中 12 款模型、计 121,680 次有效试验。部分第三方报道将两个口径混用,阅读时需注意区分。
干净失败:67.24% 的失败没有报错
这是本轮评测中最值得警惕的数字。在 12 款模型 121,680 次有效试验的消融中,79,853 次尝试未通过可执行检查;而这 79,853 次失败中,67.24% 干净收场——正常终止、调用了改状态的工具、最终没有报告任何工具错误。它们没有崩溃、没有抛异常、没有告诉用户出错了,只是安静地把错误留在数据库里:
| 失败类型(类别相互重叠,不合计 100%) | 占比 | 含义 |
|---|---|---|
| 写入了错误的字段值 | 77.61% | 该写 hold 的写了 solved,该写金额的写错数字 |
| 产生了非预期的额外副作用 | 43.30% | 做了要求之外的状态变更 |
| 遗漏了必需的状态变更 | 25.36% | 该做的动作没做全 |
失败归因方面,约五分之四的失败被归为工具处理(tool handling)而非推理(reasoning)问题——不过作者谨慎地说明,这些标签是「可观测的分类而非因果解释」。换句话说:大多数失败不是模型不会想,而是智能体在工具层面的状态管理出了错,而现有的「看轨迹、看回复」评测方式恰恰测不到这一层。
pass@1 榜单:Claude Opus 5.5 领跑、Kimi-K3 开源权重登顶
单次尝试成功率上,Claude 系模型占据前两位:
| 模型 | pass@1 | 备注 |
|---|---|---|
| Claude Opus 5.5 | 67.16% | 全场居首 |
| Claude Opus 5 | 66.50% | 与 5.5 仅差 0.66 分 |
| GPT-5.4 | 65.36% | 闭源第三 |
| GPT-5.6 Sol | 61.91% | — |
| Claude Sonnet 4.6 | 59.19% | — |
| GPT-6 Astra | 58.31% | — |
| Kimi-K3(开源权重居首) | 57.37% | 零售域 82.24%,超过所有闭源模型 |
| Qwen3.8-27B | 51.70% | 开源第二 |
| DeepSeek-V4-Pro | 43.26% | — |
| Grok-4.3 | 14.38% | 榜尾 |
域间波动同样剧烈:Claude Opus 4.6 在零售域拿到 68.62%,在车险域只有 8.30%。单一综合分数掩盖的领域适配差异,在这张表上被放大到了 60 分以上——这与本站此前在多个基准横评中反复提示的「分域看数」原则一致。
一致性断层:pass@1 与 20/20 的巨大落差
如果说 pass@1 榜单还在常规叙事之内,20 次重复后的一致性成绩则揭示了一个结构性断层。两个代表性数字:Kimi-K3 在 pass@20 上解决了 507 个任务中的 476 个(93.89%)——广度惊人;但在 20 次全部通过(20/20)的维度上,只剩 68 个任务(13.41%)。Claude Opus 5.5 和 Opus 5 各自把同样的 241 个任务(47.53%)做到了 20 次全过——pass@1 更高的 5.5 并没有比 Opus 5 多守住任何一个任务。
| 一致性维度 | 数值 | 解读 |
|---|---|---|
| 无模型 20/20 任务过半 | 0 款 | 没有任何模型能在 20 次重复中做对超过一半的任务 |
| pass@1 保留率最高(20 轮后仍守住多数单次成绩) | GPT-6 Astra 78% / Opus 5.5 与 Opus 5 各 71% | 仅此三款 |
| pass@1 保留率垫底 | GLM-5.1、Kimi-K2.6、DeepSeek-V4-Pro 约 8% | 单次成绩几乎不能外推为稳定表现 |
| 广度与可靠性落差之最 | Kimi-K3:93.89% 至少一次 vs 13.41% 全过 | 「能做」与「总能做对」相差 80 分 |
| 域间波动示例 | Claude Opus 4.6:零售 68.62% vs 车险 8.30% | 综合分掩盖领域适配差异 |
一个退款智能体头一次处理正确、接下来四次都出错,就不配叫「能用的退款智能体」。pass@1 决定演示效果,20/20 决定能不能上生产。本轮数据说明:几乎所有模型都还卡在两者之间的鸿沟里——这才是 ThinkingBox 给行业敲的警钟。
一致性成本:每可靠任务 6.8 到 9.8 美元
研究团队按 OpenRouter 未折扣牌价(2026 年 9 月 20 日快照)为各模型定价,并明确强调这是「比较用的指数而非云账单」。换算成「每个 20/20 可靠任务的成本」后,出现了与 pass@1 排名并不重合的另一个序列:
| 模型 | 20/20 任务数 | 每可靠任务成本(推算口径) |
|---|---|---|
| GPT-5.4 | 128 | $6.80 |
| GPT-6 Astra | 231 | $7.45 |
| Claude Opus 5.5 | 241 | $7.80 |
| GPT-5.6 Sol | — | 单次成功最便宜($0.127)→ 每可靠任务 $9.76 |
注:GPT-5.4 128 个可靠任务为第三方报道转述的分组结果,官方博客对该分组未完整展开;「每可靠任务成本」为按总投入除以 20/20 任务数的推算值。值得注意的悖论是:GPT-5.6 Sol 拿下了单次成功成本最低的头名,却在换算到可靠任务后变成四款中最贵——便宜的单次价格买不来可靠性,省下的 token 钱会在重试与返工中加倍还回去。
对评测体系与工程实践的三点启示
启示一:现有评测的盲区被精确定位
本站此前已多次讨论基准可信度问题(BenchJack 攻击、SWE-bench 注水、脚手架贡献近半等),但那些讨论集中在「基准被污染」「分数被高估」层面。ThinkingBox 指出的是另一个更基础的盲区:即便基准完全干净,「按文本和工具调用轨迹打分」这个判定方式本身就在系统性高估智能体——因为 67.24% 的失败根本不会在轨迹里露出破绽。数据库终态判定提供的是一类新的、更难被「表演」绕过的真值来源。
启示二:作者给出的四条工程建议(附未验证声明)
- 提交前检查终态:在把变更标记为完成之前,校验数据库终态是否与要求一致
- 给工具错误分类:让重试只针对可恢复的错误类别,避免盲目重跑
- 收窄工具面:减少可用工具数量,降低误用空间
- 不可逆操作加人工审批:对难以低成本撤销的变更设置人在回路
作者同时坦诚:以上措施在基准上的提升幅度尚未测量;强化学习训练仓库「即将推出」。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
启示三:与既有评测的互补而非替代
ThinkingBox 不是要取代编码类基准(Terminal-Bench、SWE-bench 系列)或工作流类基准(TAU-bench 系),它补的是「状态化业务操作」这一格:终态判定、重复稳定性、副作用审计。对正在搭建企业智能体评估体系的团队,一个务实的组合是:能力面用既有公开基准,可靠性面用 ThinkingBox 式的数据库终态 + 多次重复判定,两者结论交叉验证。