换代图谱:谁退役了,为什么
2026 年初到 9 月,多个曾广泛引用的智能体与模型基准集中退出历史舞台或大幅改版。综合第三方评测汇编与各评测方公告,换代图谱如下(退役原因与细节多为评测汇编转述口径,引用时需回到各评测方原始公告核对):
| 基准 | 状态(2026-09) | 换代去向 | 换代理由 |
|---|---|---|---|
| SWE-bench Verified | 退役(据报道 2026 年 2 月,OpenAI 宣布) | SWE-bench Pro | 据评测汇编转述:审计发现约 59.4% 的难题存在测试或描述缺陷,并有训练污染迹象 |
| BFCL v4 | 冻结(最后更新 2026-04-12) | 无直接接棒版本 | 收录模型停在旧一代,无法反映当前工具调用能力 |
| τ²-bench | 被 τ³-bench 取代 | 仅保留银行域;电信域饱和 | 电信域头部模型已达 97.8–98.2% 无区分度;50+ 航空与零售任务修复后重开 |
| Terminal-Bench 2.0 | 一年内迭代至 4.0(2.1→3.0→4.0) | Terminal-Bench 4.0 | 4.0 分数区间(约 20–66%)与 2.0(约 60–80%)不可比,防饱和 |
| OSWorld-Verified | 被 OSWorld 2.0 取代(6 月 26 日) | 108 个长程 GUI 任务 | 提升任务长度与真实性 |
换代理由高度收敛:饱和(分数失去区分度)、缺陷与污染(分数失去可信度)、任务过短(分数失去代表性)。这不是某一家的技术选择,而是智能体能力逼近旧基准天花板后的集体被迫升级。
Terminal-Bench 2.0 的 78 分与 4.0 的 45 分谁强?没有答案——任务集、算力与时限预算、验证方式全部变了。2026 年读评测的铁律是分数必须与版本、来源、日期三元组绑定,任何不带版本号的横评表格都应视为失效信息。
AA v4.3 双换血:harness 与工作流基准
Artificial Analysis 于 9 月 7 日发布 Intelligence Index v4.3,作为其规划的 v5 版本前最后一次大改。两处结构性变化值得逐项拆解:
换血之一:评测 harness 从 Terminus 2 换为 mini-SWE-agent
harness 是管理智能体与环境交互的软件层——工具怎么暴露、失败怎么重试、上下文怎么管理,全部由它决定。v4.3 把评测 harness 从 Terminus 2 切换为模型无关的 mini-SWE-agent,用意是削平「评测脚手架对特定模型家族更友好」的偏倚。这与本站此前多轮评测结论一致:harness 贡献已与模型本体同量级(GAIA 三口径下脚手架贡献近 50 分、SWE-bench 实测与维护者实测 24 分落差)。换 harness 意味着 v4.3 的分数与 v4.2 及之前所有版本不存在可比性,这一点评测方自己也明确提示。
换血之二:τ³-Banking 换为 AutomationBench-AA
业务工作流基准 AutomationBench-AA 是 Artificial Analysis 对 Zapier 工作流自动化基准的实现,参数如下:
| 维度 | 设定 |
|---|---|
| 任务规模 | 657 个业务工作流 |
| 模拟应用 | Gmail、Slack、Salesforce、Jira 等 |
| 测试集 | 私有(降低污染风险) |
| 约束 | 完成业务任务的同时遵守运营规则 |
| 计分 | 任务目标达成率;任何一次守卫(guardrail)违规即把该任务得分清零 |
新账本:并列的分数与分裂的成本
v4.3 榜单上,OpenAI GPT-6 Astra 与 Anthropic Claude Fable 5.1 并列最高显示分 53。但并列背后,成本结构差异显著:
| 模型 | v4.3 显示分 | 加权单任务成本(最高推理档) | 备注 |
|---|---|---|---|
| GPT-6 Astra | 53 | $3.26 | 与 Fable 5.1 并列榜首 |
| Claude Fable 5.1 | 53 | $7.63 | 评测配置含默认回退行为;成本约为 Astra 的 2.3 倍(约 −57% 的差距) |
| Claude Opus 5 | 51 | — | — |
| Claude Fable 5 | 50 | — | — |
| Muse Spark 1.3 | 48 | — | — |
| GPT-5.6 Sol | 47 | — | — |
三点读法:
- 并列不等于同构:聚合分相同不代表单项任务表现一致,两款模型的能力分布不同,选型要看自身工作负载的构成;
- 成本差距大于能力差距:榜首都差出 57% 的单任务成本,中下游差距只会更大——成本效率应与能力分一起进入选型公式;
- 成本口径的边界:报告的单任务成本反映基准工作负载与 token 定价,不是跑真实业务流程的固定报价,迁移测算仍需自建基线。
守卫计分:当安全写进能力分母
AutomationBench-AA 的计分规则值得单独一节:守卫违规一次,该任务清零。这与传统「完成即得分」的评测哲学有本质区别——它把「能不能守规矩」内嵌进了「能不能干活」的度量本身。
这个设计回应的是智能体落地中最现实的落差:一个能完成任务的智能体,如果在过程中越权发邮件、删除数据、绕过审批流,在企业环境里等于零分甚至负分。此前的评测体系里,安全与合规多以独立维度存在,与能力分数互不干扰;守卫计分则把两者耦合——能力分越高但守卫差的模型,在这个基准上反而可能低于「笨一点但守规矩」的模型。
对采购方而言,这是一个比能力排行榜更接近真实生产环境的信号。局限同样明显:657 个工作流仍是模拟应用环境,企业自有系统的守卫规则(权限矩阵、审批层级、数据分级)远比 Gmail/Slack 模拟复杂,基准表现不能直接平移。
三条新规则:怎么读 2026 年的评测分数
把这轮换代潮与 v4.3 的变化合起来,智能体评测的阅读规则可以总结为三条:
- 版本三元组规则:分数必须与基准版本、来源、日期绑定。Terminal-Bench 2.0 的 60–80% 区间与 4.0 的 20–66% 区间之间没有换算公式,跨版本比较一律无效;
- harness 共变量规则:任何智能体分数都隐含着一个 harness 变量。AA v4.3 从 Terminus 2 换到 mini-SWE-agent 后全榜重排风险,与 GAIA 系统级 92.36% 对统一脚手架 74.6% 的落差,指向同一件事——你评估的是「模型+脚手架」的组合,不是模型。采购前应在与自己业务相近的 harness 下复测;
- 守卫分母规则:看能力分的同时问一句——这个基准有没有把守规成本计入?没有守卫计分的榜单,会系统性高估那些「能干但越界」的模型在企业场景的可用性。
局限与争议
- 二手汇编口径:SWE-bench Verified 退役细节(59.4% 缺陷比例)与 BFCL 冻结时间来自第三方评测汇编转述,非本站对原始公告的直接核验,引用时应回溯源公告
- 成本数字的语境依赖:$3.26 对 $7.63 是基准负载下的加权平均,且 Fable 5.1 的评测配置含默认回退行为,配置差异本身影响成本可比性
- 私有测试集的双刃剑:AutomationBench-AA 的私有集降低污染,但也让外部无法独立审计任务分布与守卫规则的覆盖面
- 换代节奏的副作用:一年四代的 Terminal-Bench 让长期追踪成本陡增,企业自建评测基线的价值反而上升
- v5 仍未落地:v4.3 被官方定位为 v5 前的过渡,测试面还会变;该索引后续的完整计分权重构成,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态