能力评测 2026-09-27 20 分钟阅读 进阶

智能体基准「大换代」横评:退役潮、Harness 换血与 AA v4.3 新账本

旧分数集体作废、评测内核决定成绩、守卫违规一次清零 — 2026 年智能体评测的三条新规则

摘要

2026 年智能体评测经历了一轮集中换代:SWE-bench Verified 因题目缺陷与污染嫌疑退役、BFCL v4 冻结、τ²-bench 电信域饱和退场、Terminal-Bench 一年迭代四代、OSWorld 2.0 接棒长程 GUI 任务。9 月 7 日 Artificial Analysis Intelligence Index v4.3 再添两笔:评测 harness 从 Terminus 2 换为模型无关的 mini-SWE-agent,业务工作流基准 AutomationBench-AA 引入「守卫违规即清零」计分。本文梳理换代图谱,并解读 v4.3 下的新格局——GPT-6 Astra 与 Claude Fable 5.1 并列 53 分,但单任务成本相差约 57%。

换代图谱:谁退役了,为什么

2026 年初到 9 月,多个曾广泛引用的智能体与模型基准集中退出历史舞台或大幅改版。综合第三方评测汇编与各评测方公告,换代图谱如下(退役原因与细节多为评测汇编转述口径,引用时需回到各评测方原始公告核对):

基准 状态(2026-09) 换代去向 换代理由
SWE-bench Verified 退役(据报道 2026 年 2 月,OpenAI 宣布) SWE-bench Pro 据评测汇编转述:审计发现约 59.4% 的难题存在测试或描述缺陷,并有训练污染迹象
BFCL v4 冻结(最后更新 2026-04-12) 无直接接棒版本 收录模型停在旧一代,无法反映当前工具调用能力
τ²-bench 被 τ³-bench 取代 仅保留银行域;电信域饱和 电信域头部模型已达 97.8–98.2% 无区分度;50+ 航空与零售任务修复后重开
Terminal-Bench 2.0 一年内迭代至 4.0(2.1→3.0→4.0) Terminal-Bench 4.0 4.0 分数区间(约 20–66%)与 2.0(约 60–80%)不可比,防饱和
OSWorld-Verified 被 OSWorld 2.0 取代(6 月 26 日) 108 个长程 GUI 任务 提升任务长度与真实性

换代理由高度收敛:饱和(分数失去区分度)、缺陷与污染(分数失去可信度)、任务过短(分数失去代表性)。这不是某一家的技术选择,而是智能体能力逼近旧基准天花板后的集体被迫升级。

⚠️ 直接后果:跨版本分数比较全部作废

Terminal-Bench 2.0 的 78 分与 4.0 的 45 分谁强?没有答案——任务集、算力与时限预算、验证方式全部变了。2026 年读评测的铁律是分数必须与版本、来源、日期三元组绑定,任何不带版本号的横评表格都应视为失效信息。

AA v4.3 双换血:harness 与工作流基准

Artificial Analysis 于 9 月 7 日发布 Intelligence Index v4.3,作为其规划的 v5 版本前最后一次大改。两处结构性变化值得逐项拆解:

换血之一:评测 harness 从 Terminus 2 换为 mini-SWE-agent

harness 是管理智能体与环境交互的软件层——工具怎么暴露、失败怎么重试、上下文怎么管理,全部由它决定。v4.3 把评测 harness 从 Terminus 2 切换为模型无关的 mini-SWE-agent,用意是削平「评测脚手架对特定模型家族更友好」的偏倚。这与本站此前多轮评测结论一致:harness 贡献已与模型本体同量级(GAIA 三口径下脚手架贡献近 50 分、SWE-bench 实测与维护者实测 24 分落差)。换 harness 意味着 v4.3 的分数与 v4.2 及之前所有版本不存在可比性,这一点评测方自己也明确提示。

换血之二:τ³-Banking 换为 AutomationBench-AA

业务工作流基准 AutomationBench-AA 是 Artificial Analysis 对 Zapier 工作流自动化基准的实现,参数如下:

维度 设定
任务规模 657 个业务工作流
模拟应用 Gmail、Slack、Salesforce、Jira 等
测试集 私有(降低污染风险)
约束 完成业务任务的同时遵守运营规则
计分 任务目标达成率;任何一次守卫(guardrail)违规即把该任务得分清零

新账本:并列的分数与分裂的成本

v4.3 榜单上,OpenAI GPT-6 Astra 与 Anthropic Claude Fable 5.1 并列最高显示分 53。但并列背后,成本结构差异显著:

模型 v4.3 显示分 加权单任务成本(最高推理档) 备注
GPT-6 Astra 53 $3.26 与 Fable 5.1 并列榜首
Claude Fable 5.1 53 $7.63 评测配置含默认回退行为;成本约为 Astra 的 2.3 倍(约 −57% 的差距)
Claude Opus 5 51 — —
Claude Fable 5 50 — —
Muse Spark 1.3 48 — —
GPT-5.6 Sol 47 — —

三点读法:

守卫计分:当安全写进能力分母

AutomationBench-AA 的计分规则值得单独一节:守卫违规一次,该任务清零。这与传统「完成即得分」的评测哲学有本质区别——它把「能不能守规矩」内嵌进了「能不能干活」的度量本身。

这个设计回应的是智能体落地中最现实的落差:一个能完成任务的智能体,如果在过程中越权发邮件、删除数据、绕过审批流,在企业环境里等于零分甚至负分。此前的评测体系里,安全与合规多以独立维度存在,与能力分数互不干扰;守卫计分则把两者耦合——能力分越高但守卫差的模型,在这个基准上反而可能低于「笨一点但守规矩」的模型。

对采购方而言,这是一个比能力排行榜更接近真实生产环境的信号。局限同样明显:657 个工作流仍是模拟应用环境,企业自有系统的守卫规则(权限矩阵、审批层级、数据分级)远比 Gmail/Slack 模拟复杂,基准表现不能直接平移。

三条新规则:怎么读 2026 年的评测分数

把这轮换代潮与 v4.3 的变化合起来,智能体评测的阅读规则可以总结为三条:

  1. 版本三元组规则:分数必须与基准版本、来源、日期绑定。Terminal-Bench 2.0 的 60–80% 区间与 4.0 的 20–66% 区间之间没有换算公式,跨版本比较一律无效;
  2. harness 共变量规则:任何智能体分数都隐含着一个 harness 变量。AA v4.3 从 Terminus 2 换到 mini-SWE-agent 后全榜重排风险,与 GAIA 系统级 92.36% 对统一脚手架 74.6% 的落差,指向同一件事——你评估的是「模型+脚手架」的组合,不是模型。采购前应在与自己业务相近的 harness 下复测;
  3. 守卫分母规则:看能力分的同时问一句——这个基准有没有把守规成本计入?没有守卫计分的榜单,会系统性高估那些「能干但越界」的模型在企业场景的可用性。

局限与争议

核心发现

参考来源

  1. Artificial Analysis — Intelligence Index v4.3 Changelog(2026.09.07,官方更新公告,经 AI Industry Today 转述并交叉核对)
  2. AI Industry Today — Artificial Analysis Updates Intelligence Index to v4.3 as Astra and Fable 5.1 Share Top Score(2026.09.08,分数与成本口径)
  3. Fleece AI — AI Agent Benchmarks 2026 Explained(2026.09.24 更新,基准换代图谱:退役/冻结/取代理由与各榜单头名)
  4. BenchLM.ai — LLM Agent Benchmarks: 26 Agentic Evals Ranked(2026.09.24 验证快照,基准分类与模型排序)
  5. Artificial Analysis — AutomationBench-AA 评测文档(守卫计分规则,经 AI Industry Today 直引)
  6. clawpk.net 研究院 — R-BENCH-07:GAIA 三口径评测、R-BENCH-14:编码智能体评测与现实鸿沟(harness 影响的既有证据)