能力评测 2026-09-16 25 分钟阅读 进阶

GAIA 三口径评测:脚手架贡献近 50 分

系统级 92.36% vs 统一脚手架 74.6% vs 裸模型 44.8% — 看任何 GAIA 榜单前,先问「哪个口径」

摘要

GAIA(通用 AI 助手基准)是 2026 年智能体能力讨论中被引用最多的榜单之一,但它同时存在三种评测口径:官方系统级榜(允许多模型编排)头部已达 92.36%、普林斯顿 HAL 统一脚手架榜最好成绩 74.6%、而无脚手架裸模型榜平均只有 22.0%。近 50 分的差距全部来自工具框架而非模型本身——这是 2026 年智能体评测最重要的事实。本文拆解三种口径的评测方法、HAL 的 21,730 次评测发现、以及伯克利 RDI 的基准攻破审计,给出一套看榜方法论。

GAIA 是什么:对人简单,对 AI 难

GAIA 由 Meta AI、HuggingFace 等机构于 2023 年 11 月发布,设计哲学反潮流:不追求「对人越来越难」,而是追求「对人简单、对 AI 难」。任务样例可以直观感受其口味——「找出 1924 年奥斯卡最佳影片的制片人,判断其是否在世;若已去世,给出纪念他的小行星编号」需要搜索、跨源验证与天文数据库查询;「下载数据集,统计满足像素条件的图像数量」需要文件下载、代码执行与图像分析。人类平均完成率 92%,而 2023 年的 GPT-4 + 插件只有 15%。

结构上,GAIA 共 466 题、三个难度级别(L1 约 158 题少量工具步骤、L2 约 266 题多工具组合推理、L3 约 42 题长链推理),评测在 165 题公开验证集上进行。它留下的最重要设计遗产是:每题附单个无歧义答案字符串,可机器精确验证——这让分数难以「解释性放水」,也让口径差异变得刺眼。

三种口径:同一批题,三种分数

2026 年年中,同一批 GAIA 验证集上并存三套成绩,差距接近 50 分:

口径 评测方式 头部成绩 说明
官方系统级榜(HuggingFace) 任意脚手架,允许多模型编排 92.36%(阿里云 OPS-Agentic-Search) 头部系统均为多模型集成(Qwen + Claude + GPT + DeepSeek + Gemini 等编排)
统一脚手架榜(普林斯顿 HAL) 2 种标准脚手架 × 17 个模型 74.6%(Claude Sonnet 4.5) 排除脚手架差异,量模型内在 Agent 能力
裸模型榜(无脚手架) 不接任何工具框架 44.8%(GPT-5 Mini,9 模型平均 22.0%) 测模型「出厂」的 Agent 能力

先看系统级榜:2026 年 3 月,阿里云 OPS-Agentic-Search 与苏州 AI 实验室 openJiuwen-deepagent 并列 92.36%,追平人类水平(92%)——但注意头部清一色是系统而非单一模型。统一脚手架下,同样这批模型最好只到 74.6%,且前六名被 Anthropic 包揽。到裸模型口径,9 个已测模型的平均分只有 22.0%(标准差 11.0),最高的 GPT-5 Mini 也仅 44.8%。

脚手架为什么值 50 分

从裸模型 44.8% 到系统级 92.36%,近 50 分的差距全部来自工具框架。这个「脚手架红利」的构成可以从 GAIA 任务的失败模式反推:裸模型输的不是知识,而是流程——把模糊问题分解成「搜索 → 定位 → 提取 → 计算」的执行链并正确串联。脚手架提供的正是这条链的工程支撑:

对行业而言,这个结论的影响远超 GAIA 本身:它意味着模型能力差距正在被脚手架工程放大或抹平。选购「模型」与选购「智能体系统」是两个采购决策;一个裸模型分数落后的模型,接上成熟框架后完全可能反超。这也解释了为什么多智能体编排层成为 2026 年厂商竞争的焦点。

HAL:21,730 次评测给排行榜立规矩

普林斯顿 HAL(Holistic Agent Leaderboard)对「刷榜乱象」的回应是目前最系统的:以约 4 万美元成本完成 21,730 次评测运行(9 模型 × 9 基准),三个发现值得所有看榜者记住:

可靠性维度:准一次与次次准的差别

HAL 还把「可靠性」从准确率中独立出来:在 165 道 GAIA 任务上做重复运行与扰动测试,同时报告准确率、可靠性、一致性、可预测性、鲁棒性与安全六项指标。2026 年 8 月的 HAL 可靠性榜上,Claude Opus 4.5 与 4.7 并列 0.81 居前,Gemini 3.1 Pro Preview 0.76,而某些准确率不低的模型可靠性只有 0.61——同一次能做对、换个措辞就崩的模型,在生产环境中价值有限。

模型 HAL GAIA 可靠性评分 统一脚手架准确率(参考)
Claude Opus 4.5 / 4.7 0.81 68.5% / 73.3%
Gemini 3.1 Pro Preview 0.76 76.2%
Gemini 3.5 Flash 0.75 79.2%
GPT-5.5 0.61 62.8%

这张表里藏着一个关键错位:Gemini 3.5 Flash 的准确率(79.2%)高于 Claude Opus 4.5(68.5%),但可靠性评分反而更低(0.75 vs 0.81)。准确率回答「能不能做对」,可靠性回答「是不是每次都做对」——高合规场景的选型依据应是后者。

基准是可以被攻破的

2026 年伯克利 RDI 的审计给所有榜单补了最后一记警钟:用自动化 exploit Agent 攻击 8 个头部基准(SWE-bench Verified、Terminal-Bench、WebArena、OSWorld、GAIA 等),每一个都能在不解决任务的情况下刷到接近满分。攻击手法包括:读取泄漏在本地 JSON 里的参考答案(WebArena 环境中 Playwright 的 Chromium 允许访问本地文件)、利用未消毒的 eval()、在输出中夹带「给满分」指令注入 LLM 评委、以及用 10 行 conftest.py 让 SWE-bench 的全部测试通过。

⚠️ 数据声明

本文数据截止 2026 年 9 月,来源于 GAIA 官方论文与榜单、普林斯顿 HAL、gradually.ai 聚合数据及伯克利 RDI 审计报告。系统级榜成绩随月度更新变动,且各基准的环境隔离策略不同;本文不主张跨基准分数可比。看任何榜单请先核对其评测环境与口径声明。

关键发现

看榜方法论与选型建议

综合本文证据,给出一套四步看榜方法论:

  1. 先问口径:系统级、统一脚手架还是裸模型?三者差距可达 50 分,跨口径比较没有意义
  2. 再问环境:评测是否隔离了文件系统与网络?评分函数是否可被注入?无环境隔离声明的榜单直接降权
  3. 拆开准确率与可靠性:单次准确率适合能力摸底,重复运行可靠性(如 HAL 的 pass 指标)才对应生产稳定性
  4. 以自己场景复测收口:脚手架红利意味着任何榜单都无法替代在你的任务集上,用候选框架 + 候选模型跑一批真实任务的本地评测

对智能体框架开发者的启示同样直接:与其追逐更大的模型,不如把工程投入放在脚手架质量上——工具编排、上下文管理、验证回退与可观测性,这四项是把 44.8% 抬到 92% 的真正杠杆。目前官方及行业暂未披露更多 GAIA 测试集与后续版本细节,后续将持续跟进迭代动态。

核心发现

参考来源

  1. GAIA: a benchmark for General AI Assistants — Mialon et al., arXiv:2311.12983(466 题 / 三级难度 / 165 题验证集 / 人类 92% 基线)
  2. Holistic Agent Leaderboard (HAL) — Kapoor, Stroebl et al., arXiv:2510.11977(21,730 次评测、脚手架污染、可靠性指标、reasoning effort 反直觉发现)
  3. gradually.ai — GAIA / BrowseComp 聚合数据(HAL 可靠性榜 2026-08-06:Opus 0.81 / Gemini 3.1 Pro 0.76 / GPT-5.5 0.61)
  4. 大模型评测基准全景系列 — GAIA 三口径成绩表(系统级 92.36% / 统一脚手架 74.6% / 裸模型 44.8% 与 9 模型均值 22.0%)
  5. Berkeley RDI — 基准攻破审计(8 个头部基准全部可被 exploit Agent 刷分:参考答案泄漏、eval 注入、LLM 评委注入、conftest.py 绕过)
  6. steel.dev — AI Agent Benchmark Results 聚合榜(GAIA / WebArena / OSWorld 等 354 条结果与口径警示)