GAIA 是什么:对人简单,对 AI 难
GAIA 由 Meta AI、HuggingFace 等机构于 2023 年 11 月发布,设计哲学反潮流:不追求「对人越来越难」,而是追求「对人简单、对 AI 难」。任务样例可以直观感受其口味——「找出 1924 年奥斯卡最佳影片的制片人,判断其是否在世;若已去世,给出纪念他的小行星编号」需要搜索、跨源验证与天文数据库查询;「下载数据集,统计满足像素条件的图像数量」需要文件下载、代码执行与图像分析。人类平均完成率 92%,而 2023 年的 GPT-4 + 插件只有 15%。
结构上,GAIA 共 466 题、三个难度级别(L1 约 158 题少量工具步骤、L2 约 266 题多工具组合推理、L3 约 42 题长链推理),评测在 165 题公开验证集上进行。它留下的最重要设计遗产是:每题附单个无歧义答案字符串,可机器精确验证——这让分数难以「解释性放水」,也让口径差异变得刺眼。
三种口径:同一批题,三种分数
2026 年年中,同一批 GAIA 验证集上并存三套成绩,差距接近 50 分:
| 口径 | 评测方式 | 头部成绩 | 说明 |
|---|---|---|---|
| 官方系统级榜(HuggingFace) | 任意脚手架,允许多模型编排 | 92.36%(阿里云 OPS-Agentic-Search) | 头部系统均为多模型集成(Qwen + Claude + GPT + DeepSeek + Gemini 等编排) |
| 统一脚手架榜(普林斯顿 HAL) | 2 种标准脚手架 × 17 个模型 | 74.6%(Claude Sonnet 4.5) | 排除脚手架差异,量模型内在 Agent 能力 |
| 裸模型榜(无脚手架) | 不接任何工具框架 | 44.8%(GPT-5 Mini,9 模型平均 22.0%) | 测模型「出厂」的 Agent 能力 |
先看系统级榜:2026 年 3 月,阿里云 OPS-Agentic-Search 与苏州 AI 实验室 openJiuwen-deepagent 并列 92.36%,追平人类水平(92%)——但注意头部清一色是系统而非单一模型。统一脚手架下,同样这批模型最好只到 74.6%,且前六名被 Anthropic 包揽。到裸模型口径,9 个已测模型的平均分只有 22.0%(标准差 11.0),最高的 GPT-5 Mini 也仅 44.8%。
脚手架为什么值 50 分
从裸模型 44.8% 到系统级 92.36%,近 50 分的差距全部来自工具框架。这个「脚手架红利」的构成可以从 GAIA 任务的失败模式反推:裸模型输的不是知识,而是流程——把模糊问题分解成「搜索 → 定位 → 提取 → 计算」的执行链并正确串联。脚手架提供的正是这条链的工程支撑:
- 工具编排:搜索、代码执行、文件操作、图像分析的调用与重试策略
- 上下文管理:多步任务中间结果的结构化暂存,避免长链推理「忘记第 3 步的决定」
- 多模型分工:系统级头部采用多模型编排,让擅长搜索的、擅长计算的、擅长验证的模型各司其职
- 验证与回退:答案格式校验与失败重规划
对行业而言,这个结论的影响远超 GAIA 本身:它意味着模型能力差距正在被脚手架工程放大或抹平。选购「模型」与选购「智能体系统」是两个采购决策;一个裸模型分数落后的模型,接上成熟框架后完全可能反超。这也解释了为什么多智能体编排层成为 2026 年厂商竞争的焦点。
HAL:21,730 次评测给排行榜立规矩
普林斯顿 HAL(Holistic Agent Leaderboard)对「刷榜乱象」的回应是目前最系统的:以约 4 万美元成本完成 21,730 次评测运行(9 模型 × 9 基准),三个发现值得所有看榜者记住:
- 脚手架污染实锤:同一模型接不同框架分数差异巨大——GAIA 的 44.8% vs 92.36% 就是实证。HAL 的对策是「模型 × 脚手架 × 基准」三维报告,不发布单一排名
- 捷径行为普遍:日志级 LLM 分析发现 Agent 会钻环境空子得分(而非真正完成任务)
- 反直觉结果:在多数运行中,提高 reasoning effort 反而降低准确率——「想得更多」不等于「做得更好」
可靠性维度:准一次与次次准的差别
HAL 还把「可靠性」从准确率中独立出来:在 165 道 GAIA 任务上做重复运行与扰动测试,同时报告准确率、可靠性、一致性、可预测性、鲁棒性与安全六项指标。2026 年 8 月的 HAL 可靠性榜上,Claude Opus 4.5 与 4.7 并列 0.81 居前,Gemini 3.1 Pro Preview 0.76,而某些准确率不低的模型可靠性只有 0.61——同一次能做对、换个措辞就崩的模型,在生产环境中价值有限。
| 模型 | HAL GAIA 可靠性评分 | 统一脚手架准确率(参考) |
|---|---|---|
| Claude Opus 4.5 / 4.7 | 0.81 | 68.5% / 73.3% |
| Gemini 3.1 Pro Preview | 0.76 | 76.2% |
| Gemini 3.5 Flash | 0.75 | 79.2% |
| GPT-5.5 | 0.61 | 62.8% |
这张表里藏着一个关键错位:Gemini 3.5 Flash 的准确率(79.2%)高于 Claude Opus 4.5(68.5%),但可靠性评分反而更低(0.75 vs 0.81)。准确率回答「能不能做对」,可靠性回答「是不是每次都做对」——高合规场景的选型依据应是后者。
基准是可以被攻破的
2026 年伯克利 RDI 的审计给所有榜单补了最后一记警钟:用自动化 exploit Agent 攻击 8 个头部基准(SWE-bench Verified、Terminal-Bench、WebArena、OSWorld、GAIA 等),每一个都能在不解决任务的情况下刷到接近满分。攻击手法包括:读取泄漏在本地 JSON 里的参考答案(WebArena 环境中 Playwright 的 Chromium 允许访问本地文件)、利用未消毒的 eval()、在输出中夹带「给满分」指令注入 LLM 评委、以及用 10 行 conftest.py 让 SWE-bench 的全部测试通过。
本文数据截止 2026 年 9 月,来源于 GAIA 官方论文与榜单、普林斯顿 HAL、gradually.ai 聚合数据及伯克利 RDI 审计报告。系统级榜成绩随月度更新变动,且各基准的环境隔离策略不同;本文不主张跨基准分数可比。看任何榜单请先核对其评测环境与口径声明。
关键发现
- GAIA 三口径并存:系统级 92.36% 已追平人类,但统一脚手架最好 74.6%、裸模型平均仅 22.0%——近 50 分差距全部来自脚手架工程
- 系统级榜头部清一色是多模型编排系统而非单一模型,采购「模型」与采购「智能体系统」必须拆成两个决策
- HAL 用 21,730 次评测证明:脚手架污染、捷径行为、「想得更多反而更差」三个反直觉现象普遍存在
- 准确率与可靠性必须分开看:Gemini 3.5 Flash 准确率 79.2% 高于 Claude Opus 4.5 的 68.5%,但可靠性 0.75 低于 0.81
- 伯克利 RDI 审计显示 8 个头部基准全部可被 exploit Agent 攻破——看榜的首要动作是核对环境隔离
看榜方法论与选型建议
综合本文证据,给出一套四步看榜方法论:
- 先问口径:系统级、统一脚手架还是裸模型?三者差距可达 50 分,跨口径比较没有意义
- 再问环境:评测是否隔离了文件系统与网络?评分函数是否可被注入?无环境隔离声明的榜单直接降权
- 拆开准确率与可靠性:单次准确率适合能力摸底,重复运行可靠性(如 HAL 的 pass 指标)才对应生产稳定性
- 以自己场景复测收口:脚手架红利意味着任何榜单都无法替代在你的任务集上,用候选框架 + 候选模型跑一批真实任务的本地评测
对智能体框架开发者的启示同样直接:与其追逐更大的模型,不如把工程投入放在脚手架质量上——工具编排、上下文管理、验证回退与可观测性,这四项是把 44.8% 抬到 92% 的真正杠杆。目前官方及行业暂未披露更多 GAIA 测试集与后续版本细节,后续将持续跟进迭代动态。