为什么科学任务是智能体评测的下一个坐标系
本站过去半年拆过的智能体基准,任务域高度集中在工程侧:Terminal-Bench 的终端运维、SWE-bench 系的代码修复、OSWorld 的桌面操作、Toolathlon 的工具调用、GAIA 的通用助手。这批基准把「智能体能不能干活」回答到了相当程度,但也留下了方法论上的盲区——它们把两件事固定成了常量:一是评分对象(通常只看结果对不对,不看过程揭示了什么),二是脚手架给的指导程度(同一任务对谁都是同样的提示词与工具集)。这两根轴一固定,分数看似客观,实则都是「在某个未经声明设定下的读数」。
9 月 30 日同日提交 arXiv 的两篇基准论文,各自松开了一根轴。EurekaBench 把评分对象从「预测得准不准」扩展到「机制能不能解释世界、能否指导后续研究」;CompMat-Bench 把方法论指导的多少从隐含常量变成显式的 2×2 实验变量。两篇都不约而同地瞄准科学工作而非编码工作——这不是偶然:科学任务是少数既有客观真值(自然规律不因评测而改变)、又需要长时程多步推理(提出机制、设计计算、验证预测)的领域,它给智能体评测提供了工程任务难以提供的「过程评分」空间。对以通用智能体为产品的团队(Manus、GPT-6 Astra 一类)与以长时程自动化为卖点的框架(OpenClaw、Hermes Agent 一类),科学基准测出的能力结构,比编码榜更接近「自主研究」这个终极用例。
两个基准共同给出的一个可迁移结论:把评测中的隐含设定变成显式变量之后,分数会移动数十分——而移动的方向与幅度因智能体而异。EurekaBench 里是「预测 vs 洞察」47.4 对 29.4 的口径分裂,CompMat-Bench 里是弱者双降、强者只在「长工作流×少指导」组合下失守的分化。这意味着智能体选型时追问「这个分数是怎么测出来的」,与追问「分数是多少」同等重要。
EurekaBench:四十分的分裂 — 预测追平、洞察落后
EurekaBench 的题目设计借用了科学史的隐喻:论文摘要以牛顿从行星轨道数据中发现万有引力定律开篇——分析观测数据、用数学描述模式、再用新观测(月球轨道)修正理论,最终得出「落地的苹果与绕行的行星受同一种力支配」这一跨尺度洞察。基准要测的就是这种能力:智能体能否执行长时程实验、发现能解释观测的机制,并以「这些机制能支撑的科学洞察」作为评分对象。任务集由 26 个经领域专家核验的长时程任务构成,横跨神经科学、计算机科学、化学、天体物理、地球物理与等离子体物理六个领域,合计携带 306 条「被发现的机制预期支撑」的科学洞察。
评测框架沿三个轴展开:其一,智能体能否遵循已知的科学约束;其二,其发现机制的预测准确率;其三——也是最关键的——这些机制能否产出科学洞察、能否为后续研究提供信息。据该论文与第三方解读给出的对照数字:
| 评测口径 | 智能体 | 人类科学家(发布者对照) | 差距 |
|---|---|---|---|
| 预测准确率(对留出的科学观测) | 47.4% | 48.8% | −1.4 个百分点(基本追平) |
| 洞察解释分(机制能否解释「正在发生什么」) | 29.4% | 69.7% | −40.3 个百分点(大幅落后) |
这组数字的含义,论文摘要的表述相当克制但立场清晰:「当前智能体往往过度聚焦于预测准确率的优化,在预测上超过人类科学家,而在产出科学洞察上显著不足。」翻译成工程语言:智能体很擅长把「拟合观测」这件事做到逼近任务发布者的水平——这在数学上等价于一个足够强的函数逼近器该做的事;但「从拟合里提出一个能解释现象、且能外推指导新实验的机制」是另一种能力,当前的评测结果说明它没有随着预测能力一起到位。这四十分的落差不是噪声,而是「智能」两种定义之间的距离。
还有一个容易被略过的设计细节值得记录:EurekaBench 的三条评测轴里,预测准确率是被「降权」处理的——论文把预测超过人类科学家明确表述为一种「过度聚焦(overly fixate)」的失败模式。这与主流基准「分高者胜」的价值取向截然相反:在科学发现的语境里,预测分满分而洞察分不及格的智能体,反而被论文判定为抓错了优化目标。这个价值判断本身,比任何一个具体分数都更值得智能体开发者记住。
CompMat-Bench:把「指导程度」变成变量的 94 个研究步骤
CompMat-Bench 处理的是评测可行性问题。计算材料研究的底层模拟(如密度泛函理论(DFT)计算一类的昂贵仿真)耗时耗资源,把同一批昂贵仿真在多个智能体、多次试验上重复跑,评测本身就不现实——这是科学智能体基准数量远少于编码基准的现实原因之一。CompMat-Bench 的解法是把评测对象前移:基准包含 94 个任务,全部取自已发表的计算材料学研究,每个任务要求智能体完成通向该研究科学目标的其中一步;评测方预先复现了这些研究步骤,智能体的工作是为昂贵仿真准备输入、并分析输出——昂贵仿真本身不在评测中运行,预复现的输入与结果作为固定规则评分的真值。整个过程不用大模型裁判,据论文明确声明,这规避了 LLM-as-judge 的偏倚问题。
方法论上的核心动作,是把评测条件组织成 2×2 的实验网格:任务形态(单任务 vs 由相关任务组成的工作流)与方法论指导(完整指导 vs 削减指导)两个维度交叉。在全指导单任务设定下,三个基于大模型的智能体在 94 个任务上的通过率为 66.0% 到 90.4%——这是论文给出的头条区间。但真正有意思的是网格其他三格的读法,论文的发现是一个分化结构:
| 评测条件 | 弱智能体的表现 | 表现领先者的表现 |
|---|---|---|
| 单任务 × 完整指导(头条设定) | 66.0%–90.4% 区间内 | 约 90%(区间上沿) |
| 更长的工作流 | 通过率下移 | 仍保持(单因素不构成打击) |
| 削减方法论指导 | 通过率下移 | 仍保持(单因素不构成打击) |
| 长工作流 × 削减指导(叠加) | 进一步下移 | 明显下移(两个因素叠加才击穿的组合) |
这个分化结构值得细读。「更长的任务链」与「更少的方法论喂给」这两个压力,对弱智能体是双重打击——它们既依赖任务被切得足够小,也依赖有人把方法论喂到嘴边;而对强智能体,两个因素单独出现都扛得住,只有叠加时才失守。用一句概括:弱智能体的能力边界在「任务被给成什么样」,强智能体的能力边界在「任务有多自主」。这为「智能体水平」提供了一个比单一通过率更立体的测量:同一个模型驱动的智能体,在四格网格里的衰减曲线本身就是能力画像。此外需要澄清一个读法:66.0%–90.4% 是三个智能体在该设定下的区间跨度,不能把 66.0% 与 90.4% 当作同一智能体在两个任务子集上的波动。
失败模式:科学错误多于软件错误
CompMat-Bench 的失败归因给出了一个与编码基准截然不同的分布:论文的失败分析显示,多数失败归于科学错误,而非软件使用错误。换句话说,这些基于前沿大模型的智能体在「把工具跑起来」(写输入文件、调用计算程序、解析输出)上已经相当可靠;栽跟头的地方是科学判断本身——物理模型选错、参数在错误语境下使用、对结果的科学含义解读偏差。这与编码智能体的典型失败分布(环境配置、工具链、路径问题占了大量失败)几乎互补。
这个分布对两个受众各有一条行动含义。对基准开发者:科学智能体的评测重心应当放在「科学过程」上,工具层问题已经不是主要瓶颈——这也是为什么本篇介绍的两个基准都不约而同把评分对象从「任务完成」上移到「洞察与机制」。对智能体开发者:科学场景的改进杠杆不在 harness 工程而在领域知识的注入方式——如何让模型在「预测可以拟合」之外,被结构化地要求给出机制解释与约束检查,是比调脚手架参数更深的问题。EurekaBench 的三轴设计(约束遵循、预测准确、洞察产出)实际上已经给出了一个可参考的过程评分骨架。
两个变量的共同含义:你的分数是哪个设定下的分数
把两个基准放回同一张桌子,它们各自松开一根轴、共同指向同一个结论:
| 基准 | 松开的变量 | 任务规模 | 核心量化结果 | 评分方式 |
|---|---|---|---|---|
| EurekaBench(arXiv 2610.00492) | 评分对象:预测 vs 洞察解释 | 26 任务 / 6 领域 / 306 洞察 | 预测 47.4% vs 人类 48.8%;洞察 29.4% vs 69.7% | 专家核验的洞察对照 |
| CompMat-Bench(arXiv 2610.00636) | 方法论指导程度 × 任务长度 | 94 任务 / 计算材料学 | 全指导单任务 66.0%–90.4%;长工作流与少指导组合击穿强者 | 预复现真值 + 固定规则(无 LLM 裁判) |
两者的共同含义可以直接迁移回工程评测:本站此前在 GAIA 三口径、TB4.0 双 harness、AA Index 版本差异等专题里反复处理过的「分数不可比」问题,在这两篇论文里被正面回答了——不可比的根源是隐含设定不同,而这两篇的贡献是把设定变成实验变量、把「设定敏感性」本身变成可发表的发现。当一份评测报告不再只给一个总分,而是给出「在指导程度从完整到削减、任务从单步到工作流的网格上,该智能体的分数如何衰减」时,我们才算真正测到了「智能体的自主性边界」而不只是「在被喂饱时的上限」。
三条阅读规则与口径警示
- 追问口径,再引用分数。「智能体在科学任务上追平人类科学家」这句话只对预测口径成立(47.4% vs 48.8%);换到洞察解释口径,同一个智能体落后 40 个百分点。引用任何一个科学智能体分数时,先确认它测的是拟合还是解释。
- 把「指导程度」当作选型面试题。CompMat-Bench 的 2×2 网格给采购者一个现成的测试设计:把同一个任务分别以「完整方法论文档 + 单步」与「只给目标 + 多步串联」两种方式交给候选智能体,衰减曲线陡的方案在真实研究场景里更依赖人工看护。这个测试不需要 94 个任务,两三个代表性工作流即可执行。
- 警惕「预测达标」的叙事惯性。EurekaBench 把预测超过人类科学家定性为「过度聚焦」的失败模式——在以洞察为目标的应用里,预测分数的边际价值是递减的。评估科学智能体时,应优先看约束遵循与机制解释的质量,而非拟合精度。
口径警示:本篇全部数字来自两篇 arXiv 论文(2026-09-30 提交的 v1 版本)及其第三方解读;47.4%、48.8%、29.4%、69.7% 四个数字取自论文的对照实验设定,人类科学家对照为任务发布者本人的成绩,样本量为个位数量级、不应作统计意义上的总体推断;CompMat-Bench 的 66.0%–90.4% 为三个智能体在全指导单任务设定下的区间跨度,非单一智能体波动;两个基准均未评测市面全部智能体产品,任何「某产品在 EurekaBench 得 X 分」的说法截至发稿均无出处。两个基准的排行榜后续扩展、智能体厂商的官方成绩,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。