我们习惯用「刷题」来衡量智能体:给它一道题,看它答对没。可科研的本质不是答题,而是从一堆观测里归纳出机制、再让这个机制解释更多现象——也就是牛顿从苹果落地联想到月球轨道的那一跳。9 月 30 日提交的论文 EurekaBench(arXiv 2610.00492,CMU 等多位作者),想量的是这件更难的事:智能体到底能不能做出「科学发现」。它把评估从「答对」扳到了「洞见」。
EurekaBench 设计了二十六个长程任务,横跨神经科学、计算机科学、化学、天体物理、地球物理与等离子体物理六个学科,配套三百零六条「期望洞见」——每道题不只要智能体产出机制,还要这个机制能推导出可被专家核验的科学结论。它用三根轴打分:智能体有没有遵循已知科学约束、发现的机制预测准不准、以及这些机制到底能不能产生启发后续研究的洞见。和传统跑分最大的不同在于:它问的不是「你算对了吗」,而是「你想通了吗」。一个机制哪怕拟合得漂亮,如果提炼不出能延展的洞见,在这套基准里仍算短板。
结果戳破了一些乐观预期。论文发现,当下的智能体在「预测准确度」上往往已经能压过人类科学家——它们极其擅长对着数据把曲线拟合到极致;可一旦要「从结果反推机制、再把机制讲成能启发下一步研究的洞见」,就明显落后于人。换句话说,智能体很会「拟合」,还不会「想通」。这给一路高歌的科研智能体叙事泼了盆冷水:我们离让智能体独立做出牛顿那一级的跳跃,还差着关键一截。论文也老实交代,二十六道题样本仍偏小,属于早期基准,结论要谨慎看待,不宜直接外推成「智能体做不了科研」。
把 EurekaBench 放进更大的图景里,它的价值不在排名,而在把「科研智能体」的考核从工程指标拽回科学本质。过去一年,各家纷纷把智能体推进文献调研、实验设计、数据分析,演示效果都很漂亮;但演示归演示,「发现」和「帮忙」是两回事。EurekaBench 提供了一个可复用的标尺:别只看智能体帮你跑通了多少流程,要看它能不能产出那条「连起苹果与月亮」的机制性理解。对做科研智能体的团队,这篇基准等于把 KPI 从「任务完成率」改成了「洞见产出率」。
对产业侧,这篇基准也间接回应了一个正在升温的问题:资本正往「科研智能体」里密集下注,但怎么判断钱花对了?如果只盯着「它帮我跑通了多少实验流程」,很容易把「助手熟练度」误当成「发现能力」。EurekaBench 的提醒是,评估口径得先分清楚——你买的是个省力助手,还是个能产出新机制的合作者。前者今天已经可行,后者仍卡在洞见轴上。把考核对齐到正确的轴,才不至于把拟合能力当成科研突破来欢呼,也能让投入方在立项时就把「想要哪种能力」讲明白。
当然也有局限要摆正。二十六题、三百零六条洞见,覆盖的学科虽广但每域样本有限;「洞见」本身依赖专家核验,评分口径仍带主观性;而且它测的是长程实验与机制发现,并不否定智能体在文献综述、假设生成、数据处理这些环节的实打实增益。更公允的判断是:智能体已经是称职的科研助手,但距离「科研合作者」甚至「发现者」,卡在从拟合到机制的最后一跳。EurekaBench 的意义,正是把这道坎明确地标了出来——往后谁说自己的智能体「会做科研」,先问一句:你的洞见轴打了几分。
落到行动层面,这篇基准给做科研智能体的团队一个可执行的建议:别再把评测押在「答题准确率」上,而要去构造自己的「洞见轴」——给智能体原始观测,让它产出机制假说,再找领域专家判这条假说是否真能启发下一步。哪天智能体在洞见轴上稳稳超过资深研究员,才是「会做科研」真正成立的时刻;在那之前,它仍是最好用的助手,而不是合作者。对高校与工业实验室,这未必是坏消息:把智能体定位在「假设生成加验证加速」而不是「独立发现」,反而能更快见到产出。