9 月的 arXiv 上,一篇署名 Google Cloud AI Research 与滑铁卢大学的论文拿出了一套叫 ScientistTwo 的系统,把「自主科研」这件事往前推了一截。它要解决的不是某一个具体科学问题,而是一个更野心勃勃的目标:给智能体一个专家提出的根本难题,它自己走完发现的全过程——建立当前最优基线、提出新假设、编排专用智能体做端到端实验、自动跑消融、再用一个模拟同行评审的 rebuttal 引擎去验证,全程不靠人插手。
和以往「科研助手」定位不同的是,ScientistTwo 把实验执行焊死在发现循环里。它先在数据子集上筛掉不靠谱的想法再做全量实验,用沙箱跑代码、用自动消融拆解增益来源、再回头修订假设;成文阶段不是简单拼稿,而是接一个闭环的模拟同行评审与 rebuttal 引擎,外加一层 meta-review 把意见喂回工作。评测时它直接对标 ICLR、ICML、NeurIPS 的录用论文——结果是生成的方案在 80.4% 的基准上超过了人类当前最优,在自动评审设置下拿到的平均评分高于人类作者写的稿子。
真正让它和「高速水厂式论文生成器」拉开距离的,是两项工程纪律。其一,经验性 rebuttal:面对审稿人的质疑,agent 不是去文字上糊弄,而是设计、写码、执行一次针对性的后续实验来回应——用新证据答旧批评。其二,CoE 完整性审计:保证 100% 的分数可复现,校验方法与代码的对应关系,并在成千上万条参考文献里清除幻觉引用。这两条合起来,把「想法」和「能跑起来的证据」绑死,而不是让二者各自漂着。
把它放进自主科研系统的演进脉络里看更有意思。此前的 AI Scientist 系列已经证明端到端科研流程可行,但依赖人工写的代码模板、实验偏线性浅层;ScientistTwo 朝「领域通用 + 树状探索 + 实证反驳」走得更远。它的出现暗示一个趋势:机器学习领域的科研速度,会越来越取决于算力和自动化闭环的尺度,人类研究者的角色上移到方向判断、问题框定与重大突破的验证。
但该泼的冷水一句不能少。论文自己承认实验以自身运行结果为主;「超过人类 SOTA」「评分高于人类稿」是在自动评审设定下得出的,真实学术共同体的接受度是另一回事。更本质的担忧是:当科研速度被自动化放大,验证环节若被同一套自动化逻辑自己审稿自己,偏差会被成倍加速。自动科研的价值在把人力从重复劳动里解放出来,而不是让「生成—验证」闭门造车。对人类研究者来说,最该守住的,恰恰是对方向与结论的最终判断权。
眼下 ScientistTwo 更像一块能力标尺,标出了「全自主科研闭环」当前能走到哪。它对智能体领域的启示更直接:长程、多智能体、带闭环验证的系统,才是把自主能力从演示变成产出的关键——这和近期一系列关于长程智能体架构的研究指向同一处。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。