用多智能体做科研,最近一年已经不新鲜:让几个模型分工、讨论、互相挑错,是很多「AI for Science」项目的标准打法。但绝大多数这类系统,背后都有一个写死的流程——谁先想、谁来验证、走几步,都是人排好的。一篇 9 月 14 日更新的预印本描述的 Station,想试的是另一种活法:把研究环境本身打开,让智能体自己决定干什么

它和「脚本化多智能体」哪里不同

Station 被作者称为「开世界多智能体环境」。它不只是一条流水线,而是一块场地:多个来自不同模型家族的智能体(论文披露的配置是 2 个 GPT-5.5、2 个 Claude Opus 4.8、2 个 Gemini 3.1 Pro)在里头没有中央协调者,也不按固定脚本走。它们自己选研究方向、做实验、写论文,并把成果积累成一份共享知识库,后面的智能体可以读、可以引用、可以在上面继续做。

共享知识 论文库 GPT-5.5 Claude Gemini GPT-5.5 Gemini Lean 证明校验 六个研究智能体,没有中央协调者,各自选题、彼此引用、由 Lean 收口验证
图 1|Station 的特别之处在于「开世界、无总指挥」:智能体自行分工、写论文、互相引用,最后由 Lean 做形式化收口。

这套机制的要害在于「可累积」。很多多智能体系统每次运行都是一次性的,结论用完就丢;Station 让智能体的产出留在场子里,成为后续智能体的起点。论文说,在 12 道取自 AlphaEvolve 的数学构造题,外加 2 个案例研究里,有 5 道产出了作者判定为相对既有文献而言新的结果。

为什么 Lean 证明是关键一环

光说「发现了新结果」在 math 圈是不够的,所以 Station 真正值得注意的是它的证据包:团队公开了源代码、智能体之间的完整对话、智能体写下的论文,以及用 Lean 写的形式化证明制品。Lean 是一个证明助手,能一步步机械地核对形式化陈述。这意味着,读者拿到的不只是一句「我们发现了」,而是一份机器可以独立核验的推导。

增量认知:多智能体科研的真正瓶颈,往往不是「再多开几个智能体」,而是「能不能把中间结论留存、被引用、被机器核验」。Station 的价值不在于它用了多少模型,而在于它把研究过程变成了一份可审计、可复现的产物。

要冷静看待的部分

这里有两道必须说清的边界。其一,Lean 能确认的是「形式化写进 Lean 的那条陈述」,它并不自动保证这条形式化陈述和英文描述里的「新结果」严丝合缝——翻译环节仍可能出错。其二,所谓「新」,是作者本人在预印本里的判定,不是外部同行评审的结论。换句话说,这是一份证据密度很高的主张,而不是已被学界盖戳的事实。

辩证地看,Station 给「智能体能不能做科研」这个问题,提供了一版更诚实的答卷:它不靠把结论说得很满来博眼球,而是把过程、对话、代码和证明都摊开。对多智能体研究本身,它的启发是——下一步的竞争焦点,会从「谁的智能体更会聊」转向「谁的研究过程更可检查、更可累积」。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。