智能体科研大多还停留在「纸上」或仿真里:跑得再漂亮,也常是合成数据上的自娱自乐。一篇 2026 年 9 月 14 日首发的开放获取论文(发表于 Advanced Science)拿出了不一样的证据——一套分层多智能体系统,真的把科研流程从头跑到尾,而且跑的是真人。它自主提出假设、设计并预注册实验、在线招募 288 名参与者、跨三项研究收集数据、执行分析管线并起草文稿,全程人工介入有限,每个项目平均墙钟约 17 小时,边际算力成本约 114 美元(不含受试者报酬)。

这件事的意义在于它把「端到端」从口号变成了可核验的事实。过去我们见过不少自称能做科研的智能体,但多数止步于写提案或分析已有数据;这篇论文的链条更长——假设生成之后,先预注册方案再动手,然后走进真实人群做实验,最后把结果和文稿都跑出来。平均 17 小时、114 美元的边际成本,意味着这类系统或许能以很低的单位成本,对大量受控假设做批量试点,把人力从重复环节中释放出来。作者把论文开放获取,等于把这套方法论摆到同行面前接受检验。

从仿真走向真实验证,是质的一步

把视角抬高,这篇论文的价值不只是「更快更便宜」,而是把智能体科研的验证标准往前推了一截。仿真环境里跑出来的结论,往往经不起真实人类行为的扰动;而一旦系统能招募真人、跑过伦理框架下的实验,它产出的就不再是纸面推测,而是可被复现流程追上的证据。对科研组织来说,更值得借鉴的是它的工程模板:选一两条边界清晰的项目,让智能体提方案,但把预注册与伦理审批这两个关键节点牢牢留在人手里。这样既享受了自动化带来的速度与成本优势,又不把责任一并交出去。

一套系统,把科研流程从头跑到尾 提出假设 智能体生成 研究方向 预注册 先定方案 再动手 真人实验 招募 288 人 三项研究 分析管线 自动跑统计 出结果 起草论文 有限人工 介入 边际算力成本约 114 美元每项目(不含受试者报酬),平均墙钟约 17 小时 真实验证:跑的是真人 不再停留在仿真或纸面 边界仍在人:伦理与预注册 关键节点仍须人把关
图 1|从假设到投稿的闭环里,人与智能体的分工被重新划界

但边界必须说清楚。论文本身也强调,架构层面验证的是「系统能不能按设计跑通闭环」,并不等于临床或现实有效性已被证明;受试者保护、知情同意、结果可复现,这些仍然是人不能松手的环节。更现实的风险是:当系统能又快又便宜地生产「看起来像模像样」的研究,审核方反而要更警惕流程合规与数据真实的漏洞。智能体缩短了从想法到草稿的距离,却没有缩短从草稿到可信结论的距离。对想尝试的团队,建议小范围受控试点,把墙钟时间与边际算力记下来,先在本地验证投入产出,再谈扩大规模。

也要承认,这类研究最容易招来的质疑是「是不是只把流程跑通、质量却经不起同行复现」。开放获取和公开方法学是好事,但三项研究、288 人的样本仍偏少,结论的外推性有限;更关键的是,系统产出的分析是否真的符合统计规范、有没有在预注册之外偷偷加入事后分析,都需要独立团队照着方法学复跑才能下定论。演示的价值在于打开想象,证据的分量仍取决于能否被别人原样重现。

把价值与边界都摆到台面上 能做到 流程可重复、成本低 跨研究可批量试点 把人力从重复环节释放 仍要人把关 伦理审批与预注册 受试者保护与知情权 结果可复现性待核验 建议小范围受控试点,把墙钟时间与边际算力记下来,本地先验证 ROI
图 2|自主科研的卖点清晰,但责任边界不能随自动化一起交出去

责任边界,不能随自动化一起交出去

把这篇论文放回智能体应用的坐标系,它代表的是一个清晰的方向:agentic science 正从仿真走向真实世界的验证。但方向正确,不意味着可以跳过人的把关。真正该被记住的,不是「智能体跑了真人实验」这个噱头,而是它示范了如何在自动化与人审之间划出可执行的界线——预注册在前、伦理在中、复现在后。对行业而言,这类演示的启示是:智能体能把流程跑得更快,但哪些节点必须由人签字,反而比以往更该被写进制度。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

总体看,这套分层多智能体把科研闭环跑到了真人群里,是 agentic science 从演示走向落地的一个实在节点。它的价值与边界同样清楚:能复现、低成本是真本事,而伦理与预注册仍须人把关,是绕不开的责任。