「想点子」这件事,也被拆成了流水线

科研里最值钱的环节,大概是提出一个真正新的构想。Meta 的这篇 arXiv 2610.04074 把这个环节拆成了三个角色,而且三个都是用强化学习训出来的:一个负责找空白(gap finder),一个负责想点子(innovator),一个负责落稿(writer)。最巧的是 innovator,它在一个包含 277 万条分解想法的库里,从其他领域借机制——换句话说,一篇材料方向的论文,可能从生物或物理里借来一个类比思路。这种跨领域借力,本来是人类研究者靠博览群书才有的直觉,现在被显式地工程化了。

科研构想,也能流水线化gap finder 找空白innovator 借机制writer 落稿innovator 从 277 万条分解想法里跨领域借机制三者均经 RL 训练;评测只许用 cutoff 前文献论文:arXiv 2610.04074(Meta)
图|IdeaScientist 把「产生科研构想」拆成找空白、借机制、落稿三个 RL 训练的角色,其中 innovator 从 277 万条分解想法里跨领域借机制。

评测设计也挺狠:只允许用某个 cutoff 之前的文献,再把生成的提案,去和 cutoff 之后 1.5 万篇人类论文实际探索过的方向做对照。这么做,是为了堵住「拿已知结论当新颖」的漏洞。结果用一个 27B 的开放模型,就比当时最好的开放自研基线高了 14%,而且增益主要来自新颖性这一项;相比用 Claude Code SDK 和 Codex SDK 搭出来的设置,也高出至多 5.9%。

它替代不了人,但把「灵感」变成可迭代的活儿

这篇的意义不在「AI 替科学家想点子」这种耸动叙事,而在它把科研构想这件事,从靠灵光一现,变成了可以拆解、可以训练、可以评测的流水线。过去我们说一个好想法可遇不可求,现在至少能系统地生成一批候选,再由人去筛。innovator 跨领域借机制的路数,也提示了一个值得警惕的点:如果训练语料本身就有偏好,借过来的机制也可能带着同样的盲区,评测用 cutoff 对照后世论文,就是为了把这种自娱自乐拦在门外。

新颖性上的拉开比最佳开放自研基线 +14%比 Claude/Codex SDK 高 5.9%评测对照 1.5 万篇后来人类论文探索过的方向
图|IdeaScientist 用 27B 开放模型比最佳开放自研基线高 14%(主要在新颖性),并超过 Claude Code / Codex SDK 设置至多 5.9%。

三个角色各管一段,才接得住「新颖」

值得多说一句的是,这篇把构想拆成三个角色,不是图个好名字。gap finder 先在一大片文献里定位「哪里还空着」,innovator 再基于这些空位去搬机制、想点子,最后由 writer 把候选落成活 proposal。之所以用强化学习而不是更省事的提示词串联,是因为「新颖」这件事很难写进规则——你没法用一条 if 说清楚什么算新。RL 把评测信号(cutoff 之后的真实论文走向)当作奖励,让三个角色在反复试错里各自长出手感。换句话说,底座不是被换得更猛,而是被训练得更「懂行」。

对做智能体的团队,IdeaScientist 更像一面镜子:当我们在调 harness、攒记忆、接工具时,也可以反问一句——那些「设计决策」本身,能不能也被拆成可训练的环节?它当然替代不了真正的原创判断,但把灵感从玄学变成可迭代的活儿,本身就是科研智能体往前拱的一步。至于它生成的提案到底多经得起推敲,还得看后续有没有人类研究者的独立复评,目前官方和行业都还没披露更多细节。