论文越来越像真的,这才是麻烦的开始

智能体做研究的门槛正在快速下降:给出一个课题,它能查文献、写代码、跑实验、产出一份格式规整的研究文档。但审过这类产出的人多半遇到过一种不适——文本读起来无懈可击,仓库里的代码却未必支撑文中声称的方法。arXiv 2609.22111 给出的 ReAgent 框架,就是把这种不适变成了可执行的审计流程。

论文点名了现有评审实践的盲区:审稿主要评估文本质量,识别不出硬编码的指标、并未真正实现的方法、以及没有实验支撑的结果。这类不一致在人类写的论文里偶有发生,在智能体批量产出的文档里出现频率只会更高——模型擅长生成「看起来完整」的叙述,而完整性是否对应真实实现,文本自己回答不了。

ReAgent 的双通道审计:文本之外,还要对上仓库和跑得起来的实验智能体生成的研究文档方法、结果、结论的文本声明结构化主张抽取把声明拆成可核查单元配套代码仓库实现、配置、运行脚本静态审计声称的方法、实现与实验配置是否在仓库里逐项成立抓:硬编码指标、未实现的方法动态审计实际执行相关实验收集运行证据评估实证发现抓:跑不出、对不上的结果合并为结构化仓库级审计报告,证据全程可追溯
图 1|主张抽取后兵分两路:静态对仓库、动态跑实验,证据汇成一份可追溯的审计报告。

双通道:对仓库,再跑实验

ReAgent 的做法分三步。先从研究文档中抽取结构化的科学主张,把声明拆成可核查的单元;然后兵分两路——静态审计检查声称的方法、实现与实验配置是否在仓库中逐项成立,动态审计则实际执行相关实验、收集运行证据来评估实证发现。两条通道的证据最后合并成一份结构化的仓库级审计报告,每条判断都能回溯到具体证据。

双通道的价值在覆盖单视角的盲区。论文举了一类典型情形:实验跑出来的数字与论文一致,但实现路径偏离了文中声称的方法——只读文本发现不了,只复现数字也发现不了,两个视角交叉才能抓到。评估在人工整理的研究文档与仓库配对基准上进行,与代表性静态基线和基于复现的基线相比,ReAgent 展现出更有效的不一致识别能力。

局限也要说清楚:审计依赖能运行、结构清晰的仓库,遇到跑不起来的代码或缺失的配置,动态通道便无从发力;基准规模是人工整理的,覆盖面有限;论文摘要没有给出跨数据集的量化对比,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

单视角审不出的盲区:数字能复现,方法却换了只审文本看写作质量与逻辑论文读起来通顺漏:硬编码指标漏:未实现的方法漏:无支撑的结果只复现数字重跑实验看结果数字对上了数字正确但实现路径偏离声称方法静态加动态仓库比对加实际执行两个视角交叉验证能抓到「结果成立、方法不对」的隐蔽不一致
图 2|数字复现不等于方法成立:单视角各有漏网,交叉验证才能补上盲区。

和 AGENTS.md 信任问题不是一回事

站内此前拆解过伊利诺伊大学对编码智能体上下文特权提升的分析——配置文件以系统级信任进入上下文,被恶意内容劫持是安全问题。ReAgent 处理的是另一个维度:智能体的产出本身不是恶意的,却可能是不成立的。前者防的是「被教坏」,后者防的是「说大话」,共同点只有一条:智能体链条上的每一环,都不能默认可信。

评审体系跟着承压

再往远处看一层,这类工具对学术共同体意味着什么也值得掂量。审稿人本来就处在工作量饱和的状态,智能体批量投稿一旦成为常态,靠人力逐篇辨伪既不现实也不公平——要么审稿流程把「仓库一致性核查」纳入标准动作,要么接受一个噪声更多的发表环境。ReAgent 的审计报告格式恰好提供了一种可能的接口:结论、证据、溯源三件套,直接可以挂进投稿系统。当然,审计框架自己也会成为博弈对象——能被自动核查的方法声明,同样能被针对性地伪造,这场攻防才刚开场。

资本在冲刺,审计刚起跑

把这条线放回本周的行业动态里看更有意思:同一周,超衍智能拿近 4 亿元天使轮押注自进化基础模型,海外研究自动化公司接连融资,智能体产出研究文档的速度只会越来越快。而「验证产出是否言之有物」的工具还在论文阶段——这个剪刀差意味着,谁先做出可靠的科研审计基础设施,谁就接住了自主研究浪潮外溢出来的需求。对企业的启示也不必等学术圈:内部智能体生成的分析报告、实验报告,同样需要一套「制品对账」的流程,ReAgent 至少给了一份可抄的作业。