开放深度研究(OEDR)这类系统,目标是让 Agent 像研究员一样持续追一个课题、产出报告。但现有的做法有个隐含浪费:每次有新信息进来,它几乎都从零把报告重写一遍。对一个需要长期维护、随新证据不断演进的主题来说,这种「推倒重来」既烧 token,又容易让前后版本口径打架、连续性很差。一篇 10 月 8 日挂出的论文 Incremental-OEDR,把这件事重新定义成「维护一份活着的状态」。
报告不再是成品,而是演化中的状态
它的核心设定很朴素:把报告当成一份会演进的研究状态,而不是一次性生成的文档。新证据到来时,不再整篇重写,而是保留仍然有效的知识、修订已经过时或不完整的内容、并入新出现的信息。为了支撑这个设定,论文提出 Structured Harness:把报告表示成由大纲、章节、支撑证据组成的结构化集合,并配套结构化检索、一个持久的结构化证据池,以及结构化生成——只更新变化的部分,并复用已有证据。换句话说,报告被拆成了可单独改动的零件,证据被沉淀成可复用的资产。
在 DeepResearch Bench 和 DeepConsult 上,分别用开源配置与闭源配置评测,Incremental-OEDR 在保持报告质量有竞争力的同时,明显提升了连续性、压低了成本:内容级 ROUGE-L F1 最高高 0.51,大纲级 EM F1 高 0.63,token 消耗降低约三分之一,搜索调用减少约六成。论文还搭了一个横跨十年的时序评测框架,分单步更新与长链更新两类任务,专门看「一次改一点」和「连续改一长串」两种情形下的表现。项目页已公开,便于复现。
它和记忆线的趋势是同一条河
把 Incremental-OEDR 和近期的记忆研究放在一起看,会冒出一条清晰的暗线:智能体正在从「生成一段输出」转向「维护一个状态」。记忆要保真、压缩要补残差、深度研究要增量维护——三件事说的其实是同一件事的不同侧面:与其每次都从头算,不如把有价值的东西留下来、按需更新。对深度研究这种天生要「长期跟进」的任务,这个转向尤其自然:一个课题追三个月,没人愿意每天把前 29 天的报告重写成一遍。
前提与局限
但「增量维护」成立的前提,是报告真的能被可靠地结构化。它要求大纲、章节、证据三层都能被机器稳定解析和改写;一旦结构表示不稳,增量更新就可能把错误悄悄带进旧章节,比整篇重生成更难排查。论文的时序评测跨十年,已经是相当严苛的设定,但真实世界的证据漂移往往更脏、更突兀,长链下的「修订」是否永远优于「重生成」,仍要在具体业务里验证。另一个现实约束是:它对「一次性深挖」类任务收益有限,红利主要落在「长期维护的活文档」上。
对正在做研究型 Agent 的团队,这篇论文最实用的启发是:别再把报告当终点,把它当成一个带证据池的状态机。先沉淀结构化证据、再做选择性更新,省下的不止是 token 和搜索次数,更是前后版本的一致性——而一致性,恰恰是深度研究能不能被人信任的关键。当研究 Agent 从演示走向日常跟进,增量维护很可能不再是可选项,而是底座。