开放深度研究(OEDR)这类系统,目标是让 Agent 像研究员一样持续追一个课题、产出报告。但现有的做法有个隐含浪费:每次有新信息进来,它几乎都从零把报告重写一遍。对一个需要长期维护、随新证据不断演进的主题来说,这种「推倒重来」既烧 token,又容易让前后版本口径打架、连续性很差。一篇 10 月 8 日挂出的论文 Incremental-OEDR,把这件事重新定义成「维护一份活着的状态」。

报告不再是成品,而是演化中的状态

它的核心设定很朴素:把报告当成一份会演进的研究状态,而不是一次性生成的文档。新证据到来时,不再整篇重写,而是保留仍然有效的知识、修订已经过时或不完整的内容、并入新出现的信息。为了支撑这个设定,论文提出 Structured Harness:把报告表示成由大纲、章节、支撑证据组成的结构化集合,并配套结构化检索、一个持久的结构化证据池,以及结构化生成——只更新变化的部分,并复用已有证据。换句话说,报告被拆成了可单独改动的零件,证据被沉淀成可复用的资产。

在 DeepResearch Bench 和 DeepConsult 上,分别用开源配置与闭源配置评测,Incremental-OEDR 在保持报告质量有竞争力的同时,明显提升了连续性、压低了成本:内容级 ROUGE-L F1 最高高 0.51,大纲级 EM F1 高 0.63,token 消耗降低约三分之一,搜索调用减少约六成。论文还搭了一个横跨十年的时序评测框架,分单步更新与长链更新两类任务,专门看「一次改一点」和「连续改一长串」两种情形下的表现。项目页已公开,便于复现。

它和记忆线的趋势是同一条河

把 Incremental-OEDR 和近期的记忆研究放在一起看,会冒出一条清晰的暗线:智能体正在从「生成一段输出」转向「维护一个状态」。记忆要保真、压缩要补残差、深度研究要增量维护——三件事说的其实是同一件事的不同侧面:与其每次都从头算,不如把有价值的东西留下来、按需更新。对深度研究这种天生要「长期跟进」的任务,这个转向尤其自然:一个课题追三个月,没人愿意每天把前 29 天的报告重写成一遍。

前提与局限

但「增量维护」成立的前提,是报告真的能被可靠地结构化。它要求大纲、章节、证据三层都能被机器稳定解析和改写;一旦结构表示不稳,增量更新就可能把错误悄悄带进旧章节,比整篇重生成更难排查。论文的时序评测跨十年,已经是相当严苛的设定,但真实世界的证据漂移往往更脏、更突兀,长链下的「修订」是否永远优于「重生成」,仍要在具体业务里验证。另一个现实约束是:它对「一次性深挖」类任务收益有限,红利主要落在「长期维护的活文档」上。

对正在做研究型 Agent 的团队,这篇论文最实用的启发是:别再把报告当终点,把它当成一个带证据池的状态机。先沉淀结构化证据、再做选择性更新,省下的不止是 token 和搜索次数,更是前后版本的一致性——而一致性,恰恰是深度研究能不能被人信任的关键。当研究 Agent 从演示走向日常跟进,增量维护很可能不再是可选项,而是底座。

Incremental-OEDR · 报告即演化状态技术 · 深度研究旧报告 + 新证据既有章节 / 论据新信息流入Structured Harness保留有效知识修订过期内容并入新增信息证据池持久化演化后报告连续性更好省约 1/3 token搜索少约六成
图 1|报告被拆成大纲、章节、证据三层结构,只更新变化部分、复用证据;长链更新下连续性明显优于整篇重生成。