一句话:长时程 agent 得先学会不忘记,再谈学习

9 月 17 日提交的论文「An Architecture for Long-Horizon Agents: Levels, Ticks and Cascaded Intelligence」(arXiv 2609.19519)讨论了一个越来越现实的需求:让 agent 承担跨越数天甚至数周的工作——一次运维修复、一项研究计划。这类任务比任何上下文窗口都长,比任何进程生命周期都久,也超出了任何人能盯着的值守间隔。

论文的核心论点浓缩成一句:长时程智能体必须先能「持续运行而不遗忘」,然后才谈得上「持续学习」。而这个能力长在模型外的 harness 里,不是模型本身。来自 Salesforce 研究团队的作者们从长时程设定中推导出七条瓶颈,并用三件套架构作答。

三分法:分层、节拍、级联

架构的三个部分各答一个问题。记忆放哪——按时间尺度分层:每一层维护一份有界摘要文件,向下概括更低一层的状态,任务再长,每一层要装的东西都是有限的。何时行动——时钟节拍:以固定的 tick 作为自主行动的单元,没有人在场时,agent 知道自己何时该醒来检查、推进、汇报,而不是傻等下一条用户消息。算力给谁——级联智能:工作先交给够用的模型,评审不通过才升级到更强的模型,成本与可控性由此兼顾。

这三件事单看都不新鲜,组合起来的立场很清晰:长时程的连续性不靠把上下文窗口无限拉长硬撑——那是把记忆问题外包给模型厂——而是靠 harness 把状态、节奏与算力安排成一套能自我维持的节奏。

长时程 agent 架构三分法:分层、节拍、级联① 按时间尺度分层每层维护一份有界摘要文件,向下概括——任务跨天跨周,任何上下文窗口都装不下② 时钟节拍以固定的 tick 作为自主行动单元:没有人在场时,agent 知道何时该醒来干活③ 级联智能工作先交给够用的模型,评审不通过才升级到更强的模型——省成本且可控出发点:长时程 agent 必须先能「持续运行而不遗忘」,然后才谈得上「持续学习」——这个能力长在模型外的 harness 里,而不是模型本身。
图 1|三层结构各答一个问题:记忆放哪、何时行动、算力给谁——七条瓶颈由此收拢成三件事。

十天战役:一次每天看一眼的长跑

论文用一场十天战役做了实证:基于这套架构的 agent 去复现一项已发表的强化学习结果,人类参与者每天只查看一次。十天后有三条经得起复看的发现。其一,战役中的每一次上下文重置、每一个会话边界,agent 都把主线接了回来——没有掉线、没有丢任务。其二,早期写下的运维知识改变了后续的行为,而模型权重一个字没动——「学习」在这个阶段以可执行知识的形式存在于 harness 里。其三,如果要让学习组件进入这套系统,落位处恰恰是 harness 已经在跑的那些检查:评审、验证、复盘。

第三条最值得玩味。行业习惯把持续学习想象成「改权重」的大手术,这篇论文的判断则务实得多:harness 每天都在产生判断对错的信号——哪些尝试通过了评审、哪些被打回——学习器就该长在这些信号流上。权重训练是重武器,不是日常。

十天战役:三个经得起复看的发现任务:复现一项已发表的强化学习结果人类参与频率:每天查看一次第 1 天第 5 天第 10 天上下文重置会话边界跨会话续线· 每一次上下文重置与会话边界,agent 都把主线接了回来· 早期写下的运维知识改变了后续行为——模型权重一个字没动· 学习组件该落位的地方,恰是 harness 已经在跑的那些检查点
图 2|十天的连续性不靠超长上下文硬撑,靠的是分层摘要 + 节拍 + 检查——学习器安家在检查处。

对工程团队的三条可搬走的结论

其一,长时程记忆的落点选「有界摘要文件」而不是无限追加的流水账:每层只装概括,历史细节允许下沉甚至丢弃——连续性来自结构,不来自堆料。其二,给 agent 配时钟:自主性不等于永动,固定节拍让「自主」变得可预测、可审计,值守的人也从「随叫随到」变成「定时检查」。其三,先上评审、后上学习:把 harness 里已有的检查点当信号源,比急着引入训练管线便宜得多,也安全得多。

这篇论文与近期其他长时程工作的分工也很清楚:有的在算收益归因,有的在拆协作边界,而它回答的是更底层的问题——当一个任务比所有部件的寿命都长时,什么在替它记住自己。十天、每天看一眼、全程不断线,这个演示本身的说服力不亚于任何分数。至于架构在更长周期与更多任务类型上的表现,官方及行业暂未披露更多细节,后续将持续跟进迭代动态。