智能体干长程任务有个不太体面的现状:干得越久,记的流水账越长,长到塞不进上下文窗口。于是记忆系统登场——但真正的难题藏在细节里:一条完整的证据(比如「那次工具调用返回了什么、参数是什么、之后发生了什么」)往往横跨多个执行事件,而主流检索器还在用固定 Token 窗口切块、按固定 top-k 返回。块切得小,无关内容少了,可一条证据被拦腰切成几段,凑出来的上下文七零八落;块切得大,预算又爆了。9 月 22 日提交 arXiv 的论文「When Does Execution Provenance Help Agent Memory Retrieval?」,就把这个别扭问题摊开做了定量拆解。

论文的思路是把智能体记忆检索重新表述成一个更精确的问题:预算化证据补全(budgeted evidence completion)——在硬 Token 预算下,判断「支持当前查询的完整证据集」能否塞进上下文。为量化评估,作者在共享的源头坐标系里给精确的金标准片段打分,而不是像传统检索指标那样只奖励「捞到了若干相关碎片」。

预算化证据补全:同一份执行历史,两种切法平铺 512-Token 窗口一条证据被切进多个块,窗口一挤就散证据 A 前半证据 A 后半源对齐溯源单元按工具参数与输出对齐源头,证据保持完整证据 A 完整证据 B图传播补一刀类型化溯源边上做残差传播,收益集中在跨事件证据检索的难点不是找相似,而是在硬 Token 预算内把一整套证据凑齐实验设置:2000 条标注查询、1207 条 held-out 执行轨迹(ISETrace)
图 1|同一份执行历史:平铺窗口把长证据切碎,溯源单元保持证据完整,跨事件时再用图传播补齐。

方法上有两步。头一步是构造源对齐的溯源单元(provenance units):不再按固定窗口切块,而是沿着工具调用参数与输出的自然边界组织证据,让一条证据保持完整。随后在类型化溯源边上加一个零初始化的残差 R-GCN,对冻结的稠密检索分数做图传播精调——冻结意味着原有检索器不动,传播层只学增量。实验规模:2000 条带片段标注的记忆查询,跑在 1207 条 held-out 的 ISETrace 执行轨迹上。

结果分三层读。溯源单元相对平铺 512-Token 窗口,Full Support@2048 指标高出 19.07 分,而且比四种不同块尺寸下的逐项最优(per-metric oracle)还高 11.96 分——意味着这不是调参调出来的优势,是切法本身的代差。图传播在溯源单元之上再加 4.55 分(95% 置信区间 2.98 到 6.18),增益集中在金证据横跨多个事件的场景;实体共现扩展这种更朴素的图构造则拿不到类似收益,关系与拓扑消融证实增益确实依赖类型化变换与真实图结构,不是图结构自带的光环。

关键结果(Full Support@2048,论文报告口径)溯源单元 vs 平铺 512 窗口19.07%主增益溯源单元 vs 四种块尺寸最优11.96%图传播在溯源单元之上再加4.55%95% CI 2.98-6.18两个控制实验实体共现扩展:无类似收益增益依赖类型化变换与真实图结构跨事件证据越多,溯源单元的优势越大——这正是长程任务的常态
图 2|数字怎么读:把检索单元从「块」换成「溯源单元」是大头,图传播是锦上添花的小头。

把这篇论文放进 9 月的记忆研究谱系里,位置就清楚了。此前覆盖过的几条线各管一段:Agent Zero Memory 等架构线在写入侧下功夫,让每条事实入库时就带上溯源;MemCalib 基准管使用侧,衡量模型「用不用得上、用得恰不恰当」;而这篇论文补的是检索侧——证据已在库里,怎么在预算内把它完整地捞出来。写入、检索、使用,三个环节的诊断与处方各不相同,混在一起谈「智能体记忆」只会越谈越糊。

三个环节的分工还提示了一个实用的排错顺序。智能体长任务表现不稳定时,先别急着换模型:查写入——证据入库时是否带着足够的上下文标注;再查检索——相似度最高的片段是否恰好是完整证据的一部分;最后查使用——模型拿到证据后有没有真的照办。三个环节的解法完全不同,换模型只在其中一小段上有效,这也是很多「升级了模型还是老样子」的调优为什么无效的原因。

照例留一分冷静:19.07 与 4.55 都是论文自报数字,基准是 ISETrace 一种轨迹来源,跨出该分布的表现待社区复现;作者也坦承图传播的收益有条件——证据分散在多个事件时才明显,单事件场景下溯源单元已经够用。对工程团队的可操作启示反而直接:如果你的智能体有工具调用历史,先检查记忆检索的切块策略是不是在用固定窗口切执行日志——这个默认值,可能正在悄悄弄碎你的证据。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。