长程智能体越来越依赖外部记忆当「冻结的世界模型」,可我们评判一套记忆系统,多半只看两件事:任务成没成、花了多少 token。7 月 9 日提交、目前仍在审稿中的论文 Heavy-Tailed Memory Traces in Long-Horizon Language Agents(arXiv 2610.00010,作者 Xinyuan Song 与 Zekun Cai)换了个更锋利的问法:在有限上下文里反复检索,记忆被用成的「形状」本身,才是决定可靠性的那根旋钮。这个视角,把「记忆」从仓库问题,重新定义成了分布问题。

CTWM 的出发点:记忆的形状,而不只是记多少核心态(高频)少数状态被反复检索长尾态(低频)罕见状态预测误差累积随机游走策略检索呈对数正态,尾巴较平语义 LLM 策略呈截断幂律,尾巴更尖——越聪明越会选择性遗忘CTWM 用单个指数 τ 分配提示预算,保住压缩后的尾
图 1|在有限上下文里反复检索,智能体记忆会自然集中到少数高频核心,罕见状态沉到长尾并悄悄累积误差;论文用「保守尾部审计」量化了这种形状,发现它由策略决定。

论文的核心诊断很直白:上下文有限、检索又反复发生,智能体的记忆会自然向一小撮高频状态集中,而少数罕见状态沉到一条长尾里,预测误差就在尾巴上悄悄累积。作者把这套现象叫做「保守尾部审计」,并发现一个关键事实——集中是能复现的,但形状由策略决定。随机游走的智能体,检索痕迹接近对数正态;而用语义 LLM 策略的智能体,留下的却是更尖的截断幂律痕迹。换句话说,越聪明的策略,忘得越有选择性——这不是 bug,而是智能体行为的一种几何结构。

顺着这个诊断,作者提出 Core-Tail World Model(CTWM):一个按排名分配记忆预算的控制器。它只用一个指数 τ,把更多提示词预算压给高频核心,同时保留一份被压缩过的尾部摘要,专门兜住那些会悄悄出错的长尾状态。它的巧妙在于极简——你不必重训模型,也不必有复杂的内存数据库,只要拨这根 τ 的旋钮,就能在「记得多」和「记得准」之间取舍。对做长程智能体的团队,这等于把一个原本含糊的「上下文工程」难题,落成了一个可测量、可调参的控制信号。

CTWM 的账(论文自报,对照图记忆基线)Synthetic Graph World5.9提示词 -5.9%LongMemEval24.48提示词 -24.48%长尾预测误差13.6底部误差 -13.6%三处都省 token / 降误差,而整体准确率基本持平——「刻意遗忘」比「全记住」更划算
图 2|在合成图世界保持状态与转移全覆盖、提示词减 5.9%,在 LongMemEval 减 24.48% 且整体准确率持平,长尾底部预测误差降 13.6%——记忆预算成了一根可拨的旋钮。

数字上,CTWM 在几个基准上给出了干净的结果。在 Synthetic Graph World,它保住了完整的状态与转移覆盖,提示词反而少 5.9%,长尾底部的预测误差比图记忆基线低 13.6%;在 ALFWorld 上也有一致的省 token 效果;在 LongMemEval 上更明显,提示词减少 24.48%,而整体准确率基本持平。值得强调的是「持平」二字——它省了 token、降了误差,却没有拿准确率去换。这对当下动辄堆长上下文的做法是个温和的反例:与其把一切塞进窗口,不如先想清楚哪些该被刻意忘记。

把 CTWM 放进更大的语境,它呼应了这两年「上下文工程」的转向——从 FlowState、CAMG 这类把经验外置到持久记忆的方案,到让模型自己改写上下文的 Context Language Models,大家都在和「有限窗口」较劲。CTWM 的特别之处在于它不解决跨任务沉淀,只管任务内的记忆形状,反而因此轻、好落地。它和持久记忆是互补而非替代:前者管活上下文怎么分配,后者管跨会话记住什么。

当然边界要说清。论文仍在审稿中,样本集中在几个标准基准,真实业务里的长尾往往比实验室更脏;单个指数 τ 是个漂亮近似,但面对高度异构的任务,或许需要更细的分配规则。它也不是一套完整的记忆架构,而更像一个即插即用的控制器。但对关注长程智能体落地的团队,CTWM 给的启发很实在:记忆的痛点未必是「记不住」,而是「记成了一团不分轻重的糊」。先把形状管起来,再谈容量,可能才是更省力的路。一个低成本的起步,是把长尾预测误差单独拉出来监控——它往往比平均准确率更早暴露记忆失衡,也更容易在看板上被一眼看见。