「上下文工程」是这两年最被滥用的词之一——很多人把它当成「往 prompt 里多塞几段背景」。9 月 29 日提交的论文 Context Language Models(arXiv 2609.37725,华盛顿大学与 Meta Superintelligence Labs 等机构)给出了一个更锋利的定义:让模型把上下文本身当成一份文件,用类 Bash 的指令去增删改,模型自己管理自己的工作台。这把「上下文」从一段只追加的聊天记录,变成了智能体在任务进行中可以随手涂改的白板。
CLM 的核心动作很直白:上下文不是只读的历史,而是一个文件。模型可以用普通 Bash 命令删掉一条过时的搜索结果、把计划重写一遍、把二十次工具调用压成两行摘要,或者在文件顶部维护一张实时记分牌并就地更新。论文里这些编辑会「自动同步」回模型的上下文、再继续生成——也就是说,生成是基于被改过的版本往下走的。便宜的玩法是一份 in-context 的「技能文档」告诉模型怎么管自己的文件(这份文档不是人手写死,而是由智能体产出轨迹、再用一个 proposer 模型起草候选、由一个 dev 切分挑出最优);贵的玩法是强化学习。团队用逐步 GRPO 把 Qwen3.5-9B 从 28.8% 训到了 42.5%。提示版 Qwen3.6-27B 在 BrowseComp-Plus 上拿到 59.4%,比 Codex 式摘要的 53.4% 高,且 FLOPs 少 21.5%;在十二小时长跑的 EdgeBench 上,用 59% 更少的算力拿到更高分。
CLM 容易和近期一堆「记忆」论文混为一谈,但定位其实不同。FlowState、CAMG 那些工作,是把经验存到外部记忆里、跨任务复用;CLM 只管任务进行中的「活上下文」,而且任务一结束,那份被改得乱七八糟的文件就被丢掉——它不负责跨任务留存。两者是互补而非替代:你要长程记忆还得靠外部记忆层,CLM 负责的是「此刻怎么把桌面收拾干净、让模型看得更清楚」。论文自己的安全小节也点明:同样的自由度,让模型能给自己的上下文「种指令」——也就是把一段提示埋进未来会读到的上下文里。能力越大,留给攻击面的口子也越大,这部分目前更多是被指出、而非被解决。
对做智能体的团队,CLM 把「上下文工程」从「人手写规则」推到了「模型自控的编辑技能」。过去我们靠 MEM1、Self-Compact、上下文折叠这类手写策略去压缩历史;CLM 的挑衅在于——与其人写规则,不如让模型学着管自己的文件,而且它在多个基准上用更少的算力赢了这些手写策略。它的代价也清楚:学来的编辑本领不跨任务留存,下周要用的东西还是得靠持久记忆;而「模型能改自己上下文」这件事,一旦被恶意引导,就是个全新的注入面。比起又一篇「记忆论文」,CLM 真正有价值的地方,是提醒我们:智能体的瓶颈常常不在模型多聪明,而在它能不能把自己的工作台随时收拾利索。
落到工程实践,建议分两层看。当你发现瓶颈是「上下文越滚越长、关键信息被淹没、每步都要重读全史」,CLM 这类「让模型自己收拾桌面」的思路值得试;但当场景要求跨任务记住用户偏好与历史决策,外部记忆仍是刚需,两者该并行而非二选一。另一个容易被忽视的提醒是安全:一旦接受「模型能改自己上下文」,就要把上下文文件当成不可完全信任的输入来校验,防止一段被植入的指令在后续步骤里被模型当成自己的笔记执行。能力越强,这道校验越不能省。