微软团队在 AAMAS 2026 上发表的 LEGOMem(Modular Procedural Memory for Multi-agent LLM Systems),盯上了一个被多数多智能体系统忽略的问题:它们大多是「无状态、一次性」的——每来一个任务都从零开始,既不记得上次怎么干的,也不积累任何执行经验。论文想做的,是把过去任务的成功轨迹拆成可复用的记忆单元,像拼乐高一样在编排器与任务智能体之间灵活分配,让多智能体系统真正「越用越会干」。

把任务轨迹拆成记忆单元

LEGOMem 的做法分两层。它把成功的执行过程蒸馏成结构化的记忆单元:一类是全任务记忆,保存任务级的计划与推理链;另一类是子任务记忆,保存某个智能体的具体行为与工具交互。这些模块化记忆存进一个按语义嵌入索引的记忆库,在推理时根据当前任务被检索、被复用。这等于给多智能体系统装了一本「操作手册」——不是泛泛的聊天记录,而是带结构、可定位的经验。

增量认知:多智能体系统的瓶颈,常常不在单模型能力,而在「经验无法跨任务沉淀」。LEGOMem 把「记忆」从单智能体的一串日志,升级成可拆分、可分配、可检索的模块——这一步让多智能体自此有了像样的「组织记忆」。

把任务轨迹拆成可复用的记忆单元历史任务轨迹全任务记忆子任务记忆记忆库 语义索引编排器复用任务智能体复用成功执行被蒸馏成结构化记忆:全任务记忆存计划与推理链,子任务记忆存行为与工具交互
图 1|LEGOMem 把过往任务轨迹分解为可复用的记忆单元(全任务记忆与子任务记忆),存入按语义嵌入索引的记忆库,在推理时灵活分配给编排器与任务智能体。

有意思的是,这种设计刻意保持轻量:记忆是模块化的、按需取用的,而不是把整段历史塞进上下文。这避开了「上下文越长越贵、越容易漂移」的老毛病,也避免了把无关经验硬塞给不该看的智能体。对长程、多步骤的工作流来说,这种「用多少取多少」的记忆,比一股脑喂上下文要干净。

记忆该放哪:编排器比你想的更关键

论文最有反直觉的发现,落在「记忆该放在哪」这件事上。在 OfficeBench 上的实验显示:编排器的记忆对任务拆解与委派最关键——因为它掌握全局计划,记得「这类任务通常怎么分、分给谁」;而细粒度的智能体记忆,更多提升的是单个环节的执行准确率。两者缺一不可,但角色不同:编排器记忆决定「拆得对不对」,智能体记忆决定「干得准不准」。

OfficeBench 上的关键发现编排器记忆最关键细粒度智能体记忆提准确率即使小模型团队也明显受益小模型与强模型差距被显著收窄记忆该放哪、给谁用,比「有没有记忆」更决定多智能体工作流的成败
图 2|在 OfficeBench 上,编排器记忆对任务拆解与委派最关键,细粒度智能体记忆提升执行准确率;即便由较小模型组成的团队,也能借程序性记忆大幅缩小与强模型的差距。

这个发现对工程实践很实用。很多团队一上来就给每个智能体塞记忆,却忽略了编排器才是全局记忆的最佳归宿。LEGOMem 提示:与其平均用力,不如先把编排器的记忆做厚,让它学会稳定拆解与委派;再把细粒度记忆下放到具体角色,补执行层的准确率。记忆的「位置」,比「有没有记忆」更决定成败。

小模型团队也明显受益

另一个让论文出圈的点:即便由较小模型组成的团队,也能从程序性记忆里拿到实打实的收益,显著缩小与强模型团队的差距。原因在于,强模型贵在「即兴能力强」,但很多工作流的稳定性来自「按成功经验办」——一旦把过往正确执行轨迹沉淀成记忆,小模型照着走,也能交出接近的答卷。这对预算敏感、又想上多智能体的团队是个好消息:与其无脑堆大模型,不如给小模型配一套靠谱的记忆。

边界提醒:论文结论基于特定基准(OfficeBench 等)与受控设置,记忆带来的增益会随任务类型、模型组合变化;并非所有场景都「加记忆就变强」。对高度开放、少有重复模式的新颖任务,记忆的复用价值会下降。把它当作「结构化、重复性工作流」的加速器,而非通用银弹。

LEGOMem 给多智能体系统补上的是一块常被忽略的拼图:不是更强的推理,而是更稳的经验。当行业把注意力都放在「如何让智能体更聪明」时,它提醒我们,让智能体「记得住、用得上过去的成功经验」,可能是规模化落地更省力的那一步。拼乐高式的记忆,听着朴素,却正中多智能体工作流的要害。