同一天(10 月 6 日)挂上 arXiv 的还有 DAEDALUS(编号 2610.08048),它盯的是智能体记忆里一个更基础的问题:到了一个全新环境,agent 怎么才能不反复踩同一个坑。作者 Antoine Edy、Max Conti、Victor Xing 等人指出,LLM agent 常常缺乏「操作知识」——它不知道某个工具到底怎么用、这个环境有什么隐藏规矩,只能自己摸索。没有过去尝试的记忆,它就一遍遍重蹈覆辙,轨迹越跑越长、任务越做越砸。更麻烦的是,已有的记忆方案要么靠人写指南,要么靠「训练任务加真值校验器」攒程序性记忆,而这两样都要先知道环境长什么样——新环境偏偏没有这个前提。

自己出题,自己练

DAEDALUS 的思路是「自举」:不需要现成任务,也不需要真值校验器,让 agent 从自己造的练习里攒出可复用记忆。它配了两套 agent:探索者去和环境互动,生成「有挑战但能解」的任务;求解者去尝试这些任务。每次求解者失败,系统就从中提炼一条启发式,但只有在求解者带着这条启发式反复做对之后,启发式才被收编进记忆库。而求解者成与不成的结果,又会反过来给探索者当反馈,让它把下一轮题目出得恰到好处——不太简单、也不至于无解。

探索者与环境交互·出难题求解者尝试解题失败从失败提炼启发式记忆库测试期复用
图 1|DAEDALUS 的闭环:探索者出题、求解者做错后提炼启发式,反复验证通过才进记忆库,无真值校验器也能自举

「收编门槛」才是真工程

这里有个容易忽略的设计细节:启发式的收编门槛相当克制。它不是求解者一错就记一条,而是必须带着这条启发式反复做对才入库——这等于在「别再犯同一个错」和「别被偶发成功骗了」之间踩了刹车。很多企业 agent 上线后最怕的,正是把一次碰巧跑通当成规律,结果换个输入就翻车。DAEDALUS 这种「反例驱动、正例复核」的记忆方式,反而更贴近真实部署需要的稳健,也解释了为什么它能在小探索预算下就见效。

跨基准、跨模型都能用

在 AppWorld、τ2-bench、AutomationBench 三个基准上,DAEDALUS 相对无记忆基线,均值成功率最高提升 15.9 分,pass^5(连续五次都做对的比例)最高拉到 2.2 倍,和那些用了训练任务的方法打得有来有回,推理成本却低得多。更讨喜的一点是,它不需要大动干戈的探索预算就能见效,而且提炼出的启发式还能惠及别的模型族的 agent——记忆一旦成形,就不再是某一家模型的私产。消融实验还补了一刀:真正关键的信息来自求解者的执行轨迹,而把早期发现拆解开存,能让探索更省成本。

成功率提升AppWorld 等:均值最高 +15.9τ2-bench / AutomationBenchpass^5 最高 2.2 倍小探索预算即见效启发式可跨模型族复用
图 2|在 AppWorld、τ2-bench、AutomationBench 上,DAEDALUS 相对无记忆基线均值成功率最高 +15.9 分、pass^5 最高 2.2 倍

它真正解锁的是什么

DAEDALUS 最值得记下的,不是分数涨了多少,而是它把「记忆构建」和「环境特定的训练任务、真值校验器」解耦了。对要在陌生企业系统里落地的 agent 来说,这恰恰是痛点:你没法为每个客户环境先攒一套带标注的训练集。让 agent 自己出题、自己纠错、自己沉淀,等于给「部署到新环境就能边干边学」开了一条现实路径。顺带一提,它生成的那些任务,还能当作给不同模型排座的代理基准——这层副产品,比记忆本身还可能更常被用到。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

如果说 WorkflowOps 让编排层学会记协作,DAEDALUS 就是让单个 agent 学会记教训。一个管「和谁搭档」,一个管「怎么不重犯错」,方向不同,却都指向同一件事:智能体的竞争力,正在从模型本身,挪到它能不能把经验留下来。对那些想把 agent 塞进生产系统、却又怕它在陌生环境里乱撞的团队,这条「先练后上岗」的路径,比直接砸参数来得稳。