长程智能体要记住的,不只是「用户是谁、喜欢什么」。10 月 2 日挂上 arXiv 的 DyadMem(编号 2610.03020)提出一个新概念:User-conditioned Relational Agent Memory,简称 URAM,即「受用户约束的关系型智能体记忆」。它的核心判断是,现有记忆基准大多只监督用户侧的事实与偏好,却把「这个 agent 到底该怎么和这位特定用户协作」这类关系记忆,默默地留在了暗处。DyadMem 想把这个被忽略的维度,正式拉进评测。
记忆不只是事实,还有「协作方式」
举个容易懂的例子:两个用户都可能「喜欢简洁的回复」,但 A 的 agent 该在周二早晨主动汇总待办,B 的 agent 却该等被问到才动——同样是记忆,前者是事实,后者是关系。DyadMem 沿同一条多轮轨迹,同时标注用户侧记忆和 URAM,归出 6 类记忆,并配了 3065 段情节、50961 次会话、61210 个问答,以及细致的「抓取」与「更新」金标。它提供两种测评:给足记忆的 Gold-Memory,和走完整链路的 Full-Pipeline。结果很有意思——给足记忆时模型答得相当稳,一旦要走「自己抓取再作答」的完整流程,表现明显往下掉。
掉下去的根因在哪
论文没把落差归给「模型不够聪明」这种笼统说法,而是指向几个可定位的毛病:抓取阶段的召回偏低(该记的没记进去)、检索阶段召回不完整(要用时没捞出来)、以及删除操作不安全(清掉了本该留着的东西)。即便是对前沿大模型,这三件事也会稳定地出问题。换句话说,关系记忆的难点不在「存」,而在「什么时候抓、抓得准不准、该删的别误删」。这也解释了为什么很多长程 agent 的演示看着聪明,一拉长会话就变得前后矛盾——关系记忆这一层从一开始就没被认真评过。
和已有的记忆研究怎么摆
记忆方向近几个月论文密集,DyadMem 的切角是「关系」而非「架构」。它和 Mem++(写时不蒸馏、读时再选)、BudgetPM(该把观测预算花在哪)、以及一批长程记忆架构论文是互补的:那些关心「记忆内部怎么组织」,DyadMem 关心「记忆里该不该多带一层关于协作关系的内容」。它也和共享加密记忆这类基础设施(sno-station 等)不是一回事——后者解决「多个 agent 怎么共用一份记忆」,DyadMem 解决「一份记忆里该不该记协作方式」。对做长程产品的团队,它的启示很具体:别只评「agent 记不记得用户说过什么」,也要评「agent 是否用对了和这位用户打交道的方式」。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
把话说透,DyadMem 给行业的真正礼物是一个可操作的区分:用户事实是「关于谁」,关系记忆是「和谁怎么处」。前者错了顶多答非所问,后者错了会让 agent 在恰当的时刻做了不恰当的动作——比如不该主动时主动、该等待时抢跑。随着个性化 agent 走进日常,这种「用错协作方式」的失误会比记错一个偏好更扎眼。把 URAM 这类维度纳入基准,等于提前给产品团队一份自查清单:你的 agent 除了知道用户,是否真的「懂和这位用户相处的分寸」。这也能解释为什么有些看似贴心的助手用几次就让人想关掉——它记得你说过的话,却没学会你希望它用哪种方式和你共事。关系记忆这道坎,恰恰是个性化 agent 从「能用」跨到「离不开」的关键一步。