场景换了:从「人和 AI 聊」到「AI 旁听人聊人」

现有多数智能体记忆基准的设定是人与 AI 对话:单人、单模态或弱多模态、说话人结构简单。但真实部署里越来越多的场景是反过来的——医疗记录助手在旁听医生与患者的对话,会议纪要智能体在旁听一场多人会议,教学助手在旁听课堂。

H2HMem 要测的就是后一种:智能体不参与对话,只是旁听人类之间的交流,然后被要求回忆、推理并运用其中的信息。这个差别看似只是输入形式变了,实际把难度抬高了一个量级——因为「谁说的」变成了必须被保留的信息。

在人与 AI 对话里,说话人身份是确定的:要么是用户,要么是助手。而在旁听场景里,一段对话可能有三四个人,中间还夹着图片,指代关系靠上下文维系。智能体一旦把「A 说的」记成「B 说的」,后面所有基于这条记忆的推理都会偏。

数据是怎么造出来的

论文给出的规模是:20 个双人对话与 5 个多人对话,合计 300 多个会话、7000 多轮对话、1000 多张图片与 2000 多组问答。每个对话跨多个会话与多个话题,比如旅行、饮食、购物,且同时包含图片与文本。

构建流程值得一提:采用的是人在环中的方式,人负责设定人物、规划场景与话题、收集并校验图片,语言模型负责生成对话与图注,问答由自动生成后经人工验证。人物设定与话题规划这两步由人来做,是为了让对话在时间上前后一致、在话题上不跑偏——而这恰好也是后面对模型提出的要求。

这种造数据方式的取舍很明确:人工参与保证了对话的连贯性与标注质量,代价是规模有限。二十几段对话无法覆盖所有生活场景,所以它测的是能力形态,不是能力上限。

九类任务,分三层

H2HMem 把「记忆」拆成回忆、推理与应用三块回忆层基础回忆跨模态检索知识消解推理层多模态推理指代追踪时间推理应用层测试时学习冲突检测拒答指代追踪处理「这个」「那个」在长对话里指谁;拒答要求模型在信息不存在时承认不存在,而不是编一个。这三层合起来的测法,评价的已经不是「记住没」,而是理解、对齐、推理、更新能不能一起成立。
把「拒答」写进指标,是这套基准里最容易被低估的一处设计——它衡量的是可靠性,不是能力上限。

基准把记忆任务拆成三层九类。

回忆层包含基础回忆、跨模态检索与知识消解。基础回忆问的是简单事实,跨模态检索要求把图和文结合起来找,知识消解处理的是信息被更新或前后冲突时该采信哪一版。

推理层包含多模态推理、指代追踪与时间推理。指代追踪专门处理「这个」「那个」在长对话里指谁,时间推理要求还原事件先后。

应用层包含测试时学习、冲突检测与拒答。拒答这一项尤其能看出基准的取向:信息不存在时,模型应该承认不存在,而不是编一个。这一层测的已经不是「记住没」,而是理解、对齐、推理、更新能不能一起成立。

三个结论

论文结论 · 及公开报道中第三方方法在同一基准上的结果知识消解:双人 → 多人双人0.49多人0.25GraphMemix 在四项多模态记忆基准上的准确率提升(百分点)ATM-Bench+6.80Mem-Gallery+12.57MemEye+5.66H2HMem+16.60四榜宏平均 61.55%,相较该报告中此前公开基线的 49.80% 提升 11.75 个百分点;换用另一下游回答模型后提升仍然成立。
错误主要来自模态错位与说话人归因,而不是容量不足。论文的表述是:模型经常记住了,但不知道是谁说的。

实验给出的结论有三条,都不是关于容量的。

一是多人对话明显更难。知识消解这一项的表现在多人场景里从 0.49 掉到 0.25,下降幅度很大。也就是说,说话人一多,记忆系统受到的干扰是结构性的,而不是可以通过调参缓解的。

二是最大的问题不是记不住,而是对不齐。错误主要来自两类:模态错位,图文对不上;说话人归因错误,模型记住了内容但认不出是谁说的。用论文的表述,模型经常「记住了,但不知道是谁说的」。

三是检索不等于理解。模型可以把相关信息检索出来,却无法过滤噪声、理解上下文关系、处理冲突信息。把三段拼起来,结论是:记忆系统失败的原因不是遗忘,而是无法重建一段连贯的多模态交互历史。

最后这一条把问题的位置换了。它意味着继续加大向量库容量、优化相似度召回,都解决不了核心矛盾;需要建模的是交互历史的结构。而同一批基准上已经有方法在验证这个方向——公开报道显示,一项名为 GraphMemix 的多模态长期记忆方法在四项基准上全部取得更高准确率,其中在 H2HMem 上达到 60.96%,相较该基准在此前报告中的基线提升约 16.6 个百分点。值得注意的是,它换用另一下游回答模型后提升仍然成立,说明优化的是证据结构,而不是针对某个模型特化。

为什么值得单独写

因为记忆这条线近两年被大量讨论,但多数讨论停在「容量」「召回率」「向量库选型」上。H2HMem 的价值是把评价标准从「记住没」挪到「用得对不对」,并且给出了可测量、可复现的九类任务。

对做产品的团队来说,这意味着两件事。一是评测集要包含说话人与模态这两个维度,否则测不出真正会出问题的地方——单人单模态的测试集上表现很好,一进多人场景就掉,这种情况在自建评测里很常见。二是把「拒答」纳入指标:一个在信息缺失时敢说不知道的智能体,比一个永远能编出答案的智能体更适合放进旁听类场景。

这套基准对自建评测的实际提醒

多数团队的记忆评测是从自己的业务日志里抽几十条问答,人工标好标准答案,然后看模型答对多少。这种测法能发现「记不住」,但发现不了「对不齐」。

原因是它默认每次问答只涉及一个信息源、一个说话人、一个模态。只要把这三条放宽——同一轮对话里出现两个人、同一件事先有文字后有图片、某个事实在对话中途被更正过——错误率就会明显上升,但这类样本在业务日志里往往被当成噪声过滤掉了。

更麻烦的是,对不齐的错误比记不住更难被用户察觉。记不住会表现为答不上来,用户立刻知道该自己动手;记错了说话人会表现为一个看起来完整、实际归因错误的答案,用户可能直接采信。前者的代价是效率,后者的代价是判断。

可以带走的四条

其一,评价持久记忆时,把「谁说的」「图上是什么」当成一等公民,而不是附加信息。

其二,把冲突检测与拒答写进指标,它们衡量的是可靠性而不是能力上限。

其三,多人场景要单独测。它在单人场景里看不出来的退化,会在多人场景里集中暴露。

其四,看到「记忆优化」先问一句优化的是存储还是结构。

需要标注的边界

其一,数据规模与结论来自论文及公开解读,问答配有自动与人工混合的验证流程,具体标注一致性未在检索到的材料中完整披露。

其二,GraphMemix 的数字来自该方法团队的公开报告,属于同一基准上的第三方结果,评测协议与下游回答模型的配置不同会影响可比性。

其三,基准覆盖的是文本与图片两类输入,尚未见音频或视频模态的说明。

目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。