9 月下旬,Mem0 联合多家机构发布 DolphinBench(arXiv 2609.24971),一个用来评估智能体记忆的新基准。它的核心主张很直接:大多数记忆基准仍停留在「问答」范式——题目本身就在提示「该去回忆某条事实」,于是检索难度被题目提前剧透;而真实工作里,智能体要先意识到「我需要回忆」,再在动作里用上它。DolphinBench 把评估搬进任务完成,靠真实动作而非问答来打分。

做法上有三点兼顾。其一,它构造了三个知识工作人设——创业公司 CEO Morgan、基础设施工程师 Alex、产品经理 Riley——每人都有跨数年、约 50 万 token 的模拟历史消息,覆盖 Notion、Gmail、GitHub、Discord、日历、CRM 等系统。其二,每人在设上 200 道依赖历史信息的任务,且每一道都用「带历史」与「抽掉历史」两次跑智能体来验证:带历史必须通过、抽历史必须失败,才算一道有效题。其三,也是关键,所有提交都必须同时汇报准确率、总成本与端到端延迟——把记忆系统当成一个需要权衡精度、成本、速度的整体来评。

三个人设,每人约 50 万 token 的漫长历史 Morgan 创业公司 CEO · 约 50 万 token · 跨数年消息 · 200 道依赖题 · 覆盖 Notion/Gmail Alex 基础设施工程师 · 约 50 万 token · 跨数年消息 · 200 道依赖题 · 覆盖 GitHub/Discord Riley 产品经理 · 约 50 万 token · 跨数年消息 · 200 道依赖题 · 覆盖日历/CRM 每题须「带历史通过、抽历史失败」:把可解性钉死
图 1|用「动作」而非「问答」来考记忆,且每题经两次跑验证

为什么「带历史必须通过、抽历史必须失败」这道关很重要?因为合成基准常踩两个坑:答案键本身是错的,或者题目根本不需要回忆也能蒙对。DolphinBench 用「同一道题、两种条件下智能体表现必须反转」来钉死可解性,过滤掉那些看似能考记忆、实则靠巧合通过的题目。它要的答案不是「你知道那条规则吗」,而是「你有没有在几年后的某次请求里,把那条规则用对地方」。

从范式看,DolphinBench 把记忆评估从「召回准确率」推到了「任务完成上的帕累托前沿」。过去比记忆系统,往往只看答对多少;现在要同时看花了多少钱、等了多少毫秒。一个系统可以把整段历史每次都重读一遍来拿高分,但那种成本任何生产部署都扛不住。把成本与延迟摆上台面,等于逼着记忆架构在「精读全部」与「精准检索」之间做取舍,也给了工程团队一张能直接拿去比选的账。

放到更大的坐标系里看,DolphinBench 的对手不是又一篇论文基准,而是「长期记忆到底该怎么造」这场持续已久的争论。此前 LoCoMo、LongMemEval 已经把记忆评估从单轮问答往前推,但大多仍允许题目在提示里直接点名「去回忆某条事实」,于是检索难度被题目提前剧透。DolphinBench 的狠劲在于把回忆变成隐含需求:智能体得先意识到自己缺了上下文,再主动去取、用对地方。对做产品的团队,这意味着记忆模块的评价不能停留在「给个事实它能背出来」,而要进入「在几个月后的真实动作里,它会不会因为忘了关键背景而翻车」。把准确率、成本、延迟三轴一起报,也恰好对应工程上最现实的取舍:宁可检索略糙但便宜,也不要每次全量重读把账单烧穿。一个能稳定用对历史、又不会把推理成本拖垮的记忆系统,才是生产环境真正买账的那个。

不再只比「答对多少」,还要比花了多少 低 中 高 问答式 准高·成本低 重读全史 准高·成本爆炸 DolphinBench 式 准·成本·延迟兼得 把成本与延迟摆上台面,记忆架构被迫在「精读全部」与「精准检索」间取舍
图 2|评估维度从单点准确率扩展到「准确率—成本—延迟」三维

当然,它的边界也要说清:人设与历史是模拟生成,并非真实企业数据,结论外推到生产环境需谨慎;「带历史通过、抽历史失败」保证的是单题可解,不等同于系统在开放场景里的稳健。但对做记忆模块的团队,DolphinBench 的价值在于把「什么是好的长期记忆」从一句口号,变成一组可复现、可横向对比的指标——准确率、成本、延迟三者一起报,才谈得上优化。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。