智能体的记忆,过去两年大多被简化成两件事:要么把整段历史塞进上下文窗口,要么用向量数据库做相似度检索。两条路在长程、多源、会变的真实场景里都会露怯。10 月 6 日,past.dev 推出面向智能体的长期记忆 API,把问题重新定义成:此刻什么为真、它替代了什么、谁又能看到。

相似 ≠ 此刻为真

BEAM 这篇发表于 ICLR 2026 的基准,测的是长达千万 token 的对话历史。论文里有个扎心数字:把完整历史直接喂给模型,在 1M token 规模下准确率至多只有 25.9%。原因很简单,相似度检索召回的是「看起来像」的内容,而不是「现在仍然成立」的事实;而把一切塞进上下文,又会被过期信息淹没。

past.dev 的做法是:开发者存入带时间戳的文本,再用「一个问题 + 提问者身份」去召回。它返回的是当前事实、这些事实替代了什么、每条结论对应的带日期来源,以及「此刻这个人不该看到什么」。三调用模型之外,它把真相追踪、来源与访问边界一起做成一等公民,并支持 MCP,提供自托管与专属区域,持有 SOC2 Type II、ISO 27001、ISO 27701 认证。

登顶背后的短板

在 BEAM 各规模上,past.dev 都位居榜首:10M token 拿到 85.03%,高于此前最佳的 68.0%;100K/500K/1M 也分别从 86.2%/80.1%/79.1% 提升到 92.08%/89.63%/90.65%。它同时把评测脚手架开源,任何人都能复现。

但数字不是全部。第三方细读发现,矛盾消解仍停在 73% 到 79% 区间,而多会话推理在 10M 规模会跌到 28.17%。这说明它解决了时序准确性这个老问题,可跨碎片长历史的复杂推理,仍是整个行业的开放课题。把它和 mem0、Hindsight 这类存量方案区分开的关键,也正在于它不追求「召回更多」,而是追求「认出此刻为真的那一条,并说清它从哪来、替了谁」。

记忆层的生意才刚开头

记忆正在从「能查到」升级为「能负责」。当智能体替企业跟进邮件、会议、工单与文档,它必须能判断哪条事实今天有效、它替代了哪条旧结论、以及谁有权看到。past.dev 背后有 General Catalyst、Varsity、Connect Ventures 支持,走的正是「可审计、可私有部署的记忆层」路线。它的数字出自厂商自报、尚待独立复现,但把「真相与权限」作为产品主线,比单纯比检索指标更有长期价值。

past.dev · 时序真相 vs 向量相似度技术 · 记忆旧做法整段历史塞进上下文 / 相似度检索BEAM:1M token 仅 25.9%相似 ≠ 此刻为真past.dev存时间戳文本,按问题+身份召回BEAM 10M:85.03% vs 68.0%返回当前事实+替代值+来源+权限把三件事当一等公民此刻什么为真 · 它替代了什么 · 谁能看到支持 MCP;自托管与专属区域;SOC2 Type II / ISO 27001 / 27701短板:矛盾消解 73–79%,多会话推理在 10M 处降至 28.17%
图 1|记忆的难点不在召回,而在真相追踪与权限边界;past.dev 把来源与时间戳作为一等公民。