Letta(原 MemGPT)
| 分类 | 🧰 框架工具 |
| 阅读时间 | ⏱️ 17 分钟 |
| 更新时间 | 📅 2026-10-09 |
| 条目编号 | ENC-FRAMEWORK-18-letta |
关键要点 ✦
- 源自 2023 年 10 月的 MemGPT 论文(arXiv:2310.08560),借用操作系统虚拟内存隐喻管理大模型上下文
- 2024 年 9 月框架由 MemGPT 更名 Letta,旧名保留给论文描述的设计模式;Letta Inc 同日出隐身,获 1000 万美元种子轮(Felicis 领投,投后估值 7000 万美元)
- 三层记忆:Core 为常驻上下文的记忆块(human、persona 等,可被智能体自行编辑)、Recall 为可检索的历史对话、Archival 为显式沉淀的长期知识
- 核心记忆块被编辑后系统提示词整体重编译,写入即时生效,无需检索步骤——记忆即状态,而非记忆即 RAG
- 2025 至 2026 年持续迭代:sleep-time compute 研究、Letta Code 记忆优先编码智能体、Conversations API(2026-01)、Context Repositories(2026-02,git 式记忆版本管理)
- 模型无关,提供 REST API 与 Agent Development Environment(ADE),支持经 MCP 接入外部工具
从 MemGPT 论文到 Letta 公司
2023 年 10 月,UC Berkeley 团队发布论文 MemGPT: Towards LLMs as Operating Systems(arXiv:2310.08560),核心洞察是:操作系统能靠虚拟内存与分页为程序制造「内存无限」的假象,大模型同样可以把上下文窗口当作主存、把外部数据库当作磁盘,通过在两层之间调度信息制造「上下文无限」的假象。2024 年 9 月 23 日,团队宣布两件事:开源项目由 MemGPT 更名为 Letta,MemGPT 之名保留给论文描述的设计模式;Letta Inc 出隐身,获 Felicis 领投、Founders Fund 与 Y Combinator 等跟投的 1000 万美元种子轮,投后估值 7000 万美元,天使名单包括 Jeff Dean、Clem Delangue 等行业人物。
三层记忆架构
Letta 的记忆分三层。Core memory(核心记忆)由带标签的记忆块组成——如 human(用户画像)、persona(智能体人设)——在每次推理时始终存在于上下文窗口,块有尺寸上限,可由开发者经 API 或 ADE 查看,也可由智能体经专用工具在运行中自行改写。Recall memory(回溯记忆)是全部历史交互的可检索档案:每条消息、每次工具调用与结果自动入库,支持向量相似、全文与混合检索,类似操作系统术语中的磁盘缓存。Archival memory(归档记忆)是长期冷存储:与自动记录的 Recall 不同,它由智能体显式写入需要长期保留的知识与文档,按需检索、不占窗口。当运行时准备请求时,上下文窗口由全部记忆块的当前状态经模板编译而成,保证模型看到的持久状态始终最新。
自编辑记忆与工程化实现
Letta 的关键设计是把「编辑记忆」做成显式的工具调用:core_memory_append、core_memory_replace 等函数让智能体在对话中随时更新对用户的理解、沉淀重要事实;块被修改后系统提示词整体重编译,下一次调用即看到新内容,无需任何检索动作——这是它与把记忆当 RAG 外挂的方案的分野。工程上,记忆块、消息与归档段落分别落库,向量检索可基于 pgvector 实现;整套记忆操作白盒透明,便于企业审计。风险同样来自自编辑:有第三方代码评估指出,核心记忆的正确性依赖工具规则、精确串替换、只读标志与运行时约束的兜底——信任智能体改写自身记忆是有代价的设计(记忆被污染的风险另见本站「记忆投毒」词条)。
版本演进与现状
更名后的产品线快速扩展:2025 年 4 月团队发表 sleep-time compute 研究,让智能体利用交互间隙的空闲时间主动整理与重组织记忆,该概念随后并入平台架构;2025 年 12 月推出 Letta Code,一个记忆优先的编码智能体,能把对代码库的习得跨会话沉淀;2026 年 1 月发布 Conversations API,允许单个智能体在多个并发用户会话间共享记忆;2026 年 2 月发布 Context Repositories,用 git 式机制对记忆状态做版本管理与合并。开发重心亦在调整:据社区代码考古报告,2026 年 8 月原 V1 API 服务器源码已从主分支移入归档分支,后续开发集中于 letta-code 方向的智能体外壳与渠道能力。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
与同类方案的差异
与 LangChain 等把记忆作为可选组件的框架相比,Letta 把记忆放在智能体状态的核心位置,围绕它设计整个运行时;与 Claude Code、Codex CLI 等编码智能体相比,Letta Code 的差异点在跨会话记忆沉淀;与各类「向量库存对话」的简易方案相比,Letta 提供的是带自编辑语义的分层记忆模型。适用判断也由此而来:需要智能体长期记住用户与业务、并把记忆当作一等资产管理的场景(个性化助理、长期客服、代码库陪伴式开发),Letta 的模型契合度高;一次性任务型智能体则未必需要这套机制。
🎯 应用场景
✅ 最佳实践
- 为记忆块设置尺寸上限,防止核心记忆无限膨胀挤占任务上下文
- 区分自动记录与显式沉淀:对话历史交给 Recall,确需长期保留的知识再写入 Archival
- 定期审计记忆内容并配合只读标志,降低记忆投毒与错误自我更新风险
🔮 未来展望
记忆版本化(Context Repositories)与多会话共享记忆(Conversations API)指向「团队级智能体记忆」的方向;同时,托管运行时普遍内置自动上下文压缩,也在挤压独立记忆层的空间,两条路线的竞争值得关注。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。