它想解决的是一个「经验留不下来」的问题

浙江大学 REAL Lab 与北京大学 OpenDCAI Lab 联合开源的 Easel,把内容创作当成一个能积累上下文与经验的交互过程来做。它要回答的不是「一次生成的质量如何」,而是一次创作里的选题判断、表达方式与执行结果,能不能影响下一次决策。

选的场景是社交媒体。这个环境的约束条件恰好适合用来测试长期智能体:目标是个性化的,同一个话题对不同账号价值不同;环境持续变化,热点与受众兴趣并不稳定;反馈带有延迟与噪声,内容表现同时受选题、表达、曝光和时机影响。

五个阶段串成一条连续工作流

Easel 把流程拆成五段。发现阶段的「热点雷达」聚合多平台趋势,筛选适合当前账号的选题;策划阶段用内容日历统一管理选题、草稿、待发与已发内容;制作阶段协调文字、图像、语音和视频工具执行;发布阶段从一份母版生成多平台版本并完成发布前检查;复盘阶段把内容事件与账号时序数据纳入分析,做归因与经验提炼。

这五段之间不是松散的串接。复杂任务被拆解成具有依赖关系的步骤,各步骤共享上游结果。

五个阶段,112 个可组合的能力单元发现策划制作发布复盘热点雷达内容日历多模态工具多平台母版归因分析制作阶段协调的工具链文字图像语音视频账号上下文六个维度:定位、风格、受众、平台、偏好边界、长期记忆各阶段共享同一份结构化材料,减少各模态独立理解原文带来的偏移
图 1|五个阶段串成一条连续工作流,共用一套账号上下文与结构化中间产物。

112 个 Skills 是怎么被组织起来的

Easel 当前内置 112 个 Skills,覆盖发现、策划、制作、发布、归因以及基础能力。它并没有把工具直接列给模型,而是把执行流程、领域知识和工具调用方式打包成可组合的能力单元:智能体根据任务目标选择技能,按需读取流程与参考资料,之后再协调底层工具。

一个具体的例子是论文解读类任务。系统先提炼研究问题、方法与关键证据,再组织成文章、知识卡片或视频脚本,随后完成配图、配音、字幕与合成。同一组结构化材料支撑起不同表达形式,减少各模态独立理解原文带来的信息偏移。

账号上下文的六个维度

账号上下文被组织成六个维度:定位、风格、受众、平台、偏好边界和长期记忆。用户设定的约束因此可以贯穿不同任务——比如一个科技账号反复强调「保留方法细节,但减少术语堆砌」,这条偏好会影响后续的选题深度、脚本结构和图文表达。

长期记忆为什么要过一次人工确认任务交互反馈候选经验用户确认长期上下文参与后续决策不进入长期记忆的两类东西临时规格:只对当前任务生效的参数一次性参数:偶然命中一次、缺少复用条件的做法复盘时还要求保留样本量与数据覆盖,并区分相关与因果
图 2|记忆的写入需要一次显式确认,这条规则把不可见的漂移变成了可复查的编辑。

长期记忆为什么要过一次人工确认

记忆的写入规则是这套设计里比较克制的一环。智能体筛选的是可复用的偏好、制作方法与效果发现,经用户确认后增量写入,并与已有内容合并。临时规格和一次性参数不会直接成为长期规则。

反馈分两个时间尺度。任务内反馈直接作用于当前产物:模型负责内容理解、结构设计与表达判断,工具负责媒体处理与规格检查,再根据结果指导修改——图文检查布局与可读性,视频核对画面、声音和字幕,对白出现偏差时选择替换配音或重新生成。跨任务反馈则来自用户修订和发布之后的表现。

发布后的分析有两条自我约束值得一提:要求保留样本量与数据覆盖情况,并区分相关关系与因果关系。系统明确说明,高互动不能直接证明策略有效——它可能来自热点时机、额外曝光或样本差异。可复用的发现要再经过创作者确认,才进入账号画像。

目前缺的那半截

公开材料里没有给出任何基准测试分数。长期记忆是否改善了跨会话的个性化一致性、结构化中间产物是否真的减少了信息偏移、历史经验能不能帮助系统应对新任务条件——这些都是项目方自己列出的待验证问题。

项目方的表述也很直接:当前系统提供的是经验积累与反馈利用的基础,更可靠的经验筛选、适用条件建模和技能改进仍需要进一步研究与验证。

换句话说,这是一套把「经验如何沉淀」工程化的框架,而不是一份效果报告。把它当成可直接照搬的方案还有距离,但里面关于「什么不该记」的规则是现在就能用的。

为什么拿社交媒体做长期智能体的试验场

社交媒体在长期智能体的研究里有一个特殊位置:它的反馈真实且公开,同时噪声很大。

真实体现在数据可得——发布之后有多少互动、哪类表达被接受、哪类选题被忽略,这些都有客观记录。噪声体现在归因困难——同一条内容的表现同时受选题、表达方式、曝光时机和平台推荐机制影响,很难把结果归到单一变量上。

这恰好是长期记忆系统最需要面对的处境。如果反馈总是干净、因果明确,记忆的写入就只是一个存储问题;正因为反馈带噪声,系统才必须判断哪些经验值得保留、哪些只是一次偶然。Easel 把「保留样本量与数据覆盖、区分相关与因果」写进复盘阶段的要求里,针对的正是这一点。

把工具打包成技能单元,差别在哪

直接给模型一份工具清单,和把工具连同流程、领域知识一起打包成技能单元,看起来只是包装方式的区别,实际影响的是调用质量。

工具清单回答的是「能做什么」,模型需要自己推断「该怎么做、按什么顺序做、有哪些领域约束」。技能单元把这部分前置了:每个技能自带流程说明与参考资料,智能体选中技能之后按需读取,不必每次都从零推导。

代价是可维护性。112 个技能意味着 112 份需要持续更新的说明,技能之间的边界与重叠也要靠人工梳理。项目还没有公开这部分的工作量数据,而这往往是这类框架在实际使用中最先遇到摩擦的地方。

跨平台母版机制解决的是什么

发布阶段的做法是「从一份母版生成多平台版本」。这个设计的价值不只是省一次排版:它让同一份结构化材料成为多个平台版本的共同来源,调整信息密度、叙事节奏与媒体形式时,改动可以在同一处发生。

更常见的做法是每个平台各自创作一遍,结果是同一份内容在不同平台上出现口径不一致。母版机制把这种不一致变成一个显式选择——差异来自刻意的适配,而不是各自理解的偏差。

整套设计里最容易被忽略的一条

如果把 Easel 的做法压缩成可以直接借用的几条,成本最低、见效最快的一条,可能是「一次性参数不进长期记忆」。

多数记忆系统的默认行为是「能存就存」,结果是把大量只对某次任务有效的偏好沉淀成了长期约束。这些约束一旦混进账号上下文,之后想清理就要逐条判断哪条还有效,而且很难判断——因为它们看起来和真正的长期偏好没有区别。

反过来先定义「什么不该记」,等于给记忆加了一道准入线。这条线的维护成本远低于事后清理。

可以带走的几条

其一,把「什么不该记住」先写清楚。一次性参数与临时规格不进入长期记忆,这条规则比「记住更多」更重要。

其二,让记忆更新可审视。经用户确认后写入,是把不可见的漂移变成可见的编辑。

其三,复盘阶段保留样本量,并区分相关与因果。否则偶然表现会被固化成长期规则。

其四,共享结构化中间产物。多个模态各自理解原始材料的做法,会在跨模态时累积信息偏移。

目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。