它想解决的是一个「经验留不下来」的问题
浙江大学 REAL Lab 与北京大学 OpenDCAI Lab 联合开源的 Easel,把内容创作当成一个能积累上下文与经验的交互过程来做。它要回答的不是「一次生成的质量如何」,而是一次创作里的选题判断、表达方式与执行结果,能不能影响下一次决策。
选的场景是社交媒体。这个环境的约束条件恰好适合用来测试长期智能体:目标是个性化的,同一个话题对不同账号价值不同;环境持续变化,热点与受众兴趣并不稳定;反馈带有延迟与噪声,内容表现同时受选题、表达、曝光和时机影响。
五个阶段串成一条连续工作流
Easel 把流程拆成五段。发现阶段的「热点雷达」聚合多平台趋势,筛选适合当前账号的选题;策划阶段用内容日历统一管理选题、草稿、待发与已发内容;制作阶段协调文字、图像、语音和视频工具执行;发布阶段从一份母版生成多平台版本并完成发布前检查;复盘阶段把内容事件与账号时序数据纳入分析,做归因与经验提炼。
这五段之间不是松散的串接。复杂任务被拆解成具有依赖关系的步骤,各步骤共享上游结果。
112 个 Skills 是怎么被组织起来的
Easel 当前内置 112 个 Skills,覆盖发现、策划、制作、发布、归因以及基础能力。它并没有把工具直接列给模型,而是把执行流程、领域知识和工具调用方式打包成可组合的能力单元:智能体根据任务目标选择技能,按需读取流程与参考资料,之后再协调底层工具。
一个具体的例子是论文解读类任务。系统先提炼研究问题、方法与关键证据,再组织成文章、知识卡片或视频脚本,随后完成配图、配音、字幕与合成。同一组结构化材料支撑起不同表达形式,减少各模态独立理解原文带来的信息偏移。
账号上下文的六个维度
账号上下文被组织成六个维度:定位、风格、受众、平台、偏好边界和长期记忆。用户设定的约束因此可以贯穿不同任务——比如一个科技账号反复强调「保留方法细节,但减少术语堆砌」,这条偏好会影响后续的选题深度、脚本结构和图文表达。
长期记忆为什么要过一次人工确认
记忆的写入规则是这套设计里比较克制的一环。智能体筛选的是可复用的偏好、制作方法与效果发现,经用户确认后增量写入,并与已有内容合并。临时规格和一次性参数不会直接成为长期规则。
反馈分两个时间尺度。任务内反馈直接作用于当前产物:模型负责内容理解、结构设计与表达判断,工具负责媒体处理与规格检查,再根据结果指导修改——图文检查布局与可读性,视频核对画面、声音和字幕,对白出现偏差时选择替换配音或重新生成。跨任务反馈则来自用户修订和发布之后的表现。
发布后的分析有两条自我约束值得一提:要求保留样本量与数据覆盖情况,并区分相关关系与因果关系。系统明确说明,高互动不能直接证明策略有效——它可能来自热点时机、额外曝光或样本差异。可复用的发现要再经过创作者确认,才进入账号画像。
目前缺的那半截
公开材料里没有给出任何基准测试分数。长期记忆是否改善了跨会话的个性化一致性、结构化中间产物是否真的减少了信息偏移、历史经验能不能帮助系统应对新任务条件——这些都是项目方自己列出的待验证问题。
项目方的表述也很直接:当前系统提供的是经验积累与反馈利用的基础,更可靠的经验筛选、适用条件建模和技能改进仍需要进一步研究与验证。
换句话说,这是一套把「经验如何沉淀」工程化的框架,而不是一份效果报告。把它当成可直接照搬的方案还有距离,但里面关于「什么不该记」的规则是现在就能用的。
为什么拿社交媒体做长期智能体的试验场
社交媒体在长期智能体的研究里有一个特殊位置:它的反馈真实且公开,同时噪声很大。
真实体现在数据可得——发布之后有多少互动、哪类表达被接受、哪类选题被忽略,这些都有客观记录。噪声体现在归因困难——同一条内容的表现同时受选题、表达方式、曝光时机和平台推荐机制影响,很难把结果归到单一变量上。
这恰好是长期记忆系统最需要面对的处境。如果反馈总是干净、因果明确,记忆的写入就只是一个存储问题;正因为反馈带噪声,系统才必须判断哪些经验值得保留、哪些只是一次偶然。Easel 把「保留样本量与数据覆盖、区分相关与因果」写进复盘阶段的要求里,针对的正是这一点。
把工具打包成技能单元,差别在哪
直接给模型一份工具清单,和把工具连同流程、领域知识一起打包成技能单元,看起来只是包装方式的区别,实际影响的是调用质量。
工具清单回答的是「能做什么」,模型需要自己推断「该怎么做、按什么顺序做、有哪些领域约束」。技能单元把这部分前置了:每个技能自带流程说明与参考资料,智能体选中技能之后按需读取,不必每次都从零推导。
代价是可维护性。112 个技能意味着 112 份需要持续更新的说明,技能之间的边界与重叠也要靠人工梳理。项目还没有公开这部分的工作量数据,而这往往是这类框架在实际使用中最先遇到摩擦的地方。
跨平台母版机制解决的是什么
发布阶段的做法是「从一份母版生成多平台版本」。这个设计的价值不只是省一次排版:它让同一份结构化材料成为多个平台版本的共同来源,调整信息密度、叙事节奏与媒体形式时,改动可以在同一处发生。
更常见的做法是每个平台各自创作一遍,结果是同一份内容在不同平台上出现口径不一致。母版机制把这种不一致变成一个显式选择——差异来自刻意的适配,而不是各自理解的偏差。
整套设计里最容易被忽略的一条
如果把 Easel 的做法压缩成可以直接借用的几条,成本最低、见效最快的一条,可能是「一次性参数不进长期记忆」。
多数记忆系统的默认行为是「能存就存」,结果是把大量只对某次任务有效的偏好沉淀成了长期约束。这些约束一旦混进账号上下文,之后想清理就要逐条判断哪条还有效,而且很难判断——因为它们看起来和真正的长期偏好没有区别。
反过来先定义「什么不该记」,等于给记忆加了一道准入线。这条线的维护成本远低于事后清理。
可以带走的几条
其一,把「什么不该记住」先写清楚。一次性参数与临时规格不进入长期记忆,这条规则比「记住更多」更重要。
其二,让记忆更新可审视。经用户确认后写入,是把不可见的漂移变成可见的编辑。
其三,复盘阶段保留样本量,并区分相关与因果。否则偶然表现会被固化成长期规则。
其四,共享结构化中间产物。多个模态各自理解原始材料的做法,会在跨模态时累积信息偏移。
目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。