个人智能体的「全双工」考题

9 月 28 日的一篇 arXiv 论文(编号 2609.34930)从一个被忽视的角度考了个人智能体:不是单步调用对不对,而是「从定计划、到执行、再到按反馈改计划」这一整条生命周期里,它能不能把用户的偏好一贯地贯彻到底。这个叫 PDEU-Bench 的基准,覆盖 214 个长程交互任务、12 个日常领域、94 个工具,对每个阶段单独打「偏好遵循」和「计划质量」的分。

为什么这件事重要?因为眼下个人智能体正从演示走向日常——国内大厂集体入局、海外产品把「常驻办事」当卖点。但 PDEU-Bench 的结论给这股热潮泼了盆冷水:模型在单次调用里能很好地实例化用户偏好,却普遍建不出连贯的计划定义,也改不好已有计划。

把规划拆开看,三个阶段的难度并不对称。执行段考的是给你一步动作,你能不能按用户习惯来做,模型大多应付得来;定义段考的是先定目标与步骤,且这些步骤要体现用户偏好,模型常常含糊其辞;更新段考的是根据反馈修订已有计划,模型又容易推倒重来而非精准修补。PDEU-Bench 的巧思在于,它不是给一个总分,而是把偏好遵循和计划质量分别按阶段打分,让断点在哪个环节一目了然。

① 计划定义定目标与步骤偏好难落地② 计划执行单次调用记得住偏好可实例化③ 计划更新依反馈改计划常改不好PDEU-Bench:个性化规划的「全生命周期」214 长程任务 · 12 日常域 · 94 工具
图 1|PDEU-Bench 把个性化工具智能体的规划切成定义、执行、更新三段分别打分,暴露出首尾两端的断层。

断层出在首尾两端

把规划切成定义、执行、更新三段看,问题集中在两头。执行中段相对稳:给定一步动作,模型大多能按用户习惯来。可一到「先定目标与步骤」,它就含糊;一到「根据反馈修订旧计划」,它又塌。作者还测了主流的个性化与记忆增强方法——结论是,这些方法能补某一段,却没法把偏好可靠地传遍全程,增益常常到下一步就断。

更细的错误分析显示,偏好的遗漏与冲突会贯穿整个规划生命周期,并不是偶发。也就是说,今天很多「记忆」方案解决的是「记得住某条偏好」,没解决「偏好如何约束一整条跨步计划」。

这层意思对当下正热的个人智能体尤其刺耳。很多产品演示时让模型帮你订餐厅、排日程、写邮件,看起来什么都懂;可一旦要求它把不吃香菜、九点后不接电话、周末不打扰这类偏好连贯地贯彻到一整周的计划里,演示里的聪明就塌了。PDEU-Bench 用数字证明,这种塌不是偶发,而是规划生命周期两端的结构性缺口。

这解释了「演示强、长程弱」

把 PDEU-Bench 放回产品视角,它其实解释了用户最常见的体感:个人智能体演示时样样精通,真用起来却常在长任务里跑偏——明明记得你不吃香菜,却在你连订三天餐的计划里把这条忘在第二步。根因不在模型不够聪明,而在「偏好」没有被参数化成贯穿规划的信号,而只是散落在单次调用里的提示。

单次调用记得住偏好✔计划定义建不出连贯计划✘计划更新改不好旧计划✘记忆偏好 ≠ 贯穿规划:个人智能体的隐形天花板个性化/记忆方法只补单段,难把偏好传遍全程
图 2|模型能在单次调用里实例化偏好,却建不出、也改不好跨步计划——这正是个人智能体「演示强、长程弱」的根因。

给做个人智能体的团队

论文的启发很直接:想让个人智能体真正「懂你」,光堆记忆容量不够,得让偏好成为计划定义与更新的硬约束——用偏好感知的检索与记忆,把「用户要什么」写进每一步的决策前提,而不是等执行时临场想起来。对赛道来说,PDEU-Bench 把「个性化」从营销词拉回可度量:下一个竞争点,不是谁记得多,而是谁能在长程任务里把偏好一贯地贯彻到尾。

这同时也意味着,评测个人智能体不能再只看单轮对话的讨喜程度,而要看它跨多步、多日计划里是否始终如一。对个人用户来说,当你觉得某个智能体越来越懂你时,先别急着信,给它一个跨多天的复合任务试试——看它能不能在第三天还记着头一天的偏好。能把偏好贯彻到尾的,才是真懂你;只在头一天表现得像懂你的,多半只是记住了那一次对话。判断一个个人智能体够不够聪明,不妨把这当成最低标准:跨三步还记着你的偏好,才算及格。