个人智能体的「全双工」考题
9 月 28 日的一篇 arXiv 论文(编号 2609.34930)从一个被忽视的角度考了个人智能体:不是单步调用对不对,而是「从定计划、到执行、再到按反馈改计划」这一整条生命周期里,它能不能把用户的偏好一贯地贯彻到底。这个叫 PDEU-Bench 的基准,覆盖 214 个长程交互任务、12 个日常领域、94 个工具,对每个阶段单独打「偏好遵循」和「计划质量」的分。
为什么这件事重要?因为眼下个人智能体正从演示走向日常——国内大厂集体入局、海外产品把「常驻办事」当卖点。但 PDEU-Bench 的结论给这股热潮泼了盆冷水:模型在单次调用里能很好地实例化用户偏好,却普遍建不出连贯的计划定义,也改不好已有计划。
把规划拆开看,三个阶段的难度并不对称。执行段考的是给你一步动作,你能不能按用户习惯来做,模型大多应付得来;定义段考的是先定目标与步骤,且这些步骤要体现用户偏好,模型常常含糊其辞;更新段考的是根据反馈修订已有计划,模型又容易推倒重来而非精准修补。PDEU-Bench 的巧思在于,它不是给一个总分,而是把偏好遵循和计划质量分别按阶段打分,让断点在哪个环节一目了然。
断层出在首尾两端
把规划切成定义、执行、更新三段看,问题集中在两头。执行中段相对稳:给定一步动作,模型大多能按用户习惯来。可一到「先定目标与步骤」,它就含糊;一到「根据反馈修订旧计划」,它又塌。作者还测了主流的个性化与记忆增强方法——结论是,这些方法能补某一段,却没法把偏好可靠地传遍全程,增益常常到下一步就断。
更细的错误分析显示,偏好的遗漏与冲突会贯穿整个规划生命周期,并不是偶发。也就是说,今天很多「记忆」方案解决的是「记得住某条偏好」,没解决「偏好如何约束一整条跨步计划」。
这层意思对当下正热的个人智能体尤其刺耳。很多产品演示时让模型帮你订餐厅、排日程、写邮件,看起来什么都懂;可一旦要求它把不吃香菜、九点后不接电话、周末不打扰这类偏好连贯地贯彻到一整周的计划里,演示里的聪明就塌了。PDEU-Bench 用数字证明,这种塌不是偶发,而是规划生命周期两端的结构性缺口。
这解释了「演示强、长程弱」
把 PDEU-Bench 放回产品视角,它其实解释了用户最常见的体感:个人智能体演示时样样精通,真用起来却常在长任务里跑偏——明明记得你不吃香菜,却在你连订三天餐的计划里把这条忘在第二步。根因不在模型不够聪明,而在「偏好」没有被参数化成贯穿规划的信号,而只是散落在单次调用里的提示。
给做个人智能体的团队
论文的启发很直接:想让个人智能体真正「懂你」,光堆记忆容量不够,得让偏好成为计划定义与更新的硬约束——用偏好感知的检索与记忆,把「用户要什么」写进每一步的决策前提,而不是等执行时临场想起来。对赛道来说,PDEU-Bench 把「个性化」从营销词拉回可度量:下一个竞争点,不是谁记得多,而是谁能在长程任务里把偏好一贯地贯彻到尾。
这同时也意味着,评测个人智能体不能再只看单轮对话的讨喜程度,而要看它跨多步、多日计划里是否始终如一。对个人用户来说,当你觉得某个智能体越来越懂你时,先别急着信,给它一个跨多天的复合任务试试——看它能不能在第三天还记着头一天的偏好。能把偏好贯彻到尾的,才是真懂你;只在头一天表现得像懂你的,多半只是记住了那一次对话。判断一个个人智能体够不够聪明,不妨把这当成最低标准:跨三步还记着你的偏好,才算及格。