8月5日,国内权威中文大模型评测机构 SuperCLUE 发布最新一期 XClaw 龙虾产品测评,百度文心助手(任务模式)以97.62分的总成绩排名第一,超过小米 MiMoClaw、腾讯 WorkBuddy、月之暗面 KimiClaw 等同台产品。更受关注的是分项成绩:在记忆能力维度,文心助手拿下100分满分;数据处理98.86分位列第一,内容创作99.44分、研究分析96.44分同样靠前。这已不是文心短期内的首个第一——7月20日,它的任务 Agent 以94.6%的综合成功率、94.4%的平均得分,登顶全球工程向智能体评测榜单 PinchBench v2。两榜叠加,把一条行业主线推到台前:国产通用智能体的比拼,正从「回答流不流畅」转向「任务能不能交付」。
一、双榜登顶:97.62分与94.6%的含金量
两套评测的侧重并不相同,却都指向「交付」而非「对话」。PinchBench v2 关注任务规划与工具调用,考察系统能否把复杂需求拆成多个步骤并持续执行;SuperCLUE-XClaw 则从数据处理、内容创作、记忆、代码开发、研究分析五个维度做综合评估,覆盖主流厂商共10款代表性产品。文心在两个榜单同时居首,说明它的优势不局限于某一类任务,而是在「理解需求—组织信息—维持长执行链路—产出可用结果」这条完整路径上比较均衡。值得强调的是,文心助手向所有用户免费开放,不限量——这意味着它的登顶不是靠高门槛的付费版本,而是在最大众的使用场景里跑出来的。
二、记忆满分:被忽视的「干活地基」
在整张成绩单里,最值得单独拎出来的是记忆能力的100分。用过智能体的人都有体感:你跟 Agent 聊了三轮,到第四轮它忘了你第一轮设定的条件,产出直接作废。记忆是所有「干活能力」的地基——Agent 帮你执行任务,如果记不住先前的要求、上下文和中间结论,等于白干。SuperCLUE-XClaw 把记忆单列为一维并给到满分,等于把行业长期模糊感知的一项能力,变成了可量化、可横向比较的指标。当「记忆」从隐性体验变成显性榜单维度,智能体产品的迭代方向也会被牵引:比起堆参数,能不能记住、能不能在长链路里保持一致,正在成为真正的分水岭。
三、从搜索积累到任务执行:百度的一次能力迁移
文心这波表现,底层是百度多年在查询理解、信息检索、知识组织与结果排序上的积累,正从「提供资料」向后延伸到「整理资料、分析数据、生成结果」。传统搜索强调召回、排序与呈现,而 Agent 还要处理工具稳定性、上下文保持、错误修正与最终交付——搜索积累不会自动变成 Agent 能力,但确实为文心进入复杂任务场景提供了基础。百度 App 与文心助手提供了巨大的用户入口,海量真实查询能持续暴露意图识别偏差、步骤遗漏、格式错误与结果不可用等失败点,这类反馈对任务型产品的迭代,比单纯提升模型参数更直接。换句话说,文心进入任务型 AI 产品竞争前列,靠的不仅是模型,还有把搜索时代的真实流量转化为训练与评测信号的能力。
四、客观看:免费登顶与未竟之题
价值在于,文心用免费产品的双榜登顶,证明了「任务交付」正在取代「对话流畅」成为通用智能体的核心标尺,也把记忆能力这一隐形地基摆上了台面,对全行业迭代方向有牵引意义。但边界要讲清:其一,两份榜单分别由 SuperCLUE 与 PinchBench 发布,评测口径、样本与场景各有侧重,单项满分不代表在全部真实任务中都无短板;其二,评测多为限定场景的命题任务,与开放、多变的真实工作流存在差距,从「一次成功执行」到「可重复的交付能力」仍有距离;其三,搜索时代的积累能否持续转化为产品优势,取决于更多真实任务中的稳定性,而非一次评测成绩;其四,免费策略本身是产品与生态打法,不等于商业闭环已验证。文心证明了方向,而「能交付」这场仗,才刚刚从榜单打到日常。