评测一个智能体,只给一个「成没成」的终点分,越来越像用及格线衡量一名员工——能过关,却看不出到底哪项能力强、哪项拉胯。10 月 3 日挂上 arXiv 的 Agentic Cognitive Depth(编号 2610.04168)想换把尺:它把 agent 的「认知深度」定义成一条轨迹级的画像,由五个可操作指标组成,让能力短板一眼可见。

五项指标,而不是一个总分

论文把智能体拆成「规划、记忆、工具、控制流」在环路里跑的系统,再给出五个 operational criteria:C 上下文敏感、T 时间连续、M 多模态协同、A 自适应交互、Mc 元认知监控。前四项分别测控制流、记忆、工具、规划在整条轨迹上用得怎么样;第五项 Mc 测系统是否监测并调节自己的全程运行。每一项都配了可操作的代理指标和一套扰动方法,还能反推到 agent 的世界模型上。换句话说,它不告诉你「这个 agent 得了 85 分」,而告诉你「它在多模态协同上偏弱、在元认知监控上几乎空白」。比起一个含糊的「更聪明」,这种可逐项打分的方式,更方便团队在迭代时盯住最该补的那块能力,而不是被总分糊弄。

认知深度画像5 项轨迹级指标C 上下文敏感T 时间连续M 多模态协同A 自适应交互Mc 元认知监控
图 1|认知深度不是单一分数,而是 C/T/M/A/Mc 五项轨迹级指标组成的画像,哪项弱一眼可见

接到现有基准上

这套画像最实用的地方,是能「贴」到已有基准上。论文展示了如何给 GAIA、SWE-bench、WebArena、TRIP-Bench 这些任务加上逐标准的诊断,让同一个 benchmark 同时产出「做对了没」和「卡在哪一个能力维度」。对研发团队,这意味着排错方式变了:不必再对着一个低分猜原因,而是顺着 C/T/M/A/Mc 去定位——是规划没拆好,还是工具调用时机不对,还是跑着跑着忘了更早的上下文。这种从「终点体检」到「分项造影」的迁移,正是 agent 工程走向成熟的标志。

规划·记忆工具·控制流逐标准诊断per-criterionGAIASWE-benchWebArenaTRIP-Bench
图 2|把 C/T/M/A/Mc 诊断接到 GAIA、SWE-bench 等现有基准上,能看出每个任务卡在哪一项能力

它和同类评测范式怎么分

评测范式近几个月也在密集出新,Agentic Cognitive Depth 的特别之处在于「轨迹级、多维、可扰动」。它和过程级评测(看轨迹偏差、依赖归因)、基准效度研究(检验基准本身靠不靠谱)、以及过程审计类基准(如 Argo-Bench 考多步推理会不会走形)是不同层次的工作:那些更关心「评得准不准、过程对不对」,这篇关心「从哪些能力维度给 agent 画一张像」。和安全向的 EvoRiskBench 也不同——一个看能力结构,一个看失守路径。对想做 agent 内部可观测性的团队,这篇提供的不是又一个排行榜,而是一套可以把现有评测「升级成诊断仪」的方法论。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

当然,五维画像也不是银弹。指标怎么取代理、扰动怎么设计、不同任务下权重怎么定,论文给的是框架而非定论;把 Mc 这类「元认知」量化,本身也还在早期。但它把一个长期被混在一起的问题拆开了:我们说的「agent 聪明」,到底是规划强、记忆稳、工具准,还是只是碰巧在某一类任务上训练够了。能把这层迷雾拨开,评测才真正开始服务于改进,而不是只服务于宣传。对采购方而言,以后看一份 agent 评测,不妨多问一句:它的能力是总分高,还是每一项都经得起分项拆解。一项能力短板被总分掩盖的 agent,在真实任务里往往栽在最弱那一项上——比如规划满分、元认知近乎空白,上线后就会在长任务中途莫名跑偏。分项画像的价值,正在于把这种「偏科」提前暴露出来,让改进有处下手。