智能体一跑就是几天几周,出了问题去哪找?这是眼下 Agent 工程化最现实的痛点之一。一篇由十人团队完成的论文给出了一个从系统软件借来的答案:给智能体装上剖析器(profiler)。论文提出的 AgentPProf(arXiv 2609.20301,9 月 14 日提交)把性能剖析这门老手艺搬进了智能体可观测性,代码已经在 GitHub 开源。
先说为什么现有的工具不够用。当前主流的智能体可观测性方案聚焦单次执行的调试与追踪:一次会话里发生了什么、调了哪些工具、在哪一步出错。这些工具回答得了「那一次为什么失败」,回答不了「过去一个月我的失败集中在哪类任务」「预算被哪些任务吃掉了」「什么在触发不安全操作」——这些是跨运行、长期聚合的问题。系统软件里,这类问题由剖析器回答:聚合资源消耗,归因到责任代码路径,找出热点。
但直接把剖析器搬过来行不通,难点在归因对象完全不同。传统剖析归因到函数与调用栈,智能体的「责任实体」却是任务意图——比如「诊断认证问题」或「对比两个分支」——而不是任何一行代码;而且同一类意图在不同运行里的表现形态各异,缺少可以聚合的稳定标识符。没有稳定标识,聚合就无从谈起。
论文的两级设计就是冲着这个难点去的。上面一层是语义操作栈模型:用统一的操作表示智能体的一切活动,用操作栈取代运行时调用栈,从而支持不同粒度的分层归因。下面一层是递归操作分段:作者观察到智能体的任务总是占据一段连续的执行区间,并且会分解成子任务,于是让分段器在任务边界处递归地切分轨迹——切出来的单元天然带语义,正好充当聚合的标识符。
效果用两组数字说话。分段质量上,AgentPProf 与人工标注的一致性达到 B3 F1 0.764(CodeTraceBench 基准);实用价值上,在三个问题定位基准上,用它的剖面做归因让 MAP 最高提升 56%,同时剖析开销控制在可用水平。输出是 pprof 兼容格式,意味着系统工程师熟悉的火焰图工具链可以直接接管——长时程智能体的预算大户和失败热点,一眼就能在火焰图上看见。
对实际使用者来说,接入路径也不复杂:开源仓库提供了从轨迹采集到剖面生成的工具链,把智能体运行日志喂进去就能得到火焰图。团队不需要替换现有的调试工具——剖析补的是聚合视角,与单次追踪是互补关系,两条线并排看,长期问题看剖析、单次故障看追踪。
辩证地看,0.764 的一致性说明自动分段与人类理解之间仍有明显差距,错切的任务边界会把归因带偏;三个定位基准的规模也有限,结论能否外推到千行万行的真实生产轨迹,还要看更多实测。火焰图对缺乏系统背景的应用开发者也有学习门槛。但方向价值是明确的:可观测性正在从「看单次」走向「看长期」,与本站此前报道过的推理栈优化、KV cache 工程一脉相承——Agent 工程化下半场的竞争,就在这些看不见的地方。