多步推理到底靠不靠谱,一份新基准给了个不太好看的数字。近期公开的 Argo-Bench 一次性把 14 个模型放在复杂推理任务上测,结果表现最靠前的也只拿到 34.8%,中间梯队更是断崖式拉开。它想戳破的,正是过去一年被反复宣传的「智能体什么都能规划」的幻觉:当任务需要连续多步、还要边做边调整,大多数模型的真实表现远没有单轮问答那么光鲜。
为什么是「复杂推理」这道关
Argo-Bench 挑的不是那种一眼能答的题,而是需要分解子目标、调用工具、在多轮里维持上下文一致性的任务。这类任务恰恰是多步智能体的主战场——订行程、跑分析、改代码都长这样。把一个任务拆对、每一步都踩稳、前后不互相打架,比「答好一道选择题」难出一个量级。基准把 14 个模型摆在同一组题上横向比,最刺眼的是头部也只有三成出头,说明这已经不是某个模型的个别短板,而是当前这一代智能体共同的天花板。它公开了评测本身,等于把「多步可靠」这件事从宣传话术拉回了可测量的坐标。
最该警惕的是「过程不可见」
这份基准真正想提醒行业的,不是「模型还不够强」,而是「我们一直在用错尺子」。很多产品演示看着惊艳,是因为评测只看终点答案对不对;可真实任务里,终点对了不代表每一步都站得住——某一步偷偷走了捷径、抄了不可靠的来源、或者把前一步的结论悄悄改了,终点仍可能蒙混过关。Argo-Bench 的价值在于把这种「过程风险」显影出来:一个多步任务,只要中间有一环走偏,后面就跟着全错,而传统评测往往对此视而不见。这对落地团队是句大白话——别只看 Agent 交付了什么,要看它每一步怎么到的。
给选型与验收的一记提醒
把结论落到工程上,Argo-Bench 给的启示很务实:验收智能体不能只丢几个样例看结果,得构造带多步、带工具、带中途纠偏的评测集,并且把「每一步是否合理」也纳入打分。它和近期一批关注长程攻击、越界恪守、状态验证的评测是同一个方向的补刀——大家越来越意识到,单轮能力卷到头之后,真正的门槛在「连续跑一长串动作还不翻车」。对买家来说,这意味着别被「能完成示例任务」的演示带偏,要问清楚对方在多大、多复杂的多步任务上验证过。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态;但 34.8% 这个顶分,足够让所有把智能体推进生产的人,重新审视自己的验收门槛是不是定得太松了。
落到具体场景会更好懂:一个帮人做竞品分析的 Agent,可能前几步都跑得漂亮,却在「把结论写回文档」这一步悄悄用了过时的数据源,终点看起来完整,过程却埋了雷。Argo-Bench 这种基准的价值,就是把这类「终点对、过程歪」的隐患量化出来,让团队在采购或自研时,多问一句「你的多步任务集长什么样、掉到几成」。这比单纯比参数更有用,因为生产环境里的任务,几乎没有一步就能答完的;越是跨工具、跨系统的长链路,过程越可能在不被察觉处走形。
换个角度想,这个基准也不是为了唱衰。它把「多步可靠」标定成一个可追踪、可对比的指标,反而有利于行业把精力从炫技挪到补短板上。过去一年,太多团队把智能体当成「 Prompt 写得好就灵」的黑箱,Argo-Bench 这类工具的存在,逼着大家在发布前先回答一个朴素问题:我的 Agent 在比演示复杂十倍的任务上,还能稳住几成?把这个数字摆上台面,比任何营销口径都更能决定它该不该进生产。对开发者而言,真正的机会也在这里——谁先把多步过程的可观测、可回滚、可干预做扎实,谁就可能在下一阶段拉开差距,而不是在终点正确率的微弱领先上内卷。