2026 年 9 月,来自上海交通大学、新加坡管理大学等机构的论文 EarlyEval 直击一个很多团队心照不宣却很少挑明的话题:智能体评测,可能比模型本身还烧钱。论文给出的账很具体——在 SWE-bench Verified 这个业内常用的软件修复评测集上,让一个顶尖大模型完整跑完 500 道修复题,光模型调用费就要约 487 美元;如果换成更复杂的多模态评测,要求智能体读图、写代码、调工具、边推理边操作终端,单次评测成本直接飙到约 2236 美元。这还只是「交一次卷」的价格。当一个团队把评测当成日常、而不是偶尔为之时,这笔账会从一次性的开销,变成每月都在发生的固定负担。
一笔硬账:评测成本随重试指数式放大
真实研发哪有只交一次卷。改一行提示词、换一个记忆模块、调整一次工具调用顺序,往往都要把评测重跑一遍。一个迭代周期测 30 次,账单轻松突破 7 万美元。这背后的原因,是智能体根本不是答题机器,而是一个「数字实习生」:修一个真实仓库里的 bug,它要 clone 代码、读 17 个文件、跑测试、定位到第 329 行、写脚本复现、改逻辑、再跑测试——整个过程平均 45 步,每一步都要调用一次大模型。步骤越多,账单越像雪球滚下悬崖。
也正因为此,评测的瓶颈正在从「算力卡脖子」悄悄换成「评测经济学卡脖子」。过去学界想省钱,主打一个「精简题库」:从 500 题里挑出 50 道代表题,测完再 extrapolate 全量分数。这招管用,但治标不治本——就像抽查 20 份作业判断班级水平,很聪明;可如果这 20 份作业每份都要手抄三遍、逐字批注五轮,省下的纸张根本抵不过多耗的墨水。
EarlyEval 的切口:给评测装「提前下课铃」
EarlyEval 不造新模型,也不换基准,而是干了一件更务实的事:给评测过程装一个「提前下课铃」。它的核心观察是,很多失败轨迹从早期信号就能判断走不通,继续跑下去只是白白消耗 token 和时间。与其等智能体把一条死路走完,不如在仍可信的前提下尽早终止明显失败的轨迹,把预算留给更有希望的路径。这相当于把评测从「每道题都跑满」变成「该停就停」,在不牺牲评估可信度的前提下压低总成本。
这种做法的妙处在于,它和基准蒸馏是互补而非替代:抽题解决「测哪些」,提前终止解决「每道测多久」。两者叠加,评测账单才有机会真正降下来。对中小团队尤其友好——它们没有大厂那样充裕的算力预算,却同样要做模型选型、提示词迭代与回归测试,EarlyEval 这类工程化优化,比又大又贵的基准更贴近它们的真实痛点。这也提醒行业,评测优化的空间往往不在模型侧,而在流程侧。
评测经济学正在成为新门槛
把视野拉远一点,EarlyEval 指向的是一个更宽的趋势:智能体研发的隐形门槛,正从模型能力转向评测成本。当模型迭代越来越快、可选模型越来越多,决定一个团队能试多少种方案的,往往不是谁的模型更聪明,而是谁能以更低成本把每一种方案评测清楚。评测框架、早停策略、轨迹压缩、预算分配,这些听起来不如新模型性感的工程问题,正在变成智能体落地的真实约束。对不少中小团队而言,评测账单甚至可能比推理账单更先触顶——他们的试错预算有限,却要覆盖同样多的模型与配置组合。这篇论文以 arXiv 预印本形式公开,具体编号以 arXiv 页面为准,后续将持续跟进迭代动态。