我们习惯用「它会不会上网」判断浏览器 Agent

我们习惯用「它会不会上网」判断浏览器 Agent 行不行,却很少问:它最后交出来的东西,到底对不对?10 月,卡内基梅隆大学与 Browser Use 的研究者放出 Odysseys2 评测页,给了一记提醒。

终点不是「说完成」,是交付文件旧式验收看动作历史+截图找「哪步看起来完成」新式验收读交付文件逐项核验虚构结果整次记零100 个长任务;982 条评分标准;2480 次已评尝试模型没退步,是判卷依据变了
图|Odysseys2 要求浏览器 Agent 交付真实文件再验收,把「过程像完成」和「结果对不对」两把尺子摆到一起。

他们组织了 100 个长任务,模拟真实用户让浏览器助手干的活——比价、查史料、做研究、整理信息。终点不是「模型说完成了」,而是要求交付实际文件:电子表格、引用列表、访问不到页面的日志、一份对比报告。官方亮出 982 条评分标准、2480 次已评分尝试。

同一批轨迹,两种尺子差出天壤

最该普通读者注意的实验,是对同一批 Agent 运行轨迹用两种验收:旧式看动作历史和截图,逐条找「有没有哪步看起来完成了要求」;新式除了看轨迹,还读最终交付的文件,逐项核验结果,发现虚构结果就整次记零。同一批尝试,旧式平均分集中在 77 到 96 分(百分制),换成读交付文件,分数散到 2 到 85 分。

均分随验收方法漂移旧式:77–96 分新式:2–85 分新验收尚待充分人工验证,论文待发表
图|同一批尝试在两种验收下分数天差地别,但项目方坦言新尺子尚未经充分人类一致性验证,不能据此断言技术倒退。

差别不是模型退步了,是判卷的依据变了。项目方也坦白,新验收尚未经过充分的人类一致性验证,论文和技术报告还待发表——所以不能凭这个分数差就断言「Agent 技术倒退了」。但它确实戳破一个习惯:我们长期用「动作像不像做完了」给浏览器 Agent 打分,而真正该验收的是「交付物对不对」。

对采购或自建浏览器 Agent 的团队,这等于把验收标准从「过程热闹」拉回「结果可核对」。一个能流畅点完十家网店、却漏了型号、价格对不回商品页的 Agent,在旧尺子下可能拿高分,在新尺子下一文不值。评测方法,本身就是能力的一部分。