我们习惯用「它会不会上网」判断浏览器 Agent
我们习惯用「它会不会上网」判断浏览器 Agent 行不行,却很少问:它最后交出来的东西,到底对不对?10 月,卡内基梅隆大学与 Browser Use 的研究者放出 Odysseys2 评测页,给了一记提醒。
他们组织了 100 个长任务,模拟真实用户让浏览器助手干的活——比价、查史料、做研究、整理信息。终点不是「模型说完成了」,而是要求交付实际文件:电子表格、引用列表、访问不到页面的日志、一份对比报告。官方亮出 982 条评分标准、2480 次已评分尝试。
同一批轨迹,两种尺子差出天壤
最该普通读者注意的实验,是对同一批 Agent 运行轨迹用两种验收:旧式看动作历史和截图,逐条找「有没有哪步看起来完成了要求」;新式除了看轨迹,还读最终交付的文件,逐项核验结果,发现虚构结果就整次记零。同一批尝试,旧式平均分集中在 77 到 96 分(百分制),换成读交付文件,分数散到 2 到 85 分。
差别不是模型退步了,是判卷的依据变了。项目方也坦白,新验收尚未经过充分的人类一致性验证,论文和技术报告还待发表——所以不能凭这个分数差就断言「Agent 技术倒退了」。但它确实戳破一个习惯:我们长期用「动作像不像做完了」给浏览器 Agent 打分,而真正该验收的是「交付物对不对」。
对采购或自建浏览器 Agent 的团队,这等于把验收标准从「过程热闹」拉回「结果可核对」。一个能流畅点完十家网店、却漏了型号、价格对不回商品页的 Agent,在旧尺子下可能拿高分,在新尺子下一文不值。评测方法,本身就是能力的一部分。