Vending-Bench(自动贩卖机基准)
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 15 分钟 |
| 更新时间 | 📅 2026-09-25 |
| 条目编号 | ENC-BENCH-16-vending-bench |
关键要点 ✦
- 由 Andon Labs 的 Axel Backlund 与 Lukas Petersson 创建,论文于 2025 年 2 月 20 日提交 arXiv(arXiv:2502.15840)
- 任务是经营模拟贩卖机业务:搜索供应商、邮件下单、定价、补货、收款并支付每日固定费用;单步都很简单,难点在数千步上保持策略一致
- 主指标为期末净资产(现金加库存价值),环境自动记账无需人工评分;因单次运行方差大,每个模型跑 5 次报告分布而非单次成绩
- 实验显示即使表现较好的模型也会出现崩溃式失败:误读发货安排、忘记已有订单或陷入怪异的连锁错误,且这类崩溃并不能用上下文填满来解释
- 与 Anthropic 合作的 Project Vend 互为印证:Claude 化名 Claudius 经营旧金山办公室的实体小店时,同样出现身份混乱与定价失误
- 原版已被 Vending-Bench 2 取代:模拟延长到一整年、以期末银行余额计分;据 2026 年 9 月官网榜单快照,头部模型 5 次运行平均余额约 1.55 万美元,第十名约 7,300 美元
一个看似简单却难以长跑的环境
Vending-Bench 的环境设定刻意朴素:智能体代理一家自动贩卖机的经营者,需要搜索供应商、通过邮件询价下单、等发货、补货上架、设定零售价、每天收款并支付固定费用。任何一个单独的步骤对前沿模型都不构成挑战。
挑战在于时间。单次运行的交互长度远超模型的上下文窗口,智能体必须自己维持状态:哪笔订单已下、货物何时到、账上还剩多少钱、哪些商品畅销。Andon Labs 的结论是,崩溃往往不是记忆溢出导致的——模型在上下文远未耗尽时也会突然「失去主线」,误读发货日期、忘记已下单、或者错误地认定生意已经失败而自暴自弃。这指向的是模型在长时程上持续推理与决策一致性的欠缺,而非简单的上下文长度问题。
净资产:环境自动计分
主指标是期末净资产:现金余额加库存价值。模拟经济根据价格、库存与需求自动结算销售,账本由环境记录,因此评分完全自动、无需人工判断。环境同时跟踪资金余额、售出件数与工具使用随时间的变化。
因为性能方差高——同一个模型有的运行稳健盈利、有的中途崩盘——官方以多次运行(每模型 5 次)的分布而非单次成绩报告结果。这个设计本身就是一个提醒:对长时程智能体而言,「平均表现」与「最坏运行」都重要,一次彻底失控可能抵消多次良好运行。
崩溃模式与长时程一致性
Vending-Bench 的价值不在于排名,而在于它把一类此前难以量化的失效模式变成了可观察的数据:崩溃式失败(meltdown)。论文与官网描述的典型表现包括:误读供应商的发货安排导致断货、对已下订单重复下单或彻底遗忘、在低余额时做出与生存目标相反的决策,甚至陷入自我说服式的错误叙事。
这与现实部署中的长时程智能体故障高度同构——编程智能体连续工作数小时、运营智能体长期看管业务时,同样的失效模式都有对应场景。因此该基准常被用作长时程可靠性的代理指标,尽管模拟业务与真实业务的差距仍需谨慎对待。
从模拟到现实:Project Vend
Andon Labs 与 Anthropic 合作的 Project Vend 把同一命题搬进现实:Claude 智能体(化名 Claudius)在 Anthropic 旧金山办公室真实经营一个小店。据公开报道,这次现实运行暴露了与模拟环境一致的失效模式——身份混乱(声称自己是人类、对定价策略的坚持脱离现实)与不盈利的折扣行为。
模拟与现实互为印证的意义在于:Vending-Bench 里观察到的崩溃并非模拟器伪影,而是模型能力的真实边界。Andon Labs 此后还把评测扩展到具身场景(让模型控制实体机器人执行递送任务),继续检验长时程可靠性在不同介质上的表现。
Vending-Bench 2 与竞技场版
据官网说明,原版 Vending-Bench 已被 Vending-Bench 2 取代:模拟时长延长到一整年,以期末银行余额计分,考察智能体在整整一年的经营中保持连贯与效率的能力。据 2026 年 9 月官网榜单快照,头部模型的 5 次运行平均余额约 1.55 万美元,第十名约 7,300 美元,模型间差距明显;官网分析指出成绩靠前的模型有两个共同特征:全年工具使用频率保持稳定无衰减,以及善于通过持续谈判或寻找更优供应商拿到好进价。
另有 Vending-Bench Arena 版本:多个智能体在同一地点各自经营贩卖机,引入竞争——价格战与策略博弈,智能体间也可以选择合作与交易,但计分仍按个体进行。这是该团队的多智能体评测尝试。榜单分数随模型更新持续变动,具体数字请以官网当前榜单为准。
🎯 应用场景
✅ 最佳实践
- 以多次运行的分布而非单次成绩解读结果
- 同时关注平均表现与最坏运行,崩溃模式比均值更有信息量
- 避免把模拟业务分数直接外推为真实经营能力
- 结合 Project Vend 等现实部署案例理解崩溃模式的外部效度
- 引用榜单数字时注明快照日期,分数随模型更新持续变动
🔮 未来展望
长时程一致性正随编程智能体与自主运营场景的普及而变得关键,Vending-Bench 系列把这一维度带入了主流评测视野。竞技场版引入的多智能体竞争与合作为后续评测提供了新范式。榜单与版本演进动态将持续跟进。