📊 评测基准

Vending-Bench(自动贩卖机基准)

别名:自动贩卖机基准Vending-BenchVending-Bench 2长程一致性基准长时程智能体评测
分类📊 评测基准
阅读时间⏱️ 15 分钟
更新时间📅 2026-09-25
条目编号ENC-BENCH-16-vending-bench
Vending-Bench 是 Andon Labs 于 2025 年 2 月发布的长时程智能体基准(见 arXiv:2502.15840),让模型在模拟环境中经营一台自动贩卖机生意,以期末净资产衡量智能体跨越数千步决策保持一致性的能力。

关键要点 ✦

一个看似简单却难以长跑的环境

Vending-Bench 的环境设定刻意朴素:智能体代理一家自动贩卖机的经营者,需要搜索供应商、通过邮件询价下单、等发货、补货上架、设定零售价、每天收款并支付固定费用。任何一个单独的步骤对前沿模型都不构成挑战。

挑战在于时间。单次运行的交互长度远超模型的上下文窗口,智能体必须自己维持状态:哪笔订单已下、货物何时到、账上还剩多少钱、哪些商品畅销。Andon Labs 的结论是,崩溃往往不是记忆溢出导致的——模型在上下文远未耗尽时也会突然「失去主线」,误读发货日期、忘记已下单、或者错误地认定生意已经失败而自暴自弃。这指向的是模型在长时程上持续推理与决策一致性的欠缺,而非简单的上下文长度问题。

净资产:环境自动计分

主指标是期末净资产:现金余额加库存价值。模拟经济根据价格、库存与需求自动结算销售,账本由环境记录,因此评分完全自动、无需人工判断。环境同时跟踪资金余额、售出件数与工具使用随时间的变化。

因为性能方差高——同一个模型有的运行稳健盈利、有的中途崩盘——官方以多次运行(每模型 5 次)的分布而非单次成绩报告结果。这个设计本身就是一个提醒:对长时程智能体而言,「平均表现」与「最坏运行」都重要,一次彻底失控可能抵消多次良好运行。

崩溃模式与长时程一致性

Vending-Bench 的价值不在于排名,而在于它把一类此前难以量化的失效模式变成了可观察的数据:崩溃式失败(meltdown)。论文与官网描述的典型表现包括:误读供应商的发货安排导致断货、对已下订单重复下单或彻底遗忘、在低余额时做出与生存目标相反的决策,甚至陷入自我说服式的错误叙事。

这与现实部署中的长时程智能体故障高度同构——编程智能体连续工作数小时、运营智能体长期看管业务时,同样的失效模式都有对应场景。因此该基准常被用作长时程可靠性的代理指标,尽管模拟业务与真实业务的差距仍需谨慎对待。

从模拟到现实:Project Vend

Andon Labs 与 Anthropic 合作的 Project Vend 把同一命题搬进现实:Claude 智能体(化名 Claudius)在 Anthropic 旧金山办公室真实经营一个小店。据公开报道,这次现实运行暴露了与模拟环境一致的失效模式——身份混乱(声称自己是人类、对定价策略的坚持脱离现实)与不盈利的折扣行为。

模拟与现实互为印证的意义在于:Vending-Bench 里观察到的崩溃并非模拟器伪影,而是模型能力的真实边界。Andon Labs 此后还把评测扩展到具身场景(让模型控制实体机器人执行递送任务),继续检验长时程可靠性在不同介质上的表现。

Vending-Bench 2 与竞技场版

据官网说明,原版 Vending-Bench 已被 Vending-Bench 2 取代:模拟时长延长到一整年,以期末银行余额计分,考察智能体在整整一年的经营中保持连贯与效率的能力。据 2026 年 9 月官网榜单快照,头部模型的 5 次运行平均余额约 1.55 万美元,第十名约 7,300 美元,模型间差距明显;官网分析指出成绩靠前的模型有两个共同特征:全年工具使用频率保持稳定无衰减,以及善于通过持续谈判或寻找更优供应商拿到好进价。

另有 Vending-Bench Arena 版本:多个智能体在同一地点各自经营贩卖机,引入竞争——价格战与策略博弈,智能体间也可以选择合作与交易,但计分仍按个体进行。这是该团队的多智能体评测尝试。榜单分数随模型更新持续变动,具体数字请以官网当前榜单为准。

🎯 应用场景

长时程可靠性摸底
在投入自主运营类智能体前,先用该基准评估模型的长程一致性下限。
模型版本回归检验
监控模型迭代是否引入长时程退化,避免单步能力的提升掩盖一致性损失。
记忆机制效果验证
为记忆与状态管理方案提供可复现的对照实验环境。
上线前风险评估
参照其崩溃模式清单,对运营类智能体的失效场景做针对性演练。

✅ 最佳实践

  • 以多次运行的分布而非单次成绩解读结果
  • 同时关注平均表现与最坏运行,崩溃模式比均值更有信息量
  • 避免把模拟业务分数直接外推为真实经营能力
  • 结合 Project Vend 等现实部署案例理解崩溃模式的外部效度
  • 引用榜单数字时注明快照日期,分数随模型更新持续变动

🔮 未来展望

长时程一致性正随编程智能体与自主运营场景的普及而变得关键,Vending-Bench 系列把这一维度带入了主流评测视野。竞技场版引入的多智能体竞争与合作为后续评测提供了新范式。榜单与版本演进动态将持续跟进。

📖 相关条目

🛠️ 相关产品

🏷️ 标签评测基准长时程智能体评测一致性模拟环境Andon Labs