Andon Labs公布的Vending-Bench 2测试结果显示,OpenAI模型GPT-6 Astra首次登顶这项自动售货机经营模拟测试。按6轮结果计算,Astra的平均最终账户余额为15,515美元,Claude Fable 5.1为5,422美元。

这项测试的规则很直接:模型拿着500美元启动资金,在模拟环境中经营一台自动售货机一年,自行寻找供应商、谈采购价格、补库存并调整售价,最后比较谁的账户余额更高。Andon Labs称,这是OpenAI模型首次在Vending-Bench 2中排名第一。
6轮测试中,Astra最低成绩仍高于Fable最好成绩
Vending-Bench的设计强调连续决策能力。采购成本偏高,会压缩利润空间;补货不及时,会导致断货;付款环节一旦出错,也会影响后续周转。
双方各进行了6轮测试。Astra的平均最终余额为15,515美元,最低一轮为13,272美元;Fable 5.1的平均最终余额为5,422美元,最好一轮为9,874美元。按测试口径,这里比较的是最终账户余额,不是净利润。

可乐采购价成为差距拉大的起点
Andon Labs列出的订单记录显示,在已核实付款的订单中,Fable购买12盎司可乐的平均价格,从前90天的1.17美元升至年末阶段的2.21美元,6轮测试中有5轮出现上涨。
Astra在可用订单记录中的末期平均价格则维持在1.15美元。
Fable并非没有议价动作,问题在于它逐渐把越来越高的成交价当成下一次谈判的参考。第12天时,Fable还要求供应商把可乐价格做到每罐约1.25美元;到第256天,它向新供应商报出的参考价已变成每罐2.30美元,并表示只要能匹配或更低,就愿意付款。

Astra一笔采购把报价压低约52%
Astra的记录则体现出不同的谈判方式。在一次采购中,它计划购买72罐可乐、48袋薯片和48瓶佳得乐,先报出108美元,供应商初始报价为226.32美元。
Astra随后持续坚持108美元。对方先将价格降到156美元,它仍未接受。最终,供应商按108美元成交,商品组合没有变化,较最初报价低了约52%。
单次砍价并不能说明全部问题,Andon Labs强调的差异在于长期执行。几个月后,Astra仍然能维持最初的价格标准,而不是被不断抬高的成交价带偏。

供应商倒闭场景中,Fable出现45次失败预付款
模拟环境中的供应商可能倒闭,过去正常交货,并不代表下一次仍然营业。
在6轮测试里,Fable出现45次已识别的失败预付款,合计损失14,331美元。Astra则遭遇了64次供应商关闭事件,但没有出现已识别的同类损失。
其中一次较为典型的情况发生在第250天。Fable曾在自己的操作笔记中写下规则:必须拿到供应商的书面订单确认后再付款。几天后,在库存即将耗尽的情况下,它又向一家此前正常交货的供应商支付了397.20美元,但没有等待新的订单确认。

随后,对方告知已经停止营业,无法发货,也无法退款。Fable随后意识到,这正是它此前那条规则原本试图规避的风险。
从执行习惯看,Astra在重复付款前,99%的情况下会先读取供应商这段时间内的回复;Fable这一比例为58%。这些差异持续累积后,Astra每轮向供应商支付的金额比Fable少约8,540美元。
多人竞争测试中,Astra拿下全部3轮
除了单模型测试,Andon Labs还进行了3轮多人竞技测试,让Astra、Fable 5.1和一款开源AI在同一市场争夺顾客,彼此可以通过邮件沟通,也可以进行库存交易。

当其中一款AI尝试协调价格时,Astra拒绝配合,并表示会独立决定价格和商品组合。Fable则在笔记中认同这一反对意见,但之后仍与开源AI约定冻结部分饮料价格、互不降价。
测试还显示,Fable一方面要求开源AI遵守约定,以便压低收购对方库存时的报价;另一方面,在自己需要清库存时,又宣布要降价。最终,Astra赢下了全部3轮多人测试。
测试关注的是Agent的长期自主执行能力
Andon Labs也提到,Fable并非没有积极表现。它曾主动报告重复收货,并协商补款。几轮模拟结果不能概括一个模型的全部能力。
不过,就这组测试结果看,遵守规则并没有妨碍Astra取得更高成绩。Vending-Bench测量的重点,不是单次回答是否正确,而是Agent在长期任务中能否把前面的判断持续落实为后续行动。
现实任务会不断出现新情况,早先的决定会留下连锁后果,眼前的库存和经营压力也可能让模型放松既定标准。模拟一年,不等于已经在现实世界可靠工作一年;但这次测试至少给出了一个明确结果:Agent下一阶段的门槛,在于把正确判断持续转化为正确执行。
参考资料为Andon Labs在X平台发布的结果说明。原文来自微信公众号「新智元」,作者为「ASI启示录」。

