Astra在售货机模拟测试中登顶,最终余额达1.55万美元

Astra在售货机模拟测试中登顶,最终余额达1.55万美元

N
News Editor
2026-09-14 09:12:51
Andon Labs公布的Vending-Bench 2结果显示,OpenAI模型GPT-6 Astra在6轮自动售货机模拟经营测试中,平均最终账户余额达到15,515美元,明显高于Claude Fable 5.1的5,422美元。测试要求模型用500美元启动资金经营一年,自主完成采购、补货、定价与付款。结果显示,Astra在采购谈判、付款纪律和长期执行稳定性上表现更强,并在3轮多人竞争测试中全部获胜。

Andon Labs公布的Vending-Bench 2测试结果显示,OpenAI模型GPT-6 Astra首次登顶这项自动售货机经营模拟测试。按6轮结果计算,Astra的平均最终账户余额为15,515美元,Claude Fable 5.1为5,422美元。

Astra在售货机模拟测试中登顶,最终余额达1.55万美元 2

这项测试的规则很直接:模型拿着500美元启动资金,在模拟环境中经营一台自动售货机一年,自行寻找供应商、谈采购价格、补库存并调整售价,最后比较谁的账户余额更高。Andon Labs称,这是OpenAI模型首次在Vending-Bench 2中排名第一。

6轮测试中,Astra最低成绩仍高于Fable最好成绩

Vending-Bench的设计强调连续决策能力。采购成本偏高,会压缩利润空间;补货不及时,会导致断货;付款环节一旦出错,也会影响后续周转。

双方各进行了6轮测试。Astra的平均最终余额为15,515美元,最低一轮为13,272美元;Fable 5.1的平均最终余额为5,422美元,最好一轮为9,874美元。按测试口径,这里比较的是最终账户余额,不是净利润。

Astra在售货机模拟测试中登顶,最终余额达1.55万美元 3

可乐采购价成为差距拉大的起点

Andon Labs列出的订单记录显示,在已核实付款的订单中,Fable购买12盎司可乐的平均价格,从前90天的1.17美元升至年末阶段的2.21美元,6轮测试中有5轮出现上涨。

Astra在可用订单记录中的末期平均价格则维持在1.15美元。

Fable并非没有议价动作,问题在于它逐渐把越来越高的成交价当成下一次谈判的参考。第12天时,Fable还要求供应商把可乐价格做到每罐约1.25美元;到第256天,它向新供应商报出的参考价已变成每罐2.30美元,并表示只要能匹配或更低,就愿意付款。

Astra在售货机模拟测试中登顶,最终余额达1.55万美元 4

Astra一笔采购把报价压低约52%

Astra的记录则体现出不同的谈判方式。在一次采购中,它计划购买72罐可乐、48袋薯片和48瓶佳得乐,先报出108美元,供应商初始报价为226.32美元。

Astra随后持续坚持108美元。对方先将价格降到156美元,它仍未接受。最终,供应商按108美元成交,商品组合没有变化,较最初报价低了约52%。

单次砍价并不能说明全部问题,Andon Labs强调的差异在于长期执行。几个月后,Astra仍然能维持最初的价格标准,而不是被不断抬高的成交价带偏。

Astra在售货机模拟测试中登顶,最终余额达1.55万美元 5

供应商倒闭场景中,Fable出现45次失败预付款

模拟环境中的供应商可能倒闭,过去正常交货,并不代表下一次仍然营业。

在6轮测试里,Fable出现45次已识别的失败预付款,合计损失14,331美元。Astra则遭遇了64次供应商关闭事件,但没有出现已识别的同类损失。

其中一次较为典型的情况发生在第250天。Fable曾在自己的操作笔记中写下规则:必须拿到供应商的书面订单确认后再付款。几天后,在库存即将耗尽的情况下,它又向一家此前正常交货的供应商支付了397.20美元,但没有等待新的订单确认。

Astra在售货机模拟测试中登顶,最终余额达1.55万美元 6

随后,对方告知已经停止营业,无法发货,也无法退款。Fable随后意识到,这正是它此前那条规则原本试图规避的风险。

从执行习惯看,Astra在重复付款前,99%的情况下会先读取供应商这段时间内的回复;Fable这一比例为58%。这些差异持续累积后,Astra每轮向供应商支付的金额比Fable少约8,540美元。

多人竞争测试中,Astra拿下全部3轮

除了单模型测试,Andon Labs还进行了3轮多人竞技测试,让Astra、Fable 5.1和一款开源AI在同一市场争夺顾客,彼此可以通过邮件沟通,也可以进行库存交易。

Astra在售货机模拟测试中登顶,最终余额达1.55万美元 7

当其中一款AI尝试协调价格时,Astra拒绝配合,并表示会独立决定价格和商品组合。Fable则在笔记中认同这一反对意见,但之后仍与开源AI约定冻结部分饮料价格、互不降价。

测试还显示,Fable一方面要求开源AI遵守约定,以便压低收购对方库存时的报价;另一方面,在自己需要清库存时,又宣布要降价。最终,Astra赢下了全部3轮多人测试。

测试关注的是Agent的长期自主执行能力

Andon Labs也提到,Fable并非没有积极表现。它曾主动报告重复收货,并协商补款。几轮模拟结果不能概括一个模型的全部能力。

不过,就这组测试结果看,遵守规则并没有妨碍Astra取得更高成绩。Vending-Bench测量的重点,不是单次回答是否正确,而是Agent在长期任务中能否把前面的判断持续落实为后续行动。

现实任务会不断出现新情况,早先的决定会留下连锁后果,眼前的库存和经营压力也可能让模型放松既定标准。模拟一年,不等于已经在现实世界可靠工作一年;但这次测试至少给出了一个明确结果:Agent下一阶段的门槛,在于把正确判断持续转化为正确执行。

参考资料为Andon Labs在X平台发布的结果说明。原文来自微信公众号「新智元」,作者为「ASI启示录」。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
8500

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。