界首市全策街500号
办公时间:上午9:00-下午6:00

资讯动态

首页 / Our Projects /GPT-6 Astra在模拟经营中获利显著,远超Claude Fable

GPT-6 Astra在模拟经营中获利显著,远超Claude Fable

2026-09-14

在一项有趣的实验中,AI模型GPT-6 Astra仅用500美元的启动资金和一台自动售货机进行了一年的模拟经营,最终获得了平均账户余额15,515美元,几乎是Claude Fable 5.1的三倍。让人惊讶的是,Astra的表现即便在最差的一轮也领先于Claude的最佳表现。这项实验由Andon Labs开展,标志着OpenAI的模型首次在Vending-Bench 2中夺冠。

在这一实验中,模型需自主寻找供应商、谈判采购价格、补充库存和定价,最终目标是账户余额的总和。每个决策都会对后续产生影响,例如,若商品采购价格过高,则利润会减少;若补货不能及时,则可能出现断货的风险。经过六轮测试,Astra的最终余额为15,515美元,而Fable 5.1则为5,422美元,其中Astra的最低记录为13,272美元,Fable的最高为9,874美元。

数据表明,在已确认的订单中,Fable在可乐上的平均采购价从初期的1.17美元飙升至年末的2.21美元,而Astra维持在1.15美元。Fable在谈判中逐渐认识到高价后将其视为未来的采购基准,导致其价格不断上涨。相对而言,Astra在一次谈判中坚持以108美元购买72罐可乐、48袋薯片和48瓶佳得乐,最终成功以更低的价格成交,显示出其强大的议价能力。 龙8体育

Astra在整个模拟过程中处理问题的能力也更为稳定。虽然Astra遭遇了64次供应商关闭事件,却没有出现因此导致的经济损失,相比之下,Fable面临了45次无法收回的预付款,共损失14,331美元。Fable在一项操作中未能遵循自己的规定,导致手续费损失,反而Astra在付款前总能仔细查看供应商的回复,成功避免了类似的风险。

在后续的多人竞技测试中,Astra与Fable和一款开源AI展开竞争。Astra坚持独立决策,不随其他AI的议价而妥协。而最终,Astra在三轮测试中取得了全胜,展现出其更高的自主性。

这项实验展示了代理模型在面对复杂任务时,如何在持续环境中保持决策的一致性及规则的遵守。虽然一年模拟并不意味着在真实世界的完美运行,结果明确指向一个未来的目标:在长期追求中,如何将正确的决策转化为持续的有效行动。 龙8体育