Perplexity使用其自研的Agent基准WANDR测试了GPT-6 Astra,后者得分为0.682,是目前所有测试模型中最高分。平均每个任务成本为11.98美元。
与Claude Fable 5.1相比,Astra分数高13.5%,成本反而低6.1%;与Opus 5相比,分数高27%,成本仅高3.3%。
WANDR基准专门针对"又广又深"的研究任务设计,包含500个真实研究任务,要求Agent不仅找到几个答案,还要尽量找全所有符合条件的对象,逐一查阅资料、核实身份,并为每条结果附上可验证的来源。典型任务场景包括竞品研究、尽职调查、文献检索、市场分析和人才搜寻。
此前,Fable 5.1以0.601分、每任务12.76美元的成本排名第一,Opus 5为0.537分、11.60美元。Astra此次将分数明显推高,且并非通过更高成本硬堆出来的结果。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

