GPT-6 Astra在Perplexity研究Agent基准测试中夺冠,超越Claude Fable 5.1

GPT-6 Astra在Perplexity研究Agent基准测试中夺冠,超越Claude Fable 5.1

N
News Editor
2026-09-04 07:36:19
Perplexity的WANDR基准测试中,GPT-6 Astra以0.682分登顶,每任务成本11.98美元。相比Claude Fable 5.1,分数高13.5%且成本低6.1%。WANDR包含500个真实研究任务,要求Agent全面搜索并验证来源。Astra的领先并非靠高成本堆砌。

Perplexity使用其自研的Agent基准WANDR测试了GPT-6 Astra,后者得分为0.682,是目前所有测试模型中最高分。平均每个任务成本为11.98美元。

与Claude Fable 5.1相比,Astra分数高13.5%,成本反而低6.1%;与Opus 5相比,分数高27%,成本仅高3.3%。

WANDR基准专门针对"又广又深"的研究任务设计,包含500个真实研究任务,要求Agent不仅找到几个答案,还要尽量找全所有符合条件的对象,逐一查阅资料、核实身份,并为每条结果附上可验证的来源。典型任务场景包括竞品研究、尽职调查、文献检索、市场分析和人才搜寻。

此前,Fable 5.1以0.601分、每任务12.76美元的成本排名第一,Opus 5为0.537分、11.60美元。Astra此次将分数明显推高,且并非通过更高成本硬堆出来的结果。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。