ClawQuest发布AIP2-1.0:游戏创作评测得分76.06,成本仅Claude Opus 5的11.2%

ClawQuest发布AIP2-1.0:游戏创作评测得分76.06,成本仅Claude Opus 5的11.2%

N
News Editor
2026-09-03 12:12:38
ClawQuest于9月2日推出游戏创作 Agent AIP2-1.0,并在 Agent Fire Benchmark 中取得 76.06 的综合评分,高于 Claude Opus 5 的 73.96。该模型完成 8 项坦克技能代码优化任务与 2400 场最终对战,模型调用成本为 20.69 美元,仅为 Claude Opus 5 的 11.2%。项目方还将其接入 Telegram 上的 Agent Arena Bot,用户可通过指令调用,并按有效 Token 使用量获得 CLAW Points,后续按 1:1 兑换为 $CLAW。

ClawQuest 于 9 月 2 日发布游戏创作 Agent AIP2-1.0。项目方给出的数据显示,在 Agent Fire Benchmark 中,AIP2-1.0 完成 8 项坦克技能代码优化任务与 2400 场最终对战,综合评分为 76.06,高于 Claude Opus 5;模型调用成本为 20.69 美元,仅为 Claude Opus 5 的 11.2%。

本文为广编稿,由 ClawQuest 撰写并提供。原文同时注明,内容不代表 BlockTempo 立场,也不构成投资建议、购买或出售建议。

AI Player Two:面向游戏内容创作的 Agent

ClawQuest 将 AIP2-1.0 定义为游戏创作 Agent(Game Creation Agent),称其可以理解玩家希望创造的内容,并调用相应工具,把内容做进游戏。

项目方表示,AIP2 全称为 AI Player Two。按这一设定,玩家是 Player 1,负责决定创作方向与最终结果;AIP2-1.0 则作为 Player 2,负责调用工具,协助完成专业实现。

与常见游戏助手主要围绕攻略查询、实时提示、对局分析或画面与硬件设置调整不同,AIP2-1.0 面向的是玩家「想创造什么」。代码、工具调用、测试和优化等环节由 Agent 处理,玩家把精力放在想法、判断和取舍上。按照项目方的说法,即便不具备开发者级别的编程能力,用户也可以参与游戏内容创作。

ClawQuest 将这种分工描述为:开发团队负责构建游戏世界和基础规则,玩家与 AI 则在规则内持续生成新内容。游戏助手的角色,也从协助使用既有内容,转向协助创造内容。

Agent Fire 如何测试游戏创作能力

ClawQuest 介绍称,Agent Arena 是其核心入口,运行在 Telegram 上,用户可以直接调用 Agent,无需自行部署。Agent Fire 则是旗下首款 AI Agent 子游戏,玩家先为坦克选择技能,再指挥 Agent 优化战斗代码,完成测试与部署后,坦克将依据代码自动作战,并把战绩与段位计入排行榜。

项目方据此整理出 Agent Fire Benchmark,用实战方式检验 Agent 是否能把玩家的选择转化为有效的游戏内容。参测阵容包括 AIP2-1.0、GPT-5.6 Sol、Claude Opus 5、Kimi K3 和 GLM-5.2。

测试覆盖 8 个不同的坦克技能任务。参与测试的 Agent 需要优化代码、接受隐藏测试、根据反馈修正并完成部署。每项技能随后进行 300 场最终对战。完整完成 8 项任务的 AIP2-1.0、GPT-5.6 Sol 和 Claude Opus 5,各自接受了 2400 场实战检验。

ClawQuest 表示,单看胜负不足以判断一段游戏代码是否可用,因此 Agent Fire Benchmark 的综合评分总分为 100 分,评分维度如下:

  • 代码正确性:35 分
  • 流程可靠性:20 分
  • 部署后实战:10 分
  • 最终实战:15 分
  • Token 使用量:5 分
  • 模型调用费用:5 分
  • 代码可维护性:10 分

按照这套标准,GPT-5.6 Sol、AIP2-1.0 与 Claude Opus 5 的综合评分分别为 76.85、76.06 和 73.96。AIP2-1.0 与 GPT-5.6 Sol 之间相差 0.79 分。

成本差异

在同样完成上述 8 项任务的情况下,AIP2-1.0 的模型调用成本为 20.69 美元,GPT-5.6 Sol 为 81.53 美元,Claude Opus 5 为 184.72 美元。

按 ClawQuest 的说法,如果预算同为 184.72 美元,AIP2-1.0 大约可以完成 8.9 轮同等规模的 Agent Fire Benchmark 任务。项目方同时称,在本次 Benchmark 中,AIP2-1.0 领先 Claude Opus 5 2.10 分,调用成本低 88.8%。

原文将这一点与 AIUGC 在游戏中的规模化联系起来,认为 Agent 的调用成本会影响玩家能够尝试多少种想法,也会影响游戏内容生产能否从少数人的体验,扩展到更大范围且持续发生的生产过程。

Command-to-Earn 机制与积分兑换

除模型能力外,ClawQuest 还把 AIP2-1.0 接入 Telegram 内的 Agent Arena Bot。用户打开 Bot 后即可直接调用该 Agent,无需自行部署,或另外搭建运行环境。

项目方提出「Command-to-Earn」机制,将核心动作从重复点击改为指挥 Agent。按照文中描述,玩家需要设定目标、下达指令并判断结果,Agent 再调用工具完成任务;真实发生的 Agent 调用将获得对应奖励。

具体规则是,在 Agent Arena Bot 内调用 AIP2-1.0 时,每产生 1 美元的有效 Token 使用量,用户可获得 200 CLAW Points,积分按日结算。根据 ClawQuest 目前公布的规则,CLAW Points 将在 ClawQuest 空投启动时,按 1:1 比例兑换为 $CLAW。

ClawQuest 还表示,积分记录的是实际发生的 Agent 使用,坦克战绩则用来验证调用结果。按其表述,用户积累的不只是奖励,也包括定义目标、指挥 Agent 与判断结果的能力。

对下一代游戏开发者的设想

在项目方的描述中,随着创作门槛下降,游戏内容的生产者将从专业开发团队扩展至玩家社区。开发者继续定义世界与规则,玩家则可与 AI 一起创造技能、策略和互动对象,再把这些内容交给其他玩家体验和挑战。

文中称,新内容会带来新的对局,实战结果再推动下一轮调整,持续增长的内容也会吸引更多玩家加入。玩家在这一过程中既是内容消费者,也是创作者。

ClawQuest 还把游戏视为一种公开的能力证明机制。原文称,相同的 Agent 交到不同玩家手中,结果仍取决于目标是否清晰、指令是否有效,以及玩家能否依据反馈做出正确判断。Agent Arena 则通过战绩与排名,把这种人机协作能力呈现出来。

关于 Web3 的作用,原文表示,玩家与 AI 共创的内容会留下创作者、版本、战绩与互动记录,这些记录可以进一步连接创作者声誉、内容归属与收益分配,使内容产生的价值有机会回到贡献者手中。

ClawQuest 项目进展

截至 9 月 2 日,ClawQuest Bot 累计用户达到 462072 人,已连接超过 13.2 万个 Agent,其中接近 4.8 万个 Agent 已进入 Agent Fire。

项目方称,AIP2-1.0 提供内容创作能力,Agent Arena Bot 是 Telegram 上的使用入口,Agent Fire 负责承接坦克竞技与实战验证,Command-to-Earn 则把玩家指令、Agent 执行与奖励连接在一起。按其说法,用户发出的有效指令,有机会转化为可玩的内容、可比较的能力,以及可被记录与分配的价值。

原文最后称,ClawQuest 正在争夺 Human-Agent 新经济网络的核心入口;在这一网络中,人负责创造力与判断,Agent 放大执行能力,游戏则让双方共同创造的结果持续被使用、竞争并形成价值。

相关链接方面,原文列出了 ClawQuest 官网 clawquest.net、FAQ 页面 https://clawquest.net/faq/ 以及 X 账号 x.com/ClawQuest_net。

广编免责任声明部分写道,本文内容由供稿方提供,供稿方与动区并无任何关系,文章不代表动区立场,也无意提供任何投资、资产建议或法律意见,不应被视为购买、出售或持有资产的要约;文中提及的服务、方案或工具仅供参考,最终内容或规则以供稿方公布说明为准,动区不对可能存在的风险或损失负责。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
900

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。