Anthropic于近日正式发布了其最新的旗舰模型——Claude Opus 4.7,号称该公司迄今为止最强大的Opus版本。在官方公告中,Anthropic称用户现在可以放心地将最困难的编码工作交给Opus 4.7处理,而此前这些任务需要密切的人工监督。
背景:用户对4.6版本的不满与修复
此次发布正值用户对Opus 4.6版本频繁抱怨之际。不少开发者指出,他们感觉付费模型质量在悄悄下降,甚至将这种现象戏称为“AI缩水”。Anthropic否认对模型权重进行过任何调整,但承认正在准备4.7版本。有趣的是,公司内部还拥有一个更强大的Claude Mythos模型,但出于安全考虑暂不公开。
基准测试:编程与推理能力大幅跃升
基准测试数据支撑了Anthropic的宣称。在衡量编程能力的SWE-bench Multilingual测试中,Opus 4.7得分为80.5%,明显优于4.6版本的77.8%。在评估金融与法律领域知识工作的GDPVal-AA测试中,Opus 4.7以1753 Elo的分数领先GPT-5.4的1674 Elo。
在OfficeQA Pro文档推理测试中,差距更为显著:4.7版本达到80.6%,而4.6版本仅为57.1%,GPT-5.4和Gemini 3.1 Pro分别只有51.1%和42.9%。在衡量长期任务连贯性的Vending-Bench 2测试中,4.7版本的资金余额达到10,937美元,而4.6版本为8,018美元,表明模型在长期自主运行中能保持更有效的表现。
安全限制与Cybersecurity领域
在网络安全领域,Anthropic有意隐藏了部分能力。Opus 4.7内置自动安全措施,能够检测并屏蔽被禁止或高风险的网络安全请求。公司确认在训练过程中“尝试减少”模型在网络安全方面的能力。安全专业人士可申请加入新的网络安全验证计划以获取这些功能。这标志着Anthropic在为未来Mythos级别模型的大规模安全保障做准备。
实际测试:效果惊艳但token消耗惊人
我们使用与评估其他模型相同的游戏构建提示进行了测试。Opus 4.7生成了有史以来最优秀的结果:最精美的画面、最合理的难度曲线、最佳机制以及富有创意的胜利与失败画面。它似乎能程序化生成关卡,且每个关卡都感觉平衡合理。
不过,该测试并非零样本:它需要一轮故障修复。相比之下,Opus 4.6可能无需修复即通过,而小米MiMo v2 Pro模型虽然结果上略逊一筹,却能在无需多次迭代的情况下给出可用结果,且成本远低于Anthropic。对于加密领域的实际项目而言,成本可能是重要考量因素。
最引人注目的是token消耗。这是在我们测试中,首次出现单次会话耗尽全部token配额的情况。模型在完成初稿后,竟然重新编写了整份游戏代码,并标注为“Rewrite with bug fixes and improvements”。这意味着对于认真进行编码的开发者来说,要么升级计划、在API上支付更多费用,要么长时间等待配额重置,或者干脆选择性价比更高的竞品。
市场影响与分析
对于加密货币领域的开发者,Opus 4.7的强大编程能力意味着在智能合约审计、DeFi协议开发、区块链底层代码优化等场景下有巨大潜力。然而,其高昂的token消耗与成本可能让团队望而却步,尤其是需要长期自主代理任务时。相比之下,性价比更高的模型(如小米的MiMo v2 Pro)或正在崛起的去中心化AI推理网络可能成为更优选择。此外,Opus 4.7在网络安全方面的自我限制,意味着其处理高风险的智能合约安全问题时可能不够透明,开发者需依赖外部验证。
总体而言,Claude Opus 4.7在性能上迈出了一大步,但其“吞token”特性与安全策略将使加密开发者在实际采用前需进行谨慎的成本与风险评估。

