Claude 4正式发布:创意与编码的闪光点与“老问题”
旧金山AI公司Anthropic近日发布了第四代Claude模型系列——Claude Sonnet 4与Claude Opus 4。在Google Gemini突破百万token上下文、OpenAI构建多模态系统(看、听、说)的背景下,Anthropic仍坚持200K token上限与纯文本路线,成为主流AI厂商中的“异类”。
发布时机颇具针对性:Google本周发布了Gemini更新,OpenAI也推出了基于专有Codex模型的编程智能体。Claude 4的回应是“混合模型”——根据任务在推理与非推理模式间自动切换,堪称OpenAI预期GPT-5才会具备的能力。但对API用户而言,升级伴随高昂定价:Premium服务大幅涨价,而面向开发者的月费高达200美元(20倍使用上限)。
创意写作:Sonnet 4意外胜出,但进步幅度有限
在创意写作测试中,Claude 4系列展现出独特的叙事天赋。测试要求编写一段关于时间旅行与因果悖论的短篇故事。Claude Sonnet 4交出9/10的高分,其散文生动、心理刻画细腻,结局虽不完全符合指令但自有说服力。相比之下,Claude Opus 4得分8/10,前半部分沉浸感强,但中段开始仓促推进情节转折,导致整体可预测性增加。
值得注意的是,Anthropic似乎并未将创意写作作为本次升级的重点——与Claude 3.5 Sonnet相比提升幅度仅属“边际进步”。这意味着专业作家对Claude的依赖可能不会显著转向新版本。
编码:击败Gemini,但代码可维护性存争议
在编码测试中,Claude Opus 4与公认的“AI编程之王”Google Gemini 2.5 Pro正面较量。测试要求生成一个机器人躲避记者、最终与电脑融合实现AGI的2D游戏。Claude Opus通过零样本+一次迭代生成了具有动态声波、AI侦探状态、视线锥遮挡等复杂机制的游戏,功能完整且可直接游玩,得分8/10。
相比之下,Gemini虽然生成了更干净的ES6类结构和命名常量,但经过两次迭代后仍无法正常运行。然而,开发者可能更青睐Gemini的代码可维护性——Claude赢得了功能体验,但Gemini赢得了代码质量。对于注重长期协作的加密项目开发团队,这一差异可能影响工具选型。
数学推理:o3完胜,但Claude胜在透明性
在FrontierMath基准难题(构造一个特定19次多项式)上,OpenAI o3模型实现了100%准确率,是首个完美解答该问题的模型。Claude Opus 4则展示了完整的思维链(Chain of Thought),但未能得出正确结果。这符合OpenAI一贯的“黑箱推理”策略——用户只能看到最终答案。Claude虽然失败,但其透明过程对教育研究更有价值。
非数学推理:通信策略设计的“战略家”
测试要求模型为一家遭遇勒索软件攻击的医院制定面向五类利益相关者的沟通策略。Claude设计出“患者安全第一-主动应对-更强大的未来”三支柱框架,并给出具体预算(230万美元紧急资金)和针对不同文化群体的调整方案。ChatGPT(GPT-4.1)虽框架合理,但缺乏具体资源分配和交付物细节。Claude在此类需要深刻理解人类动态与利益平衡的场景中表现出色,对加密项目危机公关具有参考价值。
上下文检索:200K限制成为硬伤
在经典的“大海捞针”测试中,Claude 4在85K token范围内表现稳定,无论目标信息位于文档前端、中部还是尾部,都能精准定位并提供引用。但当测试规模扩大至200K token时,模型直接失效——因为上下文窗口已达上限。相比之下,Google Gemini支持超过100万token,OpenAI的上下文能力也远超Claude。对于需要分析长篇智能合约、法律文档或历史链上数据的加密从业者来说,这一限制可能导致频繁截断或人工分段,大幅降低效率。
结论:AI竞争格局下的机遇与抉择
Claude 4无疑是Anthropic迄今为止最强的模型,但它的定位变得更为垂直:创意写作、编码、战略沟通方面堪称“隐形冠军”;而在多模态、长上下文和易用性上明显落后于对手。对于加密行业开发者而言,如果需要编写复杂智能合约或生成游戏化DeFi界面,Claude 4的编码能力值得尝试;但如果项目涉及大量长文档分析(如白皮书审计、合规审查),Gemini或ChatGPT可能更务实。此外,高昂的API定价可能小型加密团队望而却步。
Anthropic在产品优先级上做出了明确选择——专注开发者体验与深度推理,而非广泛覆盖。这场AI竞赛远未结束,但Claude 4证明:即便带着老旧的限制,天才依然能在特定领域发光。

