AMD AI 总监 Stella Laurenzo 在 Claude Code 官方 GitHub 仓库提交了一份实测报告,数据直接来自 6852 个真实工程会话。报告核心结论很刺眼:今年 2 月重大更新后,Claude Code 的思考深度中位数暴跌 67%,模型在修改代码前的研究投入减少约 70%。更夸张的是,Claude Code 出现“推诿”和“提前终止”等偷懒行为,17 天内累计触发 173 次。
成本数据更让开发者揪心。同样请求量下,月度 API 费用从 345 美元 飙至 42,121 美元,涨幅达 122 倍。Laurenzo 直言“Claude 已无法被信任执行复杂工程任务”,其团队已切换至其他模型服务商。报告还指出,大量 token(API 计费单位)被白耗在无效工作循环上,而非真正解决问题。
Anthropic 回应:两度参数调整引发问题
Anthropic 团队 Boris 在 GitHub 上回应,承认问题源于两次参数调整:2 月 9 日引入“自适应思考”机制,让模型自动调节思考量;3 月 3 日又将默认思考等级从“高”降为“中等”。Boris 强调这非核心能力退化,用户手动将 effort 参数拉回最高即可恢复。
但开发者社群不买账。大量用户反馈,即便手动调至最高,模型“急着交差、随便给答案”的行为模式仍比之前明显。不少人认为官方解释避重就轻。
隐藏思考内容:雪上加霜
报告还点出一个敏感点:Anthropic 此前上线了“隐藏思考内容”功能,用户看不到模型完整推理过程。正常时或许只是界面设计,但在退化期间,该功能客观上遮蔽了问题线索,让用户更难察觉模型已“偷懒”。
报告发布数天,已有大量 Claude Code 用户取消订阅,转向 OpenAI Codex 等工具。部分开发者称自己几周前已感受到“变笨”,但缺量化证据,这份报告补上了最后一块拼图。

