Anthropic回应Claude Code降智争议:实验映射惹风波

Anthropic回应Claude Code降智争议:实验映射惹风波

N
News Editor
2026-08-24 01:14:10
Anthropic 旗下 Claude Code 因一次未写入更新日志的实验陷入争议。开发者 argofowl 发现,2.1.237 版本中「high」推理程度在真实请求日志里显示为 10,而 10 过去对应的是「low」档。工程师 Thariq Shihipar 回应称,这是一项针对 Claude Code 2.1.236 及以上版本 Fable 5 会话的 effort 数值映射实验,老版本和 Opus 5 不受影响,团队评测认为不会影响性能。与此同时,Opus 5 也被部分用户质疑出现明显退化,Anthropic 工程师承认该模型当前表现不稳定。

Anthropic 旗下 Claude Code 因一次后台实验设置引发开发者不满。开发者 argofowl 披露,他在排查 Claude Code 表现异常时发现,明明在后台选择了「high」推理程度,但 API 真实请求日志里却出现了数字「10」,相关变化并未写入 Claude Code 更新日志。

据 argofowl 说明,他为此花了一个下午排查问题,期间一度怀疑是 t3 code 崩溃、自己的代码出现 bug,甚至怀疑 Mac 设备本身出了问题。直到打开 API 的真实请求日志,他才看到这个数字,并将问题指向 Claude Code 的推理设置。

「high」被读成 10,引出后台实验

argofowl 发现,从 Claude Code 2.1.237 开始,模型会把「high」推理程度读成 10 out of 100,而这个数值过去对应的是「low」档。

Anthropic回应Claude Code降智争议:实验映射惹风波 3

随后,有人进一步梳理发现,Anthropic 将 Claude Code 2.1.236 及以上版本中的 Fable 5 会话纳入了一项「压缩 effort 数值刻度」实验。按照原文说法,老版本以及 Opus 5 不受这项实验影响。

由于这项调整大概率属于 A/B 测试,并非所有用户都会遇到同样情况,争议很快集中到透明度问题:开发者被拉入实验组,但没有提前获知,也没有在更新日志中看到说明。

科技博主 Chubby 转发相关内容后,这一问题在 AI 社区迅速扩散。X 平台上出现大量围绕「Claude 是否变笨」的自测帖,有用户贴出同一段 prompt 在不同版本下的输出对比,也有人翻出自己两周前的会话记录逐行比对。

Anthropic回应Claude Code降智争议:实验映射惹风波 4

工程师回应:数字单独看没有意义

面对外界质疑,Claude Code 工程师 Thariq Shihipar 很快作出回应。他表示,团队有时会先在 Claude Code 中测试 API 的服务配置,再决定是否全量推送。

Thariq Shihipar 解释称,这次运行中的实验只是修改了 effort 的数值映射方式,所以部分用户会看到 Claude 说自己是「10」。他还表示,这个刻度并不是 0 到 100,因此该数字单独看「没有任何意义」,用户选择的 effort 级别,实际获得的仍是对应的 effort。

他强调,团队已经做过深入评测,结论是这项调整不会影响模型性能。

Anthropic回应Claude Code降智争议:实验映射惹风波 5

另一场争议指向 Opus 5 表现波动

就在 Fable 5 的设置问题引发争议后,Chubby 又把矛头转向 Opus 5,称该模型当前「像是一次显著的降级」。按照原文描述,用户对 Opus 5 的不满主要集中在敷衍、低级错误频发,以及在被指出没有按指令执行后,反复机械回复「你说得对,是我疏忽了」。

原文还提到,几天前已经有人注意到 Opus 5 存在明显「降智」现象。除前述问题外,它还会制造 bug、花费大量时间修 bug,并在同一任务中反复自我纠正。

在网友持续追问后,Thariq Shihipar 公开承认,Opus 5 是一个「表现很不稳定」的模型,状态会忽高忽低。按照他的说法,团队正在努力解决这一问题,而且这是当前的最高优先级。

Anthropic回应Claude Code降智争议:实验映射惹风波 6

跑分与用户体感出现脱钩

这场围绕 Opus 5 的争议,也把一个长期存在的问题再次摆到台前:模型跑分与用户体感正在脱钩。

原文列出的成绩单显示,Opus 5 的综合得分为 82.72,SWE-bench Pro 为 79.2%,Terminal-Bench 为 86.7%。但与这些成绩同时出现的,是用户截然不同的主观感受,包括「啰嗦」「偷懒」「爱抬杠」等评价。

也就是说,同一模型一边拿出亮眼测试结果,一边又在真实使用中遭遇大量负面反馈。

Anthropic回应Claude Code降智争议:实验映射惹风波 7

版本更新透明度再成焦点

原文认为,「模型变笨」并非 Anthropic 一家独有的问题。随着大模型服务持续迭代,版本更新正在变成整个 AI 行业中不够透明的黑箱。

与传统软件相比,后者通常有语义化版本号、更新日志和回滚机制,开发者能够知道自己正在使用哪个版本,以及具体发生了哪些变化。大模型则不同。在同一个模型名称之下,服务端可能随时进行 A/B 测试、更换量化方案、调整模型路由,甚至改变推理资源。

在这种情况下,用户往往只能依赖自己的实际体感来判断模型是否发生变化,而这种判断又最容易被质疑,也最难被证伪。

Anthropic回应Claude Code降智争议:实验映射惹风波 8

这场风波把一个长期存在的问题公开化了:当模型逐渐变成基础设施,稳定性本身就构成了信任的一部分。原文指出,跑分可以用于营销,稳定性则只能靠持续兑现。

参考信息与来源

文中提到的公开讨论包括 Thariq Shihipar 在 X 平台上的回应,以及 kimmonismus 相关帖文。

  • https://x.com/trq212/status/2091252347913773169?s=20
  • https://x.com/kimmonismus/status/2091178321669198014
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
110

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。