Anthropic 上调失准风险评级,并披露未发布模型 Model 2

Anthropic 上调失准风险评级,并披露未发布模型 Model 2

N
News Editor
2026-08-16 07:57:52
Anthropic 在 8 月 14 日发布第二份全公司风险报告,将高风险情境下因失准导致灾难性危害的风险评级从「极低」上调至「低」。公司称,此次调整并非因为模型未通过安全测试,而是近期网络安全评估事件增加了不确定性,且内部能力基准已出现「饱和」。报告还首次披露内部模型 Model 2,其能力略强于 Mythos 5,但尚未完成常规上线前评估,也暂无对外发布计划。

Anthropic 在 8 月 14 日发布第二份全公司风险报告。在其负责任扩展政策 RSP v3.4 框架下,公司将「高风险情境中因失准(misalignment)造成灾难性危害」的风险评级,从「极低」上调至「低」。同一份报告也首次披露了一款尚未发布的内部模型 Model 2。

风险评级上调并非源于安全测试失利

Anthropic 表示,这次上调不是因为某个模型没有通过安全测试。公司称,主因是近期的网络安全评估事件披露增加了整体不确定性,同时其用于判断「是否已经跨过最危险能力门槛」的内部基准已经出现「饱和」,即分数触及上限,无法继续测出能力增量。

按报告的表述,这意味着问题不在于模型出现明确失控事件,而在于现有衡量工具已经难以继续区分更高能力水平,因此公司选择采用更保守的风险评级。

Model 2 首次曝光,能力略强于 Mythos 5

这份报告还披露,Anthropic 内部存在一个名为 Model 2 的系统,其能力比前沿模型 Mythos 5「略强」。报告称,公司内部已大量使用该模型,但它尚未完成平时对外上线前所需的完整评估,目前也没有对外发布计划。

对于一家正冲刺 IPO 的 AI 公司而言,在披露手中拥有一款更强模型的同时,也说明其安全评估尚未完成,并主动上调相关风险评级,这份报告把外界关注点集中到前沿能力与安全评估之间的间隔上。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
80

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。