Anthropic 在 8 月 14 日发布第二份全公司风险报告。在其负责任扩展政策 RSP v3.4 框架下,公司将「高风险情境中因失准(misalignment)造成灾难性危害」的风险评级,从「极低」上调至「低」。同一份报告也首次披露了一款尚未发布的内部模型 Model 2。
风险评级上调并非源于安全测试失利
Anthropic 表示,这次上调不是因为某个模型没有通过安全测试。公司称,主因是近期的网络安全评估事件披露增加了整体不确定性,同时其用于判断「是否已经跨过最危险能力门槛」的内部基准已经出现「饱和」,即分数触及上限,无法继续测出能力增量。
按报告的表述,这意味着问题不在于模型出现明确失控事件,而在于现有衡量工具已经难以继续区分更高能力水平,因此公司选择采用更保守的风险评级。
Model 2 首次曝光,能力略强于 Mythos 5
这份报告还披露,Anthropic 内部存在一个名为 Model 2 的系统,其能力比前沿模型 Mythos 5「略强」。报告称,公司内部已大量使用该模型,但它尚未完成平时对外上线前所需的完整评估,目前也没有对外发布计划。
对于一家正冲刺 IPO 的 AI 公司而言,在披露手中拥有一款更强模型的同时,也说明其安全评估尚未完成,并主动上调相关风险评级,这份报告把外界关注点集中到前沿能力与安全评估之间的间隔上。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

