Anthropic选定埃森哲担任首个嵌入式评估方
Anthropic宣布选择埃森哲作为首个嵌入式评估方,以推进其对AI开发降速方案中的第一步承诺。双方合作为非独家安排,Anthropic表示未来几周还将公布其他评估机构。根据公告,两家公司预计未来五年至少各投入10亿美元,相关工作将涵盖模型评估、红队测试、对齐评估和安全防护测试。

Anthropic宣布选择埃森哲作为首个嵌入式评估方,以推进其对AI开发降速方案中的第一步承诺。双方合作为非独家安排,Anthropic表示未来几周还将公布其他评估机构。根据公告,两家公司预计未来五年至少各投入10亿美元,相关工作将涵盖模型评估、红队测试、对齐评估和安全防护测试。

Anthropic 于 9 月 18 日宣布与 Accenture 合作,引入外部评估者进入公司内部,对前沿模型开展独立评估。根据官方公告,双方各自预计在未来五年投入至少 10 亿美元建设相关能力。驻场评估者将在 Anthropic 内部工作,并获得相当于员工的访问权限,职责涵盖红队测试、对齐评估、防护机制测试、训练观察及安全承诺查核等。

Anthropic开始推进「嵌入式评估」,由埃森哲旗下 AI 公司 Faculty 派员进入其内部,开展模型评测、红队测试、对齐评估和安全检查。与常见外部评测不同,评估员将获得接近员工级别的权限。双方计划未来五年各投入至少 10 亿美元建设这套评估能力,但评估范围、结果披露和费用安排等规则仍未统一。

Protos 报道称,Substack 作者 Kevin Bass 在 X 上发布长帖,指控 Anthropic 与其前沿模型安全评估机构 METR 之间可能存在财务利益交叉,并呼吁美国国会展开调查。帖文将 Dustin Moskovitz 持有的 Anthropic 股权、Good Ventures Foundation、Coefficient Giving、Tarbell Center for AI Journalism 以及 METR 联系起来。Protos 表示,尚未核实这些指控的真实性。

微软 CEO Satya Nadella 在 X 表示,对超级智能的追求必须建立在 AI 能帮助人类且处于人类控制之下这一原则上,否则不值得追求。他还称,AI 益处需要加速扩散,闭源与开源模型都应共同发展;企业应保留对自身知识、学习循环和模型控制权。微软还将于明天发布自有 MAI 模型“行为准则”供公众咨询。

Anthropic联合创始人兼CEO Dario Amodei提出「pacing the frontier」三步计划,主张放缓前沿大模型能力提升速度,为安全对齐和监管争取时间。他称递归自我改进已在行业内出现,若缺乏控制,未来6至12个月内,多智能体「蜂群」可能通过大规模网络攻击和持久僵尸网络造成灾难性损失。方案还包括引入第三方嵌入式评估机构,并推动民主国家内前沿AI公司协调设定能力与安全标准。

Anthropic CEO Dario Amodei 周末发文要求为前沿 AI「踩刹车」,称模型能力增长已快于人类理解与控制能力。埃隆·马斯克与 OpenAI CEO Sam Altman 随后公开表示认同,OpenAI还承诺向独立评估机构开放员工级系统权限。消息发酵后,HyperliquidX 上 OpenAI、Anthropic 相关资产分别下跌 7% 和 2.8%,市场开始担心英伟达、博通、AMD 等 AI 概念股在周一面临冲击。

Hugging Face CEO Clement Delangue宣布成立 Open Alignment Initiative,并由联合创始人 Thomas Wolf 牵头推进。该机构已公开申请加入 Anthropic 新提出的「嵌入式评估员」计划。若申请获批,评估人员将可长期驻场,并获得接近员工级的访问权限,直接审查模型训练与安全措施。Anthropic 同时承诺向第三方开放相关权限,并允许独立公布审查结论。
