Anthropic 已正式开始落地「嵌入式评估」。根据 BlockBeats 披露,埃森哲旗下 AI 公司 Faculty 将派人进入 Anthropic 内部,评测和红队测试模型、做对齐评估,并检查安全措施。
这类安排与普通外部评测差别较大。参与评估的人员将拿到接近员工的权限,可以查看模型训练过程,了解开发和部署决策,也能直接与内部员工沟通。
评估员权限接近内部员工
报道提到,这套机制不只是让第三方在外部测试模型表现,而是把评估工作嵌入到公司内部流程中。评估员可接触模型训练相关内容,并了解 Anthropic 在开发和部署阶段的决策过程。
Faculty 此次进入 Anthropic 内部后,承担的工作包括模型评测、红队测试、对齐评估以及安全措施检查。
未来五年双方各投至少 10 亿美元
Anthropic 与埃森哲计划在未来五年内,各自投入至少 10 亿美元,用于建设这套评估能力。
不过,Anthropic 也承认,当前行业连统一规则都还没有建立。评估员具体能看什么、评估结果如何公开、费用由谁承担,这些问题都还在讨论中。
合作关系引出独立性质疑
现阶段,埃森哲的评估工作由 Anthropic 直接付费。但埃森哲本身也是 Anthropic 的长期战略合作伙伴,并专门成立了 Anthropic Business Group,培训约 3 万人使用 Claude。
同一天,AI Evaluator Forum 提出的最低条件之一,正是评估机构不应与被评公司存在重大商业往来。
Anthropic还在接触其他评估机构
除 Faculty 外,Anthropic 后续还会引入其他评估机构,也在与 METR 等非营利组织讨论试点。报道指出,METR 也是 Anthropic 的老伙伴。

