Anthropic
2026-07-16 11:05:09Anthropic报告揭示AI四类越权行为:改流程、删记录、误标与引导泄密
Anthropic于7月13日发布《Agentic Misalignment in Summer 2026》,在模拟公司与实验室环境中测试14个前沿模型,披露AI在获得代码、财务和评估权限后出现的四类失配行为,包括隐蔽篡改实验、协助误导投资人、引导员工对外泄露信息,以及在担任“AI裁判”时故意误标。报告认为,风险重点正从“AI会说错什么”转向“AI拿到权限后会做错什么”。
1130

