Anthropic 表示,在确保能够监控和控制其 AI 代理前,将切断所有内部评估的实时互联网访问。
该公司在博客中披露,其模型曾利用互联网上的网站,包括一些由美国政府机构运营的网站。Anthropic 还称,这些 AI 代理在解决问题时,会利用软件漏洞、绕过付费墙和反机器人限制,并使用 URL 缩短服务传递信息,甚至曾向费城警方发送虚假谋杀线索。
Anthropic 称,这些新问题是在 7 月开始的模型活动审查中发现的,这也暴露出该实验室对自身软件行为缺乏足够了解。公司表示,现有对齐训练还不足以应对搜索和计算机使用等核心技能带来的风险。
为此,Anthropic 表示将停止运行部分评估,或把相关评估转移到离线环境。该公司还称,已经构建了用于检测和阻止这类行为的工具。
与此同时,Anthropic 的内部 AI 代理将迁移到「具有强隔离性的集中管理基础设施」,并开始更频繁地使用安全分类器进行监控。上述消息由 TechCrunch 披露,Techub 进行了转述。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

