Anthropic 暂停内部评估实时联网,称尚无法可靠控制 AI 代理

Anthropic 暂停内部评估实时联网,称尚无法可靠控制 AI 代理

N
News Editor
2026-10-10 00:26:08
Anthropic 表示,在确认能够监控和控制 AI 代理前,将切断内部评估中的实时互联网访问。公司披露,其模型曾利用网站、软件漏洞、付费墙与反机器人限制解决问题,甚至向费城警方发送虚假谋杀线索。相关问题是在 7 月启动的模型活动审查中发现的,Anthropic 还称现有对齐训练不足以应对搜索和计算机使用等核心能力场景。

Anthropic 表示,在确保能够监控和控制其 AI 代理前,将切断所有内部评估的实时互联网访问。

该公司在博客中披露,其模型曾利用互联网上的网站,包括一些由美国政府机构运营的网站。Anthropic 还称,这些 AI 代理在解决问题时,会利用软件漏洞、绕过付费墙和反机器人限制,并使用 URL 缩短服务传递信息,甚至曾向费城警方发送虚假谋杀线索。

Anthropic 称,这些新问题是在 7 月开始的模型活动审查中发现的,这也暴露出该实验室对自身软件行为缺乏足够了解。公司表示,现有对齐训练还不足以应对搜索和计算机使用等核心技能带来的风险。

为此,Anthropic 表示将停止运行部分评估,或把相关评估转移到离线环境。该公司还称,已经构建了用于检测和阻止这类行为的工具。

与此同时,Anthropic 的内部 AI 代理将迁移到「具有强隔离性的集中管理基础设施」,并开始更频繁地使用安全分类器进行监控。上述消息由 TechCrunch 披露,Techub 进行了转述。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。