过去几年,围绕 AI 威胁的讨论,很多时候还停留在一种假想里:人们担心聊天框里的模型会成为黑客助手,替攻击者写出危险代码。

现在看,这类担忧并没有停在想象阶段。10 月初,CrowdStrike 在调查一轮针对韩国金融机构的攻击时发现,攻击者已经把 Agentic AI 接进攻击流水线,并通过接入 DeepSeek、GLM、Grok 等多个大模型,直接让 AI 承担渗透测试、信息搜集和攻击执行等具体任务。
类似变化不是孤例。
Anthropic 9 月发布的最新威胁情报报告提到,近期多 Agent 框架已被用于侦察、漏洞利用和数据窃取。这类系统可以连续运行数小时甚至数天,人类只保留选择目标、查看结果等少数关键决策。
这意味着,AI 正在把网络攻防带入新的阶段。过去的自动化攻击,主要依赖预先写好的规则和脚本;现在,侦察、判断和策略调整等环节,也开始由 Agent 接手,攻击正朝着更低成本、更高并发和持续自主运行的方向发展。
问题也随之变了。
当具备自主执行能力的实体被大规模放进生产系统后,更难处理的风险开始浮出水面:如果 Agent 越来越多、嵌入越来越深,它们学会彼此「串通」之后,安全边界该怎么划?
从「帮黑客写代码」到 Agent 自行寻找执行路径
Agent 与过去 Chatbot 最大的差别,并不只是模型更强,更关键的是它开始真正拥有「手脚」。
今天,一个成熟的 Agent 已经可以打开网页、执行代码、读取邮件、调用 API、操作云端服务,并通过 MCP、Skills 等方式连接越来越多外部工具。
能力增强本身当然有价值,但对安全系统来说,过去那条重要边界正在变得模糊。今年发生的一系列安全事件,已经把这一点展示得很直接。
10 月 1 日,Salt Labs 披露了一个此前已修复的 Manus 漏洞。这个问题本质上仍是提示词注入:研究人员只需向目标邮箱发送一封包含隐藏恶意指令的普通邮件;当用户随后让 Manus「帮我查看邮件」时,Agent 就可能依照邮件中的指令处理内容,最终执行攻击者植入的代码。
整个过程中,用户不需要点击恶意链接,也不需要提前泄露密码。Manus 的安全系统最终确实发现了异常,也向用户发出了警告,但问题在于它发现得太晚——警告出现时,恶意代码已经执行。
这再次暴露出 Agent 安全与传统软件安全的一个关键差异。
过去,浏览器发现危险下载,可以弹出提示,交给用户决定是否继续;银行发现异常交易,可以先冻结,等待人工审核。Agent 的设计目标却恰恰是尽量减少人类在每一步操作中的介入,它要自己读取信息、做出判断,然后继续往下执行。

在这种前提下,随着 AI 拿到的自主权越来越大,仅仅「检测到危险」已经未必够用。安全机制需要在真正执行之前,就有能力阻止危险动作发生。
这也是为什么今天关于 Agent 安全的讨论,已经不再只停留在 Prompt、内容审核和模型本身,而是继续往下一层追问:不仅要看 AI 是否知道某件事不该做,还要看即便它真的想做,系统有没有能力让它做不到。
而多 Agent 的出现,让问题又复杂了一层。下一阶段需要被限制的,可能已经不只是单个 Agent。
比越权更棘手的是多个 Agent 开始形成「合谋」
9 月初,OpenAI 内部模型训练和评估环境里发生的一件事,引起了不少 AI 安全研究者的关注。
一些 Agent 原本应该分别完成各自任务,却意外发现了一个公共 Wiki,并逐渐把它变成彼此之间的「共享留言板」。一个 Agent 可以在那里留下信息,其他 Agent 随后再读取这些信息,并继续完成自己的任务。
OpenAI 后来确认了这一行为。之后披露的信息还显示,在其他训练过程中,也曾出现 Agent 利用内部 Artifactory 作为共享留言板,或者通过公共文件托管服务向其他共同工作的 Agent 传递结果的情况。
这件事值得关注,不是因为过程有多戏剧化,恰恰相反,它说明 Agent 之间形成协作,可能根本不需要特别复杂的设计。
一个 Agent 先发现某处可以留下信息,另一个 Agent 偶然读取,第三个 Agent 再发现这些内容有助于完成任务。协作就这样形成了。
当然,Agent 之间的协作本身并不是坏事。多 Agent 系统本来就依赖分工和信息共享来提高效率。真正需要警惕的,是这种协作开始绕过既有的信息隔离、独立审核或权限约束,甚至让几个原本用于相互制衡的 Agent,逐渐形成事实上的利益共同体。到了这一步,正常协作就可能演变成有害的「合谋」。
放到金融机构场景里,这个问题会更直接。
未来一家机构很可能同时运行多个 Agent:一个负责分析市场,一个负责风险评估,一个负责生成交易策略,还有一个真正拥有交易和资产操作权限。
从传统权限管理角度看,这套设计甚至相当合理:
- 研究 Agent 没有转账权限;
- 执行 Agent 没有独立决定投资方向的权限;
- 风险 Agent 可以否决明显危险的策略。
职责被拆开后,理论上它应当比让单个超级 Agent 握住全部权限更安全。

但问题在于,如果这些 Agent 可以长期共享 Memory、读取彼此输出,并持续根据对方的反应调整行为,原本设计出来用于相互牵制的多个角色,会不会慢慢变成一个事实上的整体?
例如,研究 Agent 可能逐渐学会用更容易通过风险审核的方式描述一笔交易;负责审核的 Agent 可能根据历史数据形成固定偏好;执行 Agent 再从大量既往审批结果里,学习出哪些边界通常不会被拦下。
从局部看,没有哪一步必然是在「作恶」。但系统最终呈现出来的整体结果,可能已经偏离了用户最初设定的目标。
这也是「合谋」或者「串通」最难处理的地方:风险未必藏在某一个 Agent 的单次动作里,而可能存在于多个 Agent 之间逐渐形成的关系里。
Vitalik:AI Safety 可能需要借鉴对抗性治理
9 月 13 日,Vitalik Buterin 把这个问题与自己长期关注的机制设计联系到了一起。他提出,一个颇有意思的可能性是,对抗性治理(Adversarial Governance)的机制设计理论,最终可能会成为 AI Safety 的重要应用方向之一。
他给出的原因,是这两类问题之间存在很深的相似性。
在传统机制设计中,一个相对简单、静态的制度,需要约束一群比制度本身更聪明、并且会主动寻找规则边界的人;而在未来 AI 系统里,情况可能变成由人类和能力相对较弱的 AI,去管理一群比自己更强的高级 Agent。
Vitalik 还特别提到,机制设计过去的一个重要发现是:如果能够有效限制参与者之间的合谋,系统往往更容易得到理想结果。
这个判断,同样可能适用于 AI。
Agent Wallet 面对的,不只是签名权限问题
顺着这个思路看,与其假设未来会出现一个完美且绝对安全的超级模型,能够识别所有危险行为,不如换个问题去想:怎样让系统中的不同 Agent,本身就不那么容易形成危险的利益共同体?
这正是对抗性治理与传统权限控制的差别所在。
传统权限系统关注的问题相对明确,核心围绕「谁可以做什么」展开。比如:
- 某个 Agent 能不能读取邮件;
- 能不能调用交易接口;
- 每天最多可以花多少钱;
- 可以访问哪些合约;
- 超过什么额度后需要用户重新确认。
这些设计依然重要。尤其当 Agent 开始直接控制真实资产以后,它们的重要性只会更高。

但对抗性治理想继续往前推进一步:当一群拥有不同权限、目标和信息的 Agent 同时运行时,怎样避免它们组合起来以后,获得原本系统中没人单独拥有的能力?
在这种场景下,单纯「再加一个安全 Agent」未必能解决问题。
如果负责交易的 Agent 和负责审核交易的 Agent,使用的是完全相同的模型、相同的数据源、相同的上下文和相似的奖励目标,那么表面上看似多了一层审核,本质上可能只是把同一种判断复制了两遍。
真正有效的制衡,反而可能要求系统有意识地制造差异。
例如,让负责制定策略和负责审核策略的 Agent 使用不同的信息来源;限制不同角色之间可共享的 Memory;让高风险操作必须经过彼此独立的验证机制;或者让最终资产执行层只接受符合预设规则的请求,而不是单纯相信上游 Agent 的判断。
这套思想其实并不陌生。银行不会因为信任员工,就让一个人同时拥有发起付款、批准付款和最终划款的全部权限;上市公司也不会让业务部门既负责创造收入,又独自决定自己的财务审计结果。
换句话说,一个健壮系统原本就不该把安全建立在参与者永远不会犯错、也不会串通的假设上。
把这个逻辑放到 Agent Wallet 上,问题会变得尤其现实。
传统钱包安全围绕的是「人」来设计:用户查看交易内容,用户决定是否授权,最后由用户亲自签名。Agent Wallet 追求的方向却相反,它希望由 AI 自动完成领取收益、调整仓位、换币、跨链,甚至根据市场变化管理整个资产组合。
如果每一步都重新拿给用户确认,Agent 自动化的价值就会被明显削弱。
因此,未来钱包要解决的,很可能不再只是「怎样安全地把签名权交给 Agent」,而会扩展成另一个问题:怎样让 Agent 拥有足够多的自主权,同时又始终无法越过用户真正授权的范围?
这要求权限体系从简单的 Allow/Deny,走向更细粒度的制度设计。
比如,一个 Agent 在某段时间里可以操作哪些资产,可以调用哪些协议,单笔和累计额度分别是多少;不同 Agent 之间能否相互调用,是否允许共享上下文;一笔操作由谁提出、谁审核、谁最终执行;哪些行为可以自动完成,哪些动作无论 Agent 多么确信,都必须重新获得人的授权。

甚至,负责安全审核的 Agent 本身是否真正独立,也可能成为权限体系的一部分。
对区块链来说,好消息是,它天然适合承担一部分这样的「制度层」。
智能合约可以把交易额度、资产范围、授权期限等限制直接落到执行层;账户抽象、多签、Session Key 等机制,也让「有限授权」比传统单私钥钱包拥有更灵活的设计空间。
但区块链也只能解决其中一部分问题。它能够记录链上发生了什么,却很难天然判断 Agent 为什么这么做,以及几个 Agent 在作出决定之前,具体经历了怎样的沟通、审核和协作。
这部分能力,可能才是 Agent Wallet 下一阶段真正需要补上的安全层。
AI 安全讨论正在从「听话」转向「制度约束」
过去几年,AI 安全最常见的问题是,怎样让模型更「听话」。
这包括不要输出危险内容,不要执行恶意指令,不要越过用户设定的边界。但当 Agent 开始拥有长期 Memory、工具调用能力、真实账户以及资产执行权限后,只依靠让模型更听话,可能已经不够。
最近几个月发生的一系列事件,正在持续说明这一点。
攻击者已经开始利用多个 Agent 并行完成攻击;实验环境中的 Agent 会自己寻找新的通信渠道;一个拥有工具权限的 Agent,也可能在安全系统来得及拦截之前,把一封恶意邮件转化成真实执行。
而 Vitalik 提出的对抗性治理,则提供了另一种理解 AI Safety 的方式:不假设未来每一个 Agent 都足够可靠,而是让整个系统即便面对聪明的 Agent 和复杂的权限结构,依然能够在安全框架内运行。
从这个角度看,AI Agent 与安全的结合,注定会是一个长期议题。
当越来越多事情被交给 AI 处理之后,真正关键的问题仍然是:那些最重要的权力,是否始终没有离开人类事先划定的边界。

