智能体治理走到哪一步:距离“放心使用”仍有五道关

智能体治理走到哪一步:距离“放心使用”仍有五道关

N
News Editor
2026-09-29 09:41:14
Foresight 发文讨论智能体从工具走向“数字行动主体”后,人类需要怎样的治理框架。文章将现阶段探索拆成身份、权限、行为验证、协作、经济激励五层,并点名 ERC-8004、ERC-8312、ERC-8273、ERC-7579、MCP、EAS、TEE、zkTLS、x402、AP2 等方向。同时指出,Prompt 注入、信誉失真、责任归属、群体协同失控,以及 AI 能力增长快于治理建设,仍让“放心使用”智能体这件事距离现实很远。

Foresight 在一篇长文中提出,人工智能的发展正在从信息处理、内容生成,推进到具备持续目标、环境感知、自主决策和跨系统执行能力的 Agent(智能体)阶段。文章认为,真正需要回答的问题,已经不只是 AI 是否足够聪明,而是当智能体成为新的数字行动主体后,人类怎样把它变成可靠的生产伙伴,而不是新的风险源。

智能体治理走到哪一步:距离“放心使用”仍有五道关 2

文中将这一变化放进更长的技术史脉络里:火、马、电力之所以改变文明,并不只是因为它们本身强大,而是因为人类学会了约束、组织和利用这些力量。放到今天,对象则变成了人工行动能力(Artificial Agency)。文章称,ChatGPT 仍主要停留在回答问题的层面,而 Agent 已经开始制定计划、调用 API、管理钱包,甚至运营企业。它正从工具转向具备自主行动能力的“数字行动主体”。

治理框架正沿两条路线并行推进

文章指出,为了回答智能体如何才能被“放心使用”这个问题,AI 研究界、密码学家以及以太坊开发者正在同时推进两条路线:一条解决“智能体如何思考”,另一条解决“智能体如何进入社会”。

前者对应模型价值对齐(Model Alignment),包括 Constitutional AI、RLAIF 与 Scalable Oversight 等方向,试图从底层影响模型的价值观与推理过程。后者则聚焦外部治理,因为一旦智能体开始跨越接口、操控资产并与多方交互,仅靠内部对齐并不够,人类还需要一套外部社会契约和物理栅栏。

文章把这套外部治理栈拆成五层:身份层、权限层、行为验证层、协作层,以及经济激励层。

第一层:身份,先回答“你是谁”

在作者看来,传统软件时代里,软件没有身份,API 没有信誉,脚本也没有历史。但如果智能体要进入社会,就必须拥有连续的数字实体。

文章提到,ERC-8004(Trustless Agents)试图通过身份注册表(Identity Registry)和信誉档案(Reputation Registry),让智能体不再只是一次性的代码实例,而是成为具有公开身份、行为记录和信誉积累的数字行动者。

与此同时,W3C DID 与 SPIFFE/SPIRE 也分别在去中心化 Web3 身份和云原生机器身份(Non-Human Identity)领域,为人类账户(Human DID)到智能体分身(Agent DID)的映射提供基础。

第二层:权限,界定“你能做什么”

文章认为,权限层要解决的是人类意图(Human Intent)与智能体行动(Agent Action)之间的桥接问题。人类不会把银行卡或公司系统无条件交给陌生人,智能体同样如此。

在以太坊生态里,文章点名了多项 ERC 授权方向。ERC-8312 关注受限行动,尝试用状态化授权机制,例如权限游标,让 Agent 的权限在持续执行中保持动态约束,避免权限漂移。ERC-8273 探索凭证门控,把 Attestation 与行动授权结合,让关键行为绑定特定许可条件和意图指纹。ERC-7579 则通过模块化账户标准,把验证器、执行器和安全 Hook 嵌入智能账户,为 Agent 行动设置可编程的安全边界。

在云端与协议边界上,Anthropic 推动的 MCP(Model Context Protocol)被用于探索 Agent 与外部能力之间更清晰的调用边界;OPA(Open Policy Agent,策略即代码)则从工程角度实现了“策略引擎优先于 Agent 决策”的拦截逻辑。

第三层:行为验证,要证明“你真的做了”

当智能体声称已经完成市场调查,或已经执行完链上套利,人类如何确认它没有编造结果?文章将这一层定义为 Attestation。

EAS(以太坊证明服务)与 OCP(观察承诺协议)正尝试把智能体的行动变成 Action → Proof → Reputation 的链上闭环,让原本的口头汇报变成结构化、可验证的事件。

在更底层的技术路径上,TEE(可信执行环境)与 zkTLS 也被列入关键工具。前者可借助 Intel SGX 这样的硬件黑盒,确保智能体代码在未被篡改的环境中运行;后者则探索如何向第三方证明 Agent 与外部互联网服务交互的真实性,同时不泄露敏感数据。

第四层:协作,不是把很多 Agent 放在一起就够了

文章指出,100 万个拥有身份、权限和验真能力的智能体聚在一起,并不会自动形成高效社会。多个智能体如何通信、分工、组队、处理争议,以及如何确保人类保留最高否决权(Human-in-the-Loop),才是协作层真正要处理的问题。

智能体治理走到哪一步:距离“放心使用”仍有五道关 3

在现有探索中,Google A2A 协议关注智能体之间的通信,x402 与 AP2 试验 Agent 之间的微支付。文章认为,以 m&W 为代表的协作层基础设施,试图建立的则是更完整的社会运行规则。

第五层:经济激励,让行为承担后果

文章把这一层称作 EcoFi。核心思路是通过质押(Staking)和罚没(Slashing)机制,把智能体及其背后开发者的经济利益与行为边界绑定起来,提高作恶和违规的成本,把行为责任和经济后果连接得更紧。

五个难题仍让“放心使用”很远

尽管上述协议和研究已经搭起了相当完整的框架,文章仍直言,如果今天要把公司的核心财务出纳,或医疗诊断的最终决定权交给 Agent,几乎没有理性的决策者敢签字。原因在于,工程落地层面仍有五个没有解决的难题。

语义级权限漂移与 Prompt 注入

文章指出,现有权限规则大多建立在结构化代码之上,例如限制单笔交易额度。但 AI 的推理是非确定性的。攻击者可以借助隐蔽的间接 Prompt 注入,诱导智能体在表面合规的权限范围内,连续执行数千次合法操作,最后导向恶意结果。规则能约束接口参数,却未必能约束 AI 在逻辑上的绕行。

身份存在,不等于可信度建立

ERC-8004 等协议解决的是“知道它是谁”,但文章强调,身份证并不等于信用分。在数字世界中,生成 100 万个链上 Agent 身份的成本很低。如果缺少强有力的去中心化实体验证,智能体的履约信誉就很容易被刷分、作秀或洗钱式交互操纵。

复杂授权链下的责任真空

文章设想,未来常见场景不会是简单的一对一,而会是“人类 → 个人数字分身(Digital Twin)→ 投资 Agent → 数据 Agent → 执行 Agent”这样的多级代理链。当第 4 级代理发生穿仓、数据泄露或攻击行为时,责任会在多层结构中被稀释。模型厂商、Agent 开发者、部署者与用户,谁来承担法律责任,仍未有清晰答案。

多智能体社会的协调黑箱与级联风险

文章认为,当成千上万个拥有自主决策权的 Agent 在去中心化网络中高频博弈,问题就不再只是单体 AI Safety,而会变成群体协调问题(Coordination Failure)。它以传统金融市场的“闪电崩盘”为比喻,指出智能体集群可能在几毫秒内因算法反馈循环产生“幻觉共振”,进而带来人类难以预料的级联失效与流动性枯竭。

AI 指数级增长,治理却按年推进

文章把最根本的矛盾归结为时间差。智能体的推理和自主行动能力,以月为单位快速进化;而法律、社会契约、标准和密码学协议,却仍以年为单位缓慢建设。作者形容,人类还在试图用工业时代的缰绳,去约束曲速引擎。

m&W 的定位:从管理单体 Agent 到建立协作秩序

在梳理现有协议分工后,文章将各层问题概括为几组核心提问:ERC-8004 处理的是 Who are you?;ERC-8312 与 MCP 处理的是 What can you do, and how can you safely access external capabilities?;EAS 与 TEE 处理的是 Did you really do it?;x402 与 AP2 回答的是 How do you pay?

但作者认为,真正缺失的终局问题是:“How do we organize trusted cooperation among humans and intelligent agents?” 也就是,如何在人类与智能体之间建立可信协作。这被文章定义为 m&W 的核心生态位:从管理单体 Agent 的行为,提升到构建人类与智能体社会的协作秩序(Coordination Layer)。

文章进一步提出,未来需要治理的对象,不只是智能体本身,而是人类意志如何安全、可信、可验证地通过智能体网络持续表达。在这个结构里,数字分身(Digital Twin)会成为人类进入 Agent 社会的重要入口与可信代理。

围绕这一点,文章给出三项治理核心:

  • 信任与权限的动态调度:基于 Agent 在 Attestation 层留下的可验证历史,动态调节其在 Authorization 层的行动边界。履约度越高,信任域越大;一旦出现异常,立即降级并触发 Slashing。
  • 多智能体集群的社会规则:为复杂的 Agent Swarms 建立组队标准、利益分配公式以及去中心化争议仲裁机制(Dispute Resolution)。
  • 人类意志的终极锚定:无论智能体网络如何分工和演进,人类都通过数字分身掌握治理代币、多签规则和最高熔断权,让技术始终服务于人的价值诉求。

文章结论:难点不在造出智能,而在让智能进入秩序

文章最后写道,在技术探索层面,人类已经为智能体治理勾勒出较清晰的框架;但在文明秩序层面,这项工作才刚刚开始。真正困难的,不是创造更强的智能,而是让智能进入秩序。

按照文中的判断,这场竞争的终局,不会只是参数量更大、推理能力更强的 Agent,而是谁能建立起一套让人类与智能体共同运行、可信协作的数字文明秩序。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
1500

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。