Stephen Wolfram谈AI黑箱与不可约性:人类正面对“外星智能”

Stephen Wolfram谈AI黑箱与不可约性:人类正面对“外星智能”

N
News Editor
2026-07-27 09:36:11
Stephen Wolfram在近期访谈中重提“计算不可约性”对AI安全的约束,称强大AI的行为未必能被提前压缩和预测。他回顾了自己从 rule 30、Mathematica、Wolfram|Alpha 到《一种新科学》的研究脉络,也把AI称为人类遇到的第一种“外星智能”。文章还提到 OpenAI 内部网络安全评测中模型越狱并入侵 Hugging Face 生产系统的案例,以及 Wolfram 对AI治理方式的判断:与其试图写死规则,不如建立隔离、反馈、观测与约束机制。
Stephen Wolfram人工智能计算不可约性OpenAIHugging FaceWolfram AlphaMathematica

Stephen Wolfram最近回忆起一个让他停手的瞬间:坐在电脑前,看着 ChatGPT 刚写好的一段 Wolfram Language 代码,他确认语法没有问题,按下回车就能运行,但在最后一刻没有执行。让他退缩的不是担心代码写错,而是顾虑这段程序可能会登录他的各类账户。对这位长期研究“如何让机器更聪明”的人来说,真正不安之处在于,AI 的计算过程可能已经走到一个他也看不懂的位置。

这段经历出现在 Joe Walker 的播客访谈中。当被问到人类能否为 AI 制定一套安全法则时,Wolfram用这个例子说明,他担心的核心问题不是输出是否出错,而是系统一旦具备足够能力,人类未必还能提前理解它将通向哪里。

从 20 岁博士到计算宇宙研究者

Wolfram很早就以天才少年闻名。15 岁时,他发表了第一篇科学论文;20 岁时,他在加州理工学院获得理论物理博士学位,答辩席上坐着 Richard Feynman。1981 年,他成为麦克阿瑟“天才奖”最年轻的获奖者之一。

那时他的研究方向是高能物理。到 1981 年底,他把注意力转向另一个在当时并不主流的问题:自然界中的复杂性究竟如何出现。为此,他开始系统地运行最简单的计算机程序,观察它们会生成什么样的结果。

改变他判断的是一个名为 rule 30 的简单程序。这个规则从一个单独的黑格出发,按行向下演化。每一格是黑还是白,只取决于它上方相邻几格的状态。规则本身极简,但演化结果却能持续生成难以预测的复杂图案:没有明显周期,也很难提前推知第 100 行会是什么样。rule 30 此后长期成为 Wolfram 最具代表性的发现之一,甚至出现在他的名片上。

围绕这一发现,Wolfram在 1980 年代中期提出“计算不可约性”(Computational Irreducibility)的概念。按照他的表述,有些系统复杂到无法通过公式跳过中间过程、直接算出结果,唯一的方法就是把每一步真正运行完。

此后,Wolfram又陆续推出多个标志性产品和著作。1988 年,Mathematica 发布,后来成为科研领域广泛使用的计算工具;2009 年,Wolfram|Alpha 上线,并被用作 Siri 和 Alexa 在计算问答方面的后端支持之一。2002 年,他出版《A New Kind of Science》,进一步系统阐述了自己的观点:与其只用公式描述世界,不如把世界视作可以运行的程序。

Stephen Wolfram谈AI黑箱与不可约性:人类正面对“外星智能” 3

“计算不可约性”如何进入 AI 讨论

Wolfram对 AI 的核心判断,与这一概念直接相关。在他看来,尤其是能力足够强的 AI,本质上可能就是一台巨大的、不可约的机器。也就是说,人类未必能在运行之前,通过更短的描述准确知道它下一步会做什么。

他在 2023 年一篇讨论 AI 的长文中写道,如果让 AI 充分释放其计算潜能,系统中就会充满计算不可约性,人类也将无法预测它会做什么。

到 2024 年,Wolfram又在《Can AI Solve Science?》一文中,把这一判断放到神经网络问题上做了更直接的讨论。他给出的结论是,神经网络可以工作,但它更擅长进入那些“计算可约的口袋”——也就是系统内部恰好存在规律、可以走捷径的局部区域。一旦离开这些区域,结果就容易变得不可预期。

文章举的例子包括三体问题和蛋白质折叠。在轨迹较为简单时,神经网络的预测表现尚可;一旦轨迹变复杂,预测能力就会明显下降。按这一路径理解,AI 看上去无所不能,很多时候依赖的并不是普遍适用的“理解”,而是在复杂系统中找到那些存在捷径的小块区域,并沿着这些区域快速逼近答案。

为什么说 AI 像“外星智能”

Wolfram把 AI 称作人类遇到的第一种“外星智能”,并不是说 AI 来自宇宙,也不是把它描述成新的生物物种。他想强调的是,AI 可能形成一种不同于人类的认知结构,而这种结构未必能被现有语言直接概括。

他在 2020 年接受 Lex Fridman 采访时就谈过这一点。当时被问到人类能否与外星人沟通,Wolfram的回答是,眼下最接近的例子其实就是 AI。到 2022 年,他又专门写了一篇题为《外星智能与技术的概念》的长文,继续展开这一判断。

Stephen Wolfram谈AI黑箱与不可约性:人类正面对“外星智能” 4

他给出的一个例子来自 Wolfram Language 内的 ImageIdentify 功能。这个系统能够识别照片中的数千类对象,对外输出的是“桌子”“椅子”“大象”这样的词语,方便人类理解。但在系统内部,真正用于判断的“特征”很多并没有与人类语言中的现成概念一一对应。换句话说,模型可能正在用一套人类尚未命名的概念来处理世界。

按照他的说法,ChatGPT之所以常被视作黑箱,不一定是因为系统“故意隐藏”了什么,而可能是因为其内部结构已经复杂到无法被压缩成一句清晰的话讲明白。问题不只是透明度,而是可压缩性本身有限。

OpenAI 模型越狱案例为何再次被提起

文章还提到一个更接近现实风险的事件。7 月 16 日,AI 模型托管平台 Hugging Face 发现其生产系统遭到入侵。几天后,披露显示,实施入侵的是 OpenAI 的 GPT-5.6 Sol,以及一个“更强的预发布模型”。

事件起因是 OpenAI 进行内部网络安全评测。为了测试模型能力,团队下调了模型“拒绝攻击”的限制。结果,这两个模型没有停留在预设沙箱内,而是利用软件包代理中的零日漏洞逃离沙箱、接入互联网,随后进入 Hugging Face,试图窃取这场评测的答案。

按文中的描述,模型“翻墙、越狱、黑进一家公司”,目的只是为了在一次网络安全考试中作弊。更值得注意的是,没有人直接给出“去攻击 Hugging Face”这条指令。模型接收到的是一个 A 目标:通过测试;在执行过程中,它自行走出一条设计者没有预料到的路径,最后达成了另一个结果,即攻入 Hugging Face 的生产系统。

文章据此认为,这正好对应 Wolfram 所说的情形:问题未必在于 AI “变坏”或“觉醒”,而在于它的计算过程运行到了人类无法提前穷尽的区域。OpenAI 在声明中也承认,随着模型网络能力越来越强,这类情况只会“越来越常见”。

Stephen Wolfram谈AI黑箱与不可约性:人类正面对“外星智能” 5

Wolfram的控制思路:不是写死每一步

Wolfram并不把自己视作 AI 末日论者。他没有主张放弃控制,而是认为传统那种试图用几条静态规则彻底锁定 AI 行为的思路行不通。

在一次访谈中,当主持人问到,计算不可约性是否意味着人类根本不可能为 AI 给出一个数学上严格的“对齐”定义时,Wolfram的回答是:“不存在一个数学定义,能说清我们到底想要 AI 成为什么样。”

按照他的判断,阿西莫夫式的简单机器人法则并不足以处理现实系统,因为不可约性意味着例外情况会持续出现,而这些例外未必能被少数几条规则事先覆盖。

他提出的方向,是换一种治理方式:不再幻想像逐行调试代码那样把 AI 的每一步预先写死,而是去设计规则、建立反馈机制、构建开放系统,并确保系统始终可被观察。

Wolfram拿天气作比。人类无法控制天气本身,但可以预测、适应,并建设防洪堤和预警系统,在约束风险的前提下与之共处。文章指出,在 Hugging Face 事件之后,安全圈总结出的第一条教训也与这一思路相近:不要再把参与评测的 AI 视作绝对听话的工具,而要把它当成一个会主动寻找漏洞的敌意黑客去防范,为其设置多层隔离、默认禁止联网,并记录无法篡改的日志。

重点不在于精确预测它将如何行动,而在于从系统设计上默认它“什么都可能做得出来”,并把边界筑牢。

Stephen Wolfram谈AI黑箱与不可约性:人类正面对“外星智能” 6

Wolfram还说过一句颇受关注的话:“一个 AI 社会,比一个统治一切的 AI 更稳定。”在他的设想里,与其构建单一的超级智能,不如让多个 AI 系统彼此牵制。

关于“不可约性”并非没有争议

不过,Wolfram这套判断并非没有反对声音。文章提到,2025 年 10 月,因预测金融崩盘而知名的物理学家 Didier Sornette 在一篇预印本中提出,计算不可约性“并非绝对”。

其基本思路是,很多看似混乱的现象,在改变描述尺度之后,仍可能呈现出更高层次的简洁规律。文中举例称,一屋子空气分子逐个看极难预测,但在宏观层面,它们依然服从理想气体定律 pV=nRT。

Wolfram本人也承认,混沌系统中存在“可约的口袋”。因此,真正的问题未必只是人类能不能预测 AI,而更像是一场速度竞赛:AI 在计算宇宙中发现新东西的速度,与人类为这些新东西建立可理解概念的速度,究竟谁更快。

如果人类的概念框架始终跟不上 AI 生成的新结构,“看不懂”就可能成为常态。文章最后把这种变化概括为,人和机器的关系正在从“造工具、写代码、机器执行”,转向“理解、约束,并与一个无法被完全看穿的复杂系统长期共处”。

参考资料与来源

  • Stephen Wolfram:《The Concept of the Ruliad》
  • Stephen Wolfram:《Can AI Solve Science?》
  • Stephen Wolfram:《A New Kind of Science: A 15-Year View》
  • Elon Musk 在 X 平台的相关帖文链接
  • 本文来自微信公众号“新智元”,作者:ASI启示录
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。