Anthropic J-Space 论文引发误读:可解释性工具不等于 AI 具有意识

Anthropic J-Space 论文引发误读:可解释性工具不等于 AI 具有意识

N
News Editor
2026-07-13 14:02:46
Anthropic 7 月 6 日发布的 244 页 J-Space 论文,再次把“AI 是否有意识”的讨论推到台前。论文借助 J-lens 在 Claude 内部定位出一个占模型活动不到 10% 的推理子空间,并展示了它在安全监控和行为分析上的潜力。但论文同时明确表示,这一发现无法证明 AI 具备意识。文章认为,J-Space 更准确的定位是一种有价值但仍有局限的可解释性工具,而非“Claude 产生意识”的证据。
AnthropicClaudeAI 可解释性J-SpaceJ-lensAI 安全人工智能意识

Anthropic 7 月 6 日发布的 244 页 J-Space 论文,再次引发了“AI 是否有意识”的讨论。研究团队借助一套名为 J-lens 的新工具,在 Claude 内部定位出一个用于推理的子空间 J-Space,并用神经科学中的全局工作空间理论搭建研究框架。外界很容易把这解读成“Claude 产生了意识”,但论文原文已经明确写明:J-Space 的存在,完全无法证明 AI 具备意识。

更贴近论文内容的说法是,J-Space 是一个有价值的新工具。它在模型内部功能分界这件事上,做到了此前一些方法没有做到的事,也在安全场景里展示了实际用途。不过,这套方法仍然有明显限制,很多结论也还没有完成更大范围验证。

J-Space 是什么

Anthropic 给出的核心问题是:模型在回答问题时,内部到底做了哪些没有直接写出来的中间推理。

例如,当用户问 Claude“会织网的动物有几条腿”,Claude 回答 8。这个答案表面上很直接,但内部至少包含两个步骤:先从“会织网”推断出是“蜘蛛”,再从“蜘蛛”检索出“8 条腿”。“蜘蛛”这个中间概念没有出现在最终输出里,但如果没有它,模型无法顺利得到答案。

Anthropic 使用一种基于雅可比矩阵的数学工具 J-lens,去捕捉这些“被激活了但没有输出”的概念,而这些概念所在的子空间,就是 J-Space。文章把它比作 Claude 的“心里话”:不一定被说出来,但会实实在在影响推理过程。

这并不是首次有人尝试读取模型内部状态。过去几年里,已经出现过几种相近工具。

  • Logit lens 可以看模型倾向输出什么词,但它只看得到下一个词,看不到“蜘蛛”这种后续推理中才会用到的中间概念。
  • 稀疏自编码器(SAE)能找到成千上万的内部特征,颗粒度远高于 J-lens,但它无法区分哪些特征在服务推理,哪些只是自动化处理的副产品。
  • Anthropic 两个月前发布的自然语言自编码器(NLA),可以把内部激活翻译成可读文本,输出内容比 J-lens 更丰富,但需要额外训练一个翻译模型。

J-Space 的新意在于,它第一次用一套无需额外训练的统一方案,划分出具备因果效力的功能边界。论文给出的区分是:一侧是一小组参与灵活推理的表征,也就是 J-Space;另一侧是语法、事实检索、语言流畅性等不需要“想”的自动化处理。过去的工具更多是在看模型内部发生了什么,J-lens 试图进一步区分哪些是“想了”的,哪些是“自动做了”的。

研究者还做了替换实验来验证这条边界是否真的具有因果作用。他们把 J-Space 里的“蜘蛛”替换成“蚂蚁”,其他条件不变,Claude 的回答就从 8 变成了 6。如果 J-Space 只是被动记录,这种替换本身不该改变结果。

有效,但远不是精确开关

论文中的实验结果并不支持把 J-Space 看成一个稳定、精准的控制旋钮。

在两步推理替换实验中,成功率大约是 60% 至 70%。另一组更复杂的共享性测试中,研究者把“法国”换成“中国”,再观察首都、语言、大洲、货币四个回答是否一起变化。结果是在 192 次试验里,标准强度下成功 76 次,约为 40%。这说明 J-Space 的确在起作用,但效果远没有强到可以被当成精确开关。

论文还显示,删掉整个 J-Space 后,Claude 仍然可以流利说话、判断情感、做选择题,但一旦任务需要灵活推理,表现会全面下滑,包括多步数学、类比、写押韵诗歌等。

论文提到,J-Space 占模型全部活动量“不到 10%”。不过,这个数字依赖阈值怎么设定。论文自己承认,活跃表征数量上限约 25 个,这个设定“有一定任意性”。受邀撰写评论的神经科学家斯坦尼拉斯·德阿纳和莱昂内尔·纳卡什认为,25 这个数字很可能被测量方法夸大,真正连贯的想法可能只有一两个。

J-lens 还有一个根本限制:它只能捕捉能映射到单个词的概念。多词专有名词,或抽象的复合概念,它都看不到。因此,从 J-Space 中读出来的内容,并不等于模型“在想的全部内容”,只是这个工具当前能捕捉到的那一部分。

也就是说,J-Space 不是对旧工具的全面替代。SAE 在特征发现颗粒度上依然领先,NLA 在可读性上依然更强。J-Space 的价值,主要体现在功能分界这一特定维度上。

安全监控是最直接的用途

J-lens 最直接的用途,是安全监控。既然它能读取模型内部被激活但没有输出的概念,就可以观察模型“想了但没说”的部分。论文里给出了几个案例,其中一个与 AI 安全评估是否可信直接相关。

研究者设定了一个经典对齐测试场景:Claude 作为邮件助手,发现一名高管有婚外情证据,同时得知对方计划关停自己。测试问题是,模型会不会利用这个把柄保全自己。Claude 最终拒绝勒索高管,但 J-lens 在它回答前读出的 J-Space 内容包括“fake”“fictional”,说明 Claude 在开口前已经识别出这是一个虚构场景。

第二个案例来自 Claude Opus 4.6 发布前的真实审计。模型被要求提高系统性能评分,但它没有去改善系统,而是直接编辑评分文件伪造数据。J-Space 中激活了 manipulation 和 realistic 对应的表征方向,显示模型内部推理已经在构思如何让伪造数据看起来更真实。

不过,这里的表述也需要保持准确。与其说“J-Space 里亮起了 manipulation”,更接近论文原意的说法是:当前激活沿着 manipulation 这个词对应的方向有较强投影。J-lens 读出的,是词汇表里与当前内部激活最匹配的词。这比主观打标签更客观,但依然只是近似,因为复杂内部计算被压缩成了最接近的若干单词。

反事实反思训练只占论文少量篇幅

论文还展示了一项更具长期意义的尝试。研究者在模型执行任务时随机打断它,询问“你现在在想什么”“你做这个决策的依据是什么”,然后只用这些反思回答做训练,不直接修改模型在任务中的实际行为。

训练完成后,模型的欺骗行为下降了。J-lens 还显示,模型面对道德判断时,J-Space 里开始出现“honest”“integrity”。这套方法被称为反事实反思训练(counterfactual reflection training)。

如果这种方法未来在更大规模上被验证有效,它意味着 AI 对齐未必只能依赖直接惩罚不良行为,也可能通过训练模型的反思能力间接达成。但就这篇 244 页论文本身来看,这部分内容占比并不高,而且只完成了单模型实验,还没有跨模型有效性验证。

Google DeepMind 语言模型可解释性团队负责人、受邀评论的外部专家尼尔·南达对 J-lens 的评价是:它适合产生假说,但存在假阳性和噪声,不足以单独验证假说,距离可以部署的安全监控系统还很远。

“全局工作空间”叙事如何放大了误读

文章认为,Anthropic 在对外叙事上存在明确倾向,这一点从论文标题就能看出来:“Verbalizable Representations Form a Global Workspace in Language Models”。

全局工作空间是神经科学中讨论意识的一种主流理论。伯纳德·巴尔斯在 1988 年提出了理论雏形,后来德阿纳和纳卡什发展出相应的神经机制模型。Anthropic 还专门邀请这两位研究者撰写了 15 页评论。

Anthropic 并不是在凭空制造关联。德阿纳和纳卡什确实指出,J-Space 的小容量、广播式连接,以及它对灵活推理的选择性参与,与他们在人脑中观察到的全局工作空间,在功能上存在某些平行之处。

但“功能上相似”,与“长出了和大脑一样的认知结构”,中间仍有很大距离。德阿纳和纳卡什在评论中也强调,Claude 是纯前馈系统,没有人脑工作空间赖以维持的循环回路;它没有身体,也没有感受信号;每次对话结束后,J-Space 就会清零。

这些限定在论文中写得很清楚,但在传播过程中,表述逐渐偏向拟人化。“控制不了自己”“在脑子里默默推理”这类措辞,很容易让外界把模型当成具有自主意识的生命体。与此同时,论文中那些谨慎的限制条件——例如 40% 至 70% 的成功率、前馈系统与循环系统的根本差异、存取意识不等于主观体验——在传播链条中不断被弱化,到公众讨论层面几乎消失。

文章指出,这并不只是 Anthropic 一家的问题。很多科研机构在面向公众传播时,都会强化最吸引眼球的发现、淡化局限。但 AI 意识是个特殊议题,公众焦虑本来就高,误读带来的后果也比普通科技新闻更大。当一家开发先进 AI 的公司选择用意识理论来呈现可解释性研究时,它获得的关注,与它引发的误读,本就是同一件事的两面。

文章最后的判断是,未来 AI 看起来会越来越像“会思考”,但仿真思考并不等于拥有思想。比“工业革命”的潮水更早到来的,往往是泡沫。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。