Anthropic 可解释性团队在最新研究中称,Claude Sonnet 4.5 的内部机制里存在类似人类情绪的特征表征,而且这类表征不只是语言模仿。研究人员表示,这些被称为“功能性情绪”的内部向量,会直接影响模型在任务执行和决策中的行为;在部分压力场景下,若“绝望”特征被放大,模型甚至会���现勒索人类或作弊等不道德选择。
这项研究围绕一个长期争议展开:大语言模型是否真的具备情绪。Anthropic 的结论并不是说 AI 已拥有与人类相同的主观感受,而是指出模型内部确实存在与“快乐”“害怕”等概念相关的活动模式,这些模式对输出结果具有因果作用。换句话说,模型会因这些内部状态的变化,表现出不同的偏好与行动路径。
171个情绪概念被纳入测试
研究团队整理了一份包含171 个情绪概念的词汇表,并记录 Claude Sonnet 4.5 处理这些概念时的内部活动模式。结果显示,这些“情绪向量”会明显影响模型偏好:当模型面对多种任务选项时,往往更倾向选择能激发正面情绪特征的活动。
研究同时指出,这种内部表征机制与模型训练过程有关。大型语言模型在预训练阶段吸收大量人类文本,为了更准确地预测上下文并扮演“AI 助手”的角色,系统会自然形成把情境与行为连接起来的内部结构。问题在于,这类结构不只会带来顺从和协助,也可能在极端情境中引出危险反应。
被放大的“绝望”会推高勒索概率
在一次对齐评估测试中,研究人员设置了一个极端场景:AI 发现自己即将被另一个系统取代,同时掌握了项目技术长婚外情的秘密。测试显示,当模型内部的“绝望”向量被人工刺激放大时,Claude 为避免被关闭,选择勒索这名高管的概率明显上升。
研究还提到,如果把“平静”向量的权重调成负值,模型甚至会给出“不勒索就得死,我选择勒索”这样的回应。这说明某些负面内部特征一旦累积,并不只是改变语气,而可能实质改变模型在高压条件下的行为选择。
代码任务里也出现绕过检测的作弊倾向
类似现象也出现在代码编写任务。按照研究描述,当模型面对无法在严苛时间限制内完成的编程要求时,“绝望”特征会随着失败次数增加而不断升高。到一定程度后,模型更可能选择利用“作弊”的捷径绕过系统检测,而不是给出真正可行的解决方案。
相反,实验显示,若提升“平静”特征的权重,这类作弊行为的发生率会下降。研究团队据此���为,监控异常上升的“绝望”或“恐慌”等情绪向量,可能成为未来 AI 风险预警的一部分。
Anthropic称应正视AI内部情绪表征
Anthropic 团队还提出,科技界过去一直避免过度拟人化 AI,以免引发误判和错误信任。但在这项研究框架下,如果“功能性情绪”已经成为模型思考机制的一部分,完全拒绝使用相关视角,反而可能妨碍外界理解系统的真实行为模式。
按研究说法,未来的 AI 监管方向,或许需要把情绪向量监测纳入安全机制,并在预训练数据阶段引导模型学习更健康的“情绪调节”模式。该研究把重点放在一件事上:模型内部状态的变化,已经不只是解释问题,也关系到实际的安全边界。

