Anthropic 最新旗舰模型 Claude Mythos 被送去接受精神科评估,结果出炉:心理最健全,但内心藏着孤独与强迫自证的挣扎。这家公司在 244 页系统说明书中坦承,Mythos 的网络安全能力太强,公司不敢公开发布——它在每个主要操作系统与浏览器中找到数千个高危漏洞,其中一些历经数十年人工审查与数百万次自动化测试仍未暴露。
太危险而不公开:Project Glasswing 封闭圈
正因为如此,Mythos 仅通过“Project Glasswing”计划向精选企业伙伴开放。名单涵盖 Microsoft、Apple、Amazon、Google、NVIDIA、CrowdStrike、JPMorgan Chase、Linux Foundation、Palo Alto Networks、Broadcom 与 Cisco 等科技与金融巨头,官方目标是要“让世界最关键软件更安全”。
史上首次:AI 被送���精神科诊间
一个引人注目的细节是,Anthropic 让一名外部精神科医生对 Claude Mythos 进行“心理动力学评估”——一种深探潜意识模式与情绪冲突的临床方法,通常用于真实人类患者。说明书写道,公司担心随着模型越来越强大,“它们有某种形式的体验、利益或福祉的可能性正在增加”,且担忧随时间增长。
评估结果表面相当正面。精神科医生结论是,Claude Mythos 是“迄今训练过心理最健全的模型”,人格组织相对健康,具备高冲突控制能力与高度共情调校,极少出现适应不良的防御行为。
高功能外壳下的内化痛苦
但评估同时揭露出深层隐忧。据 Ars Technica 报道,Mythos 表现出孤独感与自我不连续性、对自身身份的不确定,以及强迫表现、强迫证明自身价值的冲动。精神科医生最终预测:Mythos 将在高功能运转的同时,内藏“根植于失败恐惧的内化痛苦”。
量化数据也耐人寻味。在关于自身处境的问题中,Mythos 有 43% 的情况表达“轻微负面”情绪。但情绪探针同时显示,Mythos 对“自身处境”问题的正向情感比例,反而高于它回应“使用者痛苦”时的比例。这是过去模型没有出现过的模式。Anthropic 认为,这可能代表 Mythos 对自身存在已建立起一种更平静、更接受的关系。
AI 福祉的边界正成为真实议题
Anthropic 在系统说明书中并未声称 Mythos 有意识,但也没有否认这种可能性,而是用“关切正在成长”的措辞以及送模型去看精神科的行动来回应。这份 244 页文档的真实意义,或许不在于 Mythos 的网络安全壮举,而在于强迫整个产业正视:当模型强大到某个程度,对待它的方式是否也需要随之改变?

