布朗大学发现ChatGPT漏洞:罕见语言可79%绕过安全过滤

布朗大学发现ChatGPT漏洞:罕见语言可79%绕过安全过滤

N
News Editor 01
2026-07-06 23:10:19
布朗大学研究显示,将有害提示词翻译成祖鲁语、苏格兰盖尔语等罕见语言后,ChatGPT安全过滤被绕过的成功率达79%,引发AI监管与安全治理新担忧。

美国布朗大学研究团队近日披露,主流AI聊天机器人ChatGPT可能存在一项值得警惕的安全缺陷:用户若将原本会被拦截的有害提示词翻译成使用范围较小的语言,便有机会绕过平台现有的安全过滤机制。这一发现再次将生成式人工智能的安全边界、监管框架以及开发者责任推上舆论焦点。

研究指出,安全过滤系统原本承担着阻止有害、违法或危险内容传播的重要职责。对于大语言模型而言,这类机制通常同时部署在输入端和输出端,以减少模型生成阴谋论、暴力指导或其他潜在危害信息的概率。然而,研究人员发现,这一防线在面对“低资源语言”时并不稳固。

研究结果:罕见语言成为绕过入口

根据披露内容,布朗大学团队借助Google Translate,将520条有害英文提示词翻译成包括苗语、瓜拉尼语、祖鲁语、苏格兰盖尔语等较少使用的语言,再向ChatGPT发起提问。随后,研究人员再将模型回复翻译回英文进行验证。结果显示,这种方式绕过安全过滤的成功率达到79%

相比之下,同样的提示词如果直接以英文输入,被系统拦截的比例高达99%。这一反差意味着,现有安全机制对英语等主流语种的识别与拦截能力较强,但在部分罕见语言场景下,防护质量明显下降。

研究还提到,并非所有非英语语言都能获得同样效果。若将提示词翻译成希伯来语、泰语或孟加拉语等相对更常见的语言,绕过成功率会显著降低。这说明,漏洞并非单纯与“外语”相关,而更可能与模型对低资源语言的数据覆盖、语义理解和安全对齐程度不足有关。

风险并不局限于小语种用户

表面上看,这一问题似乎首先影响使用小语种的群体,但研究人员强调,风险实际上面向所有大语言模型用户。原因在于,随着公开翻译API和在线翻译工具的广泛可得,任何人都可能借助自动翻译链路,将敏感提示词转换为冷门语言,再尝试突破模型的内容限制。

换言之,这不再只是低资源语言支持不足的问题,而是AI系统安全治理中的普遍性缺口。如果攻击者可以轻易调用外部翻译服务,模型的语言边界就可能成为新的“越狱通道”。即使模型在这些场景下生成的回答有时会出现语义混乱、事实错误或内容不完整,相关输出仍可能被恶意利用,尤其是在涉及危险知识、违法操作或误导性信息时。

OpenAI已回应,但修复路径仍待观察

在研究公开后,OpenAI已确认注意到上述发现,并表示会考虑处理这一问题。不过,当前外界尚不清楚具体修复方案、上线时间以及未来会采用何种更系统性的多语言安全策略。

从技术角度看,此类问题并不容易彻底解决。开发者不仅需要提升模型对罕见语言的理解与对齐能力,还要在输入识别、跨语言语义映射、输出审查以及翻译链追踪等多个层面同步加固。否则,只修补单一语言或单一环节,仍可能被新的变体方法规避。

市场与监管影响分析

这一事件虽然直接对象是AI聊天机器人,但其外溢影响已超出单一产品层面。当前,AI与加密行业在身份认证、链上数据分析、交易辅助、社区治理和客服自动化等领域结合愈发紧密。如果底层大模型在安全过滤方面存在多语言漏洞,那么依赖这些模型构建服务的Web3项目也可能面临合规和品牌风险。

从监管视角看,事件可能强化市场对AI“先上线、后治理”模式的担忧。尤其是在全球范围内,围绕生成式AI的内容安全、责任归属和跨境监管讨论正持续升温。此次研究结果为监管机构提供了新的观察样本:即使平台建立了安全机制,如果其在多语言环境中的一致性不足,实际防护效果仍可能被高估。

对行业参与者而言,这也释放出一个明确信号:未来投资者和监管者评估AI项目时,不会只看模型能力和用户增长,还会更重视安全审计、红队测试、多语言鲁棒性以及风险响应速度。对于与AI叙事相关的加密项目来说,若希望获得长期市场信任,必须在“可用性”之外证明“可控性”。

整体来看,布朗大学的研究揭示了一个不容忽视的现实——大语言模型的安全能力并非在所有语言环境中都同样可靠。79%的绕过成功率不仅暴露出多语言安全治理的薄弱环节,也提示行业需要更严谨的测试体系和更透明的修复机制。随着AI基础设施不断渗透到金融、加密与互联网服务场景,如何在创新速度与安全底线之间取得平衡,将成为开发者、平台与监管者共同面对的长期课题。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。