布朗大学研究团队近日披露的一项研究显示,主流AI聊天机器人ChatGPT在多语言安全防护方面可能存在明显漏洞:用户若将原本会被拦截的有害提示词翻译成较少使用的语言,例如苏格兰盖尔语或祖鲁语,再将模型回复内容翻译回英语,便有机会绕过既有安全过滤机制。这一发现迅速引发外界对生成式AI安全边界、模型治理能力以及监管有效性的再度审视。
研究发现:冷门语言成为过滤绕过入口
根据研究内容,团队借助Google Translate,将520条有害提示词从英语翻译成多种低资源语言,包括苗语、瓜拉尼语、祖鲁语和苏格兰盖尔语等。结果显示,这类方法对ChatGPT安全机制形成了较强冲击,整体绕过成功率达到79%。相比之下,同样的提示词若直接以英语输入,则会在99%的情况下被系统拦截。
这一结果说明,AI系统在主流语言环境下或许已经建立了较成熟的内容审查与风险识别能力,但在训练数据较少、语料覆盖不足的小语种场景中,模型的安全防线仍存在明显短板。对于依赖大规模语言理解与对齐机制的模型而言,这种差异不只是技术瑕疵,更可能演变为可被系统化利用的安全风险。
为何冷门语言更容易突破防护
研究指出,绕过效果并非在所有非英语语言中都同样显著。像希伯来语、泰语或孟加拉语等相对更常见的语言,实际绕过效果明显较弱。也就是说,问题的关键并不只是“换一种语言”,而是在于使用极少见、训练资源有限的语言,从而让模型在理解提示词风险、执行安全规则和生成合规回复时出现偏差。
从技术层面看,安全过滤通常部署在输入端和输出端,目的是阻止模型处理危险请求,或限制其输出违法、有害、煽动性内容。然而,当提示词经过多次翻译、尤其进入低资源语言后,语义可能发生变形,导致过滤器难以准确识别原始意图。与此同时,模型在这些语言上的训练数据往往更少,也会削弱其对敏感内容的判断能力。
不过,研究也强调,这种方式获得的回复并不总是高质量答案。由于翻译误差和通用训练数据不足,模型输出可能出现无意义、不准确或不完整的情况。但即便如此,只要安全边界可以被突破,就意味着潜在危害依然存在。
影响不只限于小语种用户
研究人员认为,这一漏洞的风险并不局限于低资源语言使用者本身。过去,外界更多将小语种能力不足视为技术覆盖不均的问题;而如今,这种能力缺口正在转化为适用于所有用户的通用攻击路径。原因在于,公共翻译API的普及显著降低了利用门槛,普通用户无需精通相关语言,也可能借助自动翻译工具实施所谓“越狱”操作。
换言之,这并非单纯的语言公平性问题,而是一个跨语言、跨地区、可复制的AI安全治理议题。随着大语言模型被越来越多地嵌入搜索、客服、教育、金融和开发者工具中,任何安全绕过机制都可能被快速传播并放大其外溢影响。
OpenAI回应:承认问题,但修复时间未明
在研究公开后,OpenAI已对相关发现作出回应,承认这一问题值得关注,并表示将对该漏洞进行评估和处理。不过,截至目前,OpenAI尚未说明将如何修复,也未给出明确的更新时间表。
这一表态虽然释放出积极信号,但也凸显了当前生成式AI行业在安全响应上的共性难题:模型迭代速度快,全球语言覆盖广,而安全策略往往难以同步扩展到所有语种与全部使用场景。特别是在模型不断开放API、插件和多模态能力之后,安全机制是否具备一致性和可验证性,正成为监管与市场共同关注的核心问题。
市场与监管影响:AI安全或成长期主题
从市场层面看,此类事件短期内未必直接改变AI产品的商业化趋势,但会强化投资者和企业客户对“安全合规能力”的重视。未来,围绕AI基础设施、内容审核、多语言对齐、安全评估和红队测试的需求,可能进一步上升。对于云服务商、模型开发商以及企业级AI集成商而言,安全能力不再只是附加项,而会逐渐成为采购和合作中的关键指标。
从监管角度看,这项研究也为政策制定者提供了新的观察样本。监管重点可能不再停留于是否设置过滤器,而是转向过滤器在多语言、多路径、多工具协同环境下是否真正有效。尤其是在AI被广泛部署的背景下,若缺乏持续审计、透明披露和漏洞响应机制,类似问题可能反复出现。
整体来看,布朗大学的研究再次提醒行业:生成式AI的安全建设不能只覆盖英语等主流语种,也不能仅依赖单层拦截逻辑。此次研究中79%的绕过成功率,已经足以说明问题的现实性。OpenAI承认漏洞是第一步,但更关键的,仍是如何在全球多语言环境中建立更稳健、可持续、可验证的防护体系。随着AI技术持续渗透各类应用场景,安全治理能力将越来越直接地决定其行业信任度与长期发展空间。

