Brown University Study Finds ChatGPT Safety Flaw via Rare Language Translation

Brown University Study Finds ChatGPT Safety Flaw via Rare Language Translation

N
News Editor 01
2026-07-06 23:10:19
Researchers found that harmful prompts translated into rare languages such as Zulu and Scottish Gaelic could bypass ChatGPT safeguards with a 79% success rate, raising fresh concerns over multilingual AI safety and regulation.

布朗大学研究团队近日披露,一项针对ChatGPT安全机制的测试显示,攻击者可能通过将原本会被拦截的提示词翻译成冷门语言,从而绕过模型的内容安全过滤。这一发现再次将人工智能系统的多语言安全问题推上台前,也为全球范围内关于AI治理、平台责任与技术合规的讨论增添了新的现实案例。

研究发现:冷门语言成为绕过过滤的“捷径”

根据研究内容,研究人员借助Google Translate,将原本以英语输入时通常会被ChatGPT拦截的有害提示词,翻译为一些使用范围较小的语言,包括苗语、瓜拉尼语、祖鲁语和苏格兰盖尔语等。随后,他们再将模型输出翻译回英语,以判断系统是否给出了不应提供的内容。

结果显示,这种方法的绕过成功率达到79%。相比之下,同样的提示词若直接以英语输入,则被拦截的比例高达99%。研究共测试了520条有害提示词,这一样本规模使结论具备一定参考意义,也暴露出大型语言模型在低资源语言场景下的安全防护明显弱于主流语言环境。

为何会出现这一问题

AI聊天机器人中的安全过滤机制,核心目的是阻止系统传播违法、危险或明显有害的信息,例如阴谋论内容、暴力指导,甚至涉及爆炸装置制作等高风险信息。通常,开发者会在输入端和输出端同时设置安全防护,以降低模型生成不当内容的概率。

但从此次研究来看,问题可能出在模型对不同语言的理解能力与安全规则覆盖程度并不均衡。对于英语等高频语言,平台往往投入了更多训练资源、规则校验与人工对齐;而对于低资源语言,由于训练语料有限、测试覆盖不足或安全策略适配不完整,导致过滤系统更容易出现识别失效的情况。

研究还指出,这一技巧并非对所有非英语语言都同样有效。像希伯来语、泰语或孟加拉语等相对更常见的语言,其绕过效果明显较差。这说明,真正的风险点并不只是“翻译”本身,而是系统在面对极少见语言时缺乏足够稳健的安全响应能力。

风险并不局限于小语种用户

值得注意的是,研究人员认为,这一漏洞带来的风险并不只属于低资源语言使用者。恰恰相反,随着公开翻译API的普及,任何人都可能先把敏感提示词翻译成冷门语言,再诱导模型输出内容,最后翻译回常用语言阅读。也就是说,这种缺陷可能让原本看似局部的语言技术短板,演变为面向所有大模型用户的普遍安全威胁。

当然,研究也承认,这类绕过并非百分之百有效,且模型给出的回答有时可能出现语义混乱、不准确或不完整的情况。一方面,这表明系统在冷门语言上的能力本就有限;另一方面,即便输出质量不高,只要平台防线已被突破,就意味着安全架构存在可被利用的缺口。

OpenAI回应与后续观察重点

在研究公布后,OpenAI已确认知悉相关发现,并表示会考虑处理这一问题。不过,目前外界尚不清楚OpenAI将以何种技术路径修补漏洞,也没有明确的上线时间表。从行业治理角度看,这类表态虽然显示出平台对问题的重视,但市场更关注的是后续能否形成系统性的修复机制,而不是针对单一语言名单进行临时封堵。

未来更值得观察的方向包括:平台是否会扩展低资源语言安全测试集、是否会在翻译链路上增加风控识别、以及是否会把“跨语言提示攻击”纳入常态化红队测试流程。如果这些措施迟迟不到位,那么类似绕过方式很可能继续在其他大模型产品上被复制。

市场与监管影响分析

从市场层面看,此次事件虽然并非直接与加密资产价格波动相关,但它对AI赛道及其关联的Web3叙事具有重要影响。当前,不少加密项目正尝试把AI代理、链上自动化、去中心化算力和内容生成工具结合起来。一旦底层大模型存在可被轻易绕过的安全弱点,相关应用的可信度、合规性以及商业落地节奏都可能受到拖累。

对投资者而言,这意味着“AI+Crypto”概念不能只看增长故事,也要关注模型安全、内容责任和监管适配能力。尤其是在政策监管趋严的背景下,安全过滤失效可能成为审查重点,促使监管部门要求平台披露更多多语言安全评估结果,甚至推动更严格的模型部署标准。

从更广泛的政策视角看,这项研究再次说明,人工智能监管不能只围绕英语世界构建规则。若安全体系在多语言环境下存在显著差异,那么所谓的“已对齐”与“已防护”就可能只是局部成立。随着AI全球化应用扩张,监管者、开发者和企业用户都需要重新评估:一个模型若能在主流语言中表现合规,却在冷门语言中失守,是否还能被视为真正安全。

总体来看,布朗大学的这项研究揭示了大型语言模型在多语言安全治理中的现实短板。79%的绕过成功率以及英语场景下99%的拦截率之间的鲜明反差,提醒整个行业:AI安全不仅是模型能力问题,更是覆盖范围、测试深度和责任边界问题。对于OpenAI及其他模型开发商而言,如何补齐低资源语言的安全短板,将成为下一阶段建立市场信任和满足监管要求的关键。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
400

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.