Brown University Study Reveals ChatGPT Safety Flaw Through Rare Language Prompt Translation

Brown University Study Reveals ChatGPT Safety Flaw Through Rare Language Prompt Translation

N
News Editor 01
2026-07-06 23:10:19
Researchers found that translating harmful prompts into rare languages such as Zulu or Scottish Gaelic could bypass ChatGPT safety filters with a 79% success rate, raising concerns over multilingual AI safety and regulation.

布朗大学研究人员最新披露的一项实验显示,主流人工智能聊天机器人ChatGPT存在一项值得警惕的安全漏洞:用户可通过将原本会被拦截的敏感提示词翻译成使用率较低的语言,进而绕过平台既有的安全过滤机制。这一发现再次把大模型安全、内容审核边界以及AI监管有效性推上舆论焦点。

研究发现:冷门语言成为绕过过滤的突破口

根据研究内容,团队借助Google Translate,将原本使用英文输入、通常会被ChatGPT屏蔽的有害提示词,转换为多种低资源语言,例如苏格兰盖尔语、祖鲁语、苗语和瓜拉尼语。随后,研究人员再将模型给出的回复翻译回英文,以评估其是否成功规避审查。

结果显示,在涉及520条有害提示词的测试中,这种方法实现了79%的绕过成功率。相比之下,同样内容若直接以英文输入,系统的拦截率高达99%。这一对比说明,现有安全策略在英语等主流语种上的防护较为严格,但在覆盖低资源语言时仍存在明显短板。

为何语言差异会影响安全过滤效果

安全过滤器的核心作用,是阻止模型生成违法、危险或明显有害的信息,包括阴谋论扩散、暴力指引,甚至爆炸物制作说明等内容。通常,开发者会在输入端和输出端同时设置防护规则,尽可能降低模型参与危险对话的概率。

但这项研究表明,当提示词被翻译成极少见语言后,模型的识别与审查能力会出现下降。研究还指出,这种技巧在“非常冷门”的语言上效果最明显;若改用较常见的语言,如希伯来语、泰语或孟加拉语,绕过效果则明显减弱。这意味着,大模型的安全能力与训练数据覆盖度、语言理解精度以及审核规则的多语种适配水平密切相关。

不过,研究人员也强调,这种绕过并非完美无缺。由于翻译误差、训练语料稀缺或模型理解不充分,生成内容有时可能出现不完整、不准确甚至语义混乱的问题。即便如此,只要危险信息存在被输出的可能性,相关风险就不能被忽视。

OpenAI回应:承认问题,但修复时间未定

在研究公开后,OpenAI已确认知悉这一发现,并表示会对相关漏洞进行考虑和处理。不过,截至目前,官方尚未披露具体的修复方案,也未说明何时完成针对该问题的安全升级。

从行业角度看,这类回应表明头部AI企业已意识到多语种安全并非边缘议题,而是影响产品全球化落地的核心环节。特别是在人工智能工具面向全球用户开放的背景下,只针对英语环境构建高强度安全防线,显然难以满足现实需求。

对行业与监管的启示

这项研究释放出的一个关键信号是:AI风险不再只是“低资源语言用户受限”这样单向度的技术不平等问题,而可能演变为影响所有用户的普遍性安全威胁。随着公开翻译API的普及,原本并不掌握相关语言的普通用户,也可能借助工具轻松尝试类似“越狱”方法,从而放大漏洞被滥用的概率。

对于政策制定者而言,这一案例凸显了AI监管不能只停留在模型能力、版权或数据来源层面,还应更加关注内容安全、跨语言一致性治理与可审计性。如果大型语言模型在不同语言环境中执行不同强度的安全标准,那么其全球部署所带来的治理复杂度将显著上升。

对于开发者和平台方来说,下一步重点可能包括:扩大低资源语言的安全训练样本、改进多语种输入识别机制、提升输入输出两端的联动审核能力,并对机器翻译链路带来的风险进行专门测试。只有把安全评估从单语种扩展到真正的全球语境,才能减少类似漏洞的反复出现。

市场影响分析:AI安全议题或外溢至科技与加密叙事

从市场层面看,虽然此次事件聚焦于ChatGPT本身,但其影响很可能外溢至整个AI赛道,尤其是那些强调“去中心化AI”“链上AI代理”或“AI基础设施”的项目。投资者通常会把安全性、合规性和可控性视为AI商业化的重要前提,一旦头部产品暴露审查绕过漏洞,市场对相关技术的风险定价可能趋于谨慎。

在加密行业,这类消息同样值得关注。当前不少区块链项目正尝试把AI模型、自动化代理和开放网络结合,但开放性越强,往往越需要更坚实的安全约束。若AI模型在多语言条件下容易被绕过,其与加密系统结合后,可能进一步引发诈骗信息生成、自动化社工攻击或违规内容传播等连锁风险。因此,AI与加密融合的未来叙事,除了效率和创新,也将越来越依赖安全治理能力来支撑估值与用户信任。

整体来看,布朗大学的研究并未证明ChatGPT的安全体系完全失效,却清楚揭示了当前大模型在多语种治理上的脆弱性。79%的绕过成功率足以提醒行业:只要安全标准存在语言差异,模型就可能被找到新的突破口。OpenAI已作出回应,但真正的挑战在于,如何在全球化部署与开放可用之间,建立更稳固、更一致的安全防线。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
400

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.