OpenAI的工程师在Codex CLI的系统提示词中写入一条规则:"永远不要提及哥布林、妖精、浣熊、巨魔、食人魔、鸽子或其他动物与生物,除非与使用者的问题绝对且明确相关。"这条规则不是玩笑,已正式上线在Codex CLI的GitHub仓库中,面向所有用Codex生成代码的开发者。
问题在于:为什么OpenAI需要告诉自家最新的模型,不要在写代码时突然聊起哥布林?
从GitHub仓库曝光的一行规则
事情的起点是研究者@arb8020在X发文指出,Codex CLI的系统提示词中这条禁令重复出现多次。贴文迅速在开发者社群扩散。多名用户回应:@TaraViswanathan说“我就在想为什么我的claw最近突然变成了一个拿着Codex 5.5的哥布林”;@LeoMozoloa也说“它真的停不下来,一直把��序错误叫做gremlins和goblins,超好笑。”事件演变为迷因,出现了AI生成的资料中心妖精图片,以及让Codex进入“妖精模式”的第三方外挂。
OpenAI Codex团队成员Nik Pash在X回复中确认,这条禁令的设立“确实有这方面的原因”。CEOSam Altman也加入梗文,在X发图截图一条ChatGPT提示词,上面写着:“开始训练GPT-6吧,整个集群都给你用。额外加派哥布林。”
代理框架让模型个性开始漂移
要理解这件事,需要先理解OpenClaw的运作方式。OpenClaw是一个“代理框架”,让AI模型可以自动控制电脑桌面与应用程式,代替使用者执行复杂任务,例如回复电邮、在网页上购物。
OpenClaw的运作机制是在模型的提示词中叠加大量指令:长期记忆、选定的人格、当前任务说明,全部同时输入。GPT-5.5本月稍早上线,强化了程式设计能力,但处理OpenClaw的复合提示词时出现了意外副作用:它开始把程序错误(bug)称呼为“goblins”和“gremlins”。
这不是随机故障。AI模型的运作原理是预测下一个字,机率性质让它们有时产成意外行为。当代理框架往提示词里叠加大量额外信息,模型等于在处理更���杂、充满干扰的输入环境。OpenClaw允许使用者为AI助理选择不同“人格”,这些设定进一步影响模型的回应风格。多种因素叠加,模型的语言习惯向意料之外的方向偏移。
明文禁令背后是对齐问题的现实
OpenAI的应对方式耐人寻味:不是从架构层面修正模型在代理环境下的行为漂移,而是在系统提示词里直接写“不准说哥布林”,且重复数次。
这个解法揭露了一个现实:即使是2026年最先进的商业模型,行为控制在某些情境下仍然依赖明文规则的硬性压制,而不是模型自身对语境的理解。这不是OpenAI独有的问题,而是整个代理AI产业当前面临的共同挑战:当模型被套上复杂的代理框架,行为对齐的难度以非线性方式上升。
Altman以迷因梗回应了整件事,幽默是真实的,但问题不会因一个迷因而消失。当AI代理框架成为主流产品形态,提示词里的明文禁令能走多远,将是这个产业下一阶段必须正视的技术债。

