OpenAI 发布长文《面向前沿 AI 训练的安全论证》,提出前沿强化学习训练在继续推进前,应先完成结构化安全文档,理想形态参照航空、核电行业的「安全论证」。
OpenAI 在文中表示,能力跃迁后的涌现复杂性,使 AI 很难达到传统高危行业同等严谨的安全标准。目前,这套框架仍处于内部落地阶段,同时也在向外界征求反馈。
适用范围限定在前沿 RL 训练
OpenAI 明确表示,这一框架只覆盖前沿 RL 训练。至于内部部署和对外部署,仍需结合更广泛的对齐属性单独评估。
技术框架拆为三层
在技术层面,OpenAI 将安全论证拆成对齐训练、隔离与监控三层。
对齐训练
在对齐方面,OpenAI 提到多项措施,包括对 RL 环境进行自动和人工审查,调校评分器以防止奖励黑客,开展离线对齐评测与回测,并禁止自动评分器读取思维链,以避免模型学会躲避监控。
隔离
在隔离层面,OpenAI 强调多层沙箱和基础设施加固,使用训练检查点开展红队测试,限制样本之间的高带宽通信,并通过一次写入存储固化对话记录。
监控
监控方面,OpenAI 要求模型保持可监测性,对历史事故保持高召回。若出现新增风险,需要及时补充评测;对于高优先级告警,则必须在约定时限内由人工响应,或自动暂停训练。
治理和运营要求同步提出
在运营层面,OpenAI 建议由其他团队撰写异议预演,高管包括研究负责人、安全负责人、首席科学家等可以对训练开跑行使一票否决权。训练负责人则需对安全论证和事故响应承担问责。
OpenAI 还提出,一旦安全论证失效,应按手册暂停训练;相关材料需要向内部监督委员会公开,并给予审计方足够的核验权限。严重度分级需要错位设计,值班人员也应被允许在必要时直接呼叫 CEO。
系统默认应为失败关闭,不能在无监控状态下启动训练。同时,系统还需要具备回滚能力,以处理被错位模型污染的下游数据和评分。
事故调查参照航空业实践
在事故调查部分,OpenAI 提出参照航空调查实践。调查期间,应在内部进行滚动通报,利用消融和重采样追溯训练动力学,并开展运营与文化复盘。
OpenAI 还提出,应开发不直接拟合事故样本的检测评测,并把由事故衍生出的评测作为回归测试使用。调查结论、复盘结果和流程改动,应在调查结束后对外披露,受影响第三方也应尽快获知。

