OpenAI 本周公开了一份内部报告,说明其安全团队如何在生产环境部署 AI 代码代理 Codex。核心策略是 沙盒限制执行边界 + 自动审批低风险行为 + AI 安全分类代理处理告警,让开发效率与企业安全控管同步运作。
沙盒与审批:明确边界,决定何时停下
OpenAI 指出,部署 Codex 的核心原则只有一条:让代理在明确的技术边界内保持高效,低风险行为不打断用户,高风险行为必须停下来等人审核。这一原则落地为两个互补机制:沙盒与审批策略。
沙盒定义 Codex 的执行空间,包括可写入哪些路径、是否允许外连网络、哪些系统目录受保护。沙盒之外的动作为高风险,进入审批流程。用户可一次性批准某个具体操作,或批准该类操作在整个工作阶段内自动通过。
��于日常例行操作,OpenAI 启用了 自动审核模式(Auto-review mode)。该功能将 Codex 计划执行的动作与近期操作背景同步传给一个自动审批子代理。子代理判断为低风险则直接放行,不中断用户工作流;判断为高风险或有潜在非预期后果时升级到人工确认。
网络管控同样如此。Codex 不是开放式外连访问,OpenAI 维护一份允许清单,列出工作流程中需要触及的目标域名。清单外域名默认封锁,遇到不熟悉的域名则触发审批流程。
身份验证也被纳入管控。CLI 与 MCP OAuth 凭证存放在操作系统安全密钥环中,登录强制走 ChatGPT 企业工作区,Codex 操作被纳入 ChatGPT 企业版合规日志平台,安全团队可统一查阅。
指令分层:哪些免审,哪些直接封
OpenAI 不将所有 Shell 指令视为同等风险,而是建立了一套分层规则。工程师日常开发中常见的无害指令,允许在沙箱外直接执行,无需审批。特定高危指令则直接封锁或强制审批。
这套规则通过三个层次叠加生效:云端管理需求(管理员强制,用户无法覆盖)、macOS 受管偏好设置、本地需求配置文件。这种架构让 OpenAI 在保持全公司统一基准线的同时,可按团队、用户群组或环境需求测试不同配置组合。相同设置适用于 Codex 桌面应用、CLI 及 IDE 扩展组件等所有本地界面。
对比外部研究:AI 生成代码出现安全漏洞的比例比人工编写代码高出 57%。GitHub Copilot 今年也被曝光存在 CVSS 9.6 的严重漏洞(CVE-2025-53773),可通过提示注入实现远程代码执行。这些数据说明,企业采用 AI 代码代理时若缺乏分层控管,暴露面会超出预期。OpenAI 的做法是将控管逻辑写入配置层,而非依赖 AI 代理自身的判断。
AI 分类代理:追踪 Codex 行为动机
安全控管再好,部署后仍需可视性。传统安全日志能回答“发生了什么”,但安全人员真正需要知道的是 “Codex 为什么这样做”以及“这是用户的本来意图吗”。
OpenAI 让 Codex 支持 OpenTelemetry 日志输出,记录范围包括:用户提示、工具审批决策、工具执行结果、MCP 服务器使用情况、网络代理的允许或拒绝事件。企业及教育机构客户可通过 OpenAI 合规平台访问这些日志。
更关键的是,OpenAI 内部将这些日志接入了一个 AI 安全分类代理。当端点检测工具发现 Codex 的可疑行为并触发告警时,该代理自动调取相关 Codex 日志,重建原始请求、工具活动、审批决策、工具结果及网络策略记录,生成分析报告后送交安全团队审阅,协助判断是正常代理行为、无害误操作还是需要升级处理的事件。
同一套遥测数据也用于内部运营分析:追踪采纳趋势、评估哪些工具和 MCP 服务器使用最频繁、判断网络沙箱的封锁与触发频率、找出仍需调整的配置环节。这些 OpenTelemetry 日志可集中导入 SIEM 与合规日志系统。

