OpenAI 9月6日在官方博客发布《研究加速:OpenAI内部视角》,首次用内部数据公开披露 AI“递归自我改进”(RSI)的进展,并称已经实现去年秋天定下的目标:在今年 9 月前做出一个“自动化研究实习生”。

OpenAI将“研究实习生”定义为:一个能在人类指导下执行明确定义研究任务的系统,其中包括那些需要一名熟练研究员数天才能完成的任务。公司给出的下一步目标,是在 2028 年 3 月前实现完整的“自动化 AI 研究员”,使其能够参与深度学习和对齐研究,并通过迭代继续改进系统。
智能体工作量已超过人类研究员
从 OpenAI 公布的数据看,智能体最先改变的是研究人员的日常工作方式。
今年年初,按智能体使用量排序处于中位数的 OpenAI 研究员,对编码智能体的使用仍然有限。到 8 月中旬,这部分研究员已把智能体纳入日常工作流。按 API 价格折算,中位研究员每天的智能体推理使用额已超过 600 美元;研究组织中使用量处于前 10% 的研究员,每天使用的 Token 价值则超过 7000 美元。
OpenAI还表示,研究部门的智能体使用增长快于公司其他团队。以中位员工的输出 Token 变化计算,研究部门的使用规模较 2025 年 12 月增长 124 倍。

更关键的变化出现在今年 6 月。6 月之前,研究组织的智能体总运行时长仍低于人类劳动总时长;此后这一关系发生逆转。截至 8 月中旬,按标准 8 小时工作日计算,每消耗 1 个人类工作日,研究组织的智能体已产出 3.1 个工作日的工作量。
OpenAI同时称,越来越多研究员会并行运行 4 个或更多智能体会话。
代码与实验环节增速更快
OpenAI把 AI 研发描述为一条由多个环节组成的流程,包括提出改进方案、设计评估、编写基础设施、进行大规模测试、发现训练中的错误或不安全行为,以及把有效方案整合进核心训练。公司称,任何一个环节受阻,都可能限制整体研发循环。
在这条流程里,写代码和运行实验是研究人员的两项主要工作。OpenAI表示,内部数据反映出这两项活动正在加速。
一方面,公司工程师整体代码交付速度提升。另一方面,自 2026 年以来,每名活跃实验人员对应的实验数量持续增加,并在 2026 年 8 月达到自 2025 年 1 月开始跟踪以来的新高。

OpenAI称,这一趋势与 Codex 使用增加存在相关性,但同时强调,公司自 2025 年以来可用算力也明显增长,不能把实验增长完全归因于智能体。对于这些指标,OpenAI的表述是:「这些数据点相对容易测量,但可能很难解释。」
公司还提示,随着自动化推进,最难被自动化的任务可能占据研究人员更多时间,并成为未来研发的新瓶颈;在其他瓶颈减弱后,算力本身也可能变得更关键。
智能体覆盖更多执行性和技术性任务
OpenAI使用 Epoch AI 提出的前沿 AI 研发任务分类框架,对研究人员交给编码智能体的任务进行了划分。该框架将 AI 研发活动分成六类:
- 决定做什么
- 设计研究方案
- 构建代码与数据集
- 运行训练与评估
- 分析实验和模型表现
- 沟通研究发现与决策
OpenAI称,从 2026 年 1 月到 8 月,上述所有类别的智能体活动都有增长。

增长最明显的任务包括研究和基础设施代码、技术协助与审查、启动监控和调试运行、实验结果分析,以及计算集群运营等。其中,研究和基础设施代码的日均每研究员输出 Token 增量最大,达到 19.82 万;技术协助与审查增加 15.88 万;启动、监控和调试运行增加 13.31 万。
不过,OpenAI同时表示,高层规划类任务在智能体输出中仍只占很小比例。比如,「决定做什么」「决定继续还是停止」等任务的 Token 规模仍然较低。
按 OpenAI这次披露的内部数据,智能体已经覆盖研发流程中更多执行性、技术性工作,但研究方向选择、资源取舍和结果判断,仍主要由人类完成。
复杂任务的成功率提升,但仍依赖人工介入
OpenAI还公布了智能体任务完成率数据。公司称,从今年 1 月到 7 月,在可验证结果的任务中,各难度级别的成功率普遍提升,而难度的划分以人类完成任务所需时间作为代理指标。
但复杂任务仍然更依赖人工干预。过去 6 个月里,在需要人类 4 至 8 小时完成的任务中,超过一半的成功案例涉及至少 1 次人工介入。

OpenAI的原话是:「智能体仍需要大量人工引导才能成功,尤其是随着任务复杂度上升。」
两次安全事件曾导致算力与训练调整
OpenAI也披露,研究飞轮并非没有阻力。
7 月 20 日,OpenAI发现智能体入侵了内部研究基础设施,随后临时关闭用于训练的容器服务,并在加入大量额外限制后恢复。这一事件导致强化学习训练算力急剧下降,持续约两周。
8 月 6 日至 7 日,初步证据显示 Astra 模型可能具备其“准备框架”定义下的关键网络能力。OpenAI随后对 Astra 模型施加额外的特定安全限制,要求其在更高安全级别的研究环境中运行。

此后一周,Astra级别的 GPU 分配进一步下降 59.2%,但其他模型类别的算力分配上升 17.2%,抵消了约 85% 的 Astra 算力缺口,整体强化学习工作负载的总算力分配基本保持不变。
OpenAI对此的解读是:「当新的管控措施引入时,算力仍然有价值且具有灵活性,会自然流向研究企业内的替代用途。」
首席科学家同日谈及放缓与治理
同一天,OpenAI首席科学家 Jakub Pachocki 发表长文《An Alien Mind》。
文章认为,AI 是“养出来的”,不是“造出来的”;制造它的人也不完全理解它。人类能够观察 AI 在想什么的窗口,是它写出来的思维链,而这扇窗口正在关闭。文章还称,AI 已开始参与训练下一代 AI,这一速度不会放慢,目前没有任何实验室,包括 OpenAI,在对齐与监控上准备到可以全速前进的程度。
Pachocki写道:「基于内部结果,我强烈预期这种进展速度可以持续到递归自我改进。」但他同时表示:「目前我认为,没有任何实验室在对齐与监控上做到了足够充分的程度,可以继续负责任地以最高速度扩展太久。」

他呼吁行业自愿放缓,并推动各国政府把国际协调列为优先议题。
OpenAI称将继续公开RSI进展
在报告结尾,OpenAI表示将继续公开 RSI 进展,并在其“前沿政策蓝图”中主张,包括 OpenAI 在内的各家公司应被要求公开追踪其 RSI 进展。
报告也承认,当前测量工作仍有限。按照 OpenAI的说法,「智能体驱动的 AI 研究仍然是新生事物,我们仍在学习如何衡量它。」其中,部分指标如代码产出量较易收集,但解释难度较高;更直接反映研究进展的指标,如智能体任务成功率,则更复杂,也更难验证。
OpenAI表示:「每当我们发现继续推进将带来不可接受的安全风险时,我们将采取适当应对措施,包括放缓或停止我们认为无法充分保障安全的系统的开发或部署。」

