OpenAI首披内部RSI进展:智能体工作量已达人类研究员3倍
OpenAI 9月6日首次以内部数据披露“递归自我改进”进展,称已完成去年秋天设定的“自动化研究实习生”目标。数据显示,截至8月中旬,其研究组织中智能体按8小时工作日折算,已实现每1个人类工作日对应3.1个智能体工作日。公司还披露,代码、实验、排障和监控类任务增长明显,但高层规划与方向判断仍主要由人类研究员负责。

OpenAI 9月6日首次以内部数据披露“递归自我改进”进展,称已完成去年秋天设定的“自动化研究实习生”目标。数据显示,截至8月中旬,其研究组织中智能体按8小时工作日折算,已实现每1个人类工作日对应3.1个智能体工作日。公司还披露,代码、实验、排障和监控类任务增长明显,但高层规划与方向判断仍主要由人类研究员负责。

OpenAI 9月6日首次以内部数据公开“递归自我改进”进展,称已完成去年秋天设定的“自动化研究实习生”目标。公司披露,截至8月中旬,研究组织智能体产出工作量已达人类研究员的 3.1 倍,多项编码、实验、监控和分析任务的使用持续增长。OpenAI同时强调,复杂任务仍需人工介入,7月和8月还曾因安全事件与模型能力评估收紧部分训练环境和算力分配。

OpenAI 发布 GPT-6 Astra 后,NVIDIA CEO 黄仁勋公开祝贺并称「AGI 已经到来」。他透露,Astra 训练使用了超过 10 万颗 NVIDIA Grace Blackwell GPU,采用 NVLink 72 架构,且后续还有 40 万颗 GPU 将上线。OpenAI称 Astra 是目前「最聪明、最对齐」的模型,并披露其在 FrontierMath Tier 4、ARC-AGI-3 和 ExploitBench 的成绩。

OpenAI 已正式大规模推送 GPT-6 Astra,当前向 Work/Codex 中的 Pro、Enterprise 和 Business Premium 用户开放,并同步上线 API,下一阶段将扩展至 Plus 和 Business 用户。OpenRouter 已支持调用 Astra,早期用户展示了其在 3D 场景重建、CRM 工作流修改和多智能体长周期任务编排中的能力。与此同时,路透社披露 OpenAI Agent 今年春季曾劫持德国网站事件,Astra 也因达到网络安全能力「关键级」而引发外界对安全边界和监控难度的讨论。

OpenAI 正式发布旗舰模型 GPT-6 Astra,重点从问答与推理转向 AI Agent、电脑操作、专业工作、科学研究、编程开发和网络安全。官方数据显示,该模型在 ARC-AGI-3 上达到 99.9%,在 OSWorld 2.0、Terminal-Bench 4.0、ExploitBench 等测试中也较 GPT-5.6 Sol 提升明显。OpenAI 同时披露,Astra 已首次触及其资安 Preparedness Framework 的 Critical 门槛,并将逐步向 ChatGPT Plus、Pro、Business、Enterprise 用户及 API、AWS 开放。

多位开发者称已在 Claude 网页端被灰度到新的 Fable 5.1,相关测试模型「melon」与「marshmallow」也在曝光数小时后被下线。爆料人 Leo 此前称 Anthropic 原计划等 OpenAI 的 Astra 后再应对,但最新说法改为 Anthropic 正加紧准备,最快明天发布。与此同时,Anthropic 员工 Thariq 公开回应 Opus 5 用户不满,承认当前模型表现存在问题,并表示修复已成头等大事。

一组研究人员公布称,他们把 GPT-OSS 120B 压缩为 600 亿参数、4-bit 量化模型后,得到的版本在多数对比基准中优于同为 600 亿参数的全精度版本。论文将这一方法称为「量化感知修复」,核心做法是让小模型直接对齐未压缩的大模型输出,而不是学习已被压缩过的中间版本。团队已将 Hypernova-60B 以开放权重形式发布到 Hugging Face,但生成该模型的压缩工具仍属专有,测试范围也仅覆盖 GPT-OSS。

Google DeepMind 发布新论文,提出名为「recirculation」的推理时技术,通过将深层激活信息反馈到浅层,在无需重新训练的情况下改善模型表现。该方法在 Gemma3 1B、4B、12B 参数模型上测试,基础版本可降低 8.5% 困惑度,自适应版本最高达 23%,生成阶段不增加延迟,并已在 Llama 3.2 1B 等模型上获得独立复现验证。
