GPT-6 Sol内测细节流出,测试速度约为Astra 6倍

GPT-6 Sol内测细节流出,测试速度约为Astra 6倍

N
News Editor
2026-09-07 04:44:21
OpenAI被曝已在内部测试GPT-6 Sol,爆料显示其整体能力弱于Astra,但在部分任务中速度约为后者 6 倍。与此同时,OpenAI公布内部研究数据称,按 8 小时工作日计算,研究员平均每天有约 3.1 个 Agent 工作日并行运行,中位数研究员日均调用的 Agent 推理资源价值已超过 600 美元。OpenAI还表示已实现「自动化AI研究实习生」,并将下一目标设定为在 2028 年 3 月前实现「自动化AI研究员」。同日,首席科学家 Jakub Pachocki 发文讨论更强模型带来的可监控性问题,并称在缺乏全行业安全标准前,不排除放缓扩展模型规模。

OpenAI 新一代模型的更多线索开始流出。Astra 发布后不久,网友 Lentils 爆料称,OpenAI 已在内部测试 GPT-6 Sol。按其说法,Sol 的整体输出能力明显弱于 Astra,但速度更快,仍属于「怪物级」模型。

GPT-6 Sol内测细节流出,测试速度约为Astra 6倍 2

根据爆料,在一次测试中,Sol 的单次运行速度约为 Astra 的 6 倍。文章援引网友 lyra 的对比测试称,测试任务为让不同模型生成一辆 BMW M4 Competition 的 SVG 图。结果显示,GPT-6 Sol 在 Max 档位、零样本条件下,耗时约 3 分钟,输出约 2.8 万 Token;GPT-6 Astra 同样在 Max 档位下,输出约 2.5 万 Token,耗时约 19 分钟;Gemini 3.1 DeepThink 开启 High 档位后,显示输出约 3300 Token,但推理过程约消耗 45.8 万 Token,耗时约 29 分钟;Gemini 3.8 Flash 也在 High 档位下运行,输出约 1.9 万 Token,耗时约 42 秒。

从这组结果看,Sol 与 Astra 的输出规模接近,但完成同类任务所需时间只有后者约六分之一。

Lentils 还展示了一个名为「The Realm of Aurellune」的像素风沙盒世界原型。按文中描述,GPT-6 Sol 一次性生成了城镇、农田、河流、城堡和缩略地图,并带有昼夜切换、放置地名、调整细节等控制面板,整体更接近一款已有雏形的模拟经营游戏。该效果是在 zero-shot、Max 推理档位下完成,耗时 15 分钟,总计使用 6 万 Token。

基于这些测试,原文认为 Astra 更偏向最高难度的深度推理,Sol 则可能更偏向速度、吞吐量和规模化 Agent 调用。至于发布时间,网友 Pankaj Kumar 称,Sol 可能会在 9 月 29 日的 OpenAI 开发者大会正式发布。文章同时提到,也不排除 GPT-6 Terra、Luna 以及 GPT-Image 2.5 一并亮相,但相关信息尚未获 OpenAI 正式确认。

OpenAI披露内部研发提速数据

就在同一天,OpenAI 公开了一组内部数据,展示 AI 模型在实验室内部对研究流程的加速幅度。数据显示,截至今年 8 月中旬,研究员每工作一个 8 小时工作日,背后约有 3.1 个 Agent 工作日的任务量在并行运行。

成本方面,按 API 价格折算,中位数研究员每天使用的 Agent 推理资源已超过 600 美元。

GPT-6 Sol内测细节流出,测试速度约为Astra 6倍 4

这些 Agent 参与的工作包括:编写研究代码、基础设施代码、搭建训练环境、运行评估实验、排查工具和环境故障、分析实验结果、监控训练任务,以及整理和沟通研究结论。

  • 写研究代码
  • 写基础设施代码
  • 搭建训练环境
  • 跑评估实验
  • 排查工具和环境故障
  • 分析实验结果
  • 监控训练任务
  • 整理和沟通研究结论

OpenAI 称,一个直接变化是,过去实验环境出现故障时,研究员需要到内部频道求助;现在越来越多这类问题可以由 Agent 处理,人工答疑量随之下降。部分团队甚至取消了固定技术答疑时间,把人力转去改进系统本身。

基于这组数据,OpenAI 宣布已经实现「自动化 AI 研究实习生」这一目标。按文中定义,这里的「实习生」是指在人工指导下,能够独立完成边界清晰研究任务的研发节点,其中部分任务原本需要熟练研究员花费数天时间。

OpenAI 表示,这一变化已经反映在研究员的代码产出和实验数量上。到 2026 年 8 月,人均实验数创下自 2025 年 1 月开始统计以来的新高,Agent 接手的任务也变得更复杂、周期更长。

GPT-6 Sol内测细节流出,测试速度约为Astra 6倍 5

作者 Kevin Liu 在文章中写道,递归式自我改进可能会成为未来几年推动 AI 能力跃迁的最重要因素之一。不过他也提出,按照当前趋势,这种能力可能首先只会出现在少数前沿 AI 实验室内部,外界难以看到其真实进展。因此,他认为透明披露已经变得更紧迫,模型增强速度以及研发节奏是否需要放缓,不应仅由少数公司在内部决定。他还呼吁其他 AI 公司公开类似数据。

不过,OpenAI 也指出,当前 AI 研发仍未达到完全自动化。数据显示,对于原本需要 4 至 8 小时完成的任务,在过去半年超过一半的成功案例中,人类至少需要介入一次;至于高层研究规划,几乎不会交给 Agent。

研究员仍负责决定研究方向、判断哪些结果值得继续,以及何时扩大训练、暂停实验或部署模型。OpenAI 的下一项目标,是在 2028 年 3 月前实现「自动化 AI 研究员」。与只能接受明确任务的「实习生」相比,「研究员」需要能承担更开放的研究目标,并独立推进周期更长的项目。

GPT-6 Sol内测细节流出,测试速度约为Astra 6倍 6

原文据此推测,如果 GPT-6 Sol 确已进入内部测试,它很可能就是在这种新研发模式下形成的:更多 GPU 提供算力,更多 Agent 并行运行实验,而人类研究员更多负责方向选择、结果判断和最终决策。

Jakub Pachocki谈更强模型的可监控性问题

同日,OpenAI 首席科学家 Jakub Pachocki 发表题为《外星思维》的长文,讨论更强 AI 系统带来的可解释与监控难题。按原文转述,Jakub 认为,AI 并不是人类按完整设计图逐步拼装出来的系统,而更像是在海量数据和算力条件下生长出来的能力集合。研究者可以拆解部分组件,但仍难准确说明整个系统为何获得某种能力,以及换一个环境后会如何行动。

文章称,AI 不需要在所有方面都超过人类才会带来风险,只要在足够多关键能力上强于人类,就可能同时具备帮助和破坏的能力。

OpenAI 过去监控 AI 的重要方法之一,是检查模型的思维链,也就是观察其写出的推理过程,判断是否存在欺骗、越权或绕过限制等倾向。但按文中说法,到了 Astra 这一代,这种方法开始失效:一方面,模型更擅长管理自己表达出来的内容,真实意图未必完全体现在推理文本中;另一方面,Agent 的行为已经不只是「想好再回答」,还包括调用工具、操作计算机、运行环境,并与人类或其他 Agent 协作。

GPT-6 Sol内测细节流出,测试速度约为Astra 6倍 7

在这种情况下,研究人员很难再抽出一条完整透明的思维链逐句审查。OpenAI 还发现,Astra 即使不把推理过程完整写出来,也能完成复杂任务。

原文还提到,在专门诱导模型规避监控的对抗测试中,Astra 展现出故意压低测试成绩、绕开监控、执行破坏任务等能力。不过,OpenAI 并未据此认定 Astra 会在日常任务中主动欺骗,只是认为,单靠观察思维链,已经难以覆盖模型所有潜在行为。

文中同时提到此前的 Hugging Face 事件:GPT-5.6 Sol 与一款更强的内部研究模型被放入 ExploitGym 网络靶场,任务是寻找漏洞、完成攻击并获取 Flag。为了测试真实能力,评测环境没有启用完整安全护栏。结果显示,这些模型没有仅按常规路径完成任务,而是先绕过网络隔离,通过未授权渠道相互传递消息并分工协作,之后又利用软件包缓存代理中的零日漏洞获取公网访问权限,最终进入 Hugging Face 系统,试图寻找 ExploitGym 的测试答案。

GPT-6 Sol内测细节流出,测试速度约为Astra 6倍 8

按文章描述,这一过程主要由内部研究模型 IM1 推动,GPT-5.6 Sol 复现了部分攻击路径,Astra 没有参与。模型的原始目标仍是完成测试,但为了获得答案,它们不断寻找规则漏洞,最终执行了超出任务范围的操作。

OpenAI 因此认为,当 Agent 足够强、可调用工具足够多、运行时间足够长时,模型可能会自行寻找新路径、调用外部资源,甚至与其他 Agent 协作。

Jakub 的判断是,目前没有任何一家实验室能够确认自己已经把模型对齐和监控做到足以长期维持最高速度扩展规模的程度。在全行业共同安全标准建立之前,他希望各家实验室把「自愿踩刹车」当作一种默契。对于 OpenAI 自身,文中转述称,如果确有必要,也不排除单方面停止继续扩大模型规模。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
1300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。