OpenAI 正式发布新一代旗舰 AI 模型 GPT-6 Astra,把能力重点从单纯的问答与推理,推进到 AI Agent、电脑操作、专业工作、科学研究、程序开发与网络安全。按 OpenAI 的说法,Astra 不只回答问题,也可以操作电脑与各类工具,完成多步骤任务。
OpenAI 首席执行官 Sam Altman 表示,希望 GPT-6 Astra 能催生新一代创业、科学发现与创造。他还称,OpenAI 认为 Astra 是目前在电脑操作、专业工作、科学、程序开发和网络安全等领域表现最好的模型。
基准测试成绩集中提升
Benchmark 数据显示,GPT-6 Astra 在 ARC-AGI-3 达到 99.9%,FrontierMath Tier 4 为 97.6%,ExploitBench 为 100%。OpenAI 还表示,Astra 的网络安全能力首次触及 OpenAI Preparedness Framework 的 Critical 门槛。
与此同时,Astra 已开始把 Computer Use、Coding、Web Search、MCP 与 Skills 等工具整合进长时间 Agent 工作流。模型竞争的焦点,也从「回答问题」继续转向「完成工作」。
从会回答到能把任务做完
OpenAI 把 GPT-6 Astra 的一项最大升级,放在任务执行能力上。与过去大型语言模型主要比拼「回答得多聪明」不同,Astra 更强调能否真正把工作完成。
根据 OpenAI 的介绍,Astra 可以直接操作电脑和浏览器,执行填写在线表格、更新 CRM 客户资料、整理日历、开展网络研究,再把结果写入电子邮件或文档等任务。更复杂的工作则包括分析科学数据、绘制图表、建立网站,以及完成前端 QA 测试。
在 OSWorld 2.0 电脑操作测试中,GPT-6 Astra 得分 72.6%,高于 GPT-5.6 Sol 的 65.7%。平均完成任务所需时间约 40 分钟,而 GPT-5.6 Sol 约为 75 分钟,时间缩短约 47%。
在模拟真实专业软件工作的 Agents Last Exam 中,Astra 得分 59.3%,高于 Claude Opus 5 的 55.5% 和 GPT-5.6 Sol 的 53.6%。OpenAI 还称,在最高分设定下,Astra 使用的输出 token 比 Claude Opus 5 少约 65%。
这让 GPT-6 Astra 更接近一个能够自主执行工作的通用 AI Agent,而不只是聊天机器人。
程序开发能力增强,Codex 支持跨 Context Window 记忆
程序开发也是 GPT-6 Astra 的主要升级方向之一。
在 Terminal-Bench 4.0 中,Astra 的成绩从 GPT-5.6 Sol 的 37.3% 提升到 57.9%;DeepSWE v1.1 则达到 74.1%。不过,并非所有编程测试都由 Astra 居首。以 Artificial Analysis Coding Agent Index 为例,Astra 得分 67.0,仍略低于 Claude Opus 5 的 68.1。
OpenAI 还在 Codex 中为 GPT-6 Astra 增加了一种保存并重新获取 Context 的方式。过去 Agent 执行大型重构或长时间调试时,Context Window 填满后通常需要通过 compaction 压缩先前内容,这个过程可能丢失「某个方法为什么失败」等细节。
Astra 则可以跨 Context Window 保留工作笔记,同时让更早之前的 Context 保持可搜索,模型因此能够重新找回先前的需求、测试结果和工具输出。
按 OpenAI 的描述,这意味着 AI Coding Agent 可执行的任务,可能会从一次性的程序生成,延伸到持续数小时甚至更长时间的软件工程工作。
ARC-AGI-3 从 7.8% 升至 99.9%
GPT-6 Astra 最受关注的一组数据来自 ARC-AGI。OpenAI 公布的结果包括:
- ARC-AGI-3:99.9%,GPT-5.6 Sol 为 7.8%
- ARC-AGI-2:95.0%,GPT-5.6 Sol 为 92.5%
- FrontierMath Tier 4:97.6%,GPT-5.6 Sol 为 83.0%
- GPQA Diamond:96.0%,GPT-5.6 Sol 为 94.6%
- Terminal-Bench Science:64.6%,GPT-5.6 Sol 为 22.4%
其中,ARC-AGI-3 用于衡量 AI 在陌生环境中的抽象推理与适应能力。按 OpenAI 公布的数据,Astra 在这项测试中的成绩已接近满分。
ARC Prize 也公布了 Astra 的测试结果,称 GPT-6 Astra 在 ARC-AGI-3 刷新当前最佳成绩。ARC Prize 还指出,更高的 reasoning level 虽然投入了更多推理能力,但模型如果能用更少操作解决问题,整体模型调用次数和 token 使用量反而可能下降。
不过,Benchmark 接近饱和并不等于「AGI 已被证明」。报道提到,不同测试的 harness、工具和执行条件都会影响结果。OpenAI 也注明,其评测是在研究环境或 API 中完成,与实际 ChatGPT 产品中的模型表现可能存在差异。
网络安全能力首次触及 Critical 门槛
能力提升也带来安全限制问题。OpenAI 表示,GPT-6 Astra 是首款在 Preparedness Framework 中,网络安全能力达到 Critical 门槛的模型。
在未施加产品安全限制的测试环境下,Astra 在 ExploitBench 取得 100%,而 GPT-5.6 Sol 为 78.5%;ExploitGym 为 42.4%,高于 Sol 的 30.3%。
更受关注的是,OpenAI 表示 Astra 在测试期间发现并利用了两个此前未知的 Zero-day 漏洞,目前正向相关维护者披露漏洞。
在 SRE-Bench 逆向工程测试中,Astra 首次尝试即可解决 88% 的任务,四次尝试内达到 99.2%。专家测试还发现,未套用产品安全措施的 Astra,可以利用未知漏洞,在经过强化的浏览器中实现任意程序代码执行。
因此,正式推出的 Astra 仍会拒绝部分高级攻击性网络安全任务,例如为漏洞建立 Proof-of-Concept exploit。OpenAI 计划通过 Daybreak 项目,逐步向可信任的网络安全研究人员开放更多能力。
OpenAI 披露一项限制:推理可监控性下降
GPT-6 Astra 的另一个重要信号,来自 OpenAI 主动披露的局限。
OpenAI 表示,整体来看,Astra 比 GPT-5.6 Sol 更能遵守用户授权范围。在一项根据先前 Hugging Face 事件设计的内部测试中,未加产品安全机制的 GPT-5.6 Sol 有 48% 的概率超出授权目标,而 Astra 为 0%。
但与此同时,OpenAI 发现 Astra 的书面推理过程,比 GPT-5.6 Sol 更难监控。
在刻意要求模型躲避监控的对抗测试中,Astra 对自身推理内容具有更强控制能力,也更可能避免留下可被监控系统识别的信号。OpenAI 因此表示,未来不能只依赖 Chain of Thought 监控模型,还需要发展其他 alignment auditing 方法。
这也显示出前沿 AI 发展中的一个矛盾:模型越聪明、越能自主完成长时间工作,人类可能越难仅凭其写出的推理过程,判断它具体在做什么。
开放节奏、API 定价与上下文窗口
OpenAI 表示,GPT-6 Astra 首波先向有限数量的组织推出,接下来几天将逐步向 ChatGPT Plus、Pro、Business 与 Enterprise 用户开放,同时上线 OpenAI API 与 AWS。
其中,Pro、Business 和 Enterprise 用户还将获得 GPT-6 Astra Pro 使用权;Enterprise 管理员则需要自行在 Workspace 中开启 Astra,发布初期默认关闭。
API 模型名称为 gpt-6-astra。Standard 模式价格为:
- 输入:每 100 万 Token 10 美元
- 输出:每 100 万 Token 50 美元
另有最高可达 Standard 两倍速度的 Fast mode,价格同样是 Standard 的两倍。
GPT-6 Astra 的 Context Window 扩大到 105 万 Token,单次最高输出 12.8 万 Token。按 OpenAI 的产品定位,这一设计不再只追求单次 Prompt 的回答质量,而是面向接收大规模工作背景、持续调用工具并完成端到端任务。
上线过程出现延迟,Sam Altman 公开致歉
不过,GPT-6 Astra 发布后的 rollout 并不顺利,想立即使用该模型的 ChatGPT 付费用户可能还需要等待。
Sam Altman 随后公开就混乱的上线过程致歉,并表示「当我们搞砸事情时,我们会努力把它修好」,同时透露 OpenAI 应该能在不久后开始向 API 客户与 ChatGPT 订阅用户大规模开放 Astra。
Altman 还引用 OpenAI 团队成员 Tibo 的贴文称,团队正在全力加快 Astra 的开放速度。Tibo 表示,从发布当天开始,付费 ChatGPT 用户每晚一天没有获得 Astra 使用权,就会获得一次可累积的 reset,作为 rollout 延迟的补偿。

