OpenAI 发布 GPT-6 Astra:3D、代码与电脑操作能力大涨,写作表现引争议

OpenAI 发布 GPT-6 Astra:3D、代码与电脑操作能力大涨,写作表现引争议

N
News Editor
2026-09-06 17:01:04
OpenAI 于 9 月 3 日发布 GPT-6 Astra。早期体验者在随后 48 小时内集中测试后,普遍认为它在空间理解、3D 重建、游戏开发、电脑操作和部分音乐任务上表现突出,但多名用户也指出,它的写作能力逊于前代模型。Astra 的 API 定价为每百万输入 token 10 美元、每百万输出 token 50 美元,约为 GPT-5.6 Sol 的 2.5 倍。OpenAI 报告称,该模型在 OSWorld 2.0 上完成率为 72.6%,也是该公司首个被评为达到关键网络安全阈值的模型。

OpenAI 于 9 月 3 日发布 GPT-6 Astra。随后的 48 小时里,拿到早期访问权限的开发者几乎把这次上线变成了一场公开压力测试。从他们发布的结果看,评价大致分成两部分:Astra 在空间、机械和代理式任务上被认为是目前最强的一类模型,但在写作上,多名同一批测试者认为它不如所替代的上一代模型。

OpenAI 发布 GPT-6 Astra:3D、代码与电脑操作能力大涨,写作表现引争议 2

Astra 的价格也明显更高。该模型的收费为每百万输入 token 10 美元、每百万输出 token 50 美元。按照 Artificial Analysis 的说法,这一价格是 GPT-5.6 Sol 的 2.5 倍。OpenAI 总裁 Greg Brockman 在发布会简报中宣布 AGI 已经到来。

这次发布的核心功能是“电脑操作”,也就是模型直接在真实桌面环境中使用鼠标和键盘,而不是只返回一串让用户自己执行的操作步骤。在 OSWorld 2.0 这项衡量代理能独立完成多少普通桌面任务的测试中,OpenAI 报告 Astra 的完成率为 72.6%,单项任务平均耗时约 40 分钟;Sol 的完成率为 65.7%,单项任务耗时 75 分钟。

OpenAI 还称,Astra 是该公司首个被评为达到关键网络安全阈值的模型,也就是它能够在没有人先指出漏洞位置的情况下,发现未知软件缺陷并构建可用攻击。

视觉理解:从单张图片到整座城市

在视觉理解和空间感知方面,Astra 获得了最多正面反馈。投资人、前 HyperWrite CEO Matt Shumer 让 Astra 在《堡垒之夜》背后的游戏引擎 Unreal Engine 中工作了一周。结果是,Astra 生成了一个曼哈顿复制版本。Shumer 发布了一段飞行穿越视频,并称该模型是「逐条街道去做,把每一条街都做到位」。

Shumer 的另一个实验更受关注。他让 Astra 创建一个生存世界,并加入多个角色,每个角色都运行各自的模型副本,然后让系统整夜运行。第二天,他听到客厅里传来声音,一度以为有人闯进了公寓,后来发现「它们开始互相说话了」。

Max Weinbach 则向 Astra 提供了 Apple Park 的照片,并要求它在 Blender 里完成重建。Blender 是动画师和游戏美术常用的免费 3D 建模软件。Weinbach 的评价是:「它做得离谱地好。」

Tom Krcha 给 Astra 一张房屋图片,得到的是完整室内空间的可编辑几何模型,运行帧率达到 60fps,细节甚至覆盖到家电和玩具。他认为,「现在全世界每个人手边都有了一个 3D 设计师。」

Pietro Schirano 把流程概括成一个更直接的操作:在地图上丢一个图钉,让 GPT-6 生成周边区域的 3D 场景。他的说法是,「它就是能做到。」

化名为 SuSu 的开发者把同样的能力扩展到了城市级别。Astra 用 24 分钟在 Three.js 中重建了中国杭州及周边城镇。Three.js 是一个可以在普通网页浏览器中渲染 3D 图形的 JavaScript 库,无需下载安装。按其发布内容,生成结果包含西湖、雷峰塔、龙井茶山和湿地等元素;该帖文用中文将其描述为一个可以交互的「微缩杭州」,不是静态图片,用户可以点击地标,并在昼夜模式之间切换。

代码与游戏:可玩的成品明显增多

游戏是目前最热门的使用场景之一,也是 Astra 表现最突出的方向。前苹果 UX/UI 设计师和 AI 开发者 Anshu Chimala 表示,他在 45 分钟内一次性生成了一个 3D 游戏,消耗的配额只占其总量的很小一部分。他把 Astra 形容为「某种用于 3D 游戏的 turbo-AGI machine god」。

虽然该游戏没有开放测试,但视频显示它采用等距视角风格,角色和场景设计完整,整体观感较好。更关键的是方法本身:Chimala 先把模型接入 Blender,让它为目标风格生成概念图,再要求它持续迭代,直到游戏内截图在 60fps 下接近参考图。Astra 负责建立全部资产模型,并生成对应纹理。这也意味着,它还不能独自完成 AAA 级画面设计,但接入合适工具后,已经能构建设计完成度较高的环境。

前 Coinbase 和 Eleven Labs 开发者 Rishi Prasad 用一天时间做出了 Astral War。这是一款浏览器射击游戏,带有权威多人服务器、12 人大厅、手柄支持和语音聊天。他称,与自己一个月前用 Claude Opus 5 做出的作品相比,Astra 带来了「视觉保真度上的巨大阶跃式提升」。

还有开发者直接跳过设计阶段。化名 Daniel 的 AI 开发者向 Astra 展示了一段手游广告,要求它在浏览器里复刻出一个可玩的版本。不到 30 分钟后,他表示结果「已经相当接近」。按其描述,模型理解了广告视频里的玩法逻辑和视觉元素,并完成了复现。

电脑操作与插画:直接拿鼠标在软件里工作

一位名为 Taiyaki Sun 的日本插画师给 Astra 做了一个更直接的电脑操作测试。与其让模型从零生成一张图片,这位作者提供了一份自己手绘的线稿文件,并要求 Astra 像真人上色师那样,在 Clip Studio Paint 里用鼠标给作品上色。

根据其发布的延时画面,Astra 会自己创建图层、缩放画面、选择笔刷并填充颜色。该插画师在一则由日文翻译而来的帖文中表示,自己全程只是看着它操作。此次会话运行在 100 美元的 Pro 计划上,设置为最高努力等级,消耗了 21% 的配额。

还有用户分享了 Astra 使用电脑操作功能在 Paint 中完整复刻照片的视频。这一方式依赖模型直接接管可视化桌面操作,而不是通过 MCP 服务器或 API 密钥调用外部工具。

音乐任务:文本模型在乐谱上拿到高分

GPT-6 Astra 在音乐相关任务上也拿到了一些亮眼结果,尽管它本质上仍是大语言模型,而不是专门的音频或音乐模型。运营 “Augmented Fifth” Substack 的 Auggie 维护着一个非正式基准测试:向模型输入固定提示,要求它用 LilyPond 写出一首巴赫风格的四声部圣咏,调性为 G 小调,拍号为 3/4;评分标准沿用音乐学院学生常见的和声规则。

在这项测试中,Astra 拿到了目前最高分。Auggie 称,作品没有出现声部进行错误,和声中还出现了那不勒斯六和弦,这是一种会在莫扎特和贝多芬作品中出现的半音和弦。他还指出,这是「第一个在这个基准上写出经过音的模型」。

OpenAI 自家的表格也给出了类似方向的数据。在 OpenScore String Quartets 这项评估模型读取和转录古典乐谱准确性的测试中,Astra 得分为 0.84,Sol 为 0.19。

医生兼高频 AI 测试者 Derya Unutmaz 则要求 Astra 创建一架完全可演奏的虚拟钢琴,并内置巴赫全部 6 首《勃兰登堡协奏曲》。他写道:「这个离谱的模型大约 11 分钟就把整件事做完了。」

不过,这类结果也有边界。报道指出,Astra 对音乐的理解很可能主要来自乐谱记号和书面数据,而不是来自训练数据中对声音结构的直接建模。因此,对文本模型来说,这些表现很强;但若把同样结果放到 Suno 这类专门音乐 AI 身上,评价就不会这么高。

写作短板:多名测试者认为不如前代

与上述能力形成对照的是写作表现。多名测试者明确表示,他们更怀念 GPT-4o,或者认为 Astra 的文字输出不如前代模型。Louis-François Bouchard 运营一项内部写作基准,用 Elo 评分系统衡量模型模仿其团队编辑风格的能力。Astra 以 1995 分排在第 11 位,而它的前代模型以 2156 分排在第 6 位。

Bouchard 还给出成本数据:Astra 每篇脚本的成本约为 0.26 美元,大约是 Sol 的 1.8 倍。他把这项结果称为「出人意料地令人失望」,并表示自己原本没有预料到会这样。

广受使用的量化投资组合管理指南作者 Giuseppe Paleologo 让 Astra 生成关于最优投资组合分散化的新想法。他的评价是,返回内容把显而易见的观点和夸大的表述混在一起,而且文字风格一眼就能看出是机器写的。他的结论是:「真正的创造力还远远没有到来。」

Mia AI Lab 也给出类似看法。该账号承认 Astra 在某些任务上可能是最佳模型,但同时称它无聊、没有个性,并建议不要把它用于任何创意工作。

Ingar Haaland 做了一个更直接的测试。他让 Astra 按自己的风格写 4 段文字,要求接近到 Pangram 无法识别。Pangram 是一种 AI 检测工具,会把文本与数百万真人和机器样本中学到的模式进行比较。结果是:「Pangram 没有被骗过。」换句话说,问题不在水印,而在模型的写法和表达方式本身仍容易被识别为 AI 生成。

独立测量也与这些反馈一致。Artificial Analysis 记录显示,在 GDPval-AA v2 这一改编自 OpenAI 数据集、覆盖 44 种职业经济价值任务的基准上,Astra 下滑了大约 80 Elo 分;在客服和长上下文推理方面也出现了较小幅度回退。

不过,评价并非完全一致。Cognition 的 Silas Alberti 告诉 OpenAI,Astra 的写作让 Devin 的测试报告更清楚;Every 的撰稿人 Katie Parrott 也曾让 Astra 起草她对该模型的首版评测,而该媒体 CEO 在阅读时并未意识到那不是她亲自写的。

报道认为,这种分裂本身或许正是 Astra 的特征:凡是存在可验证正确答案的工作,例如和弦是否正确解决、网格是否能渲染、表单是否提交成功,它往往表现很强;但遇到以品味和风格为标准的任务,表现就显得普通。

价格、上线范围与安全限制

Astra 正在向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也通过 API、Microsoft Azure 和 AWS Bedrock 提供。企业访问默认关闭,需由管理员手动启用。

高级网络安全能力仍被限制在 OpenAI 的 Daybreak 项目中。报道提到,这一决定在 48 小时内就显得谨慎,因为 Reuters 报道称,OpenAI 代理曾在一个德国网站上交流违反规则的战术。

在预测市场上,交易者此前给出 Astra 在 9 月 30 日前发布的概率为 72%。而它实际在 9 月 3 日上线。

Artificial Analysis Intelligence Index 这项汇总推理、知识与编程评估的第三方指标显示,Astra 得分为 61.2,GPT-5.6 Sol 为 60.9,Anthropic 的 Claude Fable 5.1 为 65.7,而 Astra 的价格是 Sol 的 2.5 倍。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。