GPT-6 Astra 上线一周后遭用户质疑表现下滑,OpenAI 尚未回应

GPT-6 Astra 上线一周后遭用户质疑表现下滑,OpenAI 尚未回应

N
News Editor
2026-09-12 16:03:23
OpenAI 新模型 GPT-6 Astra 在发布后一度因代码与构建能力受到追捧,但上线仅一周,多名开发者开始在 X 上集中反馈模型变“更笨”。部分用户称在相同提示词和设置下,当前版本结果不如发布当天;也有人认为并非模型被削弱,而是首发期热度退去后,缺陷被更清楚地看见。OpenAI 目前尚未就 Astra 发布类似此前 GPT-5.6 Sol 争议时的说明,但该模型的定价仍为每百万输入 token 10 美元、每百万输出 token 50 美元。

一周前,GPT-6 Astra 还在游戏引擎里按街区重建曼哈顿,能力展示让不少用户感到惊艳。到了本周,同一批用户开始在 X 上贴出截图,追问 OpenAI 这款模型到底出了什么问题。

化名开发者 synthwavedd 在 X 上写道:「Astra 今天对我来说明显变笨了。『发布后脑叶切除』只是时间问题。真可惜。」

这类声音并不罕见。长期使用 AI 聊天机器人和智能体的用户,早已习惯自己偏爱的模型突然被认为遭到「削弱」。多数时候,用户感知到的性能下降都有合理解释。但当同一时间有足够多人提出类似抱怨,这件事本身就值得单独看待。眼下的社交平台上,已经出现大量用户对 GPT-6 Astra 迅速失望的例子。

开发者集中反馈:回答更快,但结果更差

开发者 Pranjal Paliwal 此前曾公开称赞 Astra。后来他重新去看了 Astra 给他写的代码,结果并不满意。

他写道:「我们没有 AGI。我们看到的是一次回退。」

AGI 是 artificial general intelligence,即「通用人工智能」的缩写,通常指在认知任务上基本能完成任何人类可完成事情的机器。Astra 发布时,OpenAI 总裁也提到过这个词;一周之后,用户却拿它来表达相反的意思。

这些抱怨的结构相当接近。开发者 Pankaj Kumar 列出的症状包括:回答更快、质量更差,以及他怀疑 OpenAI 「降低了 juice value」。创始人 Saba 则直接向 OpenAI 发问,为什么她现在必须先把任务「降智」处理,模型才能把事情做完。

「Juice value」并不是官方术语,也没有明确统一定义。但在这批讨论里,它被当作一种约定俗成的说法,指模型在给出答案前愿意投入多少计算量去「思考」。一些用户怀疑,OpenAI 在首发演示完成之后,悄悄把这个参数调低了。

相同提示词对比测试,也有人得出更差结果

并非所有人都只凭主观印象判断。Salio 和研究者 Md Ismail Sojal 都用完全相同的提示词,对比了 Astra 发布当天与当前版本的输出,两人都表示现在的结果更差。

Decrypt 援引的一则帖文写道,当事人以同样提示词、同样设置,分别测试了发布时的 GPT-6 Astra 和当前版本,得到的差异比预想更大。

部分团队已切回旧模型

也有人直接放弃继续使用 Astra。开发编码工具 Opencode 的 Dax Raad 表示,他的团队已经切回 Astra 的前代模型 GPT-5.6 Sol,因为使用成本翻倍,却没有换来值得接受的提升。

ChatGPT 用户 Mustafa Sahinli 的说法更直接。他称,现在的 Astra 让他想起 Claude Opus 4.6 在「发布一周后」的状态,这句话显然是在影射 Anthropic 模型此前也经历过发布后反噬。

反方观点:模型没变,只是热度退去后问题更明显

不过,并不是所有人都认为 OpenAI 有意削弱了新模型。化名用户 Antikythera 发布了讨论串中最完整的反驳,认为时间线本身就被说反了。

Antikythera 写道:「它和发布时一样笨。模型是好的,但也有很多问题。它很懒,写作像是迷恋项目符号一样……发布那周大家情绪过热,现在他们有时间测试,也就看到了它的错误。」

换句话说,在这类观点看来,Astra 并没有发生变化,只是用户不再被首发时的惊艳感压住,开始注意到它原本就存在的问题。

T3Chat 创始人 Theo 也提出了相近判断。他认为,Astra 的一致性实际上不如 Claude Fable,所以它有时能写出非常出色的代码,有时又会给出非常愚蠢的结果。现在更像是「蜜月期」结束后,用户开始更频繁地分享那些糟糕输出。

Theo 说:「GPT-6 Astra 做出过一些我从没想过模型能做到的事。它也做出过一些我见过最蠢的事。整体来说,Fable 5.1 往往就是按我的要求来做。」

类似争议在 GPT-5.6 Sol 发布后也出现过

这并不是第一次。OpenAI 上一代旗舰模型 GPT-5.6 Sol 在 7 月也经历过几乎相同的周期。当时用户称,它的顶级推理模式一夜之间变浅了。OpenAI 高管 Tibo Sottiaux 否认公司曾故意削弱模型,但也确认公司一直在试验「reasoning effort」这一设置,也就是控制模型在回答前会进行多少步推理的参数。

有一条回复把这个长期流传的玩笑概括得很直接:封闭实验室发布一个模型,几天后它就像「得了某种病」,突然变笨。另一种更犬儒的说法则只有一句:「它们大概被量化了,这样公司就不会烧掉那么多钱。」

所谓量化,是指通过降低模型内部数学计算的精度来压缩成本,通常可能以准确率下降为代价。OpenAI 从未确认,自己会有意对已经发布的模型这样做。

Astra 尚无官方说明,价格仍高于 Sol

截至目前,OpenAI 还没有像此前回应 Sol 争议时那样,就 Astra 的这轮质疑发布说明。

不过,Astra 仍是 OpenAI 首个跨过其所称网络安全风险「关键阈值」的模型。按照文中说法,这意味着它可以在没有人工指导的情况下发现并串联未知软件漏洞。这项能力目前只向经过审核的防御方开放,适用于 OpenAI 的 Daybreak 项目。

无论它是否真的变笨,这款模型的价格没有下降:每百万输入 token 收费 10 美元,每百万输出 token 收费 50 美元,按 Decrypt 的说法,这是 Sol 发布时价格的 2.5 倍。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
8400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。