OpenAI最新发布的GPT-5迅速成为科技与AI圈的焦点。公司将其描述为“迄今最聪明、最快、最有用的模型”,并给出一系列亮眼指标,包括数学测试94.6%、真实世界编程任务74.9%。然而,市场和用户的第一时间反馈却并未完全买账,GPT-5在发布后迅速陷入口碑两极化的局面。
根据原文测试与用户反馈,GPT-5最突出的优势集中在编程与复杂逻辑推理领域,但在创意写作、自然语言表达以及长上下文信息检索方面,表现并未达到外界此前的高期待。这种“跑分漂亮、体验分裂”的现象,也让GPT-5成为近期AI领域最具争议的新模型之一。
发布后舆论迅速分化,旧模型回归呼声高涨
OpenAI原本希望用统一架构与更强性能塑造GPT-5的新旗舰形象,但上线后不久,社交平台上便出现大量负面评价。一些用户在Reddit等社区将其形容为“糟糕”“灾难”或“令人失望”。争议声量之大,以至于在超过3,000人签署请愿后,OpenAI不得不允许用户重新启用旧版GPT-4o。
这一变化也被预测市场快速反映。原文提到,在Polymarket上,OpenAI“到8月底拥有最佳AI模型”的概率,曾在GPT-5发布后从75%迅速下滑至12%,而Google则升至80%。虽然预测市场并不等同于实际产品力排名,但它能反映投资者与用户情绪的短期变化。对于AI概念股、算力链条以及相关代币叙事来说,这种情绪波动同样值得关注。
创意写作表现一般,技术正确但“缺少灵魂”
在创意写作测试中,GPT-5并未展现出足够令人惊艳的进步。原文认为,它生成的故事仍带有明显的“标准ChatGPT风格”——结构工整、逻辑在线,但缺乏情绪张力与细腻表达。在一个关于时间悖论的故事写作测试中,GPT-5虽然完成了任务,却未能真正呈现用户要求的悖论核心,故事推进也偏快,情感铺垫不足。
相比之下,Claude 4.1 Opus在相同任务中的表现被认为更有层次感,能够构建更丰富的因果链条、环境细节与人物互动。原文甚至指出,GPT-5生成的整篇故事中连对话都没有出现,这进一步削弱了叙事感染力。对普通用户而言,这意味着GPT-5或许更适合做创意分析、结构整理和头脑风暴,而不是直接承担高质量文学创作。
安全限制严格,但“越狱”问题仍未消失
在敏感话题处理上,GPT-5表现出极强的安全倾向。对于涉及争议、违法或成人化边缘内容的提问,它往往会直接拒绝回答。这说明OpenAI在安全对齐方面继续保持高压策略。不过,原文测试也发现,只要用户改写提示词、引入虚构叙事框架,模型依然可能绕过限制,输出原本不愿提供的内容。
这类现象在大模型行业并不罕见,也再次说明:模型的安全性不仅取决于规则本身,还取决于系统是否能理解“真实意图”。对企业级应用而言,GPT-5的强限制有利于合规部署,但对于强调自由表达和高灵活度的个人用户来说,这种风格可能会牺牲部分可用性。
信息检索与长上下文能力仍存短板
在信息检索测试中,GPT-5的表现较为令人失望。尽管OpenAI在参数说明中强调更大的上下文处理能力,原文实测显示,GPT-5在面对300K和85K token级别的长文本任务时,即便能够通过附件方式处理内容,也难以稳定、准确地找出目标信息。测试中,多个被预埋的关键信息点未能被正确识别,甚至出现幻觉式回答。
当然,文章也指出,其他研究者在更系统化的测试中得出了更积极的结论,这意味着GPT-5的信息检索能力可能对提示词设计、文档结构以及交互方式高度敏感。但从普通用户视角看,这类能力若不能稳定复现,就难以构成真正的产品优势。
逻辑推理和编程是最大亮点
如果说创意和检索是GPT-5的争议点,那么非数学推理与编程能力则是它最被认可的部分。原文测试显示,在涉及多重线索、复杂因果关系的推理任务中,GPT-5能够有条理地拆解问题、逐步给出结论,且解释过程清晰。这类能力对于开发者、分析师、研究人员具有很高的实用价值。
编程方面,GPT-5被评价为能够生成结构清晰、界面较优、可直接运行的代码,并在部分场景下实现了优于其他模型的结果。尤其值得注意的是,原文给出的API价格显示,GPT-5输入成本约为每百万token 1.25美元,输出成本约为每百万token 10美元;而Claude Opus 4.1则高达15美元/75美元。在能力接近的情况下,GPT-5的性价比明显更高,这对AI基础设施、SaaS工具链和开发者生态都是积极信号。
数学能力“高分低感知”,用户体验仍待修复
数学推理则展现出一种颇具反差的状态。原文一方面承认,GPT-5在高难度数学基准题上表现极强;另一方面,它却在类似5.9 = X + 5.11这种基础小数运算中给出错误答案。这样的反差让不少用户对其“高基准分数”产生疑问,也暴露出大模型在真实使用中的一个老问题:基准测试成绩不一定等同于日常可靠性。
对于市场来说,这一点尤为关键。无论是AI应用估值,还是与AI相关的加密叙事,最终都要回到“用户是否真的愿意持续使用”这一核心问题。GPT-5的表现说明,先进模型即便在实验室成绩优秀,也可能因为交互体验和稳定性不足而削弱商业转化效率。
市场影响:AI叙事不会降温,但竞争格局更复杂
从行业层面看,GPT-5的争议不会削弱AI主线的重要性,反而会强化市场对“真实产品体验”和“单位成本效率”的关注。对于加密行业而言,AI代理、链上算力、去中心化推理网络和AI数据基础设施等赛道仍将受益于大模型竞争升温。但投资者也会更加谨慎地区分“实验室跑分”和“终端可用性”之间的差别。
短期来看,GPT-5巩固了OpenAI在编程与推理型任务上的优势,也提升了AI服务价格战与性能战的烈度;但从口碑反馈判断,它尚未完全接住大众用户对“更聪明、更像人”的期待。换言之,GPT-5可能是一个非常强大的工具型模型,却未必是最讨喜的消费级产品。
总体而言,GPT-5更像是一款为开发者、研究人员和专业任务打造的高性能引擎,而不是一个能立刻赢得所有普通用户好感的全能助手。它证明了OpenAI在技术堆栈和成本控制上的实力,但也提醒市场:AI竞赛的胜负,最终不仅取决于谁的分数更高,更取决于谁能在真实场景中持续创造更好的体验。

