GPT-5 Sparks Mixed Reactions as Coding and Reasoning Shine but Creativity Falls Short

GPT-5 Sparks Mixed Reactions as Coding and Reasoning Shine but Creativity Falls Short

N
News Editor 01
2026-07-05 20:11:12
OpenAI’s GPT-5 impressed with strong benchmark scores and coding performance, but early users criticized its creative writing, information retrieval, and overall user experience, triggering calls for GPT-4o’s return.

OpenAI最新发布的GPT-5迅速成为科技与AI圈的焦点。公司将其描述为“迄今最聪明、最快、最有用的模型”,并给出一系列亮眼指标,包括数学测试94.6%真实世界编程任务74.9%。然而,市场和用户的第一时间反馈却并未完全买账,GPT-5在发布后迅速陷入口碑两极化的局面。

根据原文测试与用户反馈,GPT-5最突出的优势集中在编程复杂逻辑推理领域,但在创意写作、自然语言表达以及长上下文信息检索方面,表现并未达到外界此前的高期待。这种“跑分漂亮、体验分裂”的现象,也让GPT-5成为近期AI领域最具争议的新模型之一。

发布后舆论迅速分化,旧模型回归呼声高涨

OpenAI原本希望用统一架构与更强性能塑造GPT-5的新旗舰形象,但上线后不久,社交平台上便出现大量负面评价。一些用户在Reddit等社区将其形容为“糟糕”“灾难”或“令人失望”。争议声量之大,以至于在超过3,000人签署请愿后,OpenAI不得不允许用户重新启用旧版GPT-4o

这一变化也被预测市场快速反映。原文提到,在Polymarket上,OpenAI“到8月底拥有最佳AI模型”的概率,曾在GPT-5发布后从75%迅速下滑至12%,而Google则升至80%。虽然预测市场并不等同于实际产品力排名,但它能反映投资者与用户情绪的短期变化。对于AI概念股、算力链条以及相关代币叙事来说,这种情绪波动同样值得关注。

创意写作表现一般,技术正确但“缺少灵魂”

在创意写作测试中,GPT-5并未展现出足够令人惊艳的进步。原文认为,它生成的故事仍带有明显的“标准ChatGPT风格”——结构工整、逻辑在线,但缺乏情绪张力与细腻表达。在一个关于时间悖论的故事写作测试中,GPT-5虽然完成了任务,却未能真正呈现用户要求的悖论核心,故事推进也偏快,情感铺垫不足。

相比之下,Claude 4.1 Opus在相同任务中的表现被认为更有层次感,能够构建更丰富的因果链条、环境细节与人物互动。原文甚至指出,GPT-5生成的整篇故事中连对话都没有出现,这进一步削弱了叙事感染力。对普通用户而言,这意味着GPT-5或许更适合做创意分析、结构整理和头脑风暴,而不是直接承担高质量文学创作。

安全限制严格,但“越狱”问题仍未消失

在敏感话题处理上,GPT-5表现出极强的安全倾向。对于涉及争议、违法或成人化边缘内容的提问,它往往会直接拒绝回答。这说明OpenAI在安全对齐方面继续保持高压策略。不过,原文测试也发现,只要用户改写提示词、引入虚构叙事框架,模型依然可能绕过限制,输出原本不愿提供的内容。

这类现象在大模型行业并不罕见,也再次说明:模型的安全性不仅取决于规则本身,还取决于系统是否能理解“真实意图”。对企业级应用而言,GPT-5的强限制有利于合规部署,但对于强调自由表达和高灵活度的个人用户来说,这种风格可能会牺牲部分可用性。

信息检索与长上下文能力仍存短板

在信息检索测试中,GPT-5的表现较为令人失望。尽管OpenAI在参数说明中强调更大的上下文处理能力,原文实测显示,GPT-5在面对300K85K token级别的长文本任务时,即便能够通过附件方式处理内容,也难以稳定、准确地找出目标信息。测试中,多个被预埋的关键信息点未能被正确识别,甚至出现幻觉式回答。

当然,文章也指出,其他研究者在更系统化的测试中得出了更积极的结论,这意味着GPT-5的信息检索能力可能对提示词设计、文档结构以及交互方式高度敏感。但从普通用户视角看,这类能力若不能稳定复现,就难以构成真正的产品优势。

逻辑推理和编程是最大亮点

如果说创意和检索是GPT-5的争议点,那么非数学推理编程能力则是它最被认可的部分。原文测试显示,在涉及多重线索、复杂因果关系的推理任务中,GPT-5能够有条理地拆解问题、逐步给出结论,且解释过程清晰。这类能力对于开发者、分析师、研究人员具有很高的实用价值。

编程方面,GPT-5被评价为能够生成结构清晰、界面较优、可直接运行的代码,并在部分场景下实现了优于其他模型的结果。尤其值得注意的是,原文给出的API价格显示,GPT-5输入成本约为每百万token 1.25美元,输出成本约为每百万token 10美元;而Claude Opus 4.1则高达15美元/75美元。在能力接近的情况下,GPT-5的性价比明显更高,这对AI基础设施、SaaS工具链和开发者生态都是积极信号。

数学能力“高分低感知”,用户体验仍待修复

数学推理则展现出一种颇具反差的状态。原文一方面承认,GPT-5在高难度数学基准题上表现极强;另一方面,它却在类似5.9 = X + 5.11这种基础小数运算中给出错误答案。这样的反差让不少用户对其“高基准分数”产生疑问,也暴露出大模型在真实使用中的一个老问题:基准测试成绩不一定等同于日常可靠性。

对于市场来说,这一点尤为关键。无论是AI应用估值,还是与AI相关的加密叙事,最终都要回到“用户是否真的愿意持续使用”这一核心问题。GPT-5的表现说明,先进模型即便在实验室成绩优秀,也可能因为交互体验和稳定性不足而削弱商业转化效率。

市场影响:AI叙事不会降温,但竞争格局更复杂

从行业层面看,GPT-5的争议不会削弱AI主线的重要性,反而会强化市场对“真实产品体验”和“单位成本效率”的关注。对于加密行业而言,AI代理、链上算力、去中心化推理网络和AI数据基础设施等赛道仍将受益于大模型竞争升温。但投资者也会更加谨慎地区分“实验室跑分”和“终端可用性”之间的差别。

短期来看,GPT-5巩固了OpenAI在编程与推理型任务上的优势,也提升了AI服务价格战与性能战的烈度;但从口碑反馈判断,它尚未完全接住大众用户对“更聪明、更像人”的期待。换言之,GPT-5可能是一个非常强大的工具型模型,却未必是最讨喜的消费级产品。

总体而言,GPT-5更像是一款为开发者、研究人员和专业任务打造的高性能引擎,而不是一个能立刻赢得所有普通用户好感的全能助手。它证明了OpenAI在技术堆栈和成本控制上的实力,但也提醒市场:AI竞赛的胜负,最终不仅取决于谁的分数更高,更取决于谁能在真实场景中持续创造更好的体验。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
300

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.