GPT-5 Sparks Polarized Reviews as Coding Strength Fails to Offset Creativity and Retrieval Concerns

GPT-5 Sparks Polarized Reviews as Coding Strength Fails to Offset Creativity and Retrieval Concerns

N
News Editor 01
2026-07-05 20:11:12
OpenAI’s GPT-5 debuted with strong benchmark claims, but early reviews were sharply divided. Tests praised its coding and logical reasoning while criticizing its creative writing, information retrieval, and even basic arithmetic reliability.

OpenAI最新发布的GPT-5,原本被官方定位为“迄今最智能、最快、最实用”的模型,并以94.6%的数学测试成绩74.9%的真实世界编程任务成绩为卖点高调登场。然而,模型上线后,市场反馈却迅速走向两极。一边是OpenAI强调其统一架构、推理与响应速度的全面升级;另一边则是早期用户在社交平台集中表达失望,认为它在实际体验上并未兑现宣传中的“飞跃式进化”。

从舆情表现来看,GPT-5首发后的争议相当明显。报道提到,大量用户在Reddit等社区中将其评价为“糟糕”“灾难性”或“令人失望”,甚至有超过3000人联署要求OpenAI恢复旧版GPT-4o。随后,OpenAI方面不得不重新开放旧模型入口。这一细节本身就反映出,AI模型竞争已不仅是参数、基准测试和API价格之争,更是“真实用户体验”与“产品人格”的较量。

基准测试亮眼,但用户感知并不买账

从官方叙事来看,GPT-5无疑是一款强调性能指标的旗舰模型。OpenAI及其高管将其描述为仿佛随时待命的“博士级专家团队”,可处理从量子物理到创意写作的复杂任务。但外界评测显示,这种高分表现并未完全转化为用户满意度,尤其是在开放式内容生成和长文本交互中,GPT-5暴露出明显短板。

更值得关注的是,预测市场也迅速给出负面反馈。根据报道,在Polymarket相关押注中,OpenAI“在8月底前拥有最佳AI模型”的概率,竟在GPT-5发布后短时间内从75%骤降至12%,而Google则升至80%。虽然预测市场不能直接代表技术实力,但它反映了投资者、技术观察者与高频用户对行业竞争格局变化的即时判断。

创意写作能力受批评,风格化表达仍显机械

在创意写作测试中,GPT-5的表现并未达到外界对新一代旗舰模型的期待。评测认为,其输出依然保留典型的“ChatGPT味道”:结构工整、逻辑清楚,但情感张力不足,语言风格偏模板化,故事推进也缺乏足够的层次感。尤其在时间悖论故事写作任务中,GPT-5虽然完成了情节搭建,却未真正抓住“悖论”这一核心主题。

与Claude 4.1 Opus等竞品相比,GPT-5在细节铺陈、人物关系、文化背景嵌入和对话设计上显得相对保守。评测者认为,GPT-5更适合承担创意写作中的分析、提纲、结构建议和批改角色,而不是直接担任“灵感型作家”。这说明其在语言生成层面依旧偏向“可控、稳定、规整”,而非“鲜活、富有个性、富有文学感”。

逻辑推理与编程成为最大亮点

尽管在创意任务上失分,GPT-5在逻辑推理和代码生成上的实力依旧获得较高评价。评测显示,在非数学类复杂推理任务中,GPT-5能够较为系统地拆解线索、梳理变量并得出正确结论,尤其适合处理商业分析、哲学问题、代码逻辑和多条件判断等场景。

编程则被认为是GPT-5目前最具商业价值的能力之一。测试指出,GPT-5生成的代码通常结构清晰、界面完成度较高,并且在不少任务中能够“开箱即用”。在价格层面,其API定价也具备明显竞争力:GPT-5输入价格为每100万tokens 1.25美元,输出价格为每100万tokens 10美元;相比之下,Claude Opus 4.1起步价则高达每100万输入tokens 15美元每100万输出tokens 75美元。在性能接近的前提下,成本优势无疑会增强GPT-5在开发者群体中的吸引力。

不过,评测也指出,在“vibe coding”这类更依赖模糊意图理解、迭代修复和上下文揣摩的开发流程中,Claude 4.1 Opus仍略胜一筹。也就是说,GPT-5更像一位高效率、纪律严明的技术执行者,而不是最擅长猜测用户潜台词的协作型搭档。

数学与检索表现分裂,基础能力争议升温

GPT-5最具争议的部分,恰恰来自其与官方宣传最相关的数学与知识处理能力。一方面,它在高难度数学基准题中展现出极强能力,甚至能准确解出FrontierMath中的复杂问题;但另一方面,它却在简单算术题5.9 = X + 5.11中给出错误答案X = -0.21,而正确结果应为0.79。这种“高阶强、低阶翻车”的反差,迅速成为舆论焦点。

在信息检索方面,GPT-5同样未能稳定兑现长上下文优势。报道显示,直接提示下,它在300K85K tokens的上下文测试中表现不佳;即便通过附件方式导入内容后,仍只成功检索出部分目标信息,其余则出现遗漏或幻觉。虽然有其他研究认为GPT-5在检索上具备更强潜力,但此次评测结果说明,其长文本处理能力仍高度依赖提示方式、上下文组织形式和任务设计。

从产品角度看,这一问题对专业用户尤其关键。OpenAI目前为GPT-5提供的上下文能力为总计400K tokens,最大输出为128K tokens。相比Gemini的100万至200万tokens,以及Llama 4 Scout所支持的更高上限,GPT-5虽然已有提升,但在超长文档分析、深度研究与大型知识库检索场景中,竞争压力仍然明显。

市场影响:AI叙事开始从“跑分”转向“可用性”

GPT-5的首轮口碑波动,对AI行业和加密市场观察者都具有参考意义。首先,它再次证明,单纯依靠基准测试和高管叙事,已经难以定义一款AI模型的市场地位。无论是用户联署要求恢复旧模型,还是预测市场概率大幅逆转,都表明行业正在从“谁的参数更强”转向“谁更适合真实工作流”。

其次,对于加密行业来说,AI模型竞争格局的变化会持续影响AI Agent、链上数据分析、量化策略生成、智能合约辅助开发等细分赛道。若GPT-5在编码和结构化推理方面保持优势,它可能继续受到Web3开发者欢迎;但若其在内容生成、记忆能力和交互自然度上不能改善,则在需要高频人机协作的场景中,用户可能更倾向Claude、Gemini或其他替代模型。

总体来看,GPT-5并非一款“全面碾压型”产品,而更像一款优缺点都被放大的专业工具。它在编程、逻辑推理、技术分析等任务上展现出明确优势,但在创意表达、长文本检索、基础算术稳定性方面仍存在争议。对开发者和研究人员而言,GPT-5依然具有较高性价比;但对普通用户、内容创作者和看重交互体验的人群来说,这款新模型能否真正替代GPT-4o,显然还需要时间验证。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
100

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.