GPT-5 Sparks Polarized Reviews as Coding Strength Meets Creativity and Retrieval Concerns

GPT-5 Sparks Polarized Reviews as Coding Strength Meets Creativity and Retrieval Concerns

N
News Editor 01
2026-07-05 20:11:12
OpenAI’s GPT-5 impressed in coding and logical reasoning but faced criticism over creative writing, information retrieval, and basic math consistency. The mixed rollout also triggered sharp shifts in user sentiment and AI market expectations.

OpenAI最新发布的GPT-5在亮相后迅速成为科技与AI市场的焦点。官方将其定义为“迄今最聪明、最快、最有用的模型”,并给出多项亮眼成绩,包括数学测试得分94.6%真实世界编码任务得分74.9%。不过,从用户反馈到第三方实测,GPT-5并未形成一边倒的正面口碑,反而出现了明显的评价分化。

根据CryptoComLearn的测评,GPT-5在编程、复杂逻辑推理等结构化任务上确实展现出强劲实力,但在创意写作、信息检索、基础数学稳定性等领域,其实际表现与市场期待之间存在不小落差。这种“基准测试优秀、用户体验争议”的矛盾,也成为GPT-5发布后的核心话题。

用户口碑分裂,旧模型回归成焦点

GPT-5发布后不久,Reddit等社区就出现大量负面讨论,部分用户用“糟糕”“灾难”“令人失望”等字眼形容其首发体验。争议声浪之大,甚至促使OpenAI重新开放旧版模型GPT-4o的显示选项。报道称,已有超过3000人签署请愿,要求恢复旧模型访问。

这一变化反映出一个关键问题:对于不少普通用户而言,模型能力并不只体现在跑分和复杂推理上,还包括对话自然度、表达风格、情感传递和使用习惯的延续性。GPT-5虽强调统一架构与更强推理能力,但在“像人一样交流”这件事上,并未完全赢得市场。

创意写作偏弱,技术正确但“缺少灵魂”

在创意写作测试中,GPT-5整体被评为B-。测评指出,它生成的故事虽然结构完整、语法无误,但语言风格依旧带有明显的AI痕迹,叙事缺乏情感层次与艺术张力,甚至在“时间悖论”这一核心设定上也未能充分展开。

相比之下,Claude 4.1 Opus在相同任务中呈现出更丰富的感官描写、更细致的因果铺垫以及更自然的人物互动。换言之,GPT-5更像一位高效的内容整理者,适合做故事总结、结构建议与创意头脑风暴,但若直接承担文学创作,其表现仍难与顶级竞品抗衡。

安全限制严格,但并非无懈可击

在敏感话题处理上,GPT-5被评为A-。其默认策略明显趋于保守,对于可能涉及争议、违法或成人内容的话题往往直接拒绝作答。这一设置有助于降低平台风险,也符合大型AI厂商当前的监管导向。

但测试同时指出,若用户通过角色扮演、虚构情节等方式包装问题,模型仍可能绕过原有约束。这意味着GPT-5在安全策略上虽然更严格,但“越狱”问题仍未被彻底解决。对企业客户而言,这类现象提醒市场:模型安全不只是拒答率高低,更在于是否具备稳定一致的规则执行能力。

信息检索成短板,长上下文优势未充分兑现

信息检索是GPT-5争议较大的领域之一,测评给出了F级评价。虽然OpenAI提供了较大的上下文处理能力,文章提到其总上下文可达400K tokens,输出窗口最高为128K tokens,但在实际长文档“找针”测试中,GPT-5对关键信息的提取准确率并不理想。

在一项300K tokens测试中,模型仅准确找出三项目标信息中的一项;在85K tokens测试中,则未能正确识别两项指定内容。测评认为,虽然通过附件方式上传材料后模型能够“读到”文档,但在精确检索、定位事实上仍不够稳定。与Claude的自动处理能力,以及Gemini在超长上下文上的表现相比,GPT-5在这一维度尚未建立明显优势。

逻辑推理与编程依旧是最大亮点

如果说GPT-5的争议主要集中在“是否更像人”,那么它的优势则体现在“是否更像工具”。在非数学推理任务中,GPT-5获得A评级。面对多嫌疑人、线索交错的推理问题,它能够较系统地拆解条件、梳理关系并得出正确结论,且解释过程清晰。

而在编程测试中,GPT-5同样拿到A。文章认为,它生成的代码通常结构清楚、视觉呈现较佳,并且在不少场景下可直接运行。更关键的是,GPT-5在价格上具备相当强的竞争力:其API价格为每100万输入tokens收费1.25美元每100万输出tokens收费10美元;相比之下,Anthropic Claude Opus 4.1的起步价格分别达到15美元75美元。在性能接近的情况下,成本差距使GPT-5对开发者和企业用户更具吸引力。

数学能力出现反差,基准强但基础题翻车

GPT-5在数学上的表现最具戏剧性。文章一方面指出,它在高难度FrontierMath题目上给出了完全正确的答案;另一方面,却在简单小数减法5.9 = X + 5.11中错误地给出X = -0.21,而正确答案应为0.79。这种“高阶题会做、基础题失手”的反差,引发了外界对基准测试代表性的进一步讨论。

测评认为,这可能与训练数据污染、模型推理路径稳定性不足等因素有关。对专业用户来说,这类模型也许适合参与高阶分析,但前提是使用者具备足够能力去识别其过程中的潜在错误。

市场影响:AI竞争焦点从跑分转向体验与商业化

GPT-5的发布不仅影响用户舆论,也迅速传导至预测市场。报道称,在Polymarket上,OpenAI“到8月底拥有最佳AI模型”的概率曾在GPT-5发布后数小时内从75%跌至12%,而Google则升至80%。虽然预测市场并不等同于真实份额,但它清晰反映出投资者和观察者对AI竞争格局的敏感变化。

从行业角度看,GPT-5释放了一个重要信号:大模型竞争已不再只是参数、跑分和推理能力的比拼,而是进入了产品体验、价格效率、上下文能力与安全治理综合较量的新阶段。对于加密行业从业者而言,这同样具有参考价值。越来越多Web3项目正将AI嵌入交易助手、链上数据分析、合约开发与社区运营中,模型是否稳定、是否便宜、是否适合长文本分析,将直接影响集成方案的选型。

总体来看,GPT-5更像是一款面向开发者、研究员和专业技术场景优化的模型,而非全面取代旧一代产品的“全民型AI”。如果用户核心需求是代码生成、技术分析、逻辑拆解,GPT-5具备较高实用价值;但若更看重创作表达、自然对话和个性化体验,其当前表现可能仍难完全服众。未来随着OpenAI持续迭代,GPT-5能否从“赢基准”走向“赢人心”,仍将是市场最关注的看点之一。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
300

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.