GPT-5 Sparks Polarized Reactions as Coding Strength Meets Creative Weakness

GPT-5 Sparks Polarized Reactions as Coding Strength Meets Creative Weakness

N
News Editor 01
2026-07-05 20:12:11
OpenAI’s GPT-5 impressed with strong benchmark scores in math, coding, and reasoning, but early user feedback was sharply divided over its creative writing, retrieval accuracy, and overall conversational experience.

OpenAI最新推出的GPT-5,原本被官方定位为“最聪明、最快、最有用”的旗舰模型,并以94.6%的数学测试成绩74.9%的真实世界编程任务表现作为宣传重点。然而,从上线后的市场反馈来看,这款模型并未像预期那样迅速赢得用户一致认可,反而在技术圈引发了一场围绕“基准测试成绩是否等于真实体验”的广泛讨论。

根据原始测评素材,GPT-5发布后不久,Reddit等社区就出现了大量负面评价,不少用户将其形容为“糟糕”“令人失望”甚至“灾难”。舆论压力之下,OpenAI最终同意重新开放旧版GPT-4o,允许用户在设置中切换至传统模型。更值得关注的是,超过3,000人曾联署要求恢复GPT-4o,这反映出部分用户对新模型的升级方向并不买账。

基准成绩亮眼,但真实口碑并未同步提升

从官方宣传层面看,GPT-5几乎代表了OpenAI在统一架构上的最新成果:既要兼顾快速响应,也要强化深度推理能力。可问题在于,用户真正感知到的价值,并不完全由实验室跑分决定。原文援引预测市场Polymarket数据称,OpenAI在“8月底前拥有最佳AI模型”的概率,在GPT-5发布后数小时内从75%骤降至12%;与此同时,Google则被推高至80%。虽然预测市场并非严格意义上的学术评估,但它常被视为市场情绪和预期变化的即时风向标。

这意味着,GPT-5的发布不仅是一场产品更新,也在某种程度上影响了AI赛道竞争格局的短期预期。对于OpenAI而言,跑分优势未能立刻转化为品牌信心,反而让外界更加关注“模型是否真正适合人类使用”这一核心问题。

优势集中在编程与复杂推理

从测评结果看,GPT-5最具说服力的领域仍是编程非数学类逻辑推理。在代码生成方面,原文认为该模型生成的程序通常结构清晰、界面完成度高,而且往往“开箱即用”。在与Claude 4.1 Opus的对比中,GPT-5被认为在代码准确率上接近同级顶尖水平,而价格则更具竞争力:其API定价为每100万输入token 1.25美元、每100万输出token 10美元,显著低于Claude Opus 4.1的15美元输入、75美元输出

对于开发者而言,这种“性能接近、成本更低”的组合具有现实吸引力。尤其在AI辅助开发、原型搭建和规则明确的工程任务中,GPT-5的商业价值较为突出。原始测评甚至指出,它在生成游戏代码时,是唯一能够实现功能性音效的模型。这类表现说明,GPT-5在结构化任务、规则推导和技术执行层面依旧具备强竞争力。

在复杂逻辑问题上,GPT-5同样展现出较强稳定性。面对多嫌疑人、线索交叉的推理任务时,它能够逐步梳理信息并清晰给出结论。原文认为,这种能力适合商业分析、哲学思辨、代码调试等需要层层拆解的场景。换句话说,GPT-5更像是一个擅长处理规则系统和因果链条的“分析型助手”。

创意写作与信息检索成为争议焦点

与编程和逻辑推理形成鲜明对比的是,GPT-5在创意写作上的表现并未打动测评者。原文认为,其文本虽然语法正确、结构完整,但整体风格依旧带有明显的“AI痕迹”,缺少情感张力、人物动机和叙事层次。与Claude 4.1 Opus相比,GPT-5在细节描写、文化融入和因果推进方面显得较为单薄,甚至在给定的时间悖论题材中,没有真正完成“悖论”这一核心设定。

这一点恰恰触及当前生成式AI应用最敏感的领域:用户不只需要“能写”,更需要“写得像人”。对依赖AI进行内容创作、品牌文案、故事构思的用户来说,GPT-5的优势更多体现在分析和点评,而不是直接生成富有感染力的原创文本。因此,尽管模型能力在某些硬指标上继续提升,但其“人格感”“灵气”不足的问题,可能削弱普通用户的使用黏性。

信息检索方面,测评给出的评价更为严厉。原文指出,GPT-5在处理300K token85K token的长上下文检索任务时,虽然能借助附件机制读取内容,但在定位关键信息时准确率并不理想。在300K测试中,仅成功找到3条目标信息中的1条;在85K测试中,则未能找到两条预设信息。尽管也有其他研究者给出更积极结论,但至少从这份测评看,GPT-5在长文本精准召回上仍存在争议。

安全策略严格,但绕过方式依然存在

安全性也是GPT-5的一大特征。原文提到,该模型对敏感、争议性或潜在违规话题的拒答倾向非常明显。不过,测评同时指出,只要通过角色扮演、小说情节包装等方式重新组织提问,限制仍可能被绕开。这种现象意味着,模型的安全边界虽然更严,但在实际应用中仍面临典型的大模型“提示词越狱”问题。

对企业客户和平台方而言,这既是一种保障,也是一种风险:前者意味着默认输出更稳健,后者则说明现有护栏机制仍非无懈可击。

对AI市场与相关赛道意味着什么

从行业角度看,GPT-5引发的争议再次说明,大模型竞争正在从“谁的基准测试更高”转向“谁的综合体验更好”。对于加密行业、Web3开发者和链上应用团队而言,这一变化同样重要。因为在智能合约审计、链上数据分析、量化策略辅助、技术文档生成等场景中,模型的逻辑推理和代码生成能力往往比文学创造力更关键。若按这一标准衡量,GPT-5依然可能成为开发者工具栈中的高性价比选项。

但如果应用目标转向社区运营、内容营销、品牌叙事和用户互动,那么GPT-5目前暴露出的表达僵硬、风格趋同等问题,可能限制其在面向终端用户产品中的吸引力。这意味着未来AI赛道的竞争,不仅是模型参数、上下文窗口和API价格之争,也将是“技术能力”与“人类感受”之间的平衡之争。

综合来看,GPT-5并非一个失败的模型,而是一个优缺点极其鲜明的模型。它在编程、复杂分析和结构化推理上展现出强大实力,但在创意表达、自然交流和部分信息检索任务上仍未达到许多用户的期待。对于OpenAI而言,GPT-5的真正考验或许不是再刷新多少跑分纪录,而是如何证明一款“为机器优化”的强模型,也能重新赢回人类用户的心。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
400

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.