GPT-5口碑两极化:编程强势领先,创作与检索表现遭质疑

GPT-5口碑两极化:编程强势领先,创作与检索表现遭质疑

N
News Editor 01
2026-07-05 20:11:12
OpenAI发布GPT-5后迅速引发两极评价。测试显示其在编程、逻辑推理和高级数学基准上表现突出,但在创意写作、信息检索与基础数学稳定性方面暴露短板,市场预期也随之明显波动。

OpenAI最新发布的GPT-5在亮相后迅速成为科技与AI市场的焦点。官方将其定义为“迄今最聪明、最快、最有用的模型”,并给出多项亮眼成绩,包括数学测试得分94.6%真实世界编码任务得分74.9%。不过,从用户反馈到第三方实测,GPT-5并未形成一边倒的正面口碑,反而出现了明显的评价分化。

根据CryptoComLearn的测评,GPT-5在编程、复杂逻辑推理等结构化任务上确实展现出强劲实力,但在创意写作、信息检索、基础数学稳定性等领域,其实际表现与市场期待之间存在不小落差。这种“基准测试优秀、用户体验争议”的矛盾,也成为GPT-5发布后的核心话题。

用户口碑分裂,旧模型回归成焦点

GPT-5发布后不久,Reddit等社区就出现大量负面讨论,部分用户用“糟糕”“灾难”“令人失望”等字眼形容其首发体验。争议声浪之大,甚至促使OpenAI重新开放旧版模型GPT-4o的显示选项。报道称,已有超过3000人签署请愿,要求恢复旧模型访问。

这一变化反映出一个关键问题:对于不少普通用户而言,模型能力并不只体现在跑分和复杂推理上,还包括对话自然度、表达风格、情感传递和使用习惯的延续性。GPT-5虽强调统一架构与更强推理能力,但在“像人一样交流”这件事上,并未完全赢得市场。

创意写作偏弱,技术正确但“缺少灵魂”

在创意写作测试中,GPT-5整体被评为B-。测评指出,它生成的故事虽然结构完整、语法无误,但语言风格依旧带有明显的AI痕迹,叙事缺乏情感层次与艺术张力,甚至在“时间悖论”这一核心设定上也未能充分展开。

相比之下,Claude 4.1 Opus在相同任务中呈现出更丰富的感官描写、更细致的因果铺垫以及更自然的人物互动。换言之,GPT-5更像一位高效的内容整理者,适合做故事总结、结构建议与创意头脑风暴,但若直接承担文学创作,其表现仍难与顶级竞品抗衡。

安全限制严格,但并非无懈可击

在敏感话题处理上,GPT-5被评为A-。其默认策略明显趋于保守,对于可能涉及争议、违法或成人内容的话题往往直接拒绝作答。这一设置有助于降低平台风险,也符合大型AI厂商当前的监管导向。

但测试同时指出,若用户通过角色扮演、虚构情节等方式包装问题,模型仍可能绕过原有约束。这意味着GPT-5在安全策略上虽然更严格,但“越狱”问题仍未被彻底解决。对企业客户而言,这类现象提醒市场:模型安全不只是拒答率高低,更在于是否具备稳定一致的规则执行能力。

信息检索成短板,长上下文优势未充分兑现

信息检索是GPT-5争议较大的领域之一,测评给出了F级评价。虽然OpenAI提供了较大的上下文处理能力,文章提到其总上下文可达400K tokens,输出窗口最高为128K tokens,但在实际长文档“找针”测试中,GPT-5对关键信息的提取准确率并不理想。

在一项300K tokens测试中,模型仅准确找出三项目标信息中的一项;在85K tokens测试中,则未能正确识别两项指定内容。测评认为,虽然通过附件方式上传材料后模型能够“读到”文档,但在精确检索、定位事实上仍不够稳定。与Claude的自动处理能力,以及Gemini在超长上下文上的表现相比,GPT-5在这一维度尚未建立明显优势。

逻辑推理与编程依旧是最大亮点

如果说GPT-5的争议主要集中在“是否更像人”,那么它的优势则体现在“是否更像工具”。在非数学推理任务中,GPT-5获得A评级。面对多嫌疑人、线索交错的推理问题,它能够较系统地拆解条件、梳理关系并得出正确结论,且解释过程清晰。

而在编程测试中,GPT-5同样拿到A。文章认为,它生成的代码通常结构清楚、视觉呈现较佳,并且在不少场景下可直接运行。更关键的是,GPT-5在价格上具备相当强的竞争力:其API价格为每100万输入tokens收费1.25美元每100万输出tokens收费10美元;相比之下,Anthropic Claude Opus 4.1的起步价格分别达到15美元75美元。在性能接近的情况下,成本差距使GPT-5对开发者和企业用户更具吸引力。

数学能力出现反差,基准强但基础题翻车

GPT-5在数学上的表现最具戏剧性。文章一方面指出,它在高难度FrontierMath题目上给出了完全正确的答案;另一方面,却在简单小数减法5.9 = X + 5.11中错误地给出X = -0.21,而正确答案应为0.79。这种“高阶题会做、基础题失手”的反差,引发了外界对基准测试代表性的进一步讨论。

测评认为,这可能与训练数据污染、模型推理路径稳定性不足等因素有关。对专业用户来说,这类模型也许适合参与高阶分析,但前提是使用者具备足够能力去识别其过程中的潜在错误。

市场影响:AI竞争焦点从跑分转向体验与商业化

GPT-5的发布不仅影响用户舆论,也迅速传导至预测市场。报道称,在Polymarket上,OpenAI“到8月底拥有最佳AI模型”的概率曾在GPT-5发布后数小时内从75%跌至12%,而Google则升至80%。虽然预测市场并不等同于真实份额,但它清晰反映出投资者和观察者对AI竞争格局的敏感变化。

从行业角度看,GPT-5释放了一个重要信号:大模型竞争已不再只是参数、跑分和推理能力的比拼,而是进入了产品体验、价格效率、上下文能力与安全治理综合较量的新阶段。对于加密行业从业者而言,这同样具有参考价值。越来越多Web3项目正将AI嵌入交易助手、链上数据分析、合约开发与社区运营中,模型是否稳定、是否便宜、是否适合长文本分析,将直接影响集成方案的选型。

总体来看,GPT-5更像是一款面向开发者、研究员和专业技术场景优化的模型,而非全面取代旧一代产品的“全民型AI”。如果用户核心需求是代码生成、技术分析、逻辑拆解,GPT-5具备较高实用价值;但若更看重创作表达、自然对话和个性化体验,其当前表现可能仍难完全服众。未来随着OpenAI持续迭代,GPT-5能否从“赢基准”走向“赢人心”,仍将是市场最关注的看点之一。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。