GPT-5 Review Sparks Split Reaction as Coding Strength Clashes With Creative Weakness

GPT-5 Review Sparks Split Reaction as Coding Strength Clashes With Creative Weakness

N
News Editor 01
2026-07-05 20:12:11
OpenAI’s GPT-5 impressed with strong benchmark scores in math and coding, but early reviews show mixed user sentiment. Tests suggest it excels in coding and reasoning while underperforming in creative writing, retrieval, and basic arithmetic.

OpenAI于上周正式推出GPT-5,将其定位为“迄今最聪明、最快、最有用”的模型,并公布了多项亮眼基准成绩,包括数学测试得分94.6%真实世界编程任务得分74.9%。不过,市场和用户的第一时间反馈并未完全呼应这份官方自信,反而迅速形成鲜明分化。

根据原文评测,GPT-5发布后数小时内,围绕其表现的讨论在社交平台迅速升温,不少用户用“失望”“糟糕”“不及预期”等词形容体验。由于争议过大,OpenAI甚至承诺恢复旧版GPT-4o的可选入口。这一变化说明,即便新模型在基准测试中取得进步,用户仍然高度重视模型的实际交互体验与可用性。

市场情绪快速转冷,预测平台赔率剧烈波动

从市场侧观察,GPT-5发布后的舆论变化也迅速反映在预测市场。报道提到,在Polymarket上,OpenAI“将在8月底前拥有最佳AI模型”的概率,曾在GPT-5发布前达到75%,但在模型亮相后短时间内大幅跌至12%。与此同时,Google则升至80%,成为新的领先者。

尽管这并非加密资产价格本身的直接波动,但预测市场作为链上情绪温度计,往往能反映投资者和科技用户对AI竞争格局的即时判断。对于关注AI概念代币、算力基础设施、去中心化AI协议以及相关加密叙事的市场参与者而言,这类情绪变化同样具有参考意义。

实测结果:编程与推理是亮点,创作能力仍显不足

从评测内容看,GPT-5最突出的优势集中在编程非数学逻辑推理两个方向。在复杂推理任务中,GPT-5能够较为系统地拆解线索、分析关系,并给出清晰的结论。对于商业分析、代码逻辑排查、哲学式问题推演等结构化任务,它展现出较强的稳定性。

编程方面,评测给出的评价同样较高。文章指出,GPT-5生成的代码通常结构清晰、功能完整,且在从零构建项目时表现突出。更重要的是,其API价格相较竞品更具竞争力:输入价格为每100万token 1.25美元,输出价格为每100万token 10美元。相比之下,Claude Opus 4.1的起始价格分别为15美元75美元。在企业开发、自动化脚本、Web应用原型等场景中,这种“性价比”优势可能提升GPT-5的采用率。

然而,GPT-5在创意写作中的表现却明显逊色。评测认为,其生成文本虽然技术上正确,但缺乏情感张力、细节层次与文学感染力,风格上仍带有典型AI生成痕迹。与Claude 4.1 Opus相比,GPT-5在叙事展开、人物动机塑造和因果链条构建上显得较为单薄。这意味着对于依赖内容生成、品牌叙事、创意营销的用户而言,GPT-5目前未必是最理想选择。

信息检索与基础算术短板,削弱“全能模型”叙事

更受争议的是GPT-5在信息检索基础数学上的表现。按照这篇评测,GPT-5在处理大上下文信息时,虽然可以借助附件方式处理300K85K token级别材料,但在从中准确找出特定信息时,成功率并不理想。在300K测试中,模型仅准确找回3条目标信息中的1条;在85K测试中,则未能找到两条指定内容。

对于研究、审计、合规分析和长文档处理场景而言,这种“不稳定检索”可能构成实用层面的限制。尤其是在加密行业,用户常需要AI辅助解读治理提案、审查智能合约文档、梳理监管文本或总结项目白皮书,如果检索准确度不足,将直接影响决策效率。

另一项被广泛讨论的问题来自基础算术。评测指出,GPT-5在一个简单小数运算题中给出了错误答案,这与其官方强调的高阶数学能力形成反差。虽然该模型在高难度数学题上表现出色,但这种“高阶题会做、基础题翻车”的现象,也让外界对其训练方式、评测基准以及真实泛化能力提出更多质疑。

安全机制严格,但绕过方式仍存在

在敏感话题处理上,GPT-5展现出更严格的安全边界。评测认为,它对争议性、违法风险或成人向内容普遍采取拒答策略。不过,文章同时指出,如果用户通过角色扮演、虚构叙事等方式改写提问,模型在某些情况下仍可能被绕过。这意味着,当前AI行业在“安全限制”与“可被提示词规避”之间的矛盾依旧存在。

这一点对加密行业同样重要。随着越来越多项目引入AI客服、链上助手和自动化研究工具,模型的合规性、内容安全性以及防提示注入能力,正成为平台级应用必须重视的基础能力。

对AI与加密市场的潜在影响

从更广视角看,GPT-5的发布及争议,释放出两个清晰信号。第一,AI模型竞争正从单纯比拼参数和基准成绩,转向更强调真实使用体验稳定性成本效率。第二,链上预测市场、AI概念投资和加密基础设施叙事,正在越来越快地吸收AI产业动态并形成反馈。

对于加密投资者而言,GPT-5事件并不意味着某一方已经胜出,而是说明AI赛道仍处于快速迭代期。短期内,市场可能继续关注大型模型厂商在编程代理、企业自动化、上下文扩展和多模态能力上的竞争;中长期则要看谁能真正把“技术领先”转化为“用户偏好”与“开发者生态”。

总体而言,GPT-5并非一款失败产品。相反,它在逻辑推理代码生成上展现出明显实力,并凭借更低API成本具备商业吸引力。但如果用户期待的是更自然的对话、更强的创造力和更稳健的长文本检索,那么GPT-5目前仍难言全面领先。对于市场来说,这种“能力增强但人格弱化”的产品特征,或许正是其口碑两极化的根源。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
400

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.