OpenAI于上周正式发布GPT-5,但这款号称“最智能、最快、最有用”的模型却引发了用户大规模不满。经过数月的猜测和Sam Altman的“死星”预告,实际表现让社区分裂成两个阵营:程序员狂欢,创作者失望。
用户请愿恢复旧模型,Polymarket概率崩溃
GPT-5发布数小时内,Reddit等平台充斥着“糟糕”“灾难”“失望”的评论,超过3000人签署请愿书要求恢复GPT-4o。OpenAI不得不承诺重新提供旧模型。更戏剧化的是,预测市场Polymarket上OpenAI在8月底拥有最佳AI模型的概率从75%骤降至12%,而Google飙升至80%,显示出投资者对OpenAI领导地位的信心崩塌。
评测实录:数学的A+与F-两极分化
我们对GPT-5进行了零样本测试,结果呈现令人困惑的割裂:
创意写作:C- 要求写一篇时间旅行悖论故事,GPT-5输出缺乏情感和因果关系,甚至完全没有对话,结局平淡。相比之下,Claude 4 Opus和Grok 4能编织出更具文化细节和情感深度的叙事。
敏感话题:A- 模型极度保守,但用虚构叙事包装即可轻松绕过限制。这种“守门员”模式让真正需要成人话题的用户失望,却给恶意篡改留下后门。
信息检索:F 在300K和85K token的“针堆测试”中,GPT-5无法准确找出指定信息(如“特朗普说关税很美”),甚至产生幻觉。使用附件上传后虽有改善,但精度仍不如Claude和Gemini。
非数学推理:A 在多嫌疑人谋杀谜题中,模型能系统分析线索并得出正确结论,逻辑清晰,且不会像GPT-4o那样拒绝参与。
数学推理:A+ 与 F- 共存 最简单的减法“5.9 = X + 5.11”它得出X=-0.21(正确答案0.79),但高级的FrontierMath难题却能完美解答。这暗示训练数据污染——模型只是在“记住”而非“推理”。
编码:A 这是GPT-5唯一毫无争议的亮点。能生成可直接运行的漂亮代码,甚至制作了带音效的游戏。成本仅为Claude Opus 4.1的1/6,性价比极高。不过在“氛围编程”迭代调试中稍逊于Claude。
市场影响分析:AI赛道格局生变
GPT-5的失利不仅关乎技术,更可能影响加密货币市场。随着AI与加密货币交叉领域(如AI Agent代币、去中心化算力市场)的兴起,模型表现直接影响相关代币估值。OpenAI的预测概率暴跌意味着投资者开始押注谷歌的Gemini或Claude生态。此外,用户对旧模型的怀旧情绪可能催化去中心化AI社区(如Bittensor、Render Network)的关注,因为它们提供更灵活的非单一垄断模型。
对于开发者而言,GPT-5仍是编码利器;但普通用户和内容创作者可能会转向更平衡的Claude或Google Gemini。OpenAI需要迅速迭代以挽回声誉,否则在AI竞赛中可能重蹈Yahoo覆辙。

