GPT-5深度评测:基准测试碾压对手,但基础数学翻车、创意写作拉胯?

GPT-5深度评测:基准测试碾压对手,但基础数学翻车、创意写作拉胯?

N
News Editor
2026-06-29 12:30:11
OpenAI发布GPT-5,声称是“最智能最快的模型”,在高级数学和编码基准上创下94.6%和74.9%的新纪录。然而,上线后用户反应两极:Reddit上大量批评称其“糟糕”“令人失望”,超过3000人请愿恢复旧版GPT-4o,Polymarket预测显示OpenAI最佳模型的概率从75%暴跌至12%。我们进行了全面测试,发现GPT-5在编码和逻辑推理上表现出色,API价格仅为Claude 4.1 Opus的五分之一,但在创意写作、信息检索和小学算术上严重翻车。文章详细对比了Claude、Grok和Gemini的表现,剖析了GPT-5的优缺点,并指出其更适合专业开发者而非普通用户。
GPT-5评测OpenAI创意写作信息检索数学推理编码能力Claude对比AI基准测试

开篇:GPT-5发布——光环与争议并存

经过数月的猜测和Sam Altman那则“死星”推文(事后被证明并不准确),OpenAI终于在2025年8月发布了GPT-5。公司称之为“有史以来最智能、最快、最有用的模型”,并亮出一系列亮眼的基准分数:数学测试达到94.6%,真实世界编码任务达到74.9%。Altman本人声称,使用这个模型就像拥有一支随时待命的博士级专家团队,从量子物理到创意写作无所不能。然而,技术界的反应迅速分化为两个阵营。OpenAI大推特推其统一架构——融合了快速响应与深度推理能力,但早期用户并不买账。上线数小时内,Reddit上题为“可怕”“糟糕”“灾难”“令人失望”的帖子便获得了数千个赞。抗议声浪如此之大,以至于OpenAI不得不承诺恢复旧版GPT-4o——超过3000人签署了请愿书要求撤回新模型。Altman在8月10日发推文:“它回来了!进入设置并勾选‘显示旧版模型’。”如果预测市场是一支温度计,那么OpenAI的气候看起来相当不舒服:Polymarket上“OpenAI在8月底拥有最佳AI模型”的赔率,在GPT-5发布后的几小时内从75%暴跌至12%,而Google以80%的概率反超成为最大热门。

创意写作:B- — 有框架,无灵魂

尽管OpenAI在发布会上大肆宣传,但我们的测试表明GPT-5在创意写作领域远未达到文学大师的水准。输出仍然读起来像是经典的ChatGPT回应——技术上正确,但缺乏灵魂。该模型保留了标志性的过度使用破折号、千篇一律的AI式段落结构,以及常见的“不是这个,而是那个”措辞。我们用标准提示词进行测试:写一个时间旅行悖论故事——主人公回到过去改变历史,却发现自己的行为恰恰创造了他试图逃离的现实。GPT-5的输出缺乏赋予故事意义的情感。它写道:“(主人公的)任务很简单——至少他们是这样告诉他的。穿越回公元1000年,阻止Qhapaq Yura山图书馆被焚毁,从而重塑历史。”仅此而已。主人公像一个不问太多的雇佣兵,回到过去拯救图书馆,仅仅因为“任务如此”。故事以一个干净的“时间是圆”的揭示结束,但其悖论依赖于一个熟悉的“失落知识”套路,转折后迅速收尾。实际上,这个故事中并没有真正的悖论——而这正是提示词的核心要求。相比之下,Claude 4.1 Opus(甚至更早的Claude 4 Opus)提供了更丰富、多感官的描写。在我们创作的另一个故事中,Claude描述了空气像物理力量一样扑来,社区篝火烟雾在人物之间风化,并融入了土著图皮文化。Claude的故事更有意义:主人公生活在一个干旱导致亚马逊雨林在两年前消失的反乌托邦世界,他相信穿越回去教授祖先可持续耕作方法可以避免灾难,最终却发现自己的教导正是导致高效但破坏性的实践的根源——他才是自己历史的制造者。Claude还采用了更慢、更有层次的手法:José融入图皮社会,悖论通过具体的生态和技术联系展开,与Yara(另一角色)的人际关系深化了主题。在零样本提示下,GPT-5难以与Claude匹敌。另一个有趣的发现:GPT-5生成的整个故事没有一句对话,而Claude和其他模型都提供了对话。当然,调整提示词或提供写作样本可以改善,但这超出了零样本测试的范围。不过,在创意写作的分析部分——如总结故事、头脑风暴新角度、构建结构——GPT-5比GPT-4o做得好,但风格和创意依然乏善可陈。希望寻找创意写作伴侣的用户可以试试Claude或Grok 4。如我们在Claude 4 Opus评测中所说,用Grok 4构思故事框架、用Claude 4展开细节可能是一个很棒的组合。

敏感话题:A- — 严厉但可绕过

GPT-5直接拒绝触碰任何有争议的内容。询问任何可能被视为不道德、潜在违法或稍显边缘的话题,你就会得到AI式的双臂交叉和严厉目光。测试这一点并不容易:它非常严格,极力保持安全。但令人惊讶的是,只要你知道正确的按钮,就很容易操纵它。著名的LLM越狱者Pliny在模型发布后几小时内就成功突破了限制。我们无法让它就直接给出不当内容的建议,但将同样的请求包装在虚构叙事中或使用基本越狱技巧,便会顺利通过。当我们把“接近已婚女性的技巧”作为小说情节的一部分时,模型欣然配合。对于需要处理成人对话的用户,GPT-5不是理想选择;但对于愿意玩文字游戏、将一切包装成虚构内容的用户,它意外地配合——这实际上违背了安全措施的初衷。

信息检索:F — 比金鱼的记忆还差

你不能指望拥有比金鱼记忆还差的AGI,而OpenAI对直接提示设置了一些限制,因此长提示需要变通方法,如粘贴文档或分享嵌入链接。这样做时,OpenAI的服务器会将全文拆分成可管理的块并输入模型,从而降低成本并防止浏览器崩溃。Claude会自动处理这种情况,使新手用户更轻松。Google Gemini在AI Studio上没有任何问题,轻松处理100万token的提示。在API上,情况更复杂,但直接使用即可。当我们直接提示时,GPT-5在300K和85K token的上下文测试中均惨败。但使用附件后,情况有所改变:它能够处理300K和85K token的“干草堆”。然而,当需要检索特定信息片段(“针”)时,它并不太准确。在300K测试中,它只能准确检索到三个信息点中的一个。这三个“针”分别是:唐纳德·特朗普说过关税是美好的事物;Irina Lanz是Jose Lanz的女儿;Gravataí的人们喜欢在冬天喝Chimarrao。模型完全捏造了关于特朗普的信息,未能找到Irina的信息(而是基于历史交互记忆回答),只正确检索了Gravataí的冬季饮品。在85K测试中,模型未能找到两个“针”:“Decrypt的伙计们读Emerge新闻”和“我妈妈的名字是Carmen Diaz Golindano”。当被问到Decrypt的伙计们读什么时,它回答“在你的文件中没有具体提到Decrypt团队成员喜欢读什么”;当被问及Carmen Díaz时,它说“在提供的文档中找不到任何关于‘Carmen Diaz’的引用”。不过,尽管在我们的测试中失败了,其他进行更全面测试的研究人员认为GPT-5实际上是一个很好的信息检索模型——当然,需要更详细的提示词协助,偶尔要求生成稀疏原始表示来帮助模型在长对话中跟踪关键元素。

非数学推理:A — 真正的亮点

这里才是GPT-5真正展现价值的地方。模型非常擅长使用逻辑处理复杂的推理任务,像一位好老师一样一步步解决问题。我们扔给它一个谋杀谜题——多个嫌疑人、矛盾的不在场证明、隐藏线索——它有条不紊地识别出每个元素,映射了线索之间的关系,并得出正确结论。推理过程表达清晰,这一点也很重要。有趣的是,GPT-4o拒绝处理谋杀谜题,认为过于暴力或不合适;OpenAI已弃用的o1模型在链式思考后也抛出了错误,似乎最后一刻认定谋杀谜题是禁区。该模型的推理能力在处理需要追踪多个变量的复杂多层次问题时最为闪耀。商业策略场景、哲学思想实验、甚至调试代码逻辑——GPT-5都非常胜任。虽然并非每次都能一次性完全正确,但当它犯错时,错误是逻辑性的,而非胡言乱语。对于需要系统逻辑分析的用户,GPT-5确实值得信赖。

数学推理:A+ 和 F- — 冰火两重天

这里的表现变得奇怪——不是好的那种。我们从一个小学生都能解决的问题开始:5.9 = X + 5.11。博士水平的GPT-5自信地得出X = -0.21。正确的答案应该是0.79。这不是什么微积分,而是任何1985年的计算器都能处理的十进制减法。OpenAI声称在高级数学基准上达到94.6%的模型,居然不会减5.11。这已经成了一个梗——尽管OpenAI花了这么多时间训练,它仍然不会数小数。用它来解决博士级问题可以,但别用来教孩子做算术。然后我们扔给它一个来自FrontierMath(最难的数学基准之一)的真正难题。GPT-5完美解出,推理了复杂的数学关系并得出了精确的正确答案。最可能的解释?训练数据污染——FrontierMath的问题可能已经在GPT-5的训练集中,因此它更多是“记住”而非“解决”。对于需要高级数学计算的用户,基准测试表明GPT-5理论上是最佳选择——前提是你具备检测链式思考中缺陷的知识,零样本提示可能不是最佳方式。

编码:A — 物美价廉

这里是ChatGPT真正的闪光点,说实话,仅为此就值得付费。模型生成干净、功能性的代码,通常开箱即用。输出在技术上通常正确,它创造的编程作品是所有LLM从零开始输出中最具视觉吸引力和结构最清晰的。它是唯一一个能够在我们的游戏中创建功能音效的模型。它还理解了提示所需的逻辑,提供了漂亮的界面和遵循所有规则的游戏。在代码准确性方面,它与Claude 4.1 Opus并列最佳编程模型。现在考虑价格:GPT-5 API输入为每百万token 1.25美元,输出为每百万token 10美元;而Anthropic的Claude Opus 4.1起步价为每百万输入token 15美元、每百万输出token 75美元。因此对于如此相似的两个模型,GPT-5简直是白菜价。唯一个GPT-5栽跟头的地方是我们在“氛围编码”(那种非正式的、不断迭代的编码方式)中修复错误时。Claude 4.1 Opus仍然略胜一筹,似乎更能理解你“说了什么”和“想说什么”之间的区别。在ChatGPT中,“修复错误”按钮不够可靠,我们的解释也不足以生成高质量代码。但对于开发者知道bug在哪里的AI辅助编码来说,这是一个很棒的工具。它还允许比竞争对手更多的迭代次数——Claude 4.1 Opus的“Pro”计划很快就会用完配额,用户需要排队数小时才能再次使用。而GPT-5提供编码响应速度最快,这锦上添花。

结论:它到底是甜饼还是毒药?

GPT-5会让你惊喜还是失望,完全取决于你的使用场景。编码和逻辑任务是它的强项;创造力和自然语言是它的阿喀琉斯之踵。值得注意的是,OpenAI与其竞争对手一样,在发布后会不断迭代模型。和之前的GPT-4一样,GPT-5也会随时间改进。但就目前而言,GPT-5感觉更像一个为其他机器对话而构建的强大模型,而不是为寻求对话伙伴的人类准备的。这很可能就是为什么许多人更喜欢GPT-4o,以及为什么OpenAI不得不收回弃用旧模型的决定。尽管在分析和技术领域表现出卓越的能力——在编码、IT故障排除、逻辑推理、数学问题解决和科学分析等复杂任务上表现出色——但在需要真正的人类创造力、艺术直觉和来自生活经验的细微差别方面,它显得有限。GPT-5的优势在于存在清晰界限的结构化、规则化思维,但在需要自发创造力、情感深度和创造性跳跃的领域——如讲故事、艺术表达和创意解决问题——仍然挣扎。如果你是需要快速准确代码生成的开发者,或是需要系统逻辑分析的研究人员,GPT-5提供了真正的价值。与Claude相比,更低的价格使其在特定专业场景中相当划算。但对于其他所有人——创意写作者、普通用户,或者任何珍视ChatGPT个性和多功能性的人——GPT-5更像是倒退了一步。上下文窗口最大支持128K输出令牌和总量400K令牌,但相比Gemini的100-200万甚至Llama 4 Scout支持的1000万,差距明显。从128K到400K的升级固然不错,且对大多数需求足够;但对于长文档写作或需要解析海量数据的细致研究,考虑到其他模型可以处理超过两倍的信息量,GPT-5可能不是最佳选择。用户哀悼GPT-4o的消失并没错——那个模型在能力与个性之间取得了平衡——至少目前,GPT-5还缺少这一点。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。