GPT-5 Review: Coding Excellence, Creative Failure, and Prediction Markets Favor Google Over OpenAI

GPT-5 Review: Coding Excellence, Creative Failure, and Prediction Markets Favor Google Over OpenAI

N
News Editor 01
2026-07-05 20:09:11
OpenAI's GPT-5 launch sparks mixed reactions: strong in coding/reasoning, weak in creativity and retrieval. Users demand GPT-4o return. Prediction market odds for best model drop from 75% to 12%, with Google surging to 80%.

OpenAI 于上周正式发布了 GPT-5,这款号称“最聪明、最快、最有用”的模型一经推出便引发两极分化。尽管官方展示的基准测试成绩亮眼——数学测试 94.6%、现实世界编码任务 74.9%,但早期用户的反馈却截然相反。在 Reddit 上,“可怕”“糟糕”“灾难”等评价迅速刷屏,超过 3000 人联名要求恢复旧版 GPT-4o,迫使 OpenAI 承诺重新提供旧模型。

技术测评:代码与推理表现出色,创意与检索翻车

我们对 GPT-5 进行了全面测试。在 创意写作 方面,GPT-5 的输出依然缺乏灵魂,故事结构刻板,甚至缺少对白,与 Claude 4.1 Opus 等对手相比差距明显。在 敏感话题 处理上,模型极为保守,但通过角色扮演等简单提示即可绕开限制,安全措施形同虚设。最令人失望的是 信息检索 能力:在 30 万 token 的“大海捞针”测试中,它只能准确找到 1/3 的目标信息;在 8.5 万 token 测试中则完全失败,但通过附件上传后表现有所改善。不过,其他研究者的测试结论与此不同,提示词质量对结果影响巨大。

非数学推理 方面,GPT-5 获得 A 评级,能逐层分析复杂谜题并清晰解释。然而 数学推理 出现了极端矛盾:模型搞错了一道小学算术题(5.9 = X + 5.11 给出 X = -0.21,正确答案 0.79),却又能完美解答 FrontierMath 的高级难题,提示训练数据可能存在污染。在 编码 领域,GPT-5 与 Claude 4.1 Opus 并列最佳,生成的代码干净、功能完整,且价格仅为 Claude 的十分之一(输入 $1.25/百万 token)。在“氛围编程”的迭代修复中,Claude 仍稍占上风。

市场影响:预测市场大反转,谷歌伺机反超

GPT-5 的发布不仅在技术圈引发争议,也在加密货币预测市场掀起巨浪。根据 Polymarket 数据,OpenAI 在“8月底拥有最佳AI模型”的预测概率从 75% 骤降至 12%,而谷歌同步飙升至 80%。这一逆转直接反映了市场对 GPT-5 的失望情绪。从加密领域来看,AI 相关代币(如 FET、AGIX 等)短期承压,但长远看,GPT-5 在代码和逻辑推理上的突破将推动去中心化 AI 应用发展;而谷歌的强势可能加速 AI 模型竞争,利好加密预测市场与 AI 代理赛道。

总结:目标用户明确,普通用户失望

GPT-5 更像是为机器而非人类设计的对话助手——它在结构化、规则明确的领域(编码、科学分析、逻辑任务)表现出色,但在创造力、情感共鸣和自然对话方面严重不足。对于开发者而言,它是性价比极高的编码工具;但对普通用户来说,GPT-4o 带来的个性和全能感已然消失。OpenAI 承诺会持续迭代,但目前看来,竞争对手已获得宝贵窗口期。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
400

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.