OpenAI 于上周正式发布了 GPT-5,这款号称“最聪明、最快、最有用”的模型一经推出便引发两极分化。尽管官方展示的基准测试成绩亮眼——数学测试 94.6%、现实世界编码任务 74.9%,但早期用户的反馈却截然相反。在 Reddit 上,“可怕”“糟糕”“灾难”等评价迅速刷屏,超过 3000 人联名要求恢复旧版 GPT-4o,迫使 OpenAI 承诺重新提供旧模型。
技术测评:代码与推理表现出色,创意与检索翻车
我们对 GPT-5 进行了全面测试。在 创意写作 方面,GPT-5 的输出依然缺乏灵魂,故事结构刻板,甚至缺少对白,与 Claude 4.1 Opus 等对手相比差距明显。在 敏感话题 处理上,模型极为保守,但通过角色扮演等简单提示即可绕开限制,安全措施形同虚设。最令人失望的是 信息检索 能力:在 30 万 token 的“大海捞针”测试中,它只能准确找到 1/3 的目标信息;在 8.5 万 token 测试中则完全失败,但通过附件上传后表现有所改善。不过,其他研究者的测试结论与此不同,提示词质量对结果影响巨大。
在 非数学推理 方面,GPT-5 获得 A 评级,能逐层分析复杂谜题并清晰解释。然而 数学推理 出现了极端矛盾:模型搞错了一道小学算术题(5.9 = X + 5.11 给出 X = -0.21,正确答案 0.79),却又能完美解答 FrontierMath 的高级难题,提示训练数据可能存在污染。在 编码 领域,GPT-5 与 Claude 4.1 Opus 并列最佳,生成的代码干净、功能完整,且价格仅为 Claude 的十分之一(输入 $1.25/百万 token)。在“氛围编程”的迭代修复中,Claude 仍稍占上风。
市场影响:预测市场大反转,谷歌伺机反超
GPT-5 的发布不仅在技术圈引发争议,也在加密货币预测市场掀起巨浪。根据 Polymarket 数据,OpenAI 在“8月底拥有最佳AI模型”的预测概率从 75% 骤降至 12%,而谷歌同步飙升至 80%。这一逆转直接反映了市场对 GPT-5 的失望情绪。从加密领域来看,AI 相关代币(如 FET、AGIX 等)短期承压,但长远看,GPT-5 在代码和逻辑推理上的突破将推动去中心化 AI 应用发展;而谷歌的强势可能加速 AI 模型竞争,利好加密预测市场与 AI 代理赛道。
总结:目标用户明确,普通用户失望
GPT-5 更像是为机器而非人类设计的对话助手——它在结构化、规则明确的领域(编码、科学分析、逻辑任务)表现出色,但在创造力、情感共鸣和自然对话方面严重不足。对于开发者而言,它是性价比极高的编码工具;但对普通用户来说,GPT-4o 带来的个性和全能感已然消失。OpenAI 承诺会持续迭代,但目前看来,竞争对手已获得宝贵窗口期。

