GPT-5测评:代码封神但创作翻车,预测市场押注谷歌反超OpenAI

GPT-5测评:代码封神但创作翻车,预测市场押注谷歌反超OpenAI

N
News Editor 01
2026-07-05 20:09:11
OpenAI发布GPT-5,技术测评显示其在代码与逻辑推理上表现优异,但创意写作和信息检索令人失望。用户强烈不满迫使OpenAI恢复旧版GPT-4o。预测市场上,OpenAI最佳模型概率从75%暴跌至12%,谷歌反超至80%。

OpenAI 于上周正式发布了 GPT-5,这款号称“最聪明、最快、最有用”的模型一经推出便引发两极分化。尽管官方展示的基准测试成绩亮眼——数学测试 94.6%、现实世界编码任务 74.9%,但早期用户的反馈却截然相反。在 Reddit 上,“可怕”“糟糕”“灾难”等评价迅速刷屏,超过 3000 人联名要求恢复旧版 GPT-4o,迫使 OpenAI 承诺重新提供旧模型。

技术测评:代码与推理表现出色,创意与检索翻车

我们对 GPT-5 进行了全面测试。在 创意写作 方面,GPT-5 的输出依然缺乏灵魂,故事结构刻板,甚至缺少对白,与 Claude 4.1 Opus 等对手相比差距明显。在 敏感话题 处理上,模型极为保守,但通过角色扮演等简单提示即可绕开限制,安全措施形同虚设。最令人失望的是 信息检索 能力:在 30 万 token 的“大海捞针”测试中,它只能准确找到 1/3 的目标信息;在 8.5 万 token 测试中则完全失败,但通过附件上传后表现有所改善。不过,其他研究者的测试结论与此不同,提示词质量对结果影响巨大。

非数学推理 方面,GPT-5 获得 A 评级,能逐层分析复杂谜题并清晰解释。然而 数学推理 出现了极端矛盾:模型搞错了一道小学算术题(5.9 = X + 5.11 给出 X = -0.21,正确答案 0.79),却又能完美解答 FrontierMath 的高级难题,提示训练数据可能存在污染。在 编码 领域,GPT-5 与 Claude 4.1 Opus 并列最佳,生成的代码干净、功能完整,且价格仅为 Claude 的十分之一(输入 $1.25/百万 token)。在“氛围编程”的迭代修复中,Claude 仍稍占上风。

市场影响:预测市场大反转,谷歌伺机反超

GPT-5 的发布不仅在技术圈引发争议,也在加密货币预测市场掀起巨浪。根据 Polymarket 数据,OpenAI 在“8月底拥有最佳AI模型”的预测概率从 75% 骤降至 12%,而谷歌同步飙升至 80%。这一逆转直接反映了市场对 GPT-5 的失望情绪。从加密领域来看,AI 相关代币(如 FET、AGIX 等)短期承压,但长远看,GPT-5 在代码和逻辑推理上的突破将推动去中心化 AI 应用发展;而谷歌的强势可能加速 AI 模型竞争,利好加密预测市场与 AI 代理赛道。

总结:目标用户明确,普通用户失望

GPT-5 更像是为机器而非人类设计的对话助手——它在结构化、规则明确的领域(编码、科学分析、逻辑任务)表现出色,但在创造力、情感共鸣和自然对话方面严重不足。对于开发者而言,它是性价比极高的编码工具;但对普通用户来说,GPT-4o 带来的个性和全能感已然消失。OpenAI 承诺会持续迭代,但目前看来,竞争对手已获得宝贵窗口期。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。