返回创意写作

创意写作

GPT-5评测
2026-06-29 12:30:11

GPT-5深度评测:基准测试碾压对手,但基础数学翻车、创意写作拉胯?

OpenAI发布GPT-5,声称是“最智能最快的模型”,在高级数学和编码基准上创下94.6%和74.9%的新纪录。然而,上线后用户反应两极:Reddit上大量批评称其“糟糕”“令人失望”,超过3000人请愿恢复旧版GPT-4o,Polymarket预测显示OpenAI最佳模型的概率从75%暴跌至12%。我们进行了全面测试,发现GPT-5在编码和逻辑推理上表现出色,API价格仅为Claude 4.1 Opus的五分之一,但在创意写作、信息检索和小学算术上严重翻车。文章详细对比了Claude、Grok和Gemini的表现,剖析了GPT-5的优缺点,并指出其更适合专业开发者而非普通用户。

330
GPT-5深度评测:基准测试碾压对手,但基础数学翻车、创意写作拉胯?