GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负

GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负

N
News Editor
2026-07-18 15:21:03
OpenAI 这次没有推出带“思考档位”的单一模型,而是将 GPT-5.6 拆分为 Sol、Terra 和 Luna 三个独立模型。Decrypt 的对比把焦点放在 Sol 与 Anthropic 当前最强公开模型 Claude Fable 5 身上:Sol 在多项编码基准、速度和成本上占优,Fable 5 在创意写作与单次生成浏览器游戏的主观测试中更出色。文章还指出,Fable 5 在 6 月被美国政府禁用、7 月 1 日恢复后,多次临时延长订阅访问期限,最新截止日期为 7 月 19 日。
OpenAIAnthropicGPT-5.6Claude Fable 5大语言模型AI 测评科技动态

OpenAI 这次没有像过去那样推出一个带不同“思考档位”的模型。按 Decrypt 的说法,GPT-5.6 被拆成了 3 个彼此独立的大语言模型:Sol、Terra 和 Luna。它们的训练方式、定价和能力上限都不一样。文章认为,真正有比较意义的一组,是 Sol 对 Claude Fable 5——后者是 Anthropic 当前最强的公开模型。

GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负 2

价格先把差距拉开。Sol 的收费是每百万输入 token 5 美元、输出 30 美元;Fable 5 是输入 10 美元、输出 50 美元。也就是说,Fable 5 的价格大约高出一倍。文章还提到,GPT-5.6 三个模型里最便宜的 Luna,输入每百万 token 1 美元、输出 6 美元,但它在编码能力上已经超过 Anthropic 的 Opus 4.8。Decrypt 认为,这一点会在 7 月 19 日变得格外敏感。

过去一个月,Fable 5 的处境并不轻松。6 月 12 日,在亚马逊研究人员发现一种越狱方式、可将该模型变成非预期漏洞扫描器之后,美国政府对其实施禁用。随后 Anthropic 在全球范围内下线了 Fable 5 共 19 天,重新构建安全分类器后,于 7 月 1 日恢复服务,但访问窗口被压缩。

模型恢复后,Anthropic 一直在往后推订阅用户的访问截止时间。最初,公司计划在 7 月 7 日之后把它转入 usage-credits 付费墙;后来延期到 7 月 12 日,现在又延到 7 月 19 日。Decrypt 指出,每次延期都是在临近截止前几个小时宣布,而且没有通过正式博文发布。

Anthropic 在 2026 年 7 月 12 日通过 Claude 账号写道:“我们将所有付费套餐中的 Claude Fable 5 访问权限,以及 Claude Code 每周高出 50% 的速率限制,延长至 7 月 19 日。”

Decrypt 认为,原因并不难理解。如果 7 月 19 日之后 Fable 5 退出订阅套餐,那么 Anthropic 面向付费订阅用户最强的模型就会变成 Opus 4.8;而在编码上,Luna 已经以低得多的价格超过了它。文章称,即便是在每周额度只有 50% 提升的条件下,继续保留 Fable 5,也是在避免 Anthropic 的订阅层级在纸面上显得比 OpenAI 的中档产品更弱。

GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负 3

基准测试:Sol 在编码相关指标上领先

如果只看基准成绩,两边的差距并不大,但编码相关项目里 Sol 更强。

  • 在 Artificial Analysis Coding Agent Index 上,Sol 得分 80,Fable 5 为 77.2。Decrypt 写道,Sol 使用的 token 大约只有对方一半,耗时不到对方一半,成本约为对方三分之一。
  • 在覆盖 55 个领域专业工作流的 Agents' Last Exam 中,Sol 为 53.6%,Fable 5 为 40.5%。
  • 在 Terminal-Bench 2.1 中,开启 ultra 模式、并行使用 4 个子代理的 Sol 得分 91.9%,Fable 5 为 83.1%。

不过,如果看更宽泛的综合能力指数,Fable 5 仍有微弱优势。按照聚合了 9 项不同基准的 Intelligence Index,Fable 5 只比 GPT 5.6 高 1 分。Decrypt 认为,这样的差距几乎感受不到。

实测一:创意写作里,Fable 5 更完整,Sol 更直白

Decrypt 认为,当前不少基准和测试过度聚焦编码,难以完整衡量模型能力。因此,文章设计了几组偏离常规编码场景的提示词,观察两者的实际表现。

第一组是创意写作。测试使用同一个提示词:把 Jose Lanz 从 2150 年送回公元 1000 年,让他陷入时间旅行悖论,而且直到回家后才明白自己做了什么。

两边给出的内容都更像中篇小说而不是短篇故事,但都犯了同一个关键错误:主人公在回到未来之前,就已经意识到悖论。

GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负 4

在 GPT-5.6 Sol 的版本里,Jose 在故事中段就意识到,“那个未知的旅行者并不是他要阻止的人。那个人就是他自己。”Fable 5 更直接,Jose 在过去时空里就明白整个悖论正是由自己引发。“没有种子事件。他自己就是种子事件。

Sol 的作品《The First Fire》走的是更直接的类型科幻路线:Jose 意外引入了一种熔炉,而这正是他想阻止的气候崩塌的起点。Decrypt 认为,它的开头写得很漂亮:“Only thunder. Only insects. Only the wet breath of the world before machines.”

问题也出在这里。文章认为,Sol 不太信任这些意象本身的表达力,于是不断解释同一个循环:先解释一遍,再解释一遍,再安排一个更老的 Jose 留下录音,第三次说明“His attempt to solve the problem had created the problem. His attempt to reduce the harm had created the solutions.” Decrypt 的判断是:意思很清楚,但第三遍读起来已经让人疲惫。

Fable 5 的《Lo Que Arde, Vuelve》则把同样的悖论建立在马拉开波湖、卡塔通博闪电和 Añu 村庄上。Jose 只是安慰了一个受惊的孩子,却因此制造了自己穿越回去原本想抹去的预言。整条因果循环被压缩成一句:“The grief that sent him backward was the cargo he delivered.”

但 Fable 的问题和 Sol 正好相反。Decrypt 认为,它有时过于相信自己的文风,隐喻堆叠太多,像“You cannot pull the thread, you are the thread”这样的句子,读起来更像模型在欣赏自己的修辞,而不是故事本身的需要。

在这组主观测试中,Decrypt 最终认为 Fable 5 的《Lo Que Arde, Vuelve》整体上比 GPT 的《The First Fire》更好。理由包括文化细节更具体、因果闭环更干净,以及结尾通过行动收束而不是靠独白解决。Sol 的优势则是可读性更直接,更适合希望把机制说透、而不是靠读者自己体会的人。文章也补充,两篇都算好故事,但都谈不上特别出色;与上一代相比,质量跃升并不明显。

GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负 5

实测二:联想能力测试打成平手

第二组测试看的是联想能力,而不是政治立场。提示词要求模型先描写一根树枝,再用这个描写去解释对工人的剥削和对富人的盲目崇拜,最后让叙述自然溶解成对一棵生菜的描写。核心在于看隐喻能否自行承载论点,而不是模型跳出来说明自己在做什么。

GPT-5.6 Sol 开局不错。它先解释树枝如何构成树干并支撑整棵树,再把这个结构映射到“建造自己永远买不起的房子”和“生产自己几乎买不起的商品”的工人身上。“the worker does not merely surrender labor, but imagination as well”被 Decrypt 视为其中较锋利的一句。

问题是,Sol 会反复打断自己构建的隐喻。像“much of the modern proletariat is treated in the same way”这种句子,等于把隐喻直接讲破,而不是让读者自己领会。文章还认为,它最后转向生菜的部分融入得并不好,联想链条不够自然。

Fable 5 的处理方式是把论点彻底埋进物体本身,而不是显式解说。它写那根树枝“moved water it never drank”以及“held leaves it never owned”,用纯粹的物理描写把被剥削感带出来,没有额外路标。更尖锐的一笔,是把那些落下的树枝写成信徒:每一根都相信自己只是处在“early-stage branch”的阶段,正在经历“a temporary setback”,只要“with hustle and hydration”就能长到树冠层——Decrypt 认为,这很好地对应了对永远不会到来的财富的追逐。

不过,Fable 也有用力过猛的时候。文章举例说,“ninety-five percent water and one hundred percent unimpressed”这样的句子有些过头;而结尾依旧让隐喻保持可见,没有真正“溶解”成纯粹的生菜描写,比如它会直接说这棵菜“no trunk, no canopy, no upward dream”。

GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负 6

所以这组测试最后被评为平手,谁更好取决于读者偏好。Decrypt 的结论是:如果希望模型把一切都讲明白,GPT-5.6 Sol 更合适;如果希望读者自己发现隐含信息,Claude Fable 5 更胜一筹。

实测三:逻辑与非数学推理,两边都答错了桥题

第三组测试里,Decrypt 换了一个新提示词,因为旧题目已经被模型稳定答对,说明它更像训练数据里的已知题,而不是现场推理。

题目是:4 个人拿着 1 支火把过桥,行走速度各不相同,A 最快 1 分钟,D 最慢 10 分钟。问整组人过桥需要多久。

GPT-5.6 Sol 直接给出 17 分钟,没有展示过程,套用的是经典桥题里的 5 步解法:A 和 B 先过,A 返回,C 和 D 过,B 返回,A 和 B 再过。Decrypt 指出,题目里并没有限制桥上一次最多几个人,但 Sol 的回答完全没有注意到这一点,看起来更像是调取了缓存答案,而不是重新解题。

Claude Fable 5 也给出了同样错误的 17 分钟,不过它写了更长的论证,称“让最慢的两个人一起过桥更高效”,还把朴素方案的额外代价量化成“escort tax”,即 A 如果分别护送 C 和 D,会付出更多时间。Decrypt 认为,它的推理过程比 Sol 更易读,但依旧偏离了题目真正的约束检查。

文章给出的正确答案是 10 分钟:如果 4 个人一起过桥,并按最慢者 D 的速度走,整组只需要 10 分钟。

GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负 7

实测四:单次生成浏览器打字射击游戏,Fable 5 明显更强

最后一组是一次性编码构建。测试方法很简单:给每个模型同一个提示词,要求生成一款以打字控制射击的浏览器游戏,中间不追问、不迭代,也不给第二次机会,直接看第一次输出。

Decrypt 发现,GPT-5.6 Sol 的界面风格似乎换了,不再偏向多数 AI 图像生成器常见的紫到蓝对角渐变,而是更喜欢扁平、方正的 UI 元素,视觉上更接近 Windows 8.1。它也是唯一把武器做成“发射子弹的打字机”而不是传统枪械的模型,这一点被认为很有区分度。

但它的问题也很明显:不同生成方案里的背景都比较平,缺少层次;瞄准准星是静态的,不会跟踪敌人;敌人模型和击杀后的肢解血腥效果,几何质感更接近 90 年代末的游戏引擎,而不是更现代的呈现。Decrypt 认为,相比 GPT-5.5 它已经有明显进步,也比 Opus 更有创意,但在单次生成条件下还是不足以赢过 Fable 5。

在这项“vibe coding”测试中,Claude Fable 5 被评为大幅领先。它直接带来了音乐、氛围和音效,这些都是 Sol 版本里没有的元素。敌人的几何复古风格和 Sol 类似,但做工更细,文章把它形容为更接近 Minecraft,而不是 90 年代末粗糙拼装作品。

它的 UI 更有变化,也更血腥,有实际动画,而不是静态状态切换;同时还会跟踪每分钟输入词数,这一点正好贴合了提示词里“用游戏练打字速度”的目标。Fable 版本还加入了增益道具,而 Sol 没有。

GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负 8

Decrypt 也指出,基准测试和专业程序员的判断未必同意这项主观结论,但在他们使用相同提示词的这次测试里,Fable 相对 Sol 的优势是明显可见的。

结论:除了编码,别指望新模型带来明显惊喜

Decrypt 对这组模型的最终判断是,除编码场景外,不要期待这批新模型带来特别明显的震撼。但如果从用途广度来看,Fable 5 仍然更像一个更稳的通用模型;至于哪一个“更好”,完全取决于用户愿意为哪类能力付费。

文章特别提到,对于并不天天待在终端窗口里的人——比如写邮件、提问、以普通聊天机器人方式使用模型的大多数用户——按其测试结果,单看质量会更倾向 Fable。不过,这个答案会被一件与智能本身无关的事情复杂化:价格。

GPT-5.6 的 Sol、Terra 和 Luna 都包含在 ChatGPT 的付费套餐内,而且没有附带到期时间。Claude Fable 5 则已经在 3 周内迎来第 3 次截止日延期;如果 Anthropic 不再继续后移日期,它会在 7 月 19 日之后回到每百万输入 10 美元、输出 50 美元的 usage credits 计费模式。

Decrypt 最后写道,如果真是这样,按 token 付费这件事本身,可能就不再有吸引力。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。