Tracking AI离线测试中 GPT-5.6 IQ 达 136,首次跨过 130 分门槛

Tracking AI离线测试中 GPT-5.6 IQ 达 136,首次跨过 130 分门槛

N
News Editor
2026-07-16 08:21:08
Tracking AI 最新离线 IQ 测试显示,GPT-5.6 多个版本拿到 136 分,成为首个在其离线题库中突破 130 分门槛的大模型。报道提到,Claude-5 Fable 为 130 分,其他模型多在 117 至 123 分区间。文中还援引多位开发者实测,称 GPT-5.6 在物理模拟、RAG 客服系统和代码修复等任务中表现突出,但也指出 IQ 测试只能反映标准化认知能力的一部分。
GPT-5.6Tracking AIIQ 测试大语言模型ClaudeAGI人工智能

Tracking AI 最新离线 IQ 测试显示,GPT-5.6 多个版本集体拿到 136 分。这是大语言模型第一次把 IQ 成绩推过 130 分门槛。按文中给出的说法,130 分是人类智商分布中的“天才”起点,全球大约只有 1% 的人能达到这一水平。

离线题库成绩首次突破 130 分

报道提到,Tracking AI 手中有两套测试题。一套是公开的 Mensa Norway 风格测试,任何人都可以在网上作答,模型此前已在这类测试中拿到 140 多分。另一套则是 Tracking AI 自建的离线题库,不公开,也用于避免模型提前见过答案。

这次 GPT-5.6 拿到的 136 分,来自这套更强调防泄题与防“背答案”的离线测试。文中称,在这份离线排行榜上,GPT-5.6 的多个变体,包括视觉版,都达到 136 分,与其他对手拉开明显差距。

Tracking AI离线测试中 GPT-5.6 IQ 达 136,首次跨过 130 分门槛 3

紧随其后的是 Claude-5 Fable,成绩为 130 分。再往下,GPT-5.6 LUNA Max、Claude-4.8 Opus 等模型处于 117 分到 123 分之间。报道还称,在过去一年里,从 o3 到多家公司的旗舰模型,都停留在 130 分门前,没有真正跨入这一区间,GPT-5.6 是首个完成突破的模型。

多个版本同时冲高,开发者称体感优于 GPT-5.5

文章提到,这次并非只有单一版本刷新成绩,SOL、TERRA 等一整个家族版本都达到 136 分,视觉版也没有掉队。

Tracking AI离线测试中 GPT-5.6 IQ 达 136,首次跨过 130 分门槛 4

在 Reddit 上,一位开发者自行测试后表示,体感上 GPT-5.6 的“智商”明显高于 GPT-5.5。报道称,在所展示的测试题中,GPT-5.6 都能在较短时间内取得出色结果。

从考试到实战:物理模拟、客服系统与代码修复

除分数外,文章还列举了几名开发者在实际任务中的使用体验。

Tracking AI离线测试中 GPT-5.6 IQ 达 136,首次跨过 130 分门槛 5

开发者 Amir Bohlooli 用同一个物理模拟 prompt 同时测试 Fable 5 和 GPT-5.6 Sol。按文中描述,他原本以为 Fable 会占优,结果被 GPT-5.6 的输出表现打动。GPT-5.6 选择了粒子流体模拟方案,物理过程按真实时间推进,而不是每帧执行固定运算;同时把 CSS、界面和渲染都写进一个 HTML 文件,并自动托管成可分享网页。

Ramanpal Singh 也使用一句 prompt,生成了一个基于 RAG 的客服工单系统。文中称,这个系统包含四种角色、管理后台和可嵌入组件,还支持自动给投诉分类、识别情绪并起草回复。按照报道说法,他一口气做了 5 个类似应用,成本只有 Fable 5 的零头。

Tracking AI离线测试中 GPT-5.6 IQ 达 136,首次跨过 130 分门槛 6

Claire Vo 的案例则集中在代码修复。她表示,自己几天前被一个 bug 卡住,一度怀疑是代码本身出了问题,换到 GPT-5.6 Sol 后,只留下了一句“我就是不信搞不定”。报道称,Sol 一次完成修复,还顺手让别的模型也能顺利跑通。

按 Claire Vo 的评价,Fable 更倾向于追求技术上的绝对精确,结果反而受限,而 Sol 的务实风格更容易把事情做完。

Tracking AI离线测试中 GPT-5.6 IQ 达 136,首次跨过 130 分门槛 7

136 分不等于完整智能能力

文章也提出了限制条件。有网友称,“对 99% 的人来说,这已经是 AGI 了”。但报道同时提醒,这个 136 分来自 Tracking AI 的特定离线题库与 Mensa Norway 风格测试,主要衡量的是抽象模式识别、逻辑推理等标准化认知能力。

文中指出,IQ 测试并不是为大模型专门设计的。一张 Mensa 试卷,无法衡量模型的事实可靠性、工具调用能力,也不能直接说明模型在真实职业场景中的稳定程度。它更像是从“智能”中切出一个局部,用来显示这一部分的表现。

Tracking AI离线测试中 GPT-5.6 IQ 达 136,首次跨过 130 分门槛 8

不过,文章认为,开发者的上手实测提供了另一面信息:GPT-5.6 似乎正在把“会做题”和“会做事”逐渐结合起来。报道最后写道,标准化测试中的题目,模型可能在训练数据中见过很多次;真正更能拉开差距的,是那些没有现成答案、也无法直接照搬的新问题。

参考信息

文中列出的参考资料包括 davidpattersonx 在 X 平台发布的内容,以及 Tracking AI 官网。原文署名为微信公众号“新智元”,作者为 ASI 启示录。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。