由 Ryan Shea 开发、刚刚上线的 AI IQ 平台近日公布了一份面向大众的 AI 模型“智商排行榜”。该平台通过将大模型在公开基准测试中的表现映射到人类 IQ 钟形曲线,给出一个更直观的单一分数。最新结果显示,GPT-5.5 以 136 分排名第一,成为目前该平台评估下“最聪明”的 AI 模型。
在榜单中,Claude Opus 4.7 和 Gemini 3.1 Pro 均获得 132 分,并列第二;Grok 4.3 得分 125,Kimi K2.6 得分 122。从分数分布来看,头部模型之间仍存在一定差距,但整体都处于较高水平,反映出前沿模型在复杂推理任务上的竞争已经进入精细化阶段。
评分机制:不做新测试,而是整合公开基准
AI IQ 平台并不直接组织新的能力测试,而是基于 12 项公开基准 的既有成绩进行算法换算,进一步生成“隐含 IQ 分数”。这一方法的核心,是把原本分散、专业化较强的评测结果,压缩成普通用户更容易理解的统一指标。
据介绍,平台会从 抽象推理、数学推理、编程能力和学术推理 四个维度综合衡量模型表现,再将结果映射到人类 IQ 量表中。对于行业观察者而言,这种做法的价值在于提升可读性,让用户无需逐一理解不同 benchmark 的细节,也能快速掌握各模型的大致能力层级。
除智商评分外,还追踪成本与情商表现
除了总分榜单,AI IQ 还提供了多种辅助功能,包括 “IQ vs. Cost” 图表,用于比较模型能力与成本效率之间的关系;以及 “Frontier IQ Timeline”,帮助用户观察前沿模型能力随时间的变化轨迹。这意味着平台试图不仅回答“谁更强”,也希望呈现“谁更划算”以及“进步速度如何”等更贴近实际应用的问题。
此外,平台还整合了来自 EQ-Bench 的情商相关分数,为模型提供 IQ 之外的补充观察维度。虽然这种量化方式仍依赖既有评测体系,且不同基准之间的转换方法可能引发讨论,但 AI IQ 显然正在尝试用更统一、更通俗的方式,降低公众理解大模型竞争格局的门槛。
目前,AI IQ 平台已通过 aiiq.org 对外开放。随着更多新模型发布,这类将复杂评测结果“单指标化”的平台,或将成为观察 AI 竞赛格局的一个新窗口。

