返回新智元

新智元

GPT-5.6
2026-07-16 08:21:08

Tracking AI离线测试中 GPT-5.6 IQ 达 136,首次跨过 130 分门槛

Tracking AI 最新离线 IQ 测试显示,GPT-5.6 多个版本拿到 136 分,成为首个在其离线题库中突破 130 分门槛的大模型。报道提到,Claude-5 Fable 为 130 分,其他模型多在 117 至 123 分区间。文中还援引多位开发者实测,称 GPT-5.6 在物理模拟、RAG 客服系统和代码修复等任务中表现突出,但也指出 IQ 测试只能反映标准化认知能力的一部分。

320
Tracking AI离线测试中 GPT-5.6 IQ 达 136,首次跨过 130 分门槛
Demis Hassabi
2026-07-15 03:27:19

哈萨比斯称 AGI 或在数年内到来,并主张设立前沿 AI 审查机构

DeepMind 掌舵人、诺奖得主 Demis Hassabis 表示,通用人工智能可能只剩数年时间,其影响规模或达工业革命的 10 倍且推进速度也快 10 倍。他在《前沿AI框架与新时代的曙光》中提出,应设立类似 FINRA 的“标准机构”,对前沿模型进行分级、测试与发布前评审,初期可在模型上线前最多 30 天开展审查,必要时还可协调前沿实验室放缓研发节奏。

1180
哈萨比斯称 AGI 或在数年内到来,并主张设立前沿 AI 审查机构
AtomWorld
2026-07-15 03:54:07

AtomWorld基准测试显示大模型在原子操作任务上集体失分

由中科大苏州高等研究院、新南威尔士大学等机构发布并在 ICML 2026 亮相的 AtomWorld 基准测试显示,Scaling Law 在原子级结构操作场景中的效果有限。测试覆盖 Claude、GPT、Gemini、Qwen、DeepSeek、Llama 等主流模型,结果显示模型规模扩大可改善部分规则明确任务,但在旋转、区域删除、扩超胞等依赖三维空间理解的任务上提升不稳定。研究据此提出,AI for Science 不能只依赖 Language Scaling,还需转向面向科研实操能力的 Action Scaling。

1080
AtomWorld基准测试显示大模型在原子操作任务上集体失分
Anthropic
2026-07-12 05:55:07

Anthropic解释Claude Code“变笨”争议:问题多出在Effort而非模型

Anthropic近日发文回应Claude Code用户对“模型变笨”的争议,核心在于不少人混淆了Model与Effort两项设置。官方称,Model决定能力边界,Effort决定本次任务投入多少工作量。3月4日,Anthropic曾将Claude Code默认Effort从high下调至medium以降低延迟,4月7日又调回,并为订阅用户重置一次用量额度。官方还给出判断框架:先检查上下文,再区分问题是“不会”还是“不够努力”,再决定换模型还是调高Effort。

1080
Anthropic解释Claude Code“变笨”争议:问题多出在Effort而非模型