GPT-4o

AtomWorld
2026-07-15 03:54:07

AtomWorld基准测试显示大模型在原子操作任务上集体失分

由中科大苏州高等研究院、新南威尔士大学等机构发布并在 ICML 2026 亮相的 AtomWorld 基准测试显示,Scaling Law 在原子级结构操作场景中的效果有限。测试覆盖 Claude、GPT、Gemini、Qwen、DeepSeek、Llama 等主流模型,结果显示模型规模扩大可改善部分规则明确任务,但在旋转、区域删除、扩超胞等依赖三维空间理解的任务上提升不稳定。研究据此提出,AI for Science 不能只依赖 Language Scaling,还需转向面向科研实操能力的 Action Scaling。

980
AtomWorld基准测试显示大模型在原子操作任务上集体失分