AtomWorld基准测试显示大模型在原子操作任务上集体失分

AtomWorld基准测试显示大模型在原子操作任务上集体失分

N
News Editor
2026-07-15 03:54:07
由中科大苏州高等研究院、新南威尔士大学等机构发布并在 ICML 2026 亮相的 AtomWorld 基准测试显示,Scaling Law 在原子级结构操作场景中的效果有限。测试覆盖 Claude、GPT、Gemini、Qwen、DeepSeek、Llama 等主流模型,结果显示模型规模扩大可改善部分规则明确任务,但在旋转、区域删除、扩超胞等依赖三维空间理解的任务上提升不稳定。研究据此提出,AI for Science 不能只依赖 Language Scaling,还需转向面向科研实操能力的 Action Scaling。
AtomWorldScaling LawAI for Science材料建模大模型晶体结构ICML 2026

一项面向材料学研究的最新基准测试表明,大模型在原子级结构操作任务中仍存在明显短板。由中科大苏州高等研究院、新南威尔士大学等机构联合发布、并在 ICML 2026 亮相的 AtomWorld 指出,过去几年被广泛接受的 Scaling Law,在受物理规则约束的原子实操任务里并未稳定兑现“模型越大,能力越强”的预期。

研究团队给出的判断很直接:大模型已经能较好处理材料知识理解、文本归纳和结构解析,但“理解”并不等于“操作”。在真实材料计算研究里,任务往往不是回答概念问题,而是根据明确指令调整原子结构,例如构建特定材料的 (001) 表面、替换晶格中的特定位点原子、在指定间隙位置插入新原子。这些操作依赖的不是文本推理本身,而是符合物理定律的三维空间操控能力。

论文已发布于 arXiv,地址为 https://arxiv.org/abs/2510.04704;项目主页为 https://masterai-eam.github.io/atomworld/;代码仓库为 https://github.com/MasterAI-EAM/atomworld。

AtomWorld只测“会不会改结构”

为量化模型在原子操作中的能力,研究团队搭建了 AtomWorld 评测框架。该框架依托材料领域通用的晶体学信息实现自动化测评,不考核材料识别、理论辨析这类偏知识型问题,而是把重点放在基础空间操作任务上:模型能否根据自然语言指令,精确调整原子排布,并得到目标结构。

按照研究介绍,AtomWorld 的流程包括四步:首先由随机采样器调取预设原子结构;随后随机初始化器配置原子编号和位置参数;再由结构算子生成目标结构;最后由提示词模块形成对应的自然语言描述。生成的结构—文本配对数据会送入大模型智能体,再借助 pymatgen 的 StructureMatcher 工具,将模型输出结构与标准目标结构进行比对,从而量化评估模型表现。

研究指出,这一设计意在把“材料智能体不会建模”拆解为一组可测量、可追踪的能力项,从元素替换、原子删除、原子移动,到空间区域判定与连续几何理解,逐层识别模型的失效类型、失效程度以及规模增长是否真的能带来收益。

Scaling Law在三维空间任务上遇到边界

AtomWorld 的测试覆盖了 Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro、Gemini 2.5 Pro、Qwen3-32B、GPT o3、GPT-4o-mini、DeepSeek Chat、Llama3-70B 等主流模型,并对不同尺寸的 Qwen 模型进行了比较。

AtomWorld基准测试显示大模型在原子操作任务上集体失分 3

结果显示,模型规模扩大确实能提升部分规则清晰、路径相对固定的任务表现,例如原子替换、删除和移动。以 Qwen 系列为例,从 4B 到 32B,这几类任务的成功率出现明显提高,说明规模增长并非完全失效,在明确规则场景里仍然有实际价值。

问题在于,这种提升没有自动迁移到所有原子操作任务。面对依赖三维空间关系与几何规划的任务,模型规模变大后,表现并不稳定。研究特别提到,“绕原子旋转”是最典型的例子:这一任务在不同尺寸的 Qwen 模型上始终表现较低,即便换成 Claude Opus 4.6 这样的强通用模型,成功率也只有约 12%。

类似情况也出现在“删除下方原子”“扩超胞”等任务上。研究称,即便使用更大的模型,完成效果依旧不稳定;几何误差也不会随着模型变大而必然下降。图 2 中给出的总体结果同时使用了成功率和 mean max_dist 几何误差两项指标。左侧比较不同主流模型,右侧比较不同尺寸 Qwen 模型,结论都指向同一点:规模增长可以改善部分模板化任务,但在涉及空间理解的操作上,收益不连续,也不稳固。

研究团队据此认为,AtomWorld 不是要简单否定 Scaling Law,而是提示它存在明确适用边界。参数规模和数据规模的扩张,可以带来部分能力增益,但不能自动补齐三维物理空间操作中的核心短板。对材料建模任务而言,语言推理能力、文本知识储备与原子级结构行动能力之间,不能直接划等号。

理解材料知识,不代表能完成材料建模

文章把这一反差放在了 AI for Science 的更大背景下。过去几年,大模型在科学领域已经表现出很强的“理解力”,包括阅读文献、预测材料性质、解析晶体结构,甚至参与科学发现流程。

文中举了两个例子。其一是 Anthropic 推出的 AI 科研工作台 Claude Science,它把科研过程拆成可逐步审计的流水线,在综述写作、基因分析等环节带来了 10 倍的效率提升。其二是 Google DeepMind 的 GNoME,使用图神经网络预测无机晶体稳定性,并通过“生成候选→DFT 验证→数据回流”的闭环,产出约 220 万个结构。

AtomWorld基准测试显示大模型在原子操作任务上集体失分 4

也正因为大模型在知识理解上的进展足够显著,行业中逐渐形成一种看法:既然模型已经能读懂材料相关知识,那么完成原子搭建、结构调整这类实操任务,似乎只是顺势推进的问题。AtomWorld 的结果对这一判断提出了不同视角。研究显示,模型会解释材料结构性质,不等于它已经能够可靠地修改材料结构;能读懂元素周期表,也不意味着它能在三维空间中稳定执行一次原子级操作。

研究团队认为,这个问题并不局限于材料建模。真正的科研流程从来不是纯文本工作,而是由提出假设、设计实验、调用工具、调整参数、观察结果、排查错误和持续修正组成。无论是材料建模、分子设计、自动化实验,还是更广义的科学发现,AI 若想真正参与其中,不能只停留在解释知识,还需要具备执行动作的能力。

外挂工具能补一部分短板,但补不上核心决策

针对大模型在三维操作上的不足,行业中一个常见做法是接入 pymatgen 等专业工具库,希望借助外部工具改善结构生成质量。AtomWorld 也对这种路线进行了对照测试。

研究结果显示,外挂工具的帮助主要体现在原子插入等强坐标计算类任务上,但面对需要判断原子关系、识别空间区域的复杂场景,提升十分有限。原因在于,工具可以输出精确坐标,却不能替代模型完成“原子该放哪”“哪些原子属于目标区域”这类关键决策。

研究团队给出的结论是,如果模型本身缺少三维空间感知能力,那么工具只能把错误意图执行得更精确,最后得到的仍然是“建模逻辑错误”的结果。也就是说,工具调用并不能替代模型本体的空间理解与几何规划能力。

AI for Science需要从Language Scaling走向Action Scaling

基于上述结果,研究提出了一个新的方向:AI for Science 在继续重视 Language Scaling 的同时,需要转向更强调操作能力的 Action Scaling。

AtomWorld基准测试显示大模型在原子操作任务上集体失分 5

这里的重点,不是继续单纯扩大参数规模或文本数据规模,而是把可执行动作的数据生成、动作基元拆解、模拟器反馈、物理约束验证以及工具调用纠错系统性地规模化,让模型在语言上变强的同时,也能在可验证的科研行动中变强。

从研究的表述看,现有 Scaling Law 主要聚焦海量文本语料中的语言与知识拟合,但材料原子建模需要的空间理解、几何规划和受物理约束的行动能力,在公开数据中高度缺乏“操作指令—坐标变化”的高质量成对样本,因此很难只靠语言规模扩张自然补齐。

AtomWorld 的意义也因此不止于提供一套标准化评测基准。研究认为,这一框架通过自动生成任务、标准结构与匹配反馈,为材料建模中的动作数据和训练闭环提供了底座,使科学智能体的发展方向从“更大的通用模型”,转向“在可验证科学操作中迭代真实行动能力”。

论文与出处

该研究由中科大苏州高等研究院、新南威尔士大学等机构联合发布,并在 ICML 2026 发布。论文地址为 https://arxiv.org/abs/2510.04704,项目主页为 https://masterai-eam.github.io/atomworld/,代码仓库为 https://github.com/MasterAI-EAM/atomworld。

本文参考资料包括上述论文链接。原文来自微信公众号“新智元”,作者为 LRST。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
800

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。