当大语言模型已经能写诗、编程,科研场景对 AI 的要求正在变得更高:不仅要回答问题,还要能在长周期、高不确定性的环境里持续推进研究任务。围绕这一问题,一个由广东工业大学、华南师范大学、上海交通大学、杜克大学等国内外高校联合团队提出的 Eureka 架构,给出的思路不是继续沿用固定系统结构,而是让 AI 在解决任务的过程中,按任务需要动态生成专用架构。

论文信息显示,Eureka 不再依赖预设好的统一「大脑结构」,而是把任务执行与架构塑造结合在一起。研究团队在文中提出,面对需要数月甚至数年持续思考的科学难题,固定架构往往难以兼顾不同问题对记忆、工具、验证方式和协作流程的差异化要求。
相关论文已发布在 arXiv,链接为 https://arxiv.org/abs/2608.19047。
Eureka 的测试结果
按照论文描述,Eureka 在严格系统测试中完成了全部 170 项复杂的递归长周期任务,生成 3948 份可验证的「合格证书」,整个过程中没有出现一次错误的「自我肯定」或虚假的「任务完成」。
研究称,这套架构在两类差异明显的科学问题上表现出适应性:一类是以黎曼猜想为代表的数学证明问题,另一类是量子过程与时空理论等更开放的理论物理问题。

黎曼猜想相关路径上的新边界
在探索黎曼猜想时,Eureka 自动构建了一个「数学/猜想智能体」。论文并未称其直接证明了这一难题,但指出,系统在一条重要证明路径——局部 Weil 二次型正性——上,把关键证书的适用范围从此前的 a≤1/4,扩展至 a≤69/200,也就是 0.345。
按照文中表述,这一新边界已经触及理论第一道门槛的 99.55%。研究将其描述为该路线上的一个可验证进展,但同时指出,距离最终证明仍有距离。
理论物理方向给出五项结构性发现
在量子过程与时空理论这类更开放的问题上,Eureka 生成的是「理论发现智能体」。研究称,该系统没有停留在已有理论的复述上,而是直接对理论结构进行重构,产出了五项具有递进关系的结构性发现。
其中一个例子是,系统识别出不同理论等价形式之间的细微差别,并严格证明了「行为相同」并不等于「本质相同」。按照文中说法,这为物理学家比较不同理论提供了更严格的标准。

为什么固定架构难以应对科研任务
研究团队将问题指向当前主流 AI 系统的共同限制:无论是单智能体还是多智能体协作,系统的记忆、工具、验证方式以及内部协作流程,通常都是预先设计好的。
这种方式在单一类型任务中效率较高,但对科学发现并不总是合适。论文指出,科学研究本身具有高度不确定性。一个研究假设可能需要数周验证,一个新的数学证明也可能推翻此前规划。任务周期长、结构不统一,固定架构容易出现失配。
- 架构错配:适合广泛搜索假设的架构,在严格数学证明中可能因状态同步成本过高而效率下降。
- 规划失效:任务初期存在大量未知,过早制定长期规划会消耗算力,也可能因中途出现新发现而失效。
元架构如何运作
Eureka 的核心设定,是把「执行任务」和「塑造架构」放在同一套机制内。它既执行问题,也根据任务蓝图调整自身组织方式。
研究给出的流程大致包括几个步骤。首先,系统在接到复杂任务后,不会立即尝试解决所有细节,而是先把任务拆成动态的「义务图」,只对当前信息足够明确的部分做规划,暂时保留其余未知部分。

随后,系统会在执行过程中识别所谓的「架构热点」。如果某个子问题需要反复调用相同状态、工具,或者需要更紧密的内部协作,Eureka 就会判断这里需要做「架构提升」。
研究称,这种提升不是简单增加提示词长度,而是为该热点任务编译出新的专用「宏代理」。这个宏代理拥有独立的记忆、工具箱、验证标准和内部流程,可以像独立专家一样自治处理对应子任务,主系统只接收最终可验证结果。
如果宏代理在工作中反复遇到同类瓶颈,Eureka 还会先评估改造收益是否高于成本。只有在收益确定大于成本时,才会继续升级其内部结构。论文将这一过程描述为「受控的自我演化」。
实验中的效率与并发表现
论文列出的实验结果显示,动态架构生成带来了几项直接效果。

- 效率方面:通过将语义规划与确定性计算分离,Eureka 将 AI 核心工作区的上下文负担降低了 57.8%,并避免了 65.38% 的重复计算。
- 并发方面:在涉及 16,000 项任务的并发测试中,所有并行执行结果都与按顺序执行的结果完全一致。
- 演化策略方面:与其他「蛮力」或「被动」的进化策略相比,Eureka 的受控进化策略取得了最低的运行成本和最高的任务成功率。
研究团队给出的应用方向
论文还讨论了这套架构在多个高难度领域中的潜在用途。在数学研究中,Eureka 可用于探索证明路径、验证复杂逻辑链条,并在开放问题中寻找新的结构方向。
在理论物理中,研究称,这类系统可帮助研究者梳理、统一和精炼复杂理论体系,并识别不同理论分支之间更深层的联系,特别是弦理论、量子引力等抽象程度较高的方向。
在更大规模的工程问题上,论文提到芯片设计、药物研发等长周期、多团队协作场景,认为「任务—架构」协同演化的方式可用于构建更具自适应性的项目管理与执行系统。
论文来源与署名
这项研究由 ManXis 团队完成。参考论文为 arXiv:2608.19047。本文来自微信公众号「新智元」,作者为 LRST。

