上海交大联合清华、字节跳动、小红书、上海 AI Lab 等团队发布综述《The Last AI Built by Humans》,梳理了 491 篇相关研究,试图给近来范围越来越宽的「AI 自我进化」划出一条更严格的边界。
论文将 RSI 划分为 5 级
这篇论文把递归自我改进(RSI)分成 5 个等级。L1 指系统只执行人类预先规定好的改进流程;L2 指系统可以自己决定怎么改;L3 更进一步,连下一轮该学什么也能自行决定;L4 则会根据实际运行中的反馈,持续修改记忆、技能、代码或 harness,并让这些改动影响后续任务。
到 L5,系统不仅能改任务执行层面的内容,还能修改负责产生下一轮改进的搜索方法、评估器和研究策略,并把这些改动交给下一轮继续使用。
仅能改代码不等于真正自我进化
按照论文给出的标准,单纯「会改自己代码」还不能被视为完整的递归自我改进。文中举例称,一个 Coding Agent 即便能够重写自己的源码,如果下一代如何选择、按什么标准打分、哪些修改可以保留下来,仍然由人类预先写死,那么它只能说明自己具备自我修改能力,还没有掌握完整的 RSI。
L5 被拆成两层
论文还把最高等级 L5 进一步拆成两层。第一层是「形式上递归」:AI 已经能够修改负责后续改进的机制,并让下一轮沿用这些机制。第二层则要求「真的越改越强」:修改后的机制需要在相近资源和独立评测下,确实产出更强的下一代。
491 篇研究的分布情况
在纳入的 491 篇论文中,43.8% 被归为 L1,31.6% 被归为 L2。L5 只有 29 篇,占比 5.9%。从这个分布看,大量研究仍集中在执行人类设计好的改进流程,或自动寻找改进方法;把「如何改进」这套机制本身交给 AI 的工作仍然较少。
论文同时提到,即便已有研究触及 L5,长期稳定积累优势这一点仍未被证明。
当前更像是分类框架,而非行业统一标准
这篇论文的主要目标,是为 RSI 领域建立一套分类框架。L1 到 L5 的标准由作者提出,目前还不是行业公认的统一分级。
在材料范围上,团队同时纳入了学术论文、技术报告、官方博客和开源系统。论文解释称,不少前沿 RSI 实践还没有进入正式论文体系。

