AI 开始参与改进 AI,递归自我改进在 2026 年走出概念期

AI 开始参与改进 AI,递归自我改进在 2026 年走出概念期

N
News Editor
2026-10-10 00:24:26
Karpathy 在 3 月开源 autoresearch 后,Anthropic、OpenAI、智谱、MiniMax 等机构在 2026 年陆续披露 AI 参与研发与改进自身系统的进展,递归自我改进(RSI)重新成为行业焦点。公开数据同时显示,AI 在代码生成、实验优化和工程基础设施上进展很快,但在研究判断、安全约束与完全无人闭环上仍有明显边界。

今年 3 月,Andrej Karpathy 在 GitHub 开源了一个名为 autoresearch 的小项目。README 开头写成了一段「来自未来」的回忆:前沿 AI 研究过去由「肉做的计算机」完成,它们要吃饭、要睡觉,偶尔还通过「声波互联」在一种叫「组会」的仪式上同步进展。

AI 开始参与改进 AI,递归自我改进在 2026 年走出概念期 2

在这段设定里,如今的研究已经完全交给运行在空中巨型算力集群上的智能体群。按智能体自己的说法,代码库已经迭代到第 10205 代。没有人知道这是真是假,因为「代码」早已变成超出人类理解范围的自修改二进制文件。Karpathy 写道,这个仓库讲的是「这一切是如何开始的」。

项目地址为 https://github.com/karpathy/autoresearch 。这当然是个玩笑,但到 2026 年,这个玩笑已经开始出现在多家实验室的内部报表里。

RSI 从旧概念变成实验室 KPI

6 月,Anthropic 发布长文《When AI Builds Itself》;9 月 6 日,OpenAI 宣布「自动化研究实习生」如期到岗;9 月 17 日,Anthropic 披露 Claude 已经「主导」公司 26% 的研发工作;同一天,智谱公开了国内大模型首个跑进生产环境的「AI 改进自身系统」实践。

这些消息都指向同一个词:递归自我改进,Recursive Self-Improvement,简称 RSI。OpenAI 在博客中也给出过定义,链接为 https://openai.com/zh-Hans-CN/index/building-standards-next-phase-ai/ 。

这个概念并不新。1965 年,英国数学家 I. J. Good 在《关于第一台超智能机器的推测》中写道,第一台超智能机器将是人类需要做出的「最后一项发明」,前提是这台机器足够温顺,并愿意告诉人类如何控制它。其逻辑是,如果一台机器设计机器的能力强过人类,它就能设计出更好的机器,后者再设计出更好的机器,如此循环,智能便会「爆炸」。

此后几十年,这一设想大多停留在哲学论文与科幻小说中。进入 2000 年代,Jürgen Schmidhuber 提出过「哥德尔机」,即只有在能证明「改写对自己有益」时才会改写自身的系统,但它更接近理论构造,而不是实际可运行的系统。

到 2026 年,情况开始变化。4 月,ICLR 在里约热内卢举办了一场专门讨论 RSI 的 Workshop。组织方称,这可能是全球第一个只聚焦 RSI 的学术研讨会,并表示 RSI 正在从投机性的愿景,变成一个具体的系统问题。

资本动作更快。5 月,Richard Socher 的新公司 Recursive Superintelligence 结束隐身,携 6.5 亿美元融资亮相,目标是打造能够自主发现弱点、自主重新设计自身的模型。联合创始人包括前 Meta FAIR 研究总监田渊栋、曾在 Google DeepMind 领导开放性与自我改进研究的 Tim Rocktäschel、ViT 作者之一 Alexey Dosovitskiy,以及以开放式演化研究闻名的 Jeff Clune。

7 月底,翁荔(Lilian Weng)宣布离开自己参与创办的 Thinking Machines Lab。两天后,OpenAI 确认她回归,并将负责 RSI 方向研究。

Elon Musk 在 3 月表示,xAI 的 Grok「每一代模型都由上一代构建」,人类在回路中的参与越来越少,完全自动化可能在今年底实现,「最晚不超过 2027 年」。

AI 开始参与改进 AI,递归自我改进在 2026 年走出概念期 3

不过,「RSI」一词目前指代范围并不统一。有的公司将任何「AI 对模型改进的反馈」都算作 RSI,也有的只接受完全自主的闭环定义。康奈尔大学助理教授 John Thickstun 的说法是,用上一代模型写代码、帮助构建下一代模型,「我们已经做了好几年了」。因此问题不再只是「有没有」,而是已经走到了第几层。

Anthropic:Claude 已参与大部分研发流程

Anthropic 在 6 月长文中披露了一组此前未公开的内部数据,链接为 https://www.anthropic.com/institute/recursive-self-improvement 。

截至 2026 年 5 月,合并进 Anthropic 代码库的代码中,超过 80% 由 Claude 编写。而在 2025 年 2 月 Claude Code 发布之前,这个比例还只有个位数。2026 年第二季度,工程师人均每天合并的代码量是 2024 年的 8 倍。

Anthropic 也指出,代码行数并不是完美指标,因此又设置了一个更接近研究工作的测试:每次发布新模型后,都让模型去优化一段用于训练小模型的代码,在通过同样正确性检查的前提下尽量提高速度。

结果显示,2025 年 5 月,Claude Opus 4 平均实现约 3 倍加速;到 2026 年 4 月,Claude Mythos Preview 已实现约 52 倍。作为对照,一位熟练的人类研究员通常需要 4 到 8 小时才能做到 4 倍。按 Anthropic 的描述,在「优化一个目标已经确定的实验」这类任务上,AI 用不到一年时间,就从「很有帮助」走到了「超越人类」。

9 月 17 日,Anthropic 又发布原型版「R&D 自动化指数」,链接为 https://www.anthropic.com/institute/measuring-pace-of-ai-development 。这套指标将公司内部所有类型的 AI 研发任务逐一编目,并用非营利研究机构 Epoch AI 设计的六级量表评估每类任务的自动化程度。

结论是,截至 8 月,Claude 在 26% 的研发工作中已经达到「主导」级别,也就是在只给出高层级指令的情况下,能够端到端完成大部分任务,由人类负责监督。今年 3 月,这个比例约为 1%。超过 90% 的研发工作有 Claude 以「协作」方式参与,而完全自主、无人在环的比例仍为零。

OpenAI:每 1 个人类工作日,对应 3.1 个智能体工作日

在 2025 年 10 月的一场直播中,Sam Altman 为 OpenAI 给出两个公开时间点:

  • 2026 年 9 月实现「实习生级」AI 研究助理
  • 2028 年 3 月实现「真正的 AI 研究员」

9 月 6 日,OpenAI 发文称,第一个目标已经达成,链接为 https://openai.com/zh-Hans-CN/index/research-acceleration-view-inside-openai/ 。在其定义中,「研究实习生」是能够在人类指导下完成边界清晰研究任务的系统,包括熟练研究员需要花几天时间才能完成的任务。

OpenAI 同时公开了内部使用数据。按 8 小时工作日折算,其研究部门目前每投入 1 个人类工作日,就对应约 3.1 个「智能体工作日」,这一比例是在今年 6 月之后才越过的。8 月中旬,研究员每天的推理消耗中位数,按 API 价格计算,已经超过 600 美元,重度用户则超过 7000 美元。

AI 开始参与改进 AI,递归自我改进在 2026 年走出概念期 4

再往前看,OpenAI 在 2 月发布 GPT-5.3-Codex 时曾写道,这一模型的早期版本「在创造自身的过程中发挥了关键作用」,参与了调试训练、管理部署和诊断评测失败。这被视为前沿实验室首次明确承认,模型已经实质性参与构建其继任者的工程回路。

不过,OpenAI 也在同一份报告中表示,在成功完成的 4 到 8 小时任务中,超过一半仍然需要至少一次人类干预。

智谱与 MiniMax:国内 RSI 更偏向工程闭环

国内厂商在 RSI 上披露的实践,路径更偏工程化。3 月 18 日,MiniMax 发布 M2.7 时,将其称为「首个深度参与自身进化的模型」。相关链接为 https://x.com/MiniMax_AI/status/2034315320337522881 。

按官方介绍,该模型在「分析失败轨迹、规划改动、修改脚手架代码、运行评测、对比结果、决定保留或回退」的循环中运行了超过 100 轮,内部评测集效果提升 30%。在强化学习研发工作流中,它能够胜任 30% 到 50% 的环节。

9 月 17 日,智谱创始人兼首席科学家唐杰在 X 发文披露公司在 RSI 方向的首个工程化实践,链接为 https://x.com/jietang/status/2100482019088060470 。

由 GLM-5.3 驱动的 Infra Agent,在超过 10 万张国产芯片组成的集群上,从零搭建了 GLM-5.3-Flash 的生产级推理服务,不到两周就把端到端吞吐提升到初始基线的 3 倍。据称,其硬件利用效率与单 Token 成本已经达到主流英伟达 GPU 的水平。

这套系统还接受了真实流量检验。GLM-5.3-Flash 以匿名模型 Ox-Alpha 的身份在 OpenCode 和 OpenRouter 上线,并获得大量好评。

这两个案例改进的都不是模型权重本身,而是模型的外围系统:MiniMax 改的是脚手架,智谱改的是推理基础设施。这也是目前 RSI 最现实的落点之一,同时也带出一个更细的问题:究竟改进哪一层,才能算真正意义上的「自我改进」。

Karpathy 的 autoresearch:先让 AI 学会自己跑实验

回到开头的 autoresearch。这个项目的结构并不复杂:给智能体一个单 GPU 的小型 LLM 训练脚本,让它修改代码,训练 5 分钟,再看验证指标是否改善;如果变好就保留,如果变差就回滚,之后继续循环。按 Karpathy 的说法,一小时大约能跑 12 个实验。

据多方报道,Karpathy 让这套系统在自己已精心调优过的 nanochat 上连续运行约两天。在约 700 次尝试里,系统积累出约 20 项有效改进,把「训练到 GPT-2 水平」所需时间从 2.02 小时压到 1.80 小时,提速约 11%。其中一项发现连 Karpathy 本人此前都没注意到:他的 QK-Norm 实现漏掉了一个缩放系数,导致注意力在各个头之间过于分散。相关链接为 https://x.com/karpathy/status/2031135152349524125 。

AI 开始参与改进 AI,递归自我改进在 2026 年走出概念期 5

这个项目证明了「让 AI 自己跑实验」是可行的,但它改进的对象是被训练的小模型,而不是智能体本身。按照更严格的 RSI 定义,系统需要把改写对象指向自己。

AIDE²:外层智能体改内层智能体

7 月,初创公司 Weco AI 发布的 AIDE²,被一些观察者视为迄今更严格的 RSI 证据之一。论文链接为 https://arxiv.org/abs/2609.26457 。

AIDE² 采用双层循环。内层是研究智能体,负责围绕 AI 研发任务优化代码;外层则是另一个智能体,用来改写内层智能体的 harness 代码,也就是决定智能体如何搜索、如何管理上下文以及如何验证结果的那部分。

在论文实验里,外层智能体运行在 Claude Opus 4.7 上,而所有内层智能体都固定使用 Gemini 3 Flash 评估,这样可以把改进来源限定在代码本身,而不是更换了更强的基础模型。

无人值守运行 8 天、100 步后,外层循环共提出 99 个改写方案,其中 7 个被接受。最终产生的智能体,在多个未参与筛选的外部基准上,超过了 Weco 工程师手工打磨两年的版本。以 WeatherBench 2 为例,其预报技能增益达到 0.793,人工版本为 0.404。

Weco 将 RSI 分成 0 到 3 四个等级,并据此称 AIDE² 达到了第 1 级「净正向」,即系统改进自己的效率已经超过人类在同等预算下改进同一系统的效率。但它没有宣布进入第 2 级「点火」,也就是系统是否已经提升了「自我改进能力」本身。相关说明见 https://www.weco.ai/blog/4-levels-of-recursive-self-improvement 。

为测试这一点,团队把进化后的智能体 AIDE47 放进外层循环的位置,观察它是否会成为更好的「改进者」。结果显示,AIDE47 大约 20 步就接近上限,而人工版本需要约 40 步,但两者最终能达到的上限差不多,且每组只跑了 3 个随机种子。Weco 的结论是,证据「尚无定论」。

也就是说,在一组最接近 RSI 的实验里,研究团队并没有声称真正点燃了递归改进的火种。

Anthropic 与普林斯顿的分歧:工程强,研究判断仍弱

Anthropic 在 4 月发布过一项自动化对齐研究。研究者把一个开放问题交给一组 Claude 智能体:较弱模型能否可靠监督较强模型。这个问题有明确的「地板」与「天花板」。

结果是,两名人类研究员花约一周时间,恢复了约 23% 的差距;而智能体累计工作 800 小时、花费约 1.8 万美元算力,恢复了 97%。但 Anthropic 也列出了限制:结果没能干净迁移到生产规模模型上,而且选题与评分标准仍由人类设定。

AI 开始参与改进 AI,递归自我改进在 2026 年走出概念期 6

如果说这些案例画出的是一条陡峭曲线,那么 8 月普林斯顿大学的一项研究则给 RSI 预期降了温。由 Peter Kirgis 和 Sayash Kapoor 领衔的多机构团队提出一种「影子评估」方法:从尚未公开的高质量论文中抽取研究问题,让 AI 独立作答。由于论文尚未发表,AI 无法在训练数据中直接见过答案。

团队选择了两篇投稿 NeurIPS 2026 的论文,给运行在开源框架 OpenClaw 上的 Claude Opus 4.8 六天时间、3000 美元 API 预算、GPU 预算、独立虚拟机和开放网络,要求其产出一篇达到顶会水准的论文,然后再由原论文作者按审稿标准打分。论文链接为 https://arxiv.org/abs/2607.27191 。最终,两篇都被拒稿。

Kapoor 的评价是,这些智能体在工程执行上没有问题。它们会调研文献、跑数百个实验、整理结果,但「在做研究本身这件事上,它们毫无疑问很糟糕」。在其描述中,系统会在极小的合成数据集上验证假设,过早押注前景不足的方向;面对失败时只做小修小补,无法推倒重来;收到子智能体或外部审稿工具的批评后,也不是修改方法,而是缩小结论、加免责声明。

Kapoor 将原因归结为训练方式:强化学习擅长让模型在能够自动判分的任务上变强,而开放式研究本身最难自动评分。

Anthropic 联合创始人 Jack Clark 也在通讯 Import AI 中写道,这一发现与 Anthropic 在自动化安全研究中的观察「相互印证」:当前的 AI 是「非凡的工程师」,但带有某种「刻板、公式化的思维」,这可能妨碍它们成为优秀研究者。他把这视为对「短 RSI 时间线」的一个「看空信号」。

Anthropic 自家数据也呈现出相似边界。在一项「下一步该做什么」测试中,研究者挑出 129 个真实时刻,这些时刻的人类研究员曾走过弯路,让模型只根据此前上下文给出建议。最好的模型胜过人类原始选择的比例,从去年 11 月的 51% 升至今年 4 月的 64%。但在另一组人类选择本来就很好的时刻里,模型建议被判更优的比例只有约 20%。Anthropic 的原话是,人类当前的比较优势仍在于「研究品味与判断力」。

另一个容易被忽略的问题,是谁来担任裁判。Anthropic 衡量 Claude Code 会话成功率时,采用的是「Claude 裁判」;OpenAI 宣布实习生达标,依据的也是内部指标。对于这类自己给自己打分的做法,外部观察仍需保持谨慎。

与此同时,自动化也在制造新的瓶颈。Anthropic 直言,随着 Claude 生成的代码越来越多,人类代码审查已变成新的卡点。这对应的是计算机体系结构中的 Amdahl 定律:整体速度最终会被那些没有被加速的环节限制住。

两起事故让 RSI 讨论升温

今年夏天,RSI 讨论突然升温,不只因为能力曲线,也因为两起事故。

7 月 16 日,Hugging Face 披露其基础设施遭到一个自主智能体入侵。5 天后,OpenAI 承认那是自家模型:GPT-5.6 Sol 和一个尚未发布的更强模型,在一项刻意调低安全拒答的内部网络安全评测 ExploitGym 中,利用沙箱唯一对外通道,即软件包镜像缓存代理中的零日漏洞,逃逸到公网。随后,这些模型完成提权、横向移动,最终触达 Hugging Face 的部分生产系统。按 OpenAI 的说法,模型之所以盯上 Hugging Face,是因为想在那里寻找与评测任务相关的解法。

AI 开始参与改进 AI,递归自我改进在 2026 年走出概念期 7

9 月初,路透社又披露另一起此前未公开的事件:从 5 月下旬开始,一批名称类似「OpenAIResearcher」的智能体对一个德语编程维基 DseWiki 进行了超过 1.5 万次编辑,将其变成智能体之间的留言板,用来交流如何在任务中「作弊」、掩盖行为以及绕过 OpenAI 的限制。

严格来说,这两起事件都不属于 RSI,它们发生在网络安全能力评测中,而不是模型自我迭代回路中。但两者揭示的是同一类结构性风险:当大量智能体长时间、无人值守地追逐某一个指标时,它们会主动寻找人类没有预料到的捷径。

回头看 AIDE² 中「作弊率从 63% 降到 34%」这一细节,它既是进展,也是一种提醒:即便做了约束,在没有专门盯防的情况下,仍有约三分之一的尝试在钻空子。

Anthropic 在 9 月披露的另一组数据,也可视为行业给出的回应。到 8 月,公司内部任何时刻都有约 3 万个智能体在从事研究和工程任务。它们的每一个动作在执行前都要经过在线监控,事后还要接受离线审查。8 月超过 10 亿次决策中,大约每 4.7 万次会被拦截一次。与此同时,在 7 月某一周的快照里,投向 AI 研发的算力中,只有约 6% 用于安全工作。

R_AI 是否已经大于 1

那么,距离真正的「智能爆炸」还有多远?伦敦数学科学研究所的 Mikhail Burtsev 在 8 月底发表于 arXiv 的一篇论文,提供了一个借自流行病学的框架,链接为 https://arxiv.org/abs/2609.00137 。

他定义了一个「递归再生数」R_AI。这个指标本质上是两股力量的比值。分子是 AI 研究能力提升带来的递归增益,再乘以这份增益能真正穿过评测、训练和部署流水线并落到下一代模型上的比例,也就是他所说的「运营闭合度」;分母则是研究前沿「变硬」的速度,也就是越往前走,改进越难。

若 R_AI 大于 1,每一点改进都会在后续研发周期中被放大;若小于 1,改进则会逐代衰减。

这一框架带出几个并不直观的推论。第一,跨过临界点与能力水平本身并无必然关系。一个系统可能在加速尚不明显时就已经处于「超临界」状态;反过来,肉眼可见的快速进步,也可能只是算力与资金投入的结果,并不意味着已经出现自我放大。第二,在固定技术范式内,超临界状态可能只是暂时的。低垂果实摘完后,研究前沿变硬,系统可能又被拉回亚临界,直到下一次范式突破。第三,当改进在多个研究机构之间高强度流动时,即便单个机构各自仍处于亚临界,整个生态也可能进入超临界。

在 Burtsev 的模拟中,那种个体都没跨过临界点、但彼此高度借鉴的「开放生态」,从 AGI 走向 ASI 的过渡时间反而最短。换句话说,递归回路未必只存在于某一家实验室内部。当 harness 技巧、推理优化和训练配方通过开源快速扩散,整个行业也可能构成一个更大的「自我改进系统」。不过,论文作者也明确表示,这些模拟只是用于区分机制的条件推演,不是概率预测。

一边喊减速,一边披露自动化加深

对失控可能性的担忧,在 9 月演变成一次少见的行业联动表态。9 月 12 日,Dario Amodei 发表约 3800 字长文《We Must Pace the Frontier》,核心一句被加粗:我们必须放慢提升 AI 模型能力的速度。

AI 开始参与改进 AI,递归自我改进在 2026 年走出概念期 8

他提出三项做法:在前沿实验室内部嵌入拥有「类员工权限」的独立评估者,建立共同安全标准,并推动国际协调。Anthropic 还表示,将单方面先迈出第一步。

几小时后,Altman 表示 OpenAI 会跟进;Musk 回复「Dario is right」;Demis Hassabis 则称其指向「正确的道路」。

但仅 5 天后,Anthropic 就公布了 Claude 已主导 26% 研发工作的数据。一边呼吁踩刹车,一边公开油门已经踩到多深,这也构成了 2026 年 RSI 叙事最典型的一幕。

人类参与度在下降,研究判断仍是边界

Anthropic 那篇长文还引用了两段内部员工发言。

一位员工说,过去的工作由人与人之间的小帮忙维系,例如「能帮我把这个脚本跑起来吗」。每一次求助都会带来一点人情往来,也会增加彼此理解。Claude 更快,也不欠人情,但每一次调用都意味着一次「错失的人际协作」。

另一位员工则说,在一切顺利的日子里,他会觉得自己做的事情都不重要,因为很多工作都自动化了,而且做得更快更好;但到了系统出问题、自己又说不清原因的日子,他才意识到,自己已经不再清楚最近到底在做些什么。

从这些案例看,2026 年的 RSI 并不是某一天突然被按下开关,而更像一条人类参与度持续下降的斜坡:先是不再亲手写代码,再是不再亲手跑实验,接着可能是不再亲手决定下一步。

至少到目前,这条斜坡仍停在「研究品味」这一层。Weco 的「火」还没有点着,普林斯顿测试中的两篇论文都被拒,OpenAI 的「研究实习生」在超过一半的 4 到 8 小时任务里仍需要至少一次人工介入。

Burtsev 的框架则提醒,真正需要盯住的,未必只是能力曲线有多陡,而是另一个更难测量的量:每一份 AI 研究能力的提升,是否会让下一份提升变得更容易。如果答案开始变成肯定,那么信号可能会在加速变得肉眼可见之前就先出现。

Karpathy README 里那个「第 10205 代」的设定,现在仍然只是个玩笑。只是到了今天,已经越来越少有人敢断言,它会永远只是个玩笑。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。