Naive AI 开源首个模型,押注让 AI 参与下一代 AI 研发

Naive AI 开源首个模型,押注让 AI 参与下一代 AI 研发

N
News Editor
2026-09-28 09:14:40
Naive AI 发布并开源首款模型 Naive-N0.5-Flash,定位编程与 AI 研发,采用 309B 总参数、15.5B 激活参数,并原生支持百万 token 上下文。技术报告显示,AI 已参与其注意力架构探索、训练系统改造、推理优化和实验验证。公司同时披露 NaiveRT 与 AutoWM 两个案例,展示模型在推理系统优化和世界模型研究中的具体参与方式。

Naive AI 披露首款模型 Naive-N0.5-Flash,并把「让 AI 研发 AI」作为核心路线公开摆上台面。技术报告显示,这款模型既由 AI 参与研发,也被专门训练来承担 AI 研发工作。

Naive AI 开源首个模型,押注让 AI 参与下一代 AI 研发 2

过去半个多月,这条路线在头部实验室中迅速从偏理论话题变成可量化指标。10 天前,Anthropic 公布内部数据称,公司内部 AI 研发工作中,已有 26% 由 Claude「主导」完成;所谓主导,是研究员只需给出高层指令,Claude 就能端到端完成任务的大部分,人类负责监督。而在今年 2 月,这一比例还不到 1%。更早几天,OpenAI 也表示,去年定下的「自动化研究实习生」目标已经达成,按标准工作日折算,其研究团队每投入 1 个人类工作日,就有约 3.1 个智能体工作日在同时运转。

9 月 21 日,OpenAI 还提议由美国牵头制定前沿 AI 全球技术标准,并把递归式自我改进(RSI)列为重点议题。国内方面,智谱在 9 月 17 日披露,由 GLM-5.3 驱动的 Infra Agent 已在十万卡国产集群上,从零搭起 GLM-5.3-Flash 的推理服务。

在这样的背景下,Naive AI 的做法更直接。就在今年 2 月、Anthropic 的 AI「主导」比例仍接近零时,代季峰的创业团队 Naive AI 成立。公司从一开始就没有沿用传统以人为中心的研发体系,而是把写代码、跑实验、监控流程、分析结果等研发工作交给 AI 模型,人类研究员则把精力集中在三件事上:提出目标、设定约束与评价标准,以及作出最终决策。

首款模型以开源基模为起点,面向编程与 AI 研发

路线选择上,Naive AI 专注于开源模型后训练与 Agent 研发,没有从零预训练,而是以开源模型为起点,做架构改造、增量预训练和后训练。

文中提到,开源生态正在成为新一批实验室的起点。前 OpenAI 首席技术官 Mira Murati 创办的 Thinking Machines Lab,在 7 月推出的首款模型 Inkling 虽然是从零训练,但架构沿用了 DeepSeek-V3 的混合专家设计。Naive AI 则更进一步,直接基于开源基模继续训练和改造。按其判断,开源基模已经足够强,新实验室的竞争点正从「能不能从头训出一个基模」,转向「能不能更快、更好地把基模改造成自己要的样子」。

Naive AI 押注的正是后者背后的研发效率。其刚刚发布的首款模型 Naive-N0.5-Flash,总参数量为 309B,激活参数量为 15.5B,原生支持 1M token 上下文,面向编程与 AI 研发。

这款模型有双重身份:一方面,它由 AI 参与研发;另一方面,它也被训练来承担 AI 研发工作。技术报告显示,AI 已参与注意力架构探索,以及训练、推理和部署系统的优化。研究员设定目标、约束与评价标准,AI 据此实现候选方案、运行实验,并根据结果继续调整;涉及架构选择等关键决策时,仍由研究员把关。

Naive AI 开源首个模型,押注让 AI 参与下一代 AI 研发 3

两个案例展示 AI 如何参与研发流程

官方披露了两个配套案例,用来展示这套研发方式的具体形态。

在推理运行时 NaiveRT 的优化中,研究员与 AI 在 6 天内推进了 151 轮实验,把同一系统的一轮完整投机解码耗时从 12.3 毫秒降至 3.4 毫秒。

另一项任务中,Naive-N0.5-Flash 接下世界模型研究工作,经过累计 400 小时、15 轮主要实验,持续调整数据、训练方案与推理策略,最终得到 AutoWM。文中称,该结果已跻身 WorldArena 第一梯队。

此外,Naive AI 实习生、清华博士生 Shiqian Su 也在 𝕏 上分享了一个使用 Naive-N0.5-Flash 训练 Jev 模型的示例。得到的多模态类 Jev 模型在俄罗斯方块与贪吃蛇两个小游戏上的表现,均优于 Jev 以及开源的 Laya。

按文中描述,在这一流程里,环境与数据准备、模型和训练方法选择、测试构建,以及后续训练、评估、纠错和迭代,都由 Agent 自行推进,过程中还会根据获得的证据调整方案。

这些案例背后,Naive AI 正尝试把模型投入后续研发,让它参与解决下一轮迭代中的实际问题。文章把这一路线的起点归结为模型本身的能力:它能否读懂论文、实现方法,并在一连串实验之后找到值得继续推进的方向。

围绕 AI 研发任务的评测结果

围绕论文复现、机器学习工程、后训练和长程任务,Naive AI 在首份技术报告中给出了一组评测结果。

在考察论文复现能力的 PaperBench 上,Naive-N0.5-Flash 取得 63.2 分,高于报告中的 Claude Opus 4.7、GPT-5.5 和 MiniMax M3。对于一款面向 AI 研发的模型,这项成绩对应的是它把论文中的研究方法落实为具体实现的能力。

Naive AI 开源首个模型,押注让 AI 参与下一代 AI 研发 4

在源自 Kaggle 竞赛任务的 MLE-bench-30 上,Naive-N0.5-Flash 取得 73.7%,任务涉及围绕数据开展模型训练与实验。

在要求固定计算预算下进行语言模型后训练的 PostTrainBench 上,它取得 37.5 分。

文中称,这几类评测覆盖了研发中的不同环节:论文复现关注对已有研究的理解与实现,机器学习工程考察解决具体任务的能力,后训练任务则要求模型在资源约束下寻找改进方案。它们共同构成判断模型能否参与研发的依据。

报告中的另一组对照也被单独点出。在 Sol-ExecBench(GPU 算子优化)、NanoChat AutoResearch(固定预算下的训练改进)和 NanoGPT SpeedRun(训练提速)三项任务上,比较对象是 Recursive Superintelligence。这家公司由 Richard Socher 担任 CEO,田渊栋参与联合创办,专做自动化 AI 研究。

该公司在 6 月公布的首批结果显示,社区优化了两年多、累计 83 次人类刷新纪录的 NanoGPT Speedrun,被其系统从 79.7 秒压到 77.5 秒;而 Naive-N0.5-Flash 把这一成绩进一步推进到 73.8 秒。

编程能力是完成这些工作的基础。在要求根据自然语言需求生成代码仓库的 NL2Repo 上,Naive-N0.5-Flash 得分 71.9,高于 DeepSeek-V4.1-Flash。在面向长程专业任务的 ALE-CLI 上,它取得 32.4 分,接近 GPT-6 Astra 与 Opus 5.5。

文章还提到,研发任务往往伴随更长的历史信息链条。一次训练报错,可能需要结合此前的代码修改来定位;决定下一轮实验方向时,也需要回看已有结果及其对应配置。Naive-N0.5-Flash 原生 1M 上下文,被用来为代码、工具返回与实验记录提供更长的交互空间。

按照披露的开放方案,Naive-N0.5-Flash 的模型权重与推理代码采用 MIT 许可,并将提供 API。输入、输出与缓存读取价格分别为每百万 token 0.6 元、2.6 元和 0.07 元人民币。

Naive AI 开源首个模型,押注让 AI 参与下一代 AI 研发 5

从 MiMo-V2.5 base 出发改造百万 token 上下文

研发 Naive-N0.5-Flash,首先要解决的是百万 token 上下文带来的效率问题。团队以开放权重的 MiMo-V2.5 base 为起点。这个基模的大多数层采用滑动窗口注意力(SWA),关注局部信息,少数全局注意力层负责保留长程信息。上下文增长到百万 token 级别后,这几层全局注意力会贡献相当一部分解码开销。

Naive AI 把改造目标放在这些层上,用 DeepSeek 稀疏注意力(DSA)替换全局注意力。DSA 先通过轻量索引器对历史位置打分,再选出其中 2048 个位置,交给主干网络计算注意力;SWA 则处理 128 token 的局部窗口。整个网络以 5 层 SWA 搭配 1 层 DSA 的布局为主,形成一套混合稀疏注意力架构。

团队还采用了 4 个 KV 分组的 GQA,并设计了具有 16 个 query 头的轻量索引器,继续调整索引与注意力计算的开销。文中同时说明,DSA 的索引器仍需扫描完整历史,相关层也仍需保留完整 KV 缓存,这套改造主要减少的是主干注意力的计算量与访存量。

把索引器的查询头从 64 个减到 16 个,可以显著降低长上下文稀疏注意力的处理耗时。这套方案由研究员与 AI 共同探索得到:研究员设定目标与评测协议,要求在提升长上下文解码效率的同时保持模型质量;AI 负责实现候选架构、运行消融实验并汇总结果;在满足目标的方案中,研究员最终选择了工程实现较为简洁的一种。

改完注意力结构后,模型还需要重新适应新的信息读取方式。为此,Naive-N0.5-Flash 在 1M 上下文配置下完成了累计 3.25T token 的多阶段训练。

  • 最初的 50B token 用于索引器预热:冻结模型其余参数,让准备切换为 DSA 的层继续使用全局注意力,再以其注意力分布为监督信号,通过 KL 散度损失训练索引器。
  • 随后,模型切换到稀疏注意力,进行 3T token 的继续预训练,以语言建模损失为目标,适应新的信息选择与聚合机制,并强化编程和 AI 研发能力。
  • 最后,再用 200B token 进行监督微调(SFT),并逐步降低学习率。

这次切换中,AI 还承担了一项验证工作:以全局注意力结果为参照,分析索引器选出的 top-2048 位置的召回情况。报告称,AI 在过程中发现并修复了 top-k 选择的数值稳定性问题,又独立验证了修复结果。研究员据此确定切换时机与精度阈值,并统一训练和部署阶段的验证标准。

训练系统与显存管理也由 AI 参与优化

更深一层的工作发生在训练系统中。百万 token 的序列需要分配到多张 GPU 上处理,卡间如何交换信息,会直接影响训练效率。

AI 在分析混合架构时,抓住了两类注意力的访问差异:DSA 需要完整历史,SWA 关注左侧局部窗口。基于这一点,它提出并验证了混合序列并行方案:DSA 层使用 Ulysses 序列并行,通过 all-to-all 重分配访问完整序列;SWA 层采用重叠分片,与左侧相邻分片交换必要的重叠区域。

Naive AI 开源首个模型,押注让 AI 参与下一代 AI 研发 6

这样一来,SWA 部分的通信复杂度就从随序列长度增长的 O(L),降到与窗口大小相关的 O(w)。这一思路也被延伸到推理侧,让长上下文预填充、按行分片计算和索引检索分别采用相应的上下文并行方案。

显存管理也做了细化。针对稀疏索引与注意力对齐产生的中间激活,AI 分析重计算路径,把卸载粒度细化到单个算子的输出,让不同中间结果可以分别配置卸载策略;top-k 索引则显式保留,在重计算时继续使用已选位置。长序列下的检查还发现了位置编码精度问题和序列索引越界风险。

按披露数据,这套训练系统在 1M 上下文配置下,使用 512 张 GPU,约 4 天可以完成 1T token 的训练。支撑研发运行的基础设施还包括沙箱、算力和权限管理平台,公司称其每周支持近千万次沙箱运行,峰值并发达到 10 万个。

这些细节对应的并不是抽象口号。文中把「AI 参与研发」拆成了更具体的工作:理解计算依赖,定位数值或性能问题,再通过实验判断修改是否有效。研究员负责设定约束并作出关键决策,AI 则承担大量分析、实现与验证工作。

NaiveRT:6 天 151 轮实验,把投机解码耗时降到 3.4 毫秒

NaiveRT 是一个推理运行时,针对的是长程强化学习任务中的实际问题:单条任务轨迹可能持续生成大量 token,少数耗时特别长的轨迹会拖住整个训练批次。提高单条序列的解码速度,可以缩短这些样本的等待时间。

围绕这一目标,研究员与 AI 在 6 天内推进了 151 轮优化实验,其中 63 轮改动被采纳。AI 分析整网性能,实现候选方案,再通过数值验证和多卡测试检查结果,优化涉及算子融合、数据搬运和 GPU 执行调度等多个环节。

实验中也有被放弃的方向。例如,一条 MoE 算子融合路径连续尝试了 7 轮,每一版的数值结果都正确,但端到端性能全部下降。分析发现,原有算子边界的开销已经大部分被执行重叠覆盖,融合又引入了额外同步,研究员最终叫停了这一方向。

最终,在同一套系统上,NaiveRT 把一轮包含草稿生成、验证、采样与提交的完整投机解码,从 SGLang 的 12.3 毫秒缩短到 3.4 毫秒,延迟下降 72.4%。

Naive AI 开源首个模型,押注让 AI 参与下一代 AI 研发 7

在 8 张前沿 GPU 上,它还测得 2,122 token/s 的单流解码峰值。文中说明,这一数字来自 41 个 HTML/SVG 生成请求中的最佳一秒窗口,测试关闭思考模式,且不计入预填充时间。

文中还给出了 AI 参与研发的过程拆分:151 轮实验中,63 轮改动被采纳,71 轮验证失败或回滚,17 轮用于探索。曲线上的下降台阶,对应一项或多项改动进入实际执行路径。

AutoWM:400 小时、15 轮主要实验进入 WorldArena 第一梯队

AutoWM 把任务扩展到了世界模型研究。一位研究员向 Naive-N0.5-Flash 给出研究目标、算力预算和评测协议,此后由模型持续推进方案设计、训练与评测,并根据实验结果决定下一步尝试。

研究从复现 FlowWAM 开始。早期对无分类器引导和时间步的调整提升有限,模型随后转向数据与训练方案:重写视频描述,把训练集从 2500 段视频扩充到 22500 段,筛除评分较低的样本,并调整帧采样和 rollout 结构。换用更强的基模、配合更高质量的数据后,成绩继续提高。

随着实验推进,模型还发现,WorldArena 的部分指标无需真实参考视频即可计算,可以被用于指导输出选择。它开始搜索不同时间步生成的结果,把帧选择建模为用动态规划求解的背包问题,并继续探索 Best-of-N 视频选择与后处理策略。搜索规模扩大也不一定有效,其中一项配置中,N=32 的表现反而低于 N=16。

累计 400 小时、15 轮主要实验后,团队按 WorldArena-1 Track 1 的公开协议,在视频质量评测中测得 77.43 分,高于报告记录的当时公开最高成绩 73.64 分。

文章称,这项结果包含训练改进、推理时筛选和后处理的共同贡献,也记录了模型如何在实验反馈中逐步调整研究路线。

Naive AI 把这一路线放进 RSI 讨论中

Naive AI 把这类实践视为探索递归式自我改进(RSI)的一部分:让模型参与后续模型与系统的研发,再逐步扩大它能够承担的工作范围。

Naive AI 开源首个模型,押注让 AI 参与下一代 AI 研发 8

文中写道,Naive AI 在 2026 年进入大模型赛道时,选择了一条不同的路:用 AI 研发 AI。以开放基模为起点,它围绕研发任务强化 Naive 系列的能力,同时让 AI 深入参与架构改造、训练与系统优化。这次披露的技术报告和两个案例,让这条路线首次有了一批可以具体检验的结果。

接下来更值得关注的是,这些成果能否为下一轮研发带来增量。推理速度提升,可以缩短实验中的生成等待;模型更擅长读论文、写代码和分析结果,也可能帮助研究员更快找到有效方案。如果这些改进能够持续积累,团队就有机会在相同时间和资源预算内推进更多有效探索。

这也是 Naive AI 希望逐步形成的 RSI 闭环:让 AI 参与后续模型与系统的研发,再让提升后的能力继续推动下一轮改进。

不过,放到整个行业里,RSI 到底指什么,眼下仍在争论中。OpenAI 在 9 月 21 日的提案中明确表示,完全自主的 RSI 目前尚未发生,在能够安全实现之前也不应追求。Anthropic 同样强调,Claude 在其统计的任何一类研发工作中都尚未完全自主。

谷歌与 Google DeepMind 等机构在 9 月中旬发布的 Dream-RSI 则走了另一条路:模型权重不动,只让智能体从过往搜索记录中学习更好的探索策略。也就是说,「自我改进」改的究竟是权重、系统,还是做研究的方法,各家的答案并不相同。

Naive AI 目前的实践,同样是研究员把握方向、AI 承担大量执行。它的不同之处在于目标:让研发的产物和研发的执行者逐渐合二为一,Naive 系列既是这套体系造出来的模型,也被训练成这套体系里的研究员。两个案例已经展示了 AI 承担具体研发任务的潜力,这种能力能否持续转化为下一代模型的进步,还需要后续迭代来回答。

本文来自微信公众号「机器之心」(ID:almosthuman2014),作者:RSI。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。