NaiveAI开源首个模型,AI参与 6 天 151 轮优化

NaiveAI开源首个模型,AI参与 6 天 151 轮优化

N
News Editor
2026-09-28 03:40:43
清华大学副教授代季峰创办的 NaiveAI 发布并开源 Naive-N0.5-Flash,模型基于小米 MiMo-V2.5 Base 改造,采用 MIT 协议。团队保留 MoE 架构,调整注意力机制,并继续训练 3.25 万亿 tokens。NaiveAI 还披露,AI 直接参与代码编写、实验运行、结果分析和后续优化;在 NaiveRT 推理系统研发中,团队 6 天完成 151 轮优化实验,其中 63 轮被采用。

清华大学副教授代季峰创办的 NaiveAI 发布 Naive-N0.5-Flash,并开放模型权重。该模型基于小米 MiMo-V2.5 Base 改造,使用 MIT 协议开源。

从技术方案看,NaiveAI 保留了原有的 MoE 架构,主要调整了注意力机制。团队将全局注意力替换为滑动窗口注意力和 DeepSeek 稀疏注意力,并继续训练 3.25 万亿 tokens。改造后,模型原生支持 100 万 token 上下文,用于降低处理超长文本时的计算量。

NaiveAI 还提到,AI 直接参与了研发流程,负责写代码、跑实验、分析结果和继续优化,研究员则负责确定方向和做关键决定。

以推理系统 NaiveRT 为例,团队在 6 天内进行了 151 轮优化实验,其中 63 轮被采用。官方公布的最高推理速度为 2122 tok/s,不过对应测试条件较为特殊:使用 8 张 GPU、关闭思考模式、不计算输入处理时间,且取自 41 次请求中表现最好的一秒。按官方给出的标准模式,速度约为每位用户 50 tok/s。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。