清华大学副教授代季峰创办的 NaiveAI 发布 Naive-N0.5-Flash,并开放模型权重。该模型基于小米 MiMo-V2.5 Base 改造,使用 MIT 协议开源。
从技术方案看,NaiveAI 保留了原有的 MoE 架构,主要调整了注意力机制。团队将全局注意力替换为滑动窗口注意力和 DeepSeek 稀疏注意力,并继续训练 3.25 万亿 tokens。改造后,模型原生支持 100 万 token 上下文,用于降低处理超长文本时的计算量。
NaiveAI 还提到,AI 直接参与了研发流程,负责写代码、跑实验、分析结果和继续优化,研究员则负责确定方向和做关键决定。
以推理系统 NaiveRT 为例,团队在 6 天内进行了 151 轮优化实验,其中 63 轮被采用。官方公布的最高推理速度为 2122 tok/s,不过对应测试条件较为特殊:使用 8 张 GPU、关闭思考模式、不计算输入处理时间,且取自 41 次请求中表现最好的一秒。按官方给出的标准模式,速度约为每位用户 50 tok/s。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

