DeepSeek开源V4.1-Flash,称性能与成本表现超过V4-Pro
DeepSeek于9月10日发布开源模型DeepSeek-V4.1-Flash,并以MIT许可上传至Hugging Face,同时上线网页端和移动应用。公司称,这一新架构家族中最小的模型在性能、成本、速度和总执行时间上超过自家旗舰V4-Pro。模型采用混合专家架构,支持100万token上下文与原生图像输入,相关基准成绩和API定价也一并公布,但这些评测数据目前仍主要来自DeepSeek自测,尚待第三方独立验证。

DeepSeek于9月10日发布开源模型DeepSeek-V4.1-Flash,并以MIT许可上传至Hugging Face,同时上线网页端和移动应用。公司称,这一新架构家族中最小的模型在性能、成本、速度和总执行时间上超过自家旗舰V4-Pro。模型采用混合专家架构,支持100万token上下文与原生图像输入,相关基准成绩和API定价也一并公布,但这些评测数据目前仍主要来自DeepSeek自测,尚待第三方独立验证。

腾讯混元于 8 月 28 日发布并开源新一代大语言模型 Hy4 preview,模型总参数 770B、每个 token 激活 49B,上下文长度达到 100 万 token,权重以 Apache 2.0 许可证发布在 Hugging Face。模型采用 78 层混合专家架构,已上线腾讯云 Tokenhub 与 OpenRouter,并接入 WorkBuddy 和 CodeBuddy。腾讯披露的模型卡与内部盲测数据显示,Hy4 preview 在多项工程与基准测试中取得成绩,但相关数据尚未完成第三方独立验证。

Scalabot 发布首个世界模型 HERON-World Model,可根据当前画面和后续动作预测机器人执行后的世界变化,并将预测扩展到多智能体协作场景。团队称,该模型采用 WorldArena 1.0 Track 1 开源测试方案进行离线评估,EWMScore_P 为 75.80 分,在物理交互、空间透视、运动动态和轨迹准确性四项中分别得到 95.60、99.20、92.61 和 56.66 分。其训练方案结合 Ego 人类操作视频、仿真数据和真机数据,并采用 MoT+MoE 架构。

沙特AI公司HUMAIN推出M3模型,最初宣称100%沙特自主研发,后澄清其底座为中国MiniMax M3。两者均采用混合专家架构,拥有4280亿总参数和230亿激活参数。HUMAIN使用超过1万亿阿拉伯语Token进行后训练,在阿拉伯语基准测试中平均得分89.37%,后续计划开放权重并部署于沙特服务器。分析认为,这显示中国模型正成为其他国家构建主权AI系统的基础。

SEMICON Taiwan 2026存储器高峰论坛9月1日登场,谷歌云高级总监Nikhil Cherian指出,AI运算已转向内存受限,高性能内存占AI服务器硬件成本超75%。谷歌推出软硬双轨策略:TPU 8i/8t分流推理与训练,TurboQuant算法将键值缓存压缩至3位,内存占用缩小6倍,注意力运算加速8倍。

Z.ai 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,也是实验室最具性价比的编程模型。该模型采用混合专家架构,总参数量 3200 亿,每个令牌激活 180 亿参数,支持 1,048,576 个令牌上下文、图像和视频输入,并以 MIT 许可证开源,权重已上传至 Hugging Face。

阿里巴巴 Qwen 团队于 8 月 26 日发布开源模型 Qwen3.8-Flash-Next,并将其定位为「Qwen 4 架构的预览」。该模型采用 125B 参数的 MoE 多模态架构,每个 token 约启用 6B 参数,模型权重已上线 Hugging Face,并计划同步上架 ModelScope。阿里目前尚未公布基准测试成绩,相关参数规格也还未经过独立验证,实际性能仍待完整评测。

Eigen Labs 今年 4 月启动 Darkbloom,试图把闲置的 Apple Silicon Mac 组成分散式 AI 推理网络。8 月 21 日,工程师 Gajesh Naik 宣布项目已升级为 OpenRouter 付费推理供应商,并招募更多机主加入。官方宣传单机月收入可达 120 至 200 美元,但按已披露数据反推,平均单机月收入约 34 美元;多份实测显示,实际收益还要更低。
