阿里巴巴 Qwen 团队预告周三发布 Qwen 3.8-Flash-Next
阿里巴巴 Qwen 团队称,将于周三发布 Qwen 3.8-Flash-Next。该模型为混合专家(MoE)架构,被定位为下一代 Qwen 4 架构的预览版本,而非最终旗舰。团队表示,模型将支持开放权重,并上线 Hugging Face 与 ModelScope,开发者可免费下载、微调和运行。对于 1250 亿总参数、每个 token 激活 60 亿参数等数字,报道同时提到尚未获得官方证实。

阿里巴巴 Qwen 团队称,将于周三发布 Qwen 3.8-Flash-Next。该模型为混合专家(MoE)架构,被定位为下一代 Qwen 4 架构的预览版本,而非最终旗舰。团队表示,模型将支持开放权重,并上线 Hugging Face 与 ModelScope,开发者可免费下载、微调和运行。对于 1250 亿总参数、每个 token 激活 60 亿参数等数字,报道同时提到尚未获得官方证实。

斯坦福大学教授、Simile AI 创始人 Percy Liang 宣布,Marin 开放实验室已启动 Marin 535B-A23B 模型训练,并将训练过程全程公开。该模型拥有 5350 亿总参数、230 亿激活参数,训练数据总量为 18.75 万亿 token,部署 11 套 GB200 NVL72 系统,预计连续训练约 3 个月。团队还同步开放了实时训练曲线、数据构成页面和 GitHub 议题页,希望把原本较为封闭的大模型训练过程置于公开观察之下。

加州大学伯克利分校与得州大学奥斯汀分校研究团队发布边缘原生混合专家模型推理引擎 FreeToken。该系统将个人计算机作为统一弹性推理平台,支持在单张工作站 GPU、游戏台式机和 8GB 显存笔记本 GPU 上运行不同规模模型。FreeToken 已以 Apache-2.0 协议开源,发布到 GitHub 和 PyPI,并提供 Windows、Linux 桌面应用及兼容 OpenAI、Anthropic 的 API 接口。

智谱 AI 创始人、清华大学教授唐杰表示,单独讨论大模型参数量已越来越难判断模型能力。回顾从 GPT-3、Chinchilla 到 MoE 的 Scaling Law 演变后,他提出模型能力还取决于训练数据、训练与推理阶段的算力分配,以及后训练与单次推理的有效深度。智谱最新的 GLM-5.3 被他视为一次控制实验:在不增加参数的前提下,集中扩展长程任务训练与强化学习。

Mira Murati 离开 OpenAI 两年后,旗下 Thinking Machines Lab 上周公开首个模型 Inkling。该模型采用 MoE 架构,总参数 9750 亿、推理激活参数 410 亿,支持文本、图像和音频输入,上下文窗口达 100 万 token,并以 Apache 2.0 许可证在 Hugging Face 提供完整权重。Decrypt 评测认为,它是西方实验室从零训练后发布的最强开源模型之一,但在编码、逻辑、创意写作和内容审查等多项实测里表现并不均衡。

AMD于7月25日发布全开源混合专家模型Instella-MoE,总参数量160亿、每个Token激活28亿参数。AMD称,该模型完全基于MI300X、MI325X GPU及ROCm软件栈从零训练,并引入Gated MLA与FarSkip-Collective等架构设计。测试数据显示,Instella-MoE-16B-A3B基础模型平均得分为76.7,在全开源模型中处于领先位置,同时支持64K Token长上下文及完整训练流程开放。

AI 芯片初创公司 Etched 宣布完成 3 亿美元 C 轮融资,投后估值达到 103 亿美元,由红杉资本领投。公司去年 12 月刚以 50 亿美元估值完成 5 亿美元融资,7 个月内估值翻倍。Etched 表示其首款芯片已由台积电制造,首批完整系统正由客户测试,目前已锁定 10 亿美元订单。

DeepSeek V4 Preview发布,SWE-bench跑分83.7%超越Claude Opus和GPT-5.2;完全基于华为升腾950芯片,输入成本低至0.3美元/百万token,仅为闭源对手1/27。
