阿里巴巴周一发布 Qwen3.8-Max,并称这是公司迄今能力最强的模型。该模型的权重将于下周登陆 Hugging Face 和 ModelScope,这是阿里首次放出 Max 级模型的权重。

参数规模与运行方式
Qwen3.8-Max 的总参数规模为 2.4 万亿,其中任一时刻激活 950 亿参数。报道将参数比作模型可调用的“旋钮”数量。
这种设计的重点在于效率:模型运行时不必同时动用全部参数。原文用图书馆作比喻,称每次提问只会点亮相关书架。按这一说法,硬件条件足够的小型企业和实验室,也能运行这一类前沿模型,而不必承担大型数据中心同等水平的成本。
阿里强调持续执行能力
阿里此次发布说明没有沿用常见的基准测试叙事,而是把重点放在模型的持续工作能力上。
按照发布内容,Qwen3.8-Max 曾连续 16 天自行构建一个编程工具,期间完成 265 次 commits、127 个 pull requests 和 151 个 issues,全程没有人类接触键盘。另一次任务中,它用了 5 天复现一篇此前没有见过代码实现的研究论文,最终结果比论文本身高出 2.7 分。在一场持续 24 小时的机器学习竞赛中,该模型的成绩超过了 526 个人类队伍中的 458 支。
可接入竞争对手工具
Qwen3.8-Max 提供了面向 Claude Code 和 Codex 的使用说明,这两款编程工具分别由 Anthropic 和 OpenAI 开发。阿里的 API 同时兼容这两家公司的协议。
报道还提到,Qwen 多数编程基准测试是在 Claude Code 内部完成的。
文本与编程测试不占优,多模态任务表现更强
从测试结果看,Qwen3.8-Max 并未在文本和编程项目中全面领先。
- 在 31 项文本测试中,Anthropic 的 Fable 5 拿下 15 个第一;
- OpenAI 的 GPT-5.6 Sol 拿下 9 个第一;
- Qwen 拿下 7 个第一。
在 12 项编程测试中,Qwen 只获得 1 个第一。

不过,报道称该模型在“智能成本”上非常便宜且高效。即便它需要更多迭代或推理步骤,完成任务的总成本仍会更低,接近 Claude Fable 5 收费水平的 30%。
而在多模态任务中,排名出现反转。原文提到,在文档、视频和空间推理相关测试里,Qwen 领跑了表格中的大多数项目。
策略转向与发布时间点
在商业策略上,阿里的动作也出现了反转。报道提到,阿里在 4 月关闭了 Qwen Code 的免费层;在管理层人员离开后,团队一度更偏向封闭、付费模型。此前对 Qwen 3.7 Max 的评测还指出,Plus 版本会开放,但 Max 仍锁在 API 后面。
现在这扇门已经打开。报道认为,这个时间点并非偶然。
根据文中数据,中国开放权重模型在 OpenRouter 上的 token 占比,已从 2024 年末不足 2% 升至 2026 年中约 61%。Qwen 也已超过 Meta 的 Llama,成为全球自托管数量最多的模型。
分发优势正在放大
与此同时,华盛顿在 6 月依据出口管制限制了 Fable 5 和 Mythos 5;报道还称,北京据报也在考虑对中国模型出海施加限制。
按 Decrypt 的说法,阿里在纸面排名上并非赢家,但在分发层面占了上风。对于用户来说,如果一个可免费下载的模型已经足够接近头部产品,那么排在第二也并非坏位置。

