阿里巴巴发布 Qwen3.8-Max:自评跑分领先,低价策略更受关注

阿里巴巴发布 Qwen3.8-Max:自评跑分领先,低价策略更受关注

N
News Editor
2026-08-04 01:51:01
阿里巴巴旗下 Qwen 团队发布新旗舰模型 Qwen3.8-Max,官方称其在 OSWorld-Verified 测试中拿下 86.1 分,高于 GPT-5.6 Sol Max 和 Fable 5。公司同时披露多项评测分数、2.4 兆参数 MoE 架构、100 万 token 上下文窗口,并预告下周开放 Qwen3.8-Max 与 Qwen3.8-27B 权重。不过,这些成绩与演示目前均来自官方自评,尚未经过第三方独立验证,开源授权条款也还未公布。

阿里巴巴旗下 Qwen 团队发布新一代旗舰模型 Qwen3.8-Max,并在官方发布贴文中称,该模型在 OSWorld-Verified 测试中获得 86.1 分,高于 GPT-5.6 Sol Max 的 83.2 分、Fable 5 的 85.0 分,以及 Gemini 3.1 Pro 的 76.2 分。

不过,文中提到,这份成绩单目前仅来自阿里巴巴官方自评,尚未经过第三方机构独立验证。除 OSWorld-Verified 外,Qwen 团队还列出多项评测结果,包括 PaperBench 93.0 分、TerminalBench 2.1 的 86.6 分、Vision2Web 69.0 分、LVBench 81.8 分,以及 ERQA 77.8 分。这些数字同样出自官方披露。

定位指向长时间自主执行任务

报道指出,过去一年,大型语言模型的竞争方向已逐渐分化。OpenAI 的 GPT 系列偏向通用推理与企业生产力,Anthropic 的 Claude 系列强调代码生成和长文本推理,Google 的 Gemini 聚焦多模态与网页原生工作流,月之暗面(Moonshot AI)的 Kimi K3 则以前沿性能和开源权重切入市场。

Qwen3.8-Max 试图把这些路线的能力整合到同一个模型中,瞄准的不是普通聊天助手,而是可连续工作数天的“自主员工”。阿里巴巴官方称,这套模型适合长时间自主写代码、操作桌面软件完成重复性业务流程、协助研究机构重现实验,以及在制造和物流场景中把视觉输入持续反馈给规划循环。

按报道说法,Qwen3.8-Max 的卖点更接近持续执行任务的能力,而非单纯提升对话表现。

采用 2.4 兆参数 MoE 架构

Qwen3.8-Max 采用混合专家架构(MoE),总参数量为 2.4 兆,但推理时实际激活参数约为 950 亿。报道将这一设计概括为,模型内部保留了一整组“专家”,但每次回答问题时只调用其中一部分,以在维持能力的同时压低计算成本。

该模型建立在 Qwen3.5 架构之上,上下文窗口扩展至 100 万 token。按文中表述,这一长度相当于可以一次读取整本书后再作答。

价格低于 Claude Opus 5 和 GPT-5.6 Sol 标准模式

报道认为,这次发布中更受关注的是定价。根据 QwenCloud 定价页,Qwen3.8-Max 在海外市场的价格为每百万 token 输入 2 美元、输出 6 美元;中国境内价格为输入人民币 12 元、输出人民币 36 元,若命中隐式缓存,价格最低可降至人民币 1.5 元。

按输入与输出合计计算,Qwen3.8-Max 每百万 token 的总成本为 8 美元,不到 Claude Opus 5 合计 30 美元的三分之一,也不到 GPT-5.6 Sol 标准模式合计 35 美元的四分之一。

文中提到,推理成本之所以关键,是因为自主代理在执行多轮规划和反复自我修正的长流程任务时,token 消耗远高于普通聊天任务。单项工作可能消耗数百万 token,企业若同时运行数百甚至上千个代理,推理费用很快会成为运营成本中的主要部分。

报道还称,价格压力已开始向行业蔓延。OpenAI 上周下调 GPT-5.6 中低阶模型 Terra 和 Luna 的 API 价格,降幅分别为 20% 和 80%。在这一背景下,Qwen3.8-Max 的低价被视为将价格竞争继续向前推进。

官方比较表也显示并非全面领先

尽管阿里巴巴公布的成绩较为亮眼,但报道同时指出,Qwen3.8-Max 并非在所有项目中都占优。在专业软件工程测试 SWE-Pro 中,最高分来自 OpenAI 的模型;在部分软件工程评测以及 Agents’ Last Exam 中,Anthropic 的 Opus 4.8 仍保持领先。

文章称,阿里巴巴官方比较表本身也承认,Qwen3.8-Max 提供的是较为“均衡”的表现组合,而不是“全面最强”。

此外,阿里巴巴还宣称,Qwen3.8-Max 能自主完成超过 10 天的软件项目、重现包含数千行代码的研究论文、进行芯片设计的迭代优化,并借助多模态反馈持续修正计划。只是,这些示范同样全部来自公司内部,尚未经过独立验证。

预告开放权重,但授权条款仍未公布

阿里巴巴同时预告,将于下周在 Hugging Face 与 ModelScope 开放 Qwen3.8-Max 权重,并同步发布较小型号 Qwen3.8-27B。若这一安排落地,将是 Qwen“Max”级旗舰模型首次开放自部署,意味着原本主要通过 API 提供的顶级模型将首次交由企业自行运行。

不过,报道指出,阿里巴巴目前只公布了“将开源”的计划,并未说明具体采用何种授权方式。文中认为,这不是细节问题,而是决定企业能否真正部署与商用的关键。

如果采用 Apache 2.0 这类宽松授权,企业可自由微调并整合进商业产品;若采用类似月之暗面 Kimi K3 的定制授权,即便开放权重,仍可能要求额外披露,且以模型即服务(MaaS)形式对外提供时需另行取得商业授权。在授权条款公布前,计划自建部署的企业仍难以判断这次开放权重的实际意义。

发布时间点正值模型与价格竞争升温

Qwen3.8-Max 发布时点正处于行业竞争密集阶段。报道提到,最近几周,月之暗面、OpenAI 和 Anthropic 都相继推出新动作,竞争方向分别覆盖推理、编程、多模态、自主代理与价格。

在这一轮竞争中,阿里巴巴拿出的组合是:评测成绩与对手接近或领先、价格压低到对手的四分之一左右、上下文窗口扩大至 100 万 token,并加上“下周开放权重”的预告。只是,这些筹码仍需等待时间验证,不能仅凭厂商自评成绩单下结论。

文章最后指出,跑分由厂商自行选择赛道,价格则由市场直接投票。就 Qwen3.8-Max 而言,真正受到关注的并不只是它赢过了谁,而是其低价是否会迫使竞争对手继续下调价格。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
690

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。