阿里开源 Qwen3.8-27B:14 项对比中 9 项领先 Claude

阿里开源 Qwen3.8-27B:14 项对比中 9 项领先 Claude

N
News Editor
2026-08-15 09:03:32
阿里巴巴于 8 月 14 日开源 Qwen3.8-27B。这是一个 270 亿参数的原生多模态模型,采用 Apache 2.0 授权,原生支持 262K 上下文,并可通过 YaRN 外推至 100 万 tokens。按阿里官方模型卡披露的 14 项对比,Qwen3.8-27B 在 9 项指标上领先 Claude Opus 4.6 Max,但落后的 5 项集中在纯推理与长链编码。4-bit 量化后约需 14 至 17GB 显存,不过这一数字不包含 KV cache 与多模态组件,目前也还没有第三方独立复现。

阿里巴巴于 8 月 14 日开源 Qwen3.8-27B。这是一款 270 亿参数的稠密原生多模态模型,采用 Apache 2.0 授权,没有月活或营收门槛。官方信息显示,该模型原生支持 262K 上下文,并可通过 YaRN 外推到 100 万 tokens。

官方模型卡列出 17 项评测,其中 14 项附有 Claude Opus 4.6 Max 的对照分数。按这 14 项数据逐项对比,Qwen3.8-27B 在 9 项上领先,在 5 项上落后。不过,这些数字全部来自阿里自家发布,目前还没有第三方独立复现。

领先项目集中在视觉代理任务

从官方披露的数据看,Qwen3.8-27B 领先幅度较大的项目,主要集中在视觉理解、界面操作和指令执行相关任务。

  • MathVision 为 94.6,对比 Claude Opus 4.6 Max 的 65.5,领先 29.1 分
  • CharXiv 为 90.2,对比 66.0,领先 24.2 分
  • AndroidWorld 为 81.9,对比 62.0,领先 19.9 分
  • IFBench 为 79.5,对比 62.5,领先 17.0 分
  • QwenSWEBench 为 79.0,对比 63.8,领先 15.2 分
  • OSWorld-Verified 为 84.3,对比 72.7,领先 11.6 分
  • SWE-bench Pro 为 61.7,对比 53.4,领先 8.3 分

输入内容还指出,QwenSWEBench 是阿里自家推出的评测。在这种情况下,厂商在自家设计的评测中取得更高分数,其参考价值需要结合这一前提来看。

落后项目全部落在纯推理和长链编码

落后的 5 项则集中在另一类能力上,特点比较一致,都是纯文本推理、多步骤编码或相关任务。

  • Terminus 终端编码为 73.0,对比 78.2,落后 5.2 分
  • NL2Repo-Bench 代码生成为 42.3,对比 47.6,落后 5.3 分
  • GPQA Diamond 为 89.2,对比 91.3,落后 2.1 分
  • OmniDocBench 落后 0.3 分
  • RealWorldQA 落后 1.0 分

按这组对比,Qwen3.8-27B 的优势主要落在「看屏幕、读图表、按按钮」这类视觉代理任务,短板则出现在纯推理与多步骤长链编码。输入内容将这种差异概括为:眼睛更强,脑力相关任务相对偏弱。

17GB 显存可运行,但不等于 Agent 场景也能轻松跑

硬件门槛是这次发布的一个核心卖点。根据输入内容,Qwen3.8-27B 的原始 BF16 权重大约需要 56GB 显存,意味着要使用 80GB 级别的显卡;FP8 约需 28GB,对应 48GB 显卡;压到 4-bit 后,显存占用约为 14 至 17GB,一张 24GB 的 RTX 4090 可以放下权重,32GB 的 RTX 5090 则更有余量。

不过,这个 14 至 17GB 的数字只计算了权重,并不包括 KV cache、并发 Agent 工作会话、CUDA graphs、运行时缓冲区以及多模态组件。加上该模型原生上下文达到 262K,当 Agent 把整包代码库和多轮工具输出一并塞入上下文时,显存需求会与普通对话场景明显不同。

也就是说,「一张消费级显卡能跑这个模型」对应的是权重装载层面;至于是否能在同样的硬件条件下流畅承担 Agent 任务,还要看任务长度和上下文规模。

对照组选用 Claude Opus 4.6 Max

这次模型卡选用的对照对象是 Claude Opus 4.6 Max。输入内容提到,Anthropic 在 8 月 14 日发布的风险报告中披露,其内部还有未发布的 Model 2,表现高于已经对外服务的 Fable 5。该报告中,用来作为能力跃升参照点的是「Opus 4.6 到 Mythos Preview」。

因此,Qwen3.8-27B 此次公开对比所对应的,是 Claude Opus 4.6 Max,而不是输入内容中提到的 Anthropic 更新进度里的其他模型。

模型卡新增 reasoning_effort 参数

这次模型卡还加入了 reasoning_effort 参数,分为 xhigh(默认)、medium、low 三档,允许开发者按任务难度调整模型思考时长。另一个默认开启的选项是 preserve_thinking,用于保留历史消息中的推理内容。

按输入内容的说法,这类调节旋钮过去更多出现在闭源 API 的计费页面上,这次则被直接写入开源模型卡。

官方数据目前仍缺少第三方独立复现

围绕 Qwen3.8-27B 与 Claude Opus 4.6 Max 的对比,目前最需要注意的一点,是所有关键分数都来自阿里官方模型卡。无论是 14 项对照中 9 胜 5 负,还是 AndroidWorld 领先 19.9 分、MathVision 领先 29.1 分、Terminus 落后 5.2 分、GPQA Diamond 落后 2.1 分,现阶段都还没有第三方独立复现结果。

因此,现阶段可以确认的是阿里公开了这一组成绩、开源了模型、并给出了量化后的显存门槛;至于这些基准结果在独立测试环境下是否一致,输入内容未提供外部验证数据。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
250

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。