阿里巴巴于 8 月 14 日开源 Qwen3.8-27B。这是一款 270 亿参数的稠密原生多模态模型,采用 Apache 2.0 授权,没有月活或营收门槛。官方信息显示,该模型原生支持 262K 上下文,并可通过 YaRN 外推到 100 万 tokens。
官方模型卡列出 17 项评测,其中 14 项附有 Claude Opus 4.6 Max 的对照分数。按这 14 项数据逐项对比,Qwen3.8-27B 在 9 项上领先,在 5 项上落后。不过,这些数字全部来自阿里自家发布,目前还没有第三方独立复现。
领先项目集中在视觉代理任务
从官方披露的数据看,Qwen3.8-27B 领先幅度较大的项目,主要集中在视觉理解、界面操作和指令执行相关任务。
- MathVision 为 94.6,对比 Claude Opus 4.6 Max 的 65.5,领先 29.1 分
- CharXiv 为 90.2,对比 66.0,领先 24.2 分
- AndroidWorld 为 81.9,对比 62.0,领先 19.9 分
- IFBench 为 79.5,对比 62.5,领先 17.0 分
- QwenSWEBench 为 79.0,对比 63.8,领先 15.2 分
- OSWorld-Verified 为 84.3,对比 72.7,领先 11.6 分
- SWE-bench Pro 为 61.7,对比 53.4,领先 8.3 分
输入内容还指出,QwenSWEBench 是阿里自家推出的评测。在这种情况下,厂商在自家设计的评测中取得更高分数,其参考价值需要结合这一前提来看。
落后项目全部落在纯推理和长链编码
落后的 5 项则集中在另一类能力上,特点比较一致,都是纯文本推理、多步骤编码或相关任务。
- Terminus 终端编码为 73.0,对比 78.2,落后 5.2 分
- NL2Repo-Bench 代码生成为 42.3,对比 47.6,落后 5.3 分
- GPQA Diamond 为 89.2,对比 91.3,落后 2.1 分
- OmniDocBench 落后 0.3 分
- RealWorldQA 落后 1.0 分
按这组对比,Qwen3.8-27B 的优势主要落在「看屏幕、读图表、按按钮」这类视觉代理任务,短板则出现在纯推理与多步骤长链编码。输入内容将这种差异概括为:眼睛更强,脑力相关任务相对偏弱。
17GB 显存可运行,但不等于 Agent 场景也能轻松跑
硬件门槛是这次发布的一个核心卖点。根据输入内容,Qwen3.8-27B 的原始 BF16 权重大约需要 56GB 显存,意味着要使用 80GB 级别的显卡;FP8 约需 28GB,对应 48GB 显卡;压到 4-bit 后,显存占用约为 14 至 17GB,一张 24GB 的 RTX 4090 可以放下权重,32GB 的 RTX 5090 则更有余量。
不过,这个 14 至 17GB 的数字只计算了权重,并不包括 KV cache、并发 Agent 工作会话、CUDA graphs、运行时缓冲区以及多模态组件。加上该模型原生上下文达到 262K,当 Agent 把整包代码库和多轮工具输出一并塞入上下文时,显存需求会与普通对话场景明显不同。
也就是说,「一张消费级显卡能跑这个模型」对应的是权重装载层面;至于是否能在同样的硬件条件下流畅承担 Agent 任务,还要看任务长度和上下文规模。
对照组选用 Claude Opus 4.6 Max
这次模型卡选用的对照对象是 Claude Opus 4.6 Max。输入内容提到,Anthropic 在 8 月 14 日发布的风险报告中披露,其内部还有未发布的 Model 2,表现高于已经对外服务的 Fable 5。该报告中,用来作为能力跃升参照点的是「Opus 4.6 到 Mythos Preview」。
因此,Qwen3.8-27B 此次公开对比所对应的,是 Claude Opus 4.6 Max,而不是输入内容中提到的 Anthropic 更新进度里的其他模型。
模型卡新增 reasoning_effort 参数
这次模型卡还加入了 reasoning_effort 参数,分为 xhigh(默认)、medium、low 三档,允许开发者按任务难度调整模型思考时长。另一个默认开启的选项是 preserve_thinking,用于保留历史消息中的推理内容。
按输入内容的说法,这类调节旋钮过去更多出现在闭源 API 的计费页面上,这次则被直接写入开源模型卡。
官方数据目前仍缺少第三方独立复现
围绕 Qwen3.8-27B 与 Claude Opus 4.6 Max 的对比,目前最需要注意的一点,是所有关键分数都来自阿里官方模型卡。无论是 14 项对照中 9 胜 5 负,还是 AndroidWorld 领先 19.9 分、MathVision 领先 29.1 分、Terminus 落后 5.2 分、GPQA Diamond 落后 2.1 分,现阶段都还没有第三方独立复现结果。
因此,现阶段可以确认的是阿里公开了这一组成绩、开源了模型、并给出了量化后的显存门槛;至于这些基准结果在独立测试环境下是否一致,输入内容未提供外部验证数据。

