DeepSeek V4.1 Flash 设计跑分逼近 GPT-6 Astra,成本仅约 1.4%

DeepSeek V4.1 Flash 设计跑分逼近 GPT-6 Astra,成本仅约 1.4%

N
News Editor
2026-09-10 21:16:03
OpenDesign Arena 本周用同一批设计任务测试 13 个 AI 模型,OpenAI 的 GPT-6 Astra 以 82.7 分居首,DeepSeek 新模型 V4.1 Flash 以 81.2 分紧随其后,达到前者约 98% 的得分。按单个成品设计计算,V4.1 Flash 耗时 5.3 分钟、成本 0.023 美元,约为 GPT-6 Astra 1.61 美元的 1.4%。测试主要衡量网页、仪表盘、移动端界面和落地页等日常设计产出,不涉及通用推理或编程能力。

OpenDesign Arena 背后的公司 OpenDesign 本周用同一批设计任务测试了 13 个 AI 模型。最终,OpenAI 的 GPT-6 Astra 拿到最高分,但 DeepSeek 最新模型 V4.1 Flash 以接近的成绩排在其后,得分达到榜首的 98%,价格则只有最高价位的约 1.4%。

DeepSeek V4.1 Flash 设计跑分逼近 GPT-6 Astra,成本仅约 1.4% 2

OpenDesign Arena 如何给设计模型打分

OpenDesign Arena 评估的是日常设计工作,包括构建网页应用、仪表盘、移动端界面和落地页,总分为 100 分。

其中,30 分用于检查输出是否真正符合任务要求,另外 70 分评估设计质量,覆盖布局、层级、配色和风格匹配度。按 OpenDesign 的定位,这套测试回答的不是大多数 AI 榜单常见的泛化问题,而是更具体的一点:真实从业的网页设计师明天实际该用哪个模型。

GPT-6 Astra 得分第一,DeepSeek 在成本和速度上更低

在这套评分标准下,GPT-6 Astra 平均得分 82.7,完成一个设计耗时 11.1 分钟,每个成品设计成本为 1.61 美元。

DeepSeek V4.1 Flash 得分 81.2,完成时间 5.3 分钟,成本 0.023 美元。Claude Fable 5.1 得分 80.3,耗时 12.8 分钟,成本 3.66 美元。

从结果看,DeepSeek V4.1 Flash 只比 GPT-6 Astra 低 1.5 分,但运行成本明显更低,完成时间也更短。

OpenDesign 测试的其他模型,包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash 和 Gemini 3.8 Flash,都低于 DeepSeek V4.1 Flash,且运行成本更高。这一情况覆盖了 13 个受测模型中的 11 个。能明确超过它的只有 GPT-6 Astra,而且领先幅度只有 1.5 分。

DeepSeek 报告解释了 V4.1 Flash 的成本结构

DeepSeek 在 V4.1 Flash 技术报告中解释了这类成本节省的来源。该模型总参数量为 5520 亿,即模型训练中用于存储已学到内容的内部参数设置。

不过,在读取输入提示时,它只激活其中 80 亿参数;在生成回复时,则激活 160 亿参数。DeepSeek 将这一结构称为 Causal Encoder-Decoder design,并表示这也是模型完成速度较快的原因之一。

这不是 DeepSeek 第一次用更低价格缩小差距

报道提到,几周前,DeepSeek 的 V4 Pro 模型在另一项基准对比中,成绩已进入 Claude Fable 5 的 5% 以内,同时收费只占后者的一部分。

DeepSeek 还一直在北京招聘工程师,准备建设自己的 Code Harness,目标是掌握完整的 agentic stack,而不只是提供底层模型。

这组测试能说明什么,不能说明什么

OpenDesign 的测试设置也限制了这些数字的解释范围。一个模型的输出,只有在能够首先渲染成可正常运行的网页时才会进入评分;如果结果为空白、损坏或被截断,就记为 0 分,而且不会重新测试。

这意味着,这套基准主要衡量的是稳定、日常可交付的设计输出,而不是通用推理能力或编程能力。

GPT-6 Astra 已发布,交付率仍保持第一

OpenAI 已于 9 月 3 日发布 GPT-6 Astra。报道称,这个模型已经形成一种能够处理多类任务的口碑,包括电路板布局、报税草稿和 3D 场景搭建,不过早期测试者也认为,它在写作方面弱于被替代的上一代模型。

在 OpenDesign 的图表中,它的价格和速度也延续了这一通用型特征:比 DeepSeek 的低价模型更慢、更贵,但仍然是全场最高分。

交付率方面,DeepSeek V4.1 Flash 的 delivery rate 为 57.7%,即 OpenDesign 认定无需修改即可交付的输出占比。GPT-6 Astra 的交付率为 60%,Claude Fable 5.1 为 56.7%。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。