OpenDesign Arena 背后的公司 OpenDesign 本周用同一批设计任务测试了 13 个 AI 模型。最终,OpenAI 的 GPT-6 Astra 拿到最高分,但 DeepSeek 最新模型 V4.1 Flash 以接近的成绩排在其后,得分达到榜首的 98%,价格则只有最高价位的约 1.4%。

OpenDesign Arena 如何给设计模型打分
OpenDesign Arena 评估的是日常设计工作,包括构建网页应用、仪表盘、移动端界面和落地页,总分为 100 分。
其中,30 分用于检查输出是否真正符合任务要求,另外 70 分评估设计质量,覆盖布局、层级、配色和风格匹配度。按 OpenDesign 的定位,这套测试回答的不是大多数 AI 榜单常见的泛化问题,而是更具体的一点:真实从业的网页设计师明天实际该用哪个模型。
GPT-6 Astra 得分第一,DeepSeek 在成本和速度上更低
在这套评分标准下,GPT-6 Astra 平均得分 82.7,完成一个设计耗时 11.1 分钟,每个成品设计成本为 1.61 美元。
DeepSeek V4.1 Flash 得分 81.2,完成时间 5.3 分钟,成本 0.023 美元。Claude Fable 5.1 得分 80.3,耗时 12.8 分钟,成本 3.66 美元。
从结果看,DeepSeek V4.1 Flash 只比 GPT-6 Astra 低 1.5 分,但运行成本明显更低,完成时间也更短。
OpenDesign 测试的其他模型,包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash 和 Gemini 3.8 Flash,都低于 DeepSeek V4.1 Flash,且运行成本更高。这一情况覆盖了 13 个受测模型中的 11 个。能明确超过它的只有 GPT-6 Astra,而且领先幅度只有 1.5 分。
DeepSeek 报告解释了 V4.1 Flash 的成本结构
DeepSeek 在 V4.1 Flash 技术报告中解释了这类成本节省的来源。该模型总参数量为 5520 亿,即模型训练中用于存储已学到内容的内部参数设置。
不过,在读取输入提示时,它只激活其中 80 亿参数;在生成回复时,则激活 160 亿参数。DeepSeek 将这一结构称为 Causal Encoder-Decoder design,并表示这也是模型完成速度较快的原因之一。
这不是 DeepSeek 第一次用更低价格缩小差距
报道提到,几周前,DeepSeek 的 V4 Pro 模型在另一项基准对比中,成绩已进入 Claude Fable 5 的 5% 以内,同时收费只占后者的一部分。
DeepSeek 还一直在北京招聘工程师,准备建设自己的 Code Harness,目标是掌握完整的 agentic stack,而不只是提供底层模型。
这组测试能说明什么,不能说明什么
OpenDesign 的测试设置也限制了这些数字的解释范围。一个模型的输出,只有在能够首先渲染成可正常运行的网页时才会进入评分;如果结果为空白、损坏或被截断,就记为 0 分,而且不会重新测试。
这意味着,这套基准主要衡量的是稳定、日常可交付的设计输出,而不是通用推理能力或编程能力。
GPT-6 Astra 已发布,交付率仍保持第一
OpenAI 已于 9 月 3 日发布 GPT-6 Astra。报道称,这个模型已经形成一种能够处理多类任务的口碑,包括电路板布局、报税草稿和 3D 场景搭建,不过早期测试者也认为,它在写作方面弱于被替代的上一代模型。
在 OpenDesign 的图表中,它的价格和速度也延续了这一通用型特征:比 DeepSeek 的低价模型更慢、更贵,但仍然是全场最高分。
交付率方面,DeepSeek V4.1 Flash 的 delivery rate 为 57.7%,即 OpenDesign 认定无需修改即可交付的输出占比。GPT-6 Astra 的交付率为 60%,Claude Fable 5.1 为 56.7%。


