OpenDesign 旗下 OpenDesign Arena 近期对 13 款 AI 模型进行了同一批设计任务测试,结果显示,OpenAI 的 GPT-6 Astra 仍是最高分模型,但 DeepSeek 最新推出的 V4.1 Flash 以约 1.4% 的价格达到前者 98% 的设计得分,成为本轮评测中成本效率最突出的产品。
OpenDesign Arena 的评分范围为 100 分,聚焦日常工作型设计,包括构建网页应用、仪表盘、移动端界面和落地页。其中 30 分用于检查输出是否满足任务要求,另外 70 分评估布局、层级、色彩与风格匹配等设计质量。该基准试图回答一个比多数 AI 排行榜更具体的问题:一名实际工作的网页设计师,明天应该用哪款模型。
Myriad:英伟达9月将涨到多高?点击参与预测。
具体数据上,GPT-6 Astra 平均得分 82.7 分,完成每项设计耗时 11.1 分钟,成本为 1.61 美元。DeepSeek V4.1 Flash 得分 81.2 分,5.3 分钟完成,成本仅 0.023 美元。Claude Fable 5.1 得分 80.3 分,耗时 12.8 分钟,成本 3.66 美元。
OpenDesign 测试的其他模型,包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash 和 Gemini 3.8 Flash 等,得分均低于 DeepSeek V4.1 Flash,且运行成本更高。这意味着在 13 款受测模型中,有 11 款被 DeepSeek V4.1 Flash 以更低价格超越;只有 GPT-6 Astra 在总分上压过它,且领先幅度仅为 1.5 分。
DeepSeek 为 V4.1 Flash 发布的技术报告解释了成本节省来源。该模型总参数规模为 5520 亿,这些参数是模型训练期间用于存储所学内容的内部设置;但在读取输入提示时仅唤醒 80 亿参数,在生成回复时唤醒 160 亿参数。DeepSeek 将这一设计称为因果编码器-解码器架构,这也是该模型实现快速完成任务的同一项关键机制。
这并非 DeepSeek 首次尝试以低成本缩小能力差距。数周前,该公司的 V4 Pro 模型在另一项基准比较中与 Claude Fable 5 的差距缩小至 5% 以内,而收费仅为后者的一小部分。DeepSeek 还在北京招募工程师,以构建自有 Code Harness,目标是掌控完整智能体技术栈,而不只是提供底层模型。
OpenDesign 的测试设置也限制了这些数字能够证明的范围。模型输出只有在能够渲染为可运行网页时才会获得评分;任何空白、损坏或被截断的结果均记为零分,且不会重新测试。这意味着该基准衡量的是可靠、日常的设计输出,而非通用推理或编程能力。
GPT-6 Astra 由 OpenAI 于 9 月 3 日发布,已因“样样都能做”而闻名,包括布局电路板、起草税务申报表、构建 3D 场景等;但早期测试者指出,其写作能力弱于它所取代的模型。其在 OpenDesign 榜单上的价格与速度也符合这种通用型定位:比 DeepSeek 更便宜的入门模型更慢、更贵,但仍是该领域最高分。
交付率方面,即 OpenDesign 判定无需修改即可交付的输出比例,DeepSeek V4.1 Flash 为 57.7%,GPT-6 Astra 为 60%,Claude Fable 5.1 为 56.7%。
