OpenDesign 是基准网站 OpenDesign Arena 背后的公司,本周在同一批设计任务中运行了 13 个人工智能模型。得分最高的是 OpenAI 的 GPT-6 Astra。但 DeepSeek 的最新型号 V4.1 Flash 达到了最高分数的 98%,而收取的价格约为最高价格的 1.4%。

OpenDesign Arena 对日常设计工作(构建 Web 应用程序、仪表板、移动屏幕和登陆页面)的模型进行评分,满分 100 分。其中三十个点检查输出是否真正符合要求;另外70级的设计质量体现在布局、层次、色彩和风格的契合上。

它的构建是为了回答一个比大多数人工智能排行榜所问的问题更狭窄的问题:一个正在工作的网页设计师明天应该实际使用哪种模型。

在此规模上,GPT-6 Astra 平均得分为 82.7 分,每个完成设计耗时 11.1 分钟,费用为 1.61 美元。 DeepSeek V4.1 Flash 得分为 81.2,用时 5.3 分钟完成工作,成本为 0.023 美元。 《克劳德寓言 5.1》的评分为 80.3,时长 12.8 分钟,售价 3.66 美元。

OpenDesign 测试的所有其他型号(其中包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash 和 Gemini 3.8 Flash)的得分均低于 DeepSeek V4.1 Flash,且运行成本更高。这是测试的 13 款车型中的 11 款。只有 GPT-6 Astra 彻底击败了它,而且仅领先一分半。

DeepSeek V4.1 Flash 的技术报告解释了节省的来源。该模型总共携带 5520 亿个参数(模型在训练期间调整以存储所学知识的内部设置),但仅唤醒其中 80 亿个参数来读取传入的提示,并唤醒其中 160 亿个参数来写入响应。 DeepSeek 将此称为因果编码器-解码器设计,模型快速完成时间背后的技巧是相同的。

这并不是 DeepSeek 第一次以低成本缩小能力差距。几周前,该公司的 V4 Pro 型号在单独的基准比较中与 Claude Fable 5 的差距在 5% 以内,而收费仅为 Fable 的一小部分。 DeepSeek 还一直在北京招募工程师来构建自己的 Code Harness,旨在拥有完整的代理堆栈,而不仅仅是提供其底层的模型。

OpenDesign 的测试设置缩小了这些数字可以证明的范围。模型的输出只有在首先呈现为工作网页时才会被评分;任何空白、破损或被切断的东西得分为零,并且不会重新测试。这意味着基准衡量的是可靠的日常设计输出,而不是一般推理或编码技能。

OpenAI 于 9 月 3 日发布的 GPT-6 Astra 已经因无所不能而闻名——布置电路板、起草纳税申报表、构建 3D 场景——但早期测试人员认为它的写入能力比它所取代的模型更弱。它的价格和 OpenDesign 图表上的速度符合同样的通用设计:比 DeepSeek 的更便宜的产品更慢、更昂贵,但仍然是该领域得分最高的。

DeepSeek V4.1 Flash 的交付率(OpenDesign 判断为无需修改即可交付的输出份额)为 57.7%。 GPT-6 Astra 的交付率为 60%。克劳德寓言5.1的收视率是56.7%。