-
最近 OpenDesign 這個設計 agent benchmark 出了一批新數據,13 個模型全部用 API 跑同一批任務,從 web app、mobile、desktop、dashboard 到 landing page 五種場景。結論很直接:DeepSeek V4.1 Flash 綜合 81.2 分,貼近 GPT-6 Astra 的 82.7,贏過 Claude Fable 5.1 的 80.3,但單次成本只要 $0.023。品質差不到 2 分,成本差兩個數量級。
五維分數(越高越好)
模型 綜合 /100 需求理解 /30 設計品質 /70 交付率 完成時間 單次成本 DeepSeek V4.1 Flash 81.2 28.4 52.8 57.7% 5.3 分 $0.023 GPT-6 Astra 82.7 26.5 56.2 60.0% 11.1 分 $1.61 Claude Fable 5.1 80.3 27.1 53.2 56.7% 12.8 分 $3.66 三個看點。需求理解 V4.1 Flash 反而是最高的 28.4/30,GPT-6 Astra 只有 26.5,prompt 吃得最準。設計品質小輸 GPT-6 Astra 3.4 分,但贏 Claude。完成時間 5.3 分,比兩個貴族快一倍以上。
成本直接換算:V4.1 Flash $0.023,GPT-6 Astra $1.61(貴 70 倍),Claude Fable 5.1 $3.66(貴 159 倍)。

完成時間排行(13 個模型)
最快那批:GPT-5.6 Sol 3 分、Muse Spark 1.3 3 分、Gemini 3.8 Flash 4 分、DeepSeek V4.1 Flash 5 分。
之後直接斷層:GPT-6 Astra 11 分、DeepSeek V4 Flash 11 分、Grok 4.6 11 分、Claude Fable 5.1 13 分、Kimi K3 14 分、DeepSeek V4 Pro 18 分、GLM-5.3 Flash 24 分、Owen 3.8-Max 26 分、Hunyuan H4 Preview 29 分。
V4.1 Flash 比自家 V4 Flash 快一倍、比 V4 Pro 快三倍多。

每個場景都一樣
粉紅色區 = 更貴又更低分。整體 11 個模型在裡面,web app 10 個、mobile 8 個、desktop 9 個、landing 9 個。




結論
跑設計或前端這類 agent 任務,V4.1 Flash 現在就是甜蜜點:品質貼著頂尖、成本是零頭、速度還快。以前要在便宜跟品質之間二選一,現在不用了,直接切過去。

-
,
王 王池川 将此主题从 LLM讨论区 移至此处