LLM API费效比图(每个任务的平均花费,cost per task)
-
这篇文章本来是吹GLM5.2的,但后面的费效比图非常有趣,如下:

下图是每个模型的“费效比”(横坐标,平均执行benchmark的每个项目的总花费,纵坐标,总体benchmark的评分)
注意,横坐标价格是对数坐标,右侧模型的花费是指数级增长的。总结来看,Mimo-v2.5 Pro、DeepSeek-V4系列,用比其他模型少一、甚至两个数量级的钱,就可以跑完相同分数的benchmark。
相较于DeepSeek-V4-Pro(MAX思考长度)
模型名称 提高分数比例 消费提高比例 GLM5.2 15.9% 1000% GPT5.5 25% 2000% Claude Opus 4.8 27% 4000% Claude Fable 5 36% 6000%

