跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. LLM API费效比图(每个任务的平均花费,cost per task)

LLM API费效比图(每个任务的平均花费,cost per task)

已定时 已固定 已锁定 已移动 LLM讨论区
本地模型
8 帖子 7 发布者 233 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • kop wangK 离线
    kop wangK 离线
    kop wang
    超级版主
    发表于 最后由 kop wang 编辑
    #1

    原文章链接:https://artificialanalysis.ai/articles/glm-5-2-is-the-new-leading-open-weights-model-on-the-artificial-analysis-intelligence-index

    这篇文章本来是吹GLM5.2的,但后面的费效比图非常有趣,如下:

    3108f8dc-8283-43e9-b5a7-db43c8f4ade0-image.jpeg

    下图是每个模型的“费效比”(横坐标,平均执行benchmark的每个项目的总花费,纵坐标,总体benchmark的评分)

    注意,横坐标价格是对数坐标,右侧模型的花费是指数级增长的。
    

    总结来看,Mimo-v2.5 Pro、DeepSeek-V4系列,用比其他模型少一、甚至两个数量级的钱,就可以跑完相同分数的benchmark。

    相较于DeepSeek-V4-Pro(MAX思考长度)

    模型名称 提高分数比例 消费提高比例
    GLM5.2 15.9% 1000%
    GPT5.5 25% 2000%
    Claude Opus 4.8 27% 4000%
    Claude Fable 5 36% 6000%

    虚心交流,一起进步

    1 条回复 最后回复
    1
    • M 离线
      M 离线
      mark
      超凡大师
      发表于 最后由 编辑
      #2

      一个比一个贵.这个就是涨价离谱了

      5 1 条回复 最后回复
      0
      • M mark

        一个比一个贵.这个就是涨价离谱了

        5 离线
        5 离线
        566656661
        超凡大师
        发表于 最后由 编辑
        #3

        @mark

        深度思考的能力的確是外國的模型比較好, 但是長久下來會被價格戰打下來

        倒不如說模型的能力可以依靠原資料堆起來, 但是能Cost down才能看到模型團隊的設計能力

        stxpnetS 1 条回复 最后回复
        0
        • stxpnetS 离线
          stxpnetS 离线
          stxpnet
          超凡大师
          发表于 最后由 编辑
          #4

          皮衣黄: ,好,很好,非常好.
          要的就是这种效果!

          26-08-19
          双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
          8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

          1 条回复 最后回复
          0
          • 5 566656661

            @mark

            深度思考的能力的確是外國的模型比較好, 但是長久下來會被價格戰打下來

            倒不如說模型的能力可以依靠原資料堆起來, 但是能Cost down才能看到模型團隊的設計能力

            stxpnetS 离线
            stxpnetS 离线
            stxpnet
            超凡大师
            发表于 最后由 编辑
            #5

            @566656661 主要是民间大神们一起努力去探索,慢慢把资本家的遮羞部全部扯掉

            26-08-19
            双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
            8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

            1 条回复 最后回复
            0
            • Kk HhK 离线
              Kk HhK 离线
              Kk Hh
              发表于 最后由 编辑
              #6

              我现在的云端主力就是glm5.2+kimi2.7
              c6f77f10-91c0-47fa-8e35-a8debe982990-image.jpeg
              525532a4-61fd-41e9-bb50-eda8bd50e0e5-image.jpeg

              1 条回复 最后回复
              1
              • terryT 离线
                terryT 离线
                terry
                超级版主
                发表于 最后由 编辑
                #7

                老黄:一张卡才卖你十几万,贵吗?

                油管:https://www.youtube.com/@抡锤者

                1 条回复 最后回复
                0
                • AGIA 离线
                  AGIA 离线
                  AGI
                  技术大牛 劳动模范
                  发表于 最后由 编辑
                  #8

                  目前,性价比最高的还是gpt5.5

                  https://agi.cd/@x

                  1 条回复 最后回复
                  0

                  你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                  厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                  有了你的建议,这篇帖子会更精彩哦 💗

                  注册 登录
                  回复
                  • 在新帖中回复
                  登录后回复
                  • 从旧到新
                  • 从新到旧
                  • 最多赞同


                  • 登录

                  • 登录或注册以进行搜索。
                  • 第一个帖子
                    最后一个帖子
                  0
                  • 版块
                  • 最新
                  • 标签
                  • 热门
                  • 用户
                  • 群组