跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. 下手了 RTX Pro 4500 稳定与行了两周

下手了 RTX Pro 4500 稳定与行了两周

已定时 已固定 已锁定 已移动 AI硬件
rtxpro4500
20 帖子 5 发布者 724 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT terry

    @Marco-ZHANG 我对Pro 4500的算力不是很了解,按理说,你的数字不算低,但是肯定不亮眼,你开MTP的情况下才50t/s,我觉得是不是稍微低了点,还能和xtx一个水平吗?xtx过往的帖子似乎在60t/s左右。
    Prefill的话,肯定xtx有优势了,因为带宽的问题,xtx是960g/s。
    这问题你不该问我,是我要白嫖你的测试数据做视频。

    Marco ZHANGM 离线
    Marco ZHANGM 离线
    Marco ZHANG
    发表于 最后由 编辑
    #11

    @terry 说:

    @Marco-ZHANG 我对Pro 4500的算力不是很了解,按理说,你的数字不算低,但是肯定不亮眼,你开MTP的情况下才50t/s,我觉得是不是稍微低了点,还能和xtx一个水平吗?xtx过往的帖子似乎在60t/s左右。
    Prefill的话,肯定xtx有优势了,因为带宽的问题,xtx是960g/s。
    这问题你不该问我,是我要白嫖你的测试数据做视频。

    感谢Up主解答,看来还有优化空间。

    1 条回复 最后回复
    0
    • 5 566656661

      @Marco-ZHANG

      可以參考一下我發過的帖子

      都是RTX Pro 4500配上不同量化模式下的模型 (AWQ, AutoRound, PrismaQuant, MoQ, K Quant) + 不同引擎 (vLLM, LLama.cpp)

      @terry said:

      这问题你不该问我,是我要白嫖你的测试数据做视频。

      有什麼需要我在空閒的時候再試試看嘛?

      不過最近這幾個星期有項目準備開放給用戶, 星期六需要加班 + 星期日休息, 所以可能需要等一等

      Marco ZHANGM 离线
      Marco ZHANGM 离线
      Marco ZHANG
      发表于 最后由 编辑
      #12

      @566656661 说:

      @Marco-ZHANG

      可以參考一下我發過的帖子

      都是RTX Pro 4500配上不同量化模式下的模型 (AWQ, AutoRound, PrismaQuant, MoQ, K Quant) + 不同引擎 (vLLM, LLama.cpp)

      @terry said:

      这问题你不该问我,是我要白嫖你的测试数据做视频。

      有什麼需要我在空閒的時候再試試看嘛?

      不過最近這幾個星期有項目準備開放給用戶, 星期六需要加班 + 星期日休息, 所以可能需要等一等

      您的帖子我看了一下,感觉像看天书,请教一下如果我用NVFP4的模型在这块卡上还速度还能再快些吗?

      5 1 条回复 最后回复
      0
      • Marco ZHANGM Marco ZHANG

        @566656661 说:

        @Marco-ZHANG

        可以參考一下我發過的帖子

        都是RTX Pro 4500配上不同量化模式下的模型 (AWQ, AutoRound, PrismaQuant, MoQ, K Quant) + 不同引擎 (vLLM, LLama.cpp)

        @terry said:

        这问题你不该问我,是我要白嫖你的测试数据做视频。

        有什麼需要我在空閒的時候再試試看嘛?

        不過最近這幾個星期有項目準備開放給用戶, 星期六需要加班 + 星期日休息, 所以可能需要等一等

        您的帖子我看了一下,感觉像看天书,请教一下如果我用NVFP4的模型在这块卡上还速度还能再快些吗?

        5 离线
        5 离线
        566656661
        超凡大师
        发表于 最后由 566656661 编辑
        #13

        @Marco-ZHANG

        速度會更快, 代價就是模型在呼叫工具 (Hermes, OpenCode, Cline)會更容易有問題

        Autoround, AWQ是單純針對精度作優化, 表現持平, 速度就沒有NVFP4快

        用NVFP4模型就需要避開激活 (Activation) 層都被壓成NVFP4的模型, 尤其是linear_attn層

        我目前也是用PrismaSCOUT配合OpenCode日常使用

        Marco ZHANGM 1 条回复 最后回复
        1
        • 5 566656661

          @Marco-ZHANG

          速度會更快, 代價就是模型在呼叫工具 (Hermes, OpenCode, Cline)會更容易有問題

          Autoround, AWQ是單純針對精度作優化, 表現持平, 速度就沒有NVFP4快

          用NVFP4模型就需要避開激活 (Activation) 層都被壓成NVFP4的模型, 尤其是linear_attn層

          我目前也是用PrismaSCOUT配合OpenCode日常使用

          Marco ZHANGM 离线
          Marco ZHANGM 离线
          Marco ZHANG
          发表于 最后由 编辑
          #14

          @566656661 那有多少TOK/s呢?

          5 1 条回复 最后回复
          0
          • Marco ZHANGM Marco ZHANG

            @566656661 那有多少TOK/s呢?

            5 离线
            5 离线
            566656661
            超凡大师
            发表于 最后由 编辑
            #15

            @Marco-ZHANG

            看上下文長度

            因為我平時拿來編程, 150K大約63 tks, 210K也有57tks左右

            Marco ZHANGM 1 条回复 最后回复
            1
            • 5 566656661

              @Marco-ZHANG

              可以參考一下我發過的帖子

              都是RTX Pro 4500配上不同量化模式下的模型 (AWQ, AutoRound, PrismaQuant, MoQ, K Quant) + 不同引擎 (vLLM, LLama.cpp)

              @terry said:

              这问题你不该问我,是我要白嫖你的测试数据做视频。

              有什麼需要我在空閒的時候再試試看嘛?

              不過最近這幾個星期有項目準備開放給用戶, 星期六需要加班 + 星期日休息, 所以可能需要等一等

              terryT 离线
              terryT 离线
              terry
              超级版主
              发表于 最后由 编辑
              #16

              @566656661 有空把没测试等都搞下,我后面整理的时候直接归类到标签页,或者做个导航页面。

              油管:https://www.youtube.com/@抡锤者

              1 条回复 最后回复
              1
              • 5 566656661

                @Marco-ZHANG

                看上下文長度

                因為我平時拿來編程, 150K大約63 tks, 210K也有57tks左右

                Marco ZHANGM 离线
                Marco ZHANGM 离线
                Marco ZHANG
                发表于 最后由 编辑
                #17

                @566656661 感谢指点,我换上了你说的NVFP4,最高能跑到70多tok/s了,还有个问题,这种模型有没有免审察的推荐。

                5 1 条回复 最后回复
                0
                • 5 离线
                  5 离线
                  566656661
                  超凡大师
                  发表于 最后由 编辑
                  #18
                  此主題已被删除!
                  1 条回复 最后回复
                  0
                  • Marco ZHANGM Marco ZHANG

                    @566656661 感谢指点,我换上了你说的NVFP4,最高能跑到70多tok/s了,还有个问题,这种模型有没有免审察的推荐。

                    5 离线
                    5 离线
                    566656661
                    超凡大师
                    发表于 最后由 编辑
                    #19

                    @Marco-ZHANG

                    Qwen3.6-27B-PrismaQuant-Heretic-5.25bit-vllm

                    這個模型比PrismaSCOUT還要多2GB權重, 變相Pro 4500就需要把上下文降低到130K ~ 150K左右, 降低太多對我編程來說不利所以我也沒用

                    日常使用估計問題不大

                    你也可以自己找找看AutoRound或者AWQ的免审察模型, 不過就沒有NVFP4加速了

                    Marco ZHANGM 1 条回复 最后回复
                    0
                    • 5 566656661

                      @Marco-ZHANG

                      Qwen3.6-27B-PrismaQuant-Heretic-5.25bit-vllm

                      這個模型比PrismaSCOUT還要多2GB權重, 變相Pro 4500就需要把上下文降低到130K ~ 150K左右, 降低太多對我編程來說不利所以我也沒用

                      日常使用估計問題不大

                      你也可以自己找找看AutoRound或者AWQ的免审察模型, 不過就沒有NVFP4加速了

                      Marco ZHANGM 离线
                      Marco ZHANGM 离线
                      Marco ZHANG
                      发表于 最后由 编辑
                      #20

                      @566656661 谢谢

                      1 条回复 最后回复
                      1
                      • 系统 于 取消固定此主题

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组