跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. 我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?

我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?

已定时 已固定 已锁定 已移动 AI硬件
29 帖子 10 发布者 489 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • imbiplaza ASUSI imbiplaza ASUS

    @johnnybegood

    可能是效率高了。。。

    但是大部分我看的都是600w满血版本

    J 离线
    J 离线
    johnnybegood
    劳动模范 技术大牛
    编写于 最后由 johnnybegood 编辑
    #10

    @imbiplaza-ASUS

    RTX Pro 6000 Max-Q 论坛数据汇总

    1. 完整规格(论坛共识 / NVIDIA 官方)

    项目 RTX Pro 6000 Max-Q 对比 Pro 6000(非 Max-Q)
    显存 96 GB GDDR7 96 GB GDDR7
    带宽 1.79 TB/s 1.79 TB/s
    TDP 300 W(功耗减半) 600 W
    架构 Blackwell Blackwell
    AI TOPS 3511 4000
    形态 双槽 双槽

    核心卖点:在保留 96G 显存 + 1.79 TB/s 带宽的同时,把功耗从 600W 压到 300W,非常适合多卡高密度工作站部署。


    2. 论坛实测记录

    # 来源 主题标题 配置 性能数据
    1 TID 19 / PID 171 迁移 wsl 上的包到 Linux ubuntu 22.04 2× RTX 3090Ti + Pro 6000 Max-Q(共 3 卡 72G) 从 WSL 迁 Linux 跑 LTX 视频
    2 TID 284 / PID 3326 关于本地版的模型 U9 285K + 192G 内存 + Pro 6000 Max-Q 整机 96G 单卡,从 OpenClaw 改用 Hermes;192G 系统内存可做 CPU 卸载
    3 TID 966 / PID 10925 Pro 6000 Max-Q + Qwen3.6 MTP 开到 20 Pro 6000 Max-Q + Qwen3.6-27B + vLLM MTP=20, 241.9 t/s(单路)
    4 TID 966 / PID 10928 同上 同上 MTP=30/40 → 350 t/s(效率递减)
    5 TID 966 / PID 10939 同上 同上 batch=4 并发 ~1000 t/s(GPU util 0.55)

    3. Tony Xu 实测性能曲线(Pro 6000 Max-Q + Qwen3.6-27B + vLLM)

    MTP 参数 Draft 接受率 单路生成速度 备注
    MTP=3 86.3% ~85 t/s 基准
    MTP=10 92.0% ~242 t/s 收益明显
    MTP=20 96.1% 241-249 t/s 接受率最高
    MTP=30/40 — ~350 t/s 接受率已饱和,边际收益递减
    batch=4 并发 — ~1000 t/s GPU util 仍仅 0.55

    作者注:在 0.55 GPU 利用率下已能稳定 1000 t/s,作者认为若解锁到 0.92 utilization,理论上可达 1800 t/s。


    4. 关键结论

    1. 96G 不是瓶颈:跑 Qwen3.6-27B BF16 单路时显存绰绰有余,KV cache 占用 < 30%
    2. 功耗优势决定部署形态:标准 600W 装 4 卡机箱电源压力大,Max-Q 300W 装 4 卡仅 1200W,主流 1600-2000W 电源即可
    3. MTP 收益存在拐点:MTP=20 时接受率 96% 已接近饱和,再上调到 30/40 收益下降
    4. 高并发友好:batch=4 单卡就能跑 ~1000 t/s,4×Max-Q 集群可达 4000+ t/s 推理
    imbiplaza ASUSI 1 条回复 最后回复
    0
    • J johnnybegood

      @imbiplaza-ASUS

      RTX Pro 6000 Max-Q 论坛数据汇总

      1. 完整规格(论坛共识 / NVIDIA 官方)

      项目 RTX Pro 6000 Max-Q 对比 Pro 6000(非 Max-Q)
      显存 96 GB GDDR7 96 GB GDDR7
      带宽 1.79 TB/s 1.79 TB/s
      TDP 300 W(功耗减半) 600 W
      架构 Blackwell Blackwell
      AI TOPS 3511 4000
      形态 双槽 双槽

      核心卖点:在保留 96G 显存 + 1.79 TB/s 带宽的同时,把功耗从 600W 压到 300W,非常适合多卡高密度工作站部署。


      2. 论坛实测记录

      # 来源 主题标题 配置 性能数据
      1 TID 19 / PID 171 迁移 wsl 上的包到 Linux ubuntu 22.04 2× RTX 3090Ti + Pro 6000 Max-Q(共 3 卡 72G) 从 WSL 迁 Linux 跑 LTX 视频
      2 TID 284 / PID 3326 关于本地版的模型 U9 285K + 192G 内存 + Pro 6000 Max-Q 整机 96G 单卡,从 OpenClaw 改用 Hermes;192G 系统内存可做 CPU 卸载
      3 TID 966 / PID 10925 Pro 6000 Max-Q + Qwen3.6 MTP 开到 20 Pro 6000 Max-Q + Qwen3.6-27B + vLLM MTP=20, 241.9 t/s(单路)
      4 TID 966 / PID 10928 同上 同上 MTP=30/40 → 350 t/s(效率递减)
      5 TID 966 / PID 10939 同上 同上 batch=4 并发 ~1000 t/s(GPU util 0.55)

      3. Tony Xu 实测性能曲线(Pro 6000 Max-Q + Qwen3.6-27B + vLLM)

      MTP 参数 Draft 接受率 单路生成速度 备注
      MTP=3 86.3% ~85 t/s 基准
      MTP=10 92.0% ~242 t/s 收益明显
      MTP=20 96.1% 241-249 t/s 接受率最高
      MTP=30/40 — ~350 t/s 接受率已饱和,边际收益递减
      batch=4 并发 — ~1000 t/s GPU util 仍仅 0.55

      作者注:在 0.55 GPU 利用率下已能稳定 1000 t/s,作者认为若解锁到 0.92 utilization,理论上可达 1800 t/s。


      4. 关键结论

      1. 96G 不是瓶颈:跑 Qwen3.6-27B BF16 单路时显存绰绰有余,KV cache 占用 < 30%
      2. 功耗优势决定部署形态:标准 600W 装 4 卡机箱电源压力大,Max-Q 300W 装 4 卡仅 1200W,主流 1600-2000W 电源即可
      3. MTP 收益存在拐点:MTP=20 时接受率 96% 已接近饱和,再上调到 30/40 收益下降
      4. 高并发友好:batch=4 单卡就能跑 ~1000 t/s,4×Max-Q 集群可达 4000+ t/s 推理
      imbiplaza ASUSI 在线
      imbiplaza ASUSI 在线
      imbiplaza ASUS
      至尊王者
      编写于 最后由 编辑
      #11

      @johnnybegood

      看来我保持rtxpro 4500 32gb 单路 50 t/s 即可

      因为始终单路 qwen3.8 27b 喂不饱96gb vram...

      https://lcz.me/project/dcs

      J 1 条回复 最后回复
      0
      • imbiplaza ASUSI imbiplaza ASUS

        @johnnybegood

        看来我保持rtxpro 4500 32gb 单路 50 t/s 即可

        因为始终单路 qwen3.8 27b 喂不饱96gb vram...

        J 离线
        J 离线
        johnnybegood
        劳动模范 技术大牛
        编写于 最后由 johnnybegood 编辑
        #12

        @imbiplaza-ASUS 我 qwen3.8 27B q4km + mtp 128K 单路中缓存在85左右,没中 65左右, 正常长程工作跑完 55左右, 很保守了, 感觉好像散热不怎么好, 想把涡轮换成三个静音风扇那种。3090 24G

        1 条回复 最后回复
        0
        • williamlouisW 离线
          williamlouisW 离线
          williamlouis
          超级版主
          编写于 最后由 编辑
          #13

          三个静音风扇 的想法 没必要。换个房间放是正解。
          有不少测试已经测试了三风扇方案。
          1.容易搞废。放在第一条。这是重点。
          2.换完一样很吵。具体看别人的测试视频把。
          3.小火龙不建议加大投资。并且你越改。贬值越多。跑着吧。玩腻了就脱手。现在这个时间点是回血的好时机。

          个人主页:xlkj.org Telegram https://t.me/xlkjorg

          1 条回复 最后回复
          0
          • terryT 离线
            terryT 离线
            terry
            超级版主
            编写于 最后由 编辑
            #14

            以后总结表格在4列以内,不然手机看起来受罪,让AI整理即可。数据挺充分,以后我会整理更多专题页面,方便新人观看。也让一些论坛优质老帖能发挥余热。

            油管:https://www.youtube.com/@抡锤者

            J 1 条回复 最后回复
            0
            • ,terryT terry 固定了此主题
            • terryT terry

              以后总结表格在4列以内,不然手机看起来受罪,让AI整理即可。数据挺充分,以后我会整理更多专题页面,方便新人观看。也让一些论坛优质老帖能发挥余热。

              J 离线
              J 离线
              johnnybegood
              劳动模范 技术大牛
              编写于 最后由 johnnybegood 编辑
              #15

              @terry 用手机试了一下,横屏正好能把表格看全。。。这玩意也不好整,本来以为很简单,就用在线模型整的,结果搞了好几轮把我5小时额度都干爆了才弄完,早知道用本地模型了。

              1 条回复 最后回复
              0
              • kos orK 离线
                kos orK 离线
                kos or
                技术大牛 劳动模范
                编写于 最后由 编辑
                #16

                集結論壇精華 感謝 🙂

                1 条回复 最后回复
                0
                • imbiplaza ASUSI imbiplaza ASUS

                  @johnnybegood

                  可能是效率高了。。。

                  但是大部分我看的都是600w满血版本

                  Chu Hao-LungC 离线
                  Chu Hao-LungC 离线
                  Chu Hao-Lung
                  编写于 最后由 编辑
                  #17

                  @imbiplaza-ASUS 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論

                  RTX pro 6000 600W
                  優點: 性能滿血 滿執行的時候音量較小
                  缺點: 也是有燒接口的風險

                  RTX pro 6000 max Q 300W
                  優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口
                  缺點: 性能大約下降7-15% 跑滿載 聲音不小

                  在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收

                  imbiplaza ASUSI 1 条回复 最后回复
                  0
                  • Chu Hao-LungC Chu Hao-Lung

                    @imbiplaza-ASUS 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論

                    RTX pro 6000 600W
                    優點: 性能滿血 滿執行的時候音量較小
                    缺點: 也是有燒接口的風險

                    RTX pro 6000 max Q 300W
                    優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口
                    缺點: 性能大約下降7-15% 跑滿載 聲音不小

                    在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收

                    imbiplaza ASUSI 在线
                    imbiplaza ASUSI 在线
                    imbiplaza ASUS
                    至尊王者
                    编写于 最后由 编辑
                    #18

                    @Chu-Hao-Lung

                    等多三年,我们去捡 rtxpro 的洋垃圾

                    https://lcz.me/project/dcs

                    1 条回复 最后回复
                    0
                    • rock shiR 离线
                      rock shiR 离线
                      rock shi
                      劳动模范 德高望重
                      编写于 最后由 编辑
                      #19

                      96g还可以跑qwen3.8 Flash next 4bit量化,n-gram放在ssd

                      主机:GPU0-3080 20g(H3),GPU1-3080 20g(Zimage)
                      副机:2x2080ti 22g,vllm+qwen3.8-27b-fp8-16kv-128k

                      terryT 1 条回复 最后回复
                      0
                      • rock shiR rock shi

                        96g还可以跑qwen3.8 Flash next 4bit量化,n-gram放在ssd

                        terryT 离线
                        terryT 离线
                        terry
                        超级版主
                        编写于 最后由 编辑
                        #20

                        @rock-shi 这是个不错的选择,但是这个模型很慢,体验没27B好,好处是知识面全。

                        油管:https://www.youtube.com/@抡锤者

                        rock shiR kos orK 2 条回复 最后回复
                        1
                        • terryT terry

                          @rock-shi 这是个不错的选择,但是这个模型很慢,体验没27B好,好处是知识面全。

                          rock shiR 离线
                          rock shiR 离线
                          rock shi
                          劳动模范 德高望重
                          编写于 最后由 编辑
                          #21

                          @terry 27b目前确实太天花板了

                          主机:GPU0-3080 20g(H3),GPU1-3080 20g(Zimage)
                          副机:2x2080ti 22g,vllm+qwen3.8-27b-fp8-16kv-128k

                          1 条回复 最后回复
                          0
                          • terryT terry

                            @rock-shi 这是个不错的选择,但是这个模型很慢,体验没27B好,好处是知识面全。

                            kos orK 离线
                            kos orK 离线
                            kos or
                            技术大牛 劳动模范
                            编写于 最后由 kos or 编辑
                            #22

                            @terry

                            Reddit 網友們也是在討論 qwen3.8 Flash next 體驗沒27B好, 沒必要為了qwen3.8 Flash next 升級硬體, 使用27B就夠應付大多數的場景

                            e72e48f5-7c37-4ae1-bf83-882115e53ab0-image.jpeg

                            rock shiR 1 条回复 最后回复
                            2
                            • kos orK kos or

                              @terry

                              Reddit 網友們也是在討論 qwen3.8 Flash next 體驗沒27B好, 沒必要為了qwen3.8 Flash next 升級硬體, 使用27B就夠應付大多數的場景

                              e72e48f5-7c37-4ae1-bf83-882115e53ab0-image.jpeg

                              rock shiR 离线
                              rock shiR 离线
                              rock shi
                              劳动模范 德高望重
                              编写于 最后由 编辑
                              #23

                              @kos-or 对于准96g mac用户,还是蛮期待未来迭代。毕竟大参数里只有它能塞得进96g mac,显存空间弥补了70b规模的断档

                              主机:GPU0-3080 20g(H3),GPU1-3080 20g(Zimage)
                              副机:2x2080ti 22g,vllm+qwen3.8-27b-fp8-16kv-128k

                              kos orK 1 条回复 最后回复
                              0
                              • rock shiR rock shi

                                @kos-or 对于准96g mac用户,还是蛮期待未来迭代。毕竟大参数里只有它能塞得进96g mac,显存空间弥补了70b规模的断档

                                kos orK 离线
                                kos orK 离线
                                kos or
                                技术大牛 劳动模范
                                编写于 最后由 编辑
                                #24

                                @rock-shi

                                我沒有Mac Mini, Macbook Pro, Mac Studio, 但根據網路使用者的反饋是Mac適合跑 MoE model, 不適合跑 Dense model, 未來看看MoE和 Dense models 的發展吧 只要生活上和工作上夠用 都很好 😊

                                rock shiR 1 条回复 最后回复
                                2
                                • kos orK kos or

                                  @rock-shi

                                  我沒有Mac Mini, Macbook Pro, Mac Studio, 但根據網路使用者的反饋是Mac適合跑 MoE model, 不適合跑 Dense model, 未來看看MoE和 Dense models 的發展吧 只要生活上和工作上夠用 都很好 😊

                                  rock shiR 离线
                                  rock shiR 离线
                                  rock shi
                                  劳动模范 德高望重
                                  编写于 最后由 编辑
                                  #25

                                  @kos-or 是的是的👍

                                  主机:GPU0-3080 20g(H3),GPU1-3080 20g(Zimage)
                                  副机:2x2080ti 22g,vllm+qwen3.8-27b-fp8-16kv-128k

                                  1 条回复 最后回复
                                  0
                                  • PEN CHI LINP 离线
                                    PEN CHI LINP 离线
                                    PEN CHI LIN
                                    编写于 最后由 编辑
                                    #26

                                    補充一下雙5060TI的速度感覺也沒那麼不堪,就是顯存小硬傷,生視頻不好玩!

                                    2026-09-07_090743.png
                                    2026-09-07_090602.png

                                    A 80zhangyan8 2 条回复 最后回复
                                    0
                                    • PEN CHI LINP PEN CHI LIN

                                      補充一下雙5060TI的速度感覺也沒那麼不堪,就是顯存小硬傷,生視頻不好玩!

                                      2026-09-07_090743.png
                                      2026-09-07_090602.png

                                      A 离线
                                      A 离线
                                      applejuice
                                      技术大牛 劳动模范
                                      编写于 最后由 编辑
                                      #27

                                      @PEN-CHI-LIN

                                      上4 5060呗

                                      1 条回复 最后回复
                                      0
                                      • PEN CHI LINP 离线
                                        PEN CHI LINP 离线
                                        PEN CHI LIN
                                        编写于 最后由 编辑
                                        #28

                                        @applejuice 5060 出掉了前陣子呆灣這兩張5060比一張9700還貴,我直接出掉換兩張9700。16G想玩minimax h3很痛苦= = !

                                        1 条回复 最后回复
                                        0
                                        • PEN CHI LINP PEN CHI LIN

                                          補充一下雙5060TI的速度感覺也沒那麼不堪,就是顯存小硬傷,生視頻不好玩!

                                          2026-09-07_090743.png
                                          2026-09-07_090602.png

                                          80zhangyan8 离线
                                          80zhangyan8 离线
                                          80zhangyan
                                          编写于 最后由 编辑
                                          #29

                                          @PEN-CHI-LIN 使用LLM足够了

                                          1 条回复 最后回复
                                          0
                                          • ,系统 取消固定了此主题

                                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                          有了你的建议,这篇帖子会更精彩哦 💗

                                          注册 登录
                                          回复
                                          • 在新帖中回复
                                          登录后回复
                                          • 从旧到新
                                          • 从新到旧
                                          • 最多赞同


                                          • 登录

                                          • 登录或注册以进行搜索。
                                          • 第一个帖子
                                            最后一个帖子
                                          0
                                          • 版块
                                          • 最新
                                          • 标签
                                          • 热门
                                          • 用户
                                          • 群组