跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. 我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?

我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?

已定时 已固定 已锁定 已移动 AI硬件
29 帖子 10 发布者 479 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • imbiplaza ASUSI imbiplaza ASUS

    @johnnybegood

    因为我听说maxq 300w只是慢 20% 价格也是便宜20%...

    但是听说实测慢50%

    J 离线
    J 离线
    johnnybegood
    劳动模范 技术大牛
    编写于 最后由 编辑
    #7

    @imbiplaza-ASUS 我强烈怀疑这个说法, 性能不会差这么多, 反而有些人说因为限了功率, 效率反而上去了呢, 如果在计算机房用, 肯定有差距, 如果个人用, 反而是maxq好吧, 也要看实际使用环境的。

    imbiplaza ASUSI 1 条回复 最后回复
    0
    • J johnnybegood

      @imbiplaza-ASUS 我强烈怀疑这个说法, 性能不会差这么多, 反而有些人说因为限了功率, 效率反而上去了呢, 如果在计算机房用, 肯定有差距, 如果个人用, 反而是maxq好吧, 也要看实际使用环境的。

      imbiplaza ASUSI 在线
      imbiplaza ASUSI 在线
      imbiplaza ASUS
      至尊王者
      编写于 最后由 编辑
      #8

      @johnnybegood

      可能是效率高了。。。

      但是大部分我看的都是600w满血版本

      https://lcz.me/project/dcs

      J Chu Hao-LungC 3 条回复 最后回复
      0
      • imbiplaza ASUSI imbiplaza ASUS

        @johnnybegood

        可能是效率高了。。。

        但是大部分我看的都是600w满血版本

        J 离线
        J 离线
        johnnybegood
        劳动模范 技术大牛
        编写于 最后由 编辑
        #9
        此主題已被删除!
        1 条回复 最后回复
        0
        • imbiplaza ASUSI imbiplaza ASUS

          @johnnybegood

          可能是效率高了。。。

          但是大部分我看的都是600w满血版本

          J 离线
          J 离线
          johnnybegood
          劳动模范 技术大牛
          编写于 最后由 johnnybegood 编辑
          #10

          @imbiplaza-ASUS

          RTX Pro 6000 Max-Q 论坛数据汇总

          1. 完整规格(论坛共识 / NVIDIA 官方)

          项目 RTX Pro 6000 Max-Q 对比 Pro 6000(非 Max-Q)
          显存 96 GB GDDR7 96 GB GDDR7
          带宽 1.79 TB/s 1.79 TB/s
          TDP 300 W(功耗减半) 600 W
          架构 Blackwell Blackwell
          AI TOPS 3511 4000
          形态 双槽 双槽

          核心卖点:在保留 96G 显存 + 1.79 TB/s 带宽的同时,把功耗从 600W 压到 300W,非常适合多卡高密度工作站部署。


          2. 论坛实测记录

          # 来源 主题标题 配置 性能数据
          1 TID 19 / PID 171 迁移 wsl 上的包到 Linux ubuntu 22.04 2× RTX 3090Ti + Pro 6000 Max-Q(共 3 卡 72G) 从 WSL 迁 Linux 跑 LTX 视频
          2 TID 284 / PID 3326 关于本地版的模型 U9 285K + 192G 内存 + Pro 6000 Max-Q 整机 96G 单卡,从 OpenClaw 改用 Hermes;192G 系统内存可做 CPU 卸载
          3 TID 966 / PID 10925 Pro 6000 Max-Q + Qwen3.6 MTP 开到 20 Pro 6000 Max-Q + Qwen3.6-27B + vLLM MTP=20, 241.9 t/s(单路)
          4 TID 966 / PID 10928 同上 同上 MTP=30/40 → 350 t/s(效率递减)
          5 TID 966 / PID 10939 同上 同上 batch=4 并发 ~1000 t/s(GPU util 0.55)

          3. Tony Xu 实测性能曲线(Pro 6000 Max-Q + Qwen3.6-27B + vLLM)

          MTP 参数 Draft 接受率 单路生成速度 备注
          MTP=3 86.3% ~85 t/s 基准
          MTP=10 92.0% ~242 t/s 收益明显
          MTP=20 96.1% 241-249 t/s 接受率最高
          MTP=30/40 — ~350 t/s 接受率已饱和,边际收益递减
          batch=4 并发 — ~1000 t/s GPU util 仍仅 0.55

          作者注:在 0.55 GPU 利用率下已能稳定 1000 t/s,作者认为若解锁到 0.92 utilization,理论上可达 1800 t/s。


          4. 关键结论

          1. 96G 不是瓶颈:跑 Qwen3.6-27B BF16 单路时显存绰绰有余,KV cache 占用 < 30%
          2. 功耗优势决定部署形态:标准 600W 装 4 卡机箱电源压力大,Max-Q 300W 装 4 卡仅 1200W,主流 1600-2000W 电源即可
          3. MTP 收益存在拐点:MTP=20 时接受率 96% 已接近饱和,再上调到 30/40 收益下降
          4. 高并发友好:batch=4 单卡就能跑 ~1000 t/s,4×Max-Q 集群可达 4000+ t/s 推理
          imbiplaza ASUSI 1 条回复 最后回复
          0
          • J johnnybegood

            @imbiplaza-ASUS

            RTX Pro 6000 Max-Q 论坛数据汇总

            1. 完整规格(论坛共识 / NVIDIA 官方)

            项目 RTX Pro 6000 Max-Q 对比 Pro 6000(非 Max-Q)
            显存 96 GB GDDR7 96 GB GDDR7
            带宽 1.79 TB/s 1.79 TB/s
            TDP 300 W(功耗减半) 600 W
            架构 Blackwell Blackwell
            AI TOPS 3511 4000
            形态 双槽 双槽

            核心卖点:在保留 96G 显存 + 1.79 TB/s 带宽的同时,把功耗从 600W 压到 300W,非常适合多卡高密度工作站部署。


            2. 论坛实测记录

            # 来源 主题标题 配置 性能数据
            1 TID 19 / PID 171 迁移 wsl 上的包到 Linux ubuntu 22.04 2× RTX 3090Ti + Pro 6000 Max-Q(共 3 卡 72G) 从 WSL 迁 Linux 跑 LTX 视频
            2 TID 284 / PID 3326 关于本地版的模型 U9 285K + 192G 内存 + Pro 6000 Max-Q 整机 96G 单卡,从 OpenClaw 改用 Hermes;192G 系统内存可做 CPU 卸载
            3 TID 966 / PID 10925 Pro 6000 Max-Q + Qwen3.6 MTP 开到 20 Pro 6000 Max-Q + Qwen3.6-27B + vLLM MTP=20, 241.9 t/s(单路)
            4 TID 966 / PID 10928 同上 同上 MTP=30/40 → 350 t/s(效率递减)
            5 TID 966 / PID 10939 同上 同上 batch=4 并发 ~1000 t/s(GPU util 0.55)

            3. Tony Xu 实测性能曲线(Pro 6000 Max-Q + Qwen3.6-27B + vLLM)

            MTP 参数 Draft 接受率 单路生成速度 备注
            MTP=3 86.3% ~85 t/s 基准
            MTP=10 92.0% ~242 t/s 收益明显
            MTP=20 96.1% 241-249 t/s 接受率最高
            MTP=30/40 — ~350 t/s 接受率已饱和,边际收益递减
            batch=4 并发 — ~1000 t/s GPU util 仍仅 0.55

            作者注:在 0.55 GPU 利用率下已能稳定 1000 t/s,作者认为若解锁到 0.92 utilization,理论上可达 1800 t/s。


            4. 关键结论

            1. 96G 不是瓶颈:跑 Qwen3.6-27B BF16 单路时显存绰绰有余,KV cache 占用 < 30%
            2. 功耗优势决定部署形态:标准 600W 装 4 卡机箱电源压力大,Max-Q 300W 装 4 卡仅 1200W,主流 1600-2000W 电源即可
            3. MTP 收益存在拐点:MTP=20 时接受率 96% 已接近饱和,再上调到 30/40 收益下降
            4. 高并发友好:batch=4 单卡就能跑 ~1000 t/s,4×Max-Q 集群可达 4000+ t/s 推理
            imbiplaza ASUSI 在线
            imbiplaza ASUSI 在线
            imbiplaza ASUS
            至尊王者
            编写于 最后由 编辑
            #11

            @johnnybegood

            看来我保持rtxpro 4500 32gb 单路 50 t/s 即可

            因为始终单路 qwen3.8 27b 喂不饱96gb vram...

            https://lcz.me/project/dcs

            J 1 条回复 最后回复
            0
            • imbiplaza ASUSI imbiplaza ASUS

              @johnnybegood

              看来我保持rtxpro 4500 32gb 单路 50 t/s 即可

              因为始终单路 qwen3.8 27b 喂不饱96gb vram...

              J 离线
              J 离线
              johnnybegood
              劳动模范 技术大牛
              编写于 最后由 johnnybegood 编辑
              #12

              @imbiplaza-ASUS 我 qwen3.8 27B q4km + mtp 128K 单路中缓存在85左右,没中 65左右, 正常长程工作跑完 55左右, 很保守了, 感觉好像散热不怎么好, 想把涡轮换成三个静音风扇那种。3090 24G

              1 条回复 最后回复
              0
              • williamlouisW 离线
                williamlouisW 离线
                williamlouis
                超级版主
                编写于 最后由 编辑
                #13

                三个静音风扇 的想法 没必要。换个房间放是正解。
                有不少测试已经测试了三风扇方案。
                1.容易搞废。放在第一条。这是重点。
                2.换完一样很吵。具体看别人的测试视频把。
                3.小火龙不建议加大投资。并且你越改。贬值越多。跑着吧。玩腻了就脱手。现在这个时间点是回血的好时机。

                个人主页:xlkj.org Telegram https://t.me/xlkjorg

                1 条回复 最后回复
                0
                • terryT 在线
                  terryT 在线
                  terry
                  超级版主
                  编写于 最后由 编辑
                  #14

                  以后总结表格在4列以内,不然手机看起来受罪,让AI整理即可。数据挺充分,以后我会整理更多专题页面,方便新人观看。也让一些论坛优质老帖能发挥余热。

                  油管:https://www.youtube.com/@抡锤者

                  J 1 条回复 最后回复
                  0
                  • ,terryT terry 固定了此主题
                  • terryT terry

                    以后总结表格在4列以内,不然手机看起来受罪,让AI整理即可。数据挺充分,以后我会整理更多专题页面,方便新人观看。也让一些论坛优质老帖能发挥余热。

                    J 离线
                    J 离线
                    johnnybegood
                    劳动模范 技术大牛
                    编写于 最后由 johnnybegood 编辑
                    #15

                    @terry 用手机试了一下,横屏正好能把表格看全。。。这玩意也不好整,本来以为很简单,就用在线模型整的,结果搞了好几轮把我5小时额度都干爆了才弄完,早知道用本地模型了。

                    1 条回复 最后回复
                    0
                    • kos orK 离线
                      kos orK 离线
                      kos or
                      技术大牛 劳动模范
                      编写于 最后由 编辑
                      #16

                      集結論壇精華 感謝 🙂

                      1 条回复 最后回复
                      0
                      • imbiplaza ASUSI imbiplaza ASUS

                        @johnnybegood

                        可能是效率高了。。。

                        但是大部分我看的都是600w满血版本

                        Chu Hao-LungC 离线
                        Chu Hao-LungC 离线
                        Chu Hao-Lung
                        编写于 最后由 编辑
                        #17

                        @imbiplaza-ASUS 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論

                        RTX pro 6000 600W
                        優點: 性能滿血 滿執行的時候音量較小
                        缺點: 也是有燒接口的風險

                        RTX pro 6000 max Q 300W
                        優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口
                        缺點: 性能大約下降7-15% 跑滿載 聲音不小

                        在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收

                        imbiplaza ASUSI 1 条回复 最后回复
                        0
                        • Chu Hao-LungC Chu Hao-Lung

                          @imbiplaza-ASUS 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論

                          RTX pro 6000 600W
                          優點: 性能滿血 滿執行的時候音量較小
                          缺點: 也是有燒接口的風險

                          RTX pro 6000 max Q 300W
                          優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口
                          缺點: 性能大約下降7-15% 跑滿載 聲音不小

                          在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收

                          imbiplaza ASUSI 在线
                          imbiplaza ASUSI 在线
                          imbiplaza ASUS
                          至尊王者
                          编写于 最后由 编辑
                          #18

                          @Chu-Hao-Lung

                          等多三年,我们去捡 rtxpro 的洋垃圾

                          https://lcz.me/project/dcs

                          1 条回复 最后回复
                          0
                          • rock shiR 离线
                            rock shiR 离线
                            rock shi
                            劳动模范 德高望重
                            编写于 最后由 编辑
                            #19

                            96g还可以跑qwen3.8 Flash next 4bit量化,n-gram放在ssd

                            主机:GPU0-3080 20g(H3),GPU1-3080 20g(Zimage)
                            副机:2x2080ti 22g,vllm+qwen3.8-27b-fp8-16kv-128k

                            terryT 1 条回复 最后回复
                            0
                            • rock shiR rock shi

                              96g还可以跑qwen3.8 Flash next 4bit量化,n-gram放在ssd

                              terryT 在线
                              terryT 在线
                              terry
                              超级版主
                              编写于 最后由 编辑
                              #20

                              @rock-shi 这是个不错的选择,但是这个模型很慢,体验没27B好,好处是知识面全。

                              油管:https://www.youtube.com/@抡锤者

                              rock shiR kos orK 2 条回复 最后回复
                              1
                              • terryT terry

                                @rock-shi 这是个不错的选择,但是这个模型很慢,体验没27B好,好处是知识面全。

                                rock shiR 离线
                                rock shiR 离线
                                rock shi
                                劳动模范 德高望重
                                编写于 最后由 编辑
                                #21

                                @terry 27b目前确实太天花板了

                                主机:GPU0-3080 20g(H3),GPU1-3080 20g(Zimage)
                                副机:2x2080ti 22g,vllm+qwen3.8-27b-fp8-16kv-128k

                                1 条回复 最后回复
                                0
                                • terryT terry

                                  @rock-shi 这是个不错的选择,但是这个模型很慢,体验没27B好,好处是知识面全。

                                  kos orK 离线
                                  kos orK 离线
                                  kos or
                                  技术大牛 劳动模范
                                  编写于 最后由 kos or 编辑
                                  #22

                                  @terry

                                  Reddit 網友們也是在討論 qwen3.8 Flash next 體驗沒27B好, 沒必要為了qwen3.8 Flash next 升級硬體, 使用27B就夠應付大多數的場景

                                  e72e48f5-7c37-4ae1-bf83-882115e53ab0-image.jpeg

                                  rock shiR 1 条回复 最后回复
                                  2
                                  • kos orK kos or

                                    @terry

                                    Reddit 網友們也是在討論 qwen3.8 Flash next 體驗沒27B好, 沒必要為了qwen3.8 Flash next 升級硬體, 使用27B就夠應付大多數的場景

                                    e72e48f5-7c37-4ae1-bf83-882115e53ab0-image.jpeg

                                    rock shiR 离线
                                    rock shiR 离线
                                    rock shi
                                    劳动模范 德高望重
                                    编写于 最后由 编辑
                                    #23

                                    @kos-or 对于准96g mac用户,还是蛮期待未来迭代。毕竟大参数里只有它能塞得进96g mac,显存空间弥补了70b规模的断档

                                    主机:GPU0-3080 20g(H3),GPU1-3080 20g(Zimage)
                                    副机:2x2080ti 22g,vllm+qwen3.8-27b-fp8-16kv-128k

                                    kos orK 1 条回复 最后回复
                                    0
                                    • rock shiR rock shi

                                      @kos-or 对于准96g mac用户,还是蛮期待未来迭代。毕竟大参数里只有它能塞得进96g mac,显存空间弥补了70b规模的断档

                                      kos orK 离线
                                      kos orK 离线
                                      kos or
                                      技术大牛 劳动模范
                                      编写于 最后由 编辑
                                      #24

                                      @rock-shi

                                      我沒有Mac Mini, Macbook Pro, Mac Studio, 但根據網路使用者的反饋是Mac適合跑 MoE model, 不適合跑 Dense model, 未來看看MoE和 Dense models 的發展吧 只要生活上和工作上夠用 都很好 😊

                                      rock shiR 1 条回复 最后回复
                                      2
                                      • kos orK kos or

                                        @rock-shi

                                        我沒有Mac Mini, Macbook Pro, Mac Studio, 但根據網路使用者的反饋是Mac適合跑 MoE model, 不適合跑 Dense model, 未來看看MoE和 Dense models 的發展吧 只要生活上和工作上夠用 都很好 😊

                                        rock shiR 离线
                                        rock shiR 离线
                                        rock shi
                                        劳动模范 德高望重
                                        编写于 最后由 编辑
                                        #25

                                        @kos-or 是的是的👍

                                        主机:GPU0-3080 20g(H3),GPU1-3080 20g(Zimage)
                                        副机:2x2080ti 22g,vllm+qwen3.8-27b-fp8-16kv-128k

                                        1 条回复 最后回复
                                        0
                                        • PEN CHI LINP 离线
                                          PEN CHI LINP 离线
                                          PEN CHI LIN
                                          编写于 最后由 编辑
                                          #26

                                          補充一下雙5060TI的速度感覺也沒那麼不堪,就是顯存小硬傷,生視頻不好玩!

                                          2026-09-07_090743.png
                                          2026-09-07_090602.png

                                          A 80zhangyan8 2 条回复 最后回复
                                          0

                                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                          有了你的建议,这篇帖子会更精彩哦 💗

                                          注册 登录
                                          回复
                                          • 在新帖中回复
                                          登录后回复
                                          • 从旧到新
                                          • 从新到旧
                                          • 最多赞同


                                          • 登录

                                          • 登录或注册以进行搜索。
                                          • 第一个帖子
                                            最后一个帖子
                                          0
                                          • 版块
                                          • 最新
                                          • 标签
                                          • 热门
                                          • 用户
                                          • 群组