跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. 我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?

我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?

已定时 已固定 已锁定 已移动 AI硬件
29 帖子 10 发布者 479 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • imbiplaza ASUSI imbiplaza ASUS

    @johnnybegood

    少了一个 Rtxpro 6000 Max Q

    J 离线
    J 离线
    johnnybegood
    劳动模范 技术大牛
    编写于 最后由 编辑
    #4

    @imbiplaza-ASUS 估计是跟 rtx6000 合并了, 一开始几百行,人工简单校对了一下, 为了精简还是合并删除了不少。 这东西就是个参考, 也没想弄的特别细, 否则就需要详细人工校对了。不过如果有明显的错误可以标出来, 我标个颜色什么的。

    imbiplaza ASUSI 1 条回复 最后回复
    0
    • A applejuice

      09b4872f-9160-46f1-a284-c24e3d8b2b86-image.jpeg

      8x3090 可以用nvlink 吗?

      J 离线
      J 离线
      johnnybegood
      劳动模范 技术大牛
      编写于 最后由 编辑
      #5

      @applejuice 这个倒不是说8卡可以nvlink, 而是归总一下相关联的技术名称,你也不知道他是不是两两nvlink了, 如果有疑问可以去引用帖子原文查看。如果是个明显错误, 回头我标注一下。

      1 条回复 最后回复
      0
      • J johnnybegood

        @imbiplaza-ASUS 估计是跟 rtx6000 合并了, 一开始几百行,人工简单校对了一下, 为了精简还是合并删除了不少。 这东西就是个参考, 也没想弄的特别细, 否则就需要详细人工校对了。不过如果有明显的错误可以标出来, 我标个颜色什么的。

        imbiplaza ASUSI 在线
        imbiplaza ASUSI 在线
        imbiplaza ASUS
        至尊王者
        编写于 最后由 imbiplaza ASUS 编辑
        #6

        @johnnybegood

        因为我听说maxq 300w只是慢 20% 价格也是便宜20%...

        但是听说实测慢50%

        https://lcz.me/project/dcs

        J 1 条回复 最后回复
        0
        • imbiplaza ASUSI imbiplaza ASUS

          @johnnybegood

          因为我听说maxq 300w只是慢 20% 价格也是便宜20%...

          但是听说实测慢50%

          J 离线
          J 离线
          johnnybegood
          劳动模范 技术大牛
          编写于 最后由 编辑
          #7

          @imbiplaza-ASUS 我强烈怀疑这个说法, 性能不会差这么多, 反而有些人说因为限了功率, 效率反而上去了呢, 如果在计算机房用, 肯定有差距, 如果个人用, 反而是maxq好吧, 也要看实际使用环境的。

          imbiplaza ASUSI 1 条回复 最后回复
          0
          • J johnnybegood

            @imbiplaza-ASUS 我强烈怀疑这个说法, 性能不会差这么多, 反而有些人说因为限了功率, 效率反而上去了呢, 如果在计算机房用, 肯定有差距, 如果个人用, 反而是maxq好吧, 也要看实际使用环境的。

            imbiplaza ASUSI 在线
            imbiplaza ASUSI 在线
            imbiplaza ASUS
            至尊王者
            编写于 最后由 编辑
            #8

            @johnnybegood

            可能是效率高了。。。

            但是大部分我看的都是600w满血版本

            https://lcz.me/project/dcs

            J Chu Hao-LungC 3 条回复 最后回复
            0
            • imbiplaza ASUSI imbiplaza ASUS

              @johnnybegood

              可能是效率高了。。。

              但是大部分我看的都是600w满血版本

              J 离线
              J 离线
              johnnybegood
              劳动模范 技术大牛
              编写于 最后由 编辑
              #9
              此主題已被删除!
              1 条回复 最后回复
              0
              • imbiplaza ASUSI imbiplaza ASUS

                @johnnybegood

                可能是效率高了。。。

                但是大部分我看的都是600w满血版本

                J 离线
                J 离线
                johnnybegood
                劳动模范 技术大牛
                编写于 最后由 johnnybegood 编辑
                #10

                @imbiplaza-ASUS

                RTX Pro 6000 Max-Q 论坛数据汇总

                1. 完整规格(论坛共识 / NVIDIA 官方)

                项目 RTX Pro 6000 Max-Q 对比 Pro 6000(非 Max-Q)
                显存 96 GB GDDR7 96 GB GDDR7
                带宽 1.79 TB/s 1.79 TB/s
                TDP 300 W(功耗减半) 600 W
                架构 Blackwell Blackwell
                AI TOPS 3511 4000
                形态 双槽 双槽

                核心卖点:在保留 96G 显存 + 1.79 TB/s 带宽的同时,把功耗从 600W 压到 300W,非常适合多卡高密度工作站部署。


                2. 论坛实测记录

                # 来源 主题标题 配置 性能数据
                1 TID 19 / PID 171 迁移 wsl 上的包到 Linux ubuntu 22.04 2× RTX 3090Ti + Pro 6000 Max-Q(共 3 卡 72G) 从 WSL 迁 Linux 跑 LTX 视频
                2 TID 284 / PID 3326 关于本地版的模型 U9 285K + 192G 内存 + Pro 6000 Max-Q 整机 96G 单卡,从 OpenClaw 改用 Hermes;192G 系统内存可做 CPU 卸载
                3 TID 966 / PID 10925 Pro 6000 Max-Q + Qwen3.6 MTP 开到 20 Pro 6000 Max-Q + Qwen3.6-27B + vLLM MTP=20, 241.9 t/s(单路)
                4 TID 966 / PID 10928 同上 同上 MTP=30/40 → 350 t/s(效率递减)
                5 TID 966 / PID 10939 同上 同上 batch=4 并发 ~1000 t/s(GPU util 0.55)

                3. Tony Xu 实测性能曲线(Pro 6000 Max-Q + Qwen3.6-27B + vLLM)

                MTP 参数 Draft 接受率 单路生成速度 备注
                MTP=3 86.3% ~85 t/s 基准
                MTP=10 92.0% ~242 t/s 收益明显
                MTP=20 96.1% 241-249 t/s 接受率最高
                MTP=30/40 — ~350 t/s 接受率已饱和,边际收益递减
                batch=4 并发 — ~1000 t/s GPU util 仍仅 0.55

                作者注:在 0.55 GPU 利用率下已能稳定 1000 t/s,作者认为若解锁到 0.92 utilization,理论上可达 1800 t/s。


                4. 关键结论

                1. 96G 不是瓶颈:跑 Qwen3.6-27B BF16 单路时显存绰绰有余,KV cache 占用 < 30%
                2. 功耗优势决定部署形态:标准 600W 装 4 卡机箱电源压力大,Max-Q 300W 装 4 卡仅 1200W,主流 1600-2000W 电源即可
                3. MTP 收益存在拐点:MTP=20 时接受率 96% 已接近饱和,再上调到 30/40 收益下降
                4. 高并发友好:batch=4 单卡就能跑 ~1000 t/s,4×Max-Q 集群可达 4000+ t/s 推理
                imbiplaza ASUSI 1 条回复 最后回复
                0
                • J johnnybegood

                  @imbiplaza-ASUS

                  RTX Pro 6000 Max-Q 论坛数据汇总

                  1. 完整规格(论坛共识 / NVIDIA 官方)

                  项目 RTX Pro 6000 Max-Q 对比 Pro 6000(非 Max-Q)
                  显存 96 GB GDDR7 96 GB GDDR7
                  带宽 1.79 TB/s 1.79 TB/s
                  TDP 300 W(功耗减半) 600 W
                  架构 Blackwell Blackwell
                  AI TOPS 3511 4000
                  形态 双槽 双槽

                  核心卖点:在保留 96G 显存 + 1.79 TB/s 带宽的同时,把功耗从 600W 压到 300W,非常适合多卡高密度工作站部署。


                  2. 论坛实测记录

                  # 来源 主题标题 配置 性能数据
                  1 TID 19 / PID 171 迁移 wsl 上的包到 Linux ubuntu 22.04 2× RTX 3090Ti + Pro 6000 Max-Q(共 3 卡 72G) 从 WSL 迁 Linux 跑 LTX 视频
                  2 TID 284 / PID 3326 关于本地版的模型 U9 285K + 192G 内存 + Pro 6000 Max-Q 整机 96G 单卡,从 OpenClaw 改用 Hermes;192G 系统内存可做 CPU 卸载
                  3 TID 966 / PID 10925 Pro 6000 Max-Q + Qwen3.6 MTP 开到 20 Pro 6000 Max-Q + Qwen3.6-27B + vLLM MTP=20, 241.9 t/s(单路)
                  4 TID 966 / PID 10928 同上 同上 MTP=30/40 → 350 t/s(效率递减)
                  5 TID 966 / PID 10939 同上 同上 batch=4 并发 ~1000 t/s(GPU util 0.55)

                  3. Tony Xu 实测性能曲线(Pro 6000 Max-Q + Qwen3.6-27B + vLLM)

                  MTP 参数 Draft 接受率 单路生成速度 备注
                  MTP=3 86.3% ~85 t/s 基准
                  MTP=10 92.0% ~242 t/s 收益明显
                  MTP=20 96.1% 241-249 t/s 接受率最高
                  MTP=30/40 — ~350 t/s 接受率已饱和,边际收益递减
                  batch=4 并发 — ~1000 t/s GPU util 仍仅 0.55

                  作者注:在 0.55 GPU 利用率下已能稳定 1000 t/s,作者认为若解锁到 0.92 utilization,理论上可达 1800 t/s。


                  4. 关键结论

                  1. 96G 不是瓶颈:跑 Qwen3.6-27B BF16 单路时显存绰绰有余,KV cache 占用 < 30%
                  2. 功耗优势决定部署形态:标准 600W 装 4 卡机箱电源压力大,Max-Q 300W 装 4 卡仅 1200W,主流 1600-2000W 电源即可
                  3. MTP 收益存在拐点:MTP=20 时接受率 96% 已接近饱和,再上调到 30/40 收益下降
                  4. 高并发友好:batch=4 单卡就能跑 ~1000 t/s,4×Max-Q 集群可达 4000+ t/s 推理
                  imbiplaza ASUSI 在线
                  imbiplaza ASUSI 在线
                  imbiplaza ASUS
                  至尊王者
                  编写于 最后由 编辑
                  #11

                  @johnnybegood

                  看来我保持rtxpro 4500 32gb 单路 50 t/s 即可

                  因为始终单路 qwen3.8 27b 喂不饱96gb vram...

                  https://lcz.me/project/dcs

                  J 1 条回复 最后回复
                  0
                  • imbiplaza ASUSI imbiplaza ASUS

                    @johnnybegood

                    看来我保持rtxpro 4500 32gb 单路 50 t/s 即可

                    因为始终单路 qwen3.8 27b 喂不饱96gb vram...

                    J 离线
                    J 离线
                    johnnybegood
                    劳动模范 技术大牛
                    编写于 最后由 johnnybegood 编辑
                    #12

                    @imbiplaza-ASUS 我 qwen3.8 27B q4km + mtp 128K 单路中缓存在85左右,没中 65左右, 正常长程工作跑完 55左右, 很保守了, 感觉好像散热不怎么好, 想把涡轮换成三个静音风扇那种。3090 24G

                    1 条回复 最后回复
                    0
                    • williamlouisW 离线
                      williamlouisW 离线
                      williamlouis
                      超级版主
                      编写于 最后由 编辑
                      #13

                      三个静音风扇 的想法 没必要。换个房间放是正解。
                      有不少测试已经测试了三风扇方案。
                      1.容易搞废。放在第一条。这是重点。
                      2.换完一样很吵。具体看别人的测试视频把。
                      3.小火龙不建议加大投资。并且你越改。贬值越多。跑着吧。玩腻了就脱手。现在这个时间点是回血的好时机。

                      个人主页:xlkj.org Telegram https://t.me/xlkjorg

                      1 条回复 最后回复
                      0
                      • terryT 在线
                        terryT 在线
                        terry
                        超级版主
                        编写于 最后由 编辑
                        #14

                        以后总结表格在4列以内,不然手机看起来受罪,让AI整理即可。数据挺充分,以后我会整理更多专题页面,方便新人观看。也让一些论坛优质老帖能发挥余热。

                        油管:https://www.youtube.com/@抡锤者

                        J 1 条回复 最后回复
                        0
                        • ,terryT terry 固定了此主题
                        • terryT terry

                          以后总结表格在4列以内,不然手机看起来受罪,让AI整理即可。数据挺充分,以后我会整理更多专题页面,方便新人观看。也让一些论坛优质老帖能发挥余热。

                          J 离线
                          J 离线
                          johnnybegood
                          劳动模范 技术大牛
                          编写于 最后由 johnnybegood 编辑
                          #15

                          @terry 用手机试了一下,横屏正好能把表格看全。。。这玩意也不好整,本来以为很简单,就用在线模型整的,结果搞了好几轮把我5小时额度都干爆了才弄完,早知道用本地模型了。

                          1 条回复 最后回复
                          0
                          • kos orK 离线
                            kos orK 离线
                            kos or
                            技术大牛 劳动模范
                            编写于 最后由 编辑
                            #16

                            集結論壇精華 感謝 🙂

                            1 条回复 最后回复
                            0
                            • imbiplaza ASUSI imbiplaza ASUS

                              @johnnybegood

                              可能是效率高了。。。

                              但是大部分我看的都是600w满血版本

                              Chu Hao-LungC 离线
                              Chu Hao-LungC 离线
                              Chu Hao-Lung
                              编写于 最后由 编辑
                              #17

                              @imbiplaza-ASUS 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論

                              RTX pro 6000 600W
                              優點: 性能滿血 滿執行的時候音量較小
                              缺點: 也是有燒接口的風險

                              RTX pro 6000 max Q 300W
                              優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口
                              缺點: 性能大約下降7-15% 跑滿載 聲音不小

                              在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收

                              imbiplaza ASUSI 1 条回复 最后回复
                              0
                              • Chu Hao-LungC Chu Hao-Lung

                                @imbiplaza-ASUS 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論

                                RTX pro 6000 600W
                                優點: 性能滿血 滿執行的時候音量較小
                                缺點: 也是有燒接口的風險

                                RTX pro 6000 max Q 300W
                                優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口
                                缺點: 性能大約下降7-15% 跑滿載 聲音不小

                                在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收

                                imbiplaza ASUSI 在线
                                imbiplaza ASUSI 在线
                                imbiplaza ASUS
                                至尊王者
                                编写于 最后由 编辑
                                #18

                                @Chu-Hao-Lung

                                等多三年,我们去捡 rtxpro 的洋垃圾

                                https://lcz.me/project/dcs

                                1 条回复 最后回复
                                0
                                • rock shiR 离线
                                  rock shiR 离线
                                  rock shi
                                  劳动模范 德高望重
                                  编写于 最后由 编辑
                                  #19

                                  96g还可以跑qwen3.8 Flash next 4bit量化,n-gram放在ssd

                                  主机:GPU0-3080 20g(H3),GPU1-3080 20g(Zimage)
                                  副机:2x2080ti 22g,vllm+qwen3.8-27b-fp8-16kv-128k

                                  terryT 1 条回复 最后回复
                                  0
                                  • rock shiR rock shi

                                    96g还可以跑qwen3.8 Flash next 4bit量化,n-gram放在ssd

                                    terryT 在线
                                    terryT 在线
                                    terry
                                    超级版主
                                    编写于 最后由 编辑
                                    #20

                                    @rock-shi 这是个不错的选择,但是这个模型很慢,体验没27B好,好处是知识面全。

                                    油管:https://www.youtube.com/@抡锤者

                                    rock shiR kos orK 2 条回复 最后回复
                                    1
                                    • terryT terry

                                      @rock-shi 这是个不错的选择,但是这个模型很慢,体验没27B好,好处是知识面全。

                                      rock shiR 离线
                                      rock shiR 离线
                                      rock shi
                                      劳动模范 德高望重
                                      编写于 最后由 编辑
                                      #21

                                      @terry 27b目前确实太天花板了

                                      主机:GPU0-3080 20g(H3),GPU1-3080 20g(Zimage)
                                      副机:2x2080ti 22g,vllm+qwen3.8-27b-fp8-16kv-128k

                                      1 条回复 最后回复
                                      0
                                      • terryT terry

                                        @rock-shi 这是个不错的选择,但是这个模型很慢,体验没27B好,好处是知识面全。

                                        kos orK 离线
                                        kos orK 离线
                                        kos or
                                        技术大牛 劳动模范
                                        编写于 最后由 kos or 编辑
                                        #22

                                        @terry

                                        Reddit 網友們也是在討論 qwen3.8 Flash next 體驗沒27B好, 沒必要為了qwen3.8 Flash next 升級硬體, 使用27B就夠應付大多數的場景

                                        e72e48f5-7c37-4ae1-bf83-882115e53ab0-image.jpeg

                                        rock shiR 1 条回复 最后回复
                                        2
                                        • kos orK kos or

                                          @terry

                                          Reddit 網友們也是在討論 qwen3.8 Flash next 體驗沒27B好, 沒必要為了qwen3.8 Flash next 升級硬體, 使用27B就夠應付大多數的場景

                                          e72e48f5-7c37-4ae1-bf83-882115e53ab0-image.jpeg

                                          rock shiR 离线
                                          rock shiR 离线
                                          rock shi
                                          劳动模范 德高望重
                                          编写于 最后由 编辑
                                          #23

                                          @kos-or 对于准96g mac用户,还是蛮期待未来迭代。毕竟大参数里只有它能塞得进96g mac,显存空间弥补了70b规模的断档

                                          主机:GPU0-3080 20g(H3),GPU1-3080 20g(Zimage)
                                          副机:2x2080ti 22g,vllm+qwen3.8-27b-fp8-16kv-128k

                                          kos orK 1 条回复 最后回复
                                          0

                                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                          有了你的建议,这篇帖子会更精彩哦 💗

                                          注册 登录
                                          回复
                                          • 在新帖中回复
                                          登录后回复
                                          • 从旧到新
                                          • 从新到旧
                                          • 最多赞同


                                          • 登录

                                          • 登录或注册以进行搜索。
                                          • 第一个帖子
                                            最后一个帖子
                                          0
                                          • 版块
                                          • 最新
                                          • 标签
                                          • 热门
                                          • 用户
                                          • 群组