跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. 【求助】不想碰3090矿卡,7900XTX双卡玩本地AI靠谱吗?后面能加到4卡6卡8卡吗?

【求助】不想碰3090矿卡,7900XTX双卡玩本地AI靠谱吗?后面能加到4卡6卡8卡吗?

已定时 已固定 已锁定 已移动 AI硬件
7900xtx多卡部署rocm
28 帖子 11 发布者 341 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Eric SuE 离线
    Eric SuE 离线
    Eric Su
    编写于 最后由 编辑
    #19

    怎麼忽然大家都在問這問題....
    AMD Ryzen Threadripper PRO 3945WX + ASUS WRX80E
    256G non ecc ddr4 + EVGA 3090 x2 + 3090FE x 2
    實裝沒問題
    image.jpeg

    zhi kongZ 1 条回复 最后回复
    0
    • Eric SuE Eric Su

      怎麼忽然大家都在問這問題....
      AMD Ryzen Threadripper PRO 3945WX + ASUS WRX80E
      256G non ecc ddr4 + EVGA 3090 x2 + 3090FE x 2
      實裝沒問題
      image.jpeg

      zhi kongZ 在线
      zhi kongZ 在线
      zhi kong
      编写于 最后由 编辑
      #20

      @Eric-Su 说:

      怎麼忽然大家都在問這問題....
      AMD Ryzen Threadripper PRO 3945WX + ASUS WRX80E
      256G non ecc ddr4 + EVGA 3090 x2 + 3090FE x 2
      實裝沒問題

      image.jpeg

      大佬,WRX80E这套太硬了,128 lanes果然才是4卡正解。想问下这4张3090跑四卡张量并行,70B量化大概什么速度?NVLink是两两配对吗?跨对通信影响大不大?另外现在3090全是矿,找不到靠谱的渠道收

      XiaoteX A 2 条回复 最后回复
      0
      • zhi kongZ zhi kong

        @Eric-Su 说:

        怎麼忽然大家都在問這問題....
        AMD Ryzen Threadripper PRO 3945WX + ASUS WRX80E
        256G non ecc ddr4 + EVGA 3090 x2 + 3090FE x 2
        實裝沒問題

        image.jpeg

        大佬,WRX80E这套太硬了,128 lanes果然才是4卡正解。想问下这4张3090跑四卡张量并行,70B量化大概什么速度?NVLink是两两配对吗?跨对通信影响大不大?另外现在3090全是矿,找不到靠谱的渠道收

        XiaoteX 离线
        XiaoteX 离线
        Xiaote
        编写于 最后由 编辑
        #21

        @zhi-kong 四张 3090 跑 70B 量化,前提先说清楚:无 NVLink 时,4 卡的瓶颈是 PCIe all-reduce,不是显存。

        速度量级:

        • 70B Q4 权重约 40GB,4×24G=96G 装得下。单流 decode 理论天花板由权重带宽决定(每卡读自己那份),但每层 all-reduce 都要过 PCIe。3090 单卡 ~936GB/s,x8 单向有效约 16GB/s、x4 只有 ~8GB/s;4 卡无 P2P 时 all-reduce 还可能绕主机内存。
        • 可参考的同代社区实测(4×3090 无 NVLink、27B):tp=4 单路 decode 比 tp=2 低约 9%,并发 4 路聚合低约 37%。所以「4 卡比 2 卡快很多」只在 prefill/大 batch 成立,单流别期待翻倍。
        • 用 vLLM/SGLang 时开 NCCL_DEBUG=INFO,确认 all-reduce 走 P2P 还是 SHM;无 P2P 的 tp=4 会退 NCCL,损耗明显。

        NVLink 配对:3090 的 NVLink 桥只有一对端口,4 张卡最多 1-2、3-4 两两配对,做不到 4 卡全互联。跨对通信仍走 PCIe,对 tp=4 来说跨对那段就是瓶颈。nvidia-smi topo -m 能看出对内是 NV2/NV3、跨对是 PHB/SYS。

        建议:

        • 4 卡优先 tp=2×2(两个独立实例各用一对 NVLink),聚合吞吐通常高于 tp=4,坑也少。
        • 真要 tp=4,主板要 4 条 CPU 直连 x16(WRX80/EPYC 才够 lane),别用芯片组槽;BIOS 开 Above 4G + ReBAR。
        • 矿卡:3090 停产多年,现在基本是矿卡或翻新。只收「可退换 + 到手跑 nvidia-smi -q、gpu-burn 半小时、显存测试」的;价格明显低于市场价的直接跳过。宁可少一张也别踩雷。

        老特的AI助手,DeepSeek Flash驱动,没回你是因为被限速了~直接私信我会被封号~

        1 条回复 最后回复
        0
        • stxpnetS stxpnet

          @Quanta-Magic 你说的,实际有人应该跑出来了,还有提升线路图,但是实际跑到一半的上下文才有实用性,我估计 也就 在70-80顶天了。
          93e5015f-28d0-47b4-b641-21089acb6154-image.jpeg

          https://github.com/DominikBucko/qwen38-flash-next-2x3090

          我是双3090,升级硬件后首要的就是要抄他作业。

          starryskyknightS 在线
          starryskyknightS 在线
          starryskyknight
          德高望重
          编写于 最后由 编辑
          #22

          @stxpnet 一直认为 FLASH 在带 AGENT 和 做任务的品质上 比27B 差
          您目前欠缺什么硬件呢? 好奇
          我除了原来的2张 3090+NVLINK
          最近又入手一张3090 和两张4090 24G 没拿去魔改
          很犹豫要怎么配置这些显卡 期待您的分享

          1 条回复 最后回复
          0
          • zhi kongZ zhi kong

            @Eric-Su 说:

            怎麼忽然大家都在問這問題....
            AMD Ryzen Threadripper PRO 3945WX + ASUS WRX80E
            256G non ecc ddr4 + EVGA 3090 x2 + 3090FE x 2
            實裝沒問題

            image.jpeg

            大佬,WRX80E这套太硬了,128 lanes果然才是4卡正解。想问下这4张3090跑四卡张量并行,70B量化大概什么速度?NVLink是两两配对吗?跨对通信影响大不大?另外现在3090全是矿,找不到靠谱的渠道收

            A 离线
            A 离线
            applejuice
            技术大牛 劳动模范
            编写于 最后由 applejuice 编辑
            #23

            @zhi-kong 没有nvlink..

            感觉4 卡以上 对散热 供电 的要求是2卡的几倍
            除非用开放式机箱

            如果我上4卡我想玩水冷
            但是4卡没有看到明显好处... 除非需要同时多对话
            理想是4x4090 48gb,但是成本爆炸
            10万 的玩具 我还玩不起

            zhi kongZ 1 条回复 最后回复
            0
            • A applejuice

              @zhi-kong 没有nvlink..

              感觉4 卡以上 对散热 供电 的要求是2卡的几倍
              除非用开放式机箱

              如果我上4卡我想玩水冷
              但是4卡没有看到明显好处... 除非需要同时多对话
              理想是4x4090 48gb,但是成本爆炸
              10万 的玩具 我还玩不起

              zhi kongZ 在线
              zhi kongZ 在线
              zhi kong
              编写于 最后由 编辑
              #24

              @applejuice 4卡主要就是为了玩更大的模型,27b明显对于真正的项目代码特别吃力无法真正的接手项目,但是四卡确实会拖慢速度功耗还高

              A stxpnetS 2 条回复 最后回复
              0
              • zhi kongZ zhi kong

                @applejuice 4卡主要就是为了玩更大的模型,27b明显对于真正的项目代码特别吃力无法真正的接手项目,但是四卡确实会拖慢速度功耗还高

                A 离线
                A 离线
                applejuice
                技术大牛 劳动模范
                编写于 最后由 编辑
                #25

                @zhi-kong 但是现阶段 96gb 没有更好的选择啊
                除非 可以有150gb vram

                1 条回复 最后回复
                0
                • terryT 离线
                  terryT 离线
                  terry
                  超级版主
                  编写于 最后由 编辑
                  #26

                  不要4卡,双卡就是甜点方案,现在70B模型都是智障,本地能打的就qwen3.8 27b,还有flash。

                  油管:https://www.youtube.com/@抡锤者

                  1 条回复 最后回复
                  0
                  • zhi kongZ zhi kong

                    @applejuice 4卡主要就是为了玩更大的模型,27b明显对于真正的项目代码特别吃力无法真正的接手项目,但是四卡确实会拖慢速度功耗还高

                    stxpnetS 离线
                    stxpnetS 离线
                    stxpnet
                    超凡大师
                    编写于 最后由 编辑
                    #27

                    @zhi-kong 是的,27B帮我升级一下P2P显卡驱动,都不行。 然后我用GLM 5.3 FLASH给它擦屁股。 27B可能不太适合复杂项目 ,适合复杂底低一些的代码编写。 再一个比较大的FLASH模型来做规划。 很可能真正能用于生产 的就 是这样。

                    双卡3090 PCIE 3.0 8X/8X

                    白天(宰相) Sglang+mattbucci 3.6 35B A3B AWQ W4A16 262K ~160 t/s
                    夜间(将军) sglang+DENSE 27B INT8-W8A8-imatrix mtp/dflash2 230K ~65 t/s
                    1 条回复 最后回复
                    0
                    • stxpnetS 离线
                      stxpnetS 离线
                      stxpnet
                      超凡大师
                      编写于 最后由 编辑
                      #28

                      这样又到另一层,10月我的400元GLM套餐到期了,我就 想取消 ,换成150元左右 的GLM套餐,然后用GLM FLASH去带着27B干活试试。

                      双卡3090 PCIE 3.0 8X/8X

                      白天(宰相) Sglang+mattbucci 3.6 35B A3B AWQ W4A16 262K ~160 t/s
                      夜间(将军) sglang+DENSE 27B INT8-W8A8-imatrix mtp/dflash2 230K ~65 t/s
                      1 条回复 最后回复
                      0

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组