跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. AI硬件
  4. 新增显卡搭配显卡坞还是另配X99洋垃圾?双显卡、大模型、ComfyUI玩法,AI小主机能不能玩?

新增显卡搭配显卡坞还是另配X99洋垃圾?双显卡、大模型、ComfyUI玩法,AI小主机能不能玩?

已定时 已固定 已锁定 已移动 AI硬件
2 帖子 1 发布者 91 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT 在线
    terryT 在线
    terry
    超级版主
    编写于 最后由 编辑
    #1

    之前其实我做过很多期视频来谈这个话题,但是论坛跟评论区仍然有不少人发帖询问,我就再讲一次。就是说现在如果你想添置一个新的显卡,你是去买一个显卡坞回来,接到现在的主机上,还是去买一个X99的洋垃圾给它配套?

    我之前其实是有非常明确的结论,就是肯定要多花一点点钱,去买一个X99的洋垃圾。这样做的好处是什么呢?比如说你现在买了一个显卡坞,回来插到你以前的电脑或者服务器上,那么它是要跟你以前的显卡去分享CPU和内存资源的。其实CPU资源大部分时候是够的,但是在特殊情况下,它也会被争抢、被刷爆,这种情况比较少,但是是有可能发生的。

    然后内存是更严重的。就是你两张显卡,无论是跑大模型还是跑ComfyUI,都是需要比较大的内存。相信你的主机肯定不是什么X99之类的这些洋垃圾,那你最少是DDR4的内存,甚至是DDR5的内存。你要去给你的主机再增加内存的话,这个钱就远远超过一台X99洋垃圾服务器的钱了。

    显卡坞 双显卡 AI小主机.jpeg

    另外我们要考虑,使用的便利性上也是有本质区别的。如果说你是组装一个X99的洋垃圾,那么你开机关机、远程登录、接显示器这些都是非常方便的。如果说你是买了一个显卡坞,如果你是英伟达的显卡的话,那它操作便利性还能勉强接受,但是也远远比把它装到主机上便利度要差很多。如果说你买的是AMD的显卡,再加上各种驱动Bug、接显示屏,我跟你讲,一大堆的问题,反正非常不方便。再加上现在Windows的系统驱动做得真的是非常烂,这些问题会让你浪费不少时间。

    那么接下来,我们再从性能方面来对比一下。雷电3、雷电4的这些显卡坞,相当于PCIe 3.0×4的带宽,大概就是3-4GB/s的带宽。雷电5大概翻一倍,就是相当于PCIe 4.0×4,不到8GB/s的带宽。但是我们需要知道,雷电5可就很贵了,雷电5的显卡坞肯定单个显卡坞的价格就要超过整个X99洋垃圾服务器,如果配上电源的话就贵得更多了,因为你买显卡坞也得给它配电源。

    如果说你用的是Oculink,它的纸面带宽就相当于PCIe 4.0×4,跟雷电5是差不多的。但是由于它没有其他的协议栈开销,没有其他的信道开销,所以它带宽要比雷电5更好一点。而且Oculink有个什么优势呢?它本质上就是PCIe延长线,它没有协议转换,通信延迟的开销基本上是0,可以忽略。

    4060TI主机大.jpeg

    然后你雷电3、4还是5,你接到CPU上虽然是直连,但是你这个显卡坞这个地方,它还是PCIe接口,无论是3.0、4.0还是5.0。那么做这个协议转换的时候,你是有通信开销的。第一,你的带宽会受到这个影响;第二,就是转换会增加延迟。

    那么聊完这个话题,我们就顺便把另外一些朋友的问题也给解答一下,就是大家比较关心用双卡方案怎么组合。就是说大部分时候,我是强烈不推荐个人去组这个双显卡方案的。哪怕你的服务器上装了两张显卡,我还是希望它们各自工作,不要想办法协同。因为只要你想办法协同,你就要面临无尽的折腾,而且大部分时候你的效果肯定达不到1+1=2。

    最理想的状态,比如说现在你跑的是llama.cpp,你有两个3080 20G显卡,这个时候你就可以用llama.cpp的分层方案。比如说这个模型有60层,你把前面30层放到卡一,后面30层放到卡二。卡一计算完之后,把中间计算张量结果传到卡二,由卡二继续完成。那么同时只有一张3080显卡在工作,但是你获得了相当于40G的连续空间。你本来跑Qwen3.8 27B,显存根本就不够,非常紧张,这样的话两张卡它就够用了,就不紧张了。

    但是这个串行方案就没有TP方案好。如果说你用的是VLLM或者是SGLang,尤其是SGLang,它双卡TP方案的效率是非常高的。因为TP张量并行相当于它的算力叠加,显存也叠加,虽然做不到1+1=2,但是大概能够做到1+1=1.7。

    但是我们知道,张量并行对于你的主板是有要求的。就是说你的主板肯定是要有两个,比如说PCIe 4.0×8、×16的接口,然后你的主板要支持Above 4G Decoding,还得支持REBAR,并且还得支持显卡之间的P2P互联,这些都是硬性的要求。当然,如果说你的主板是PCIe 5.0,你能够拆分出两个×8,或者拆分出一个×8、一个×16,就非常不错。因为5.0的带宽比4.0的带宽翻倍了,4.0就是比较基础了。如果说你是3.0的PCIe接口,那么我还是建议你不要搞TP了,效率不高。

    华南金牌主板CPU套装.jpeg

    就以我们比较熟悉的洋垃圾主板来举例,比如说X99CD3,华南金牌的。它有Above 4G Decoding这个选项,也有REBAR这个选项,但是实际上它只能开启Above 4G Decoding,它无法开启REBAR。开启之后,它没有做这个硬件映射,是开不了机的。在X99CD4这个主板上,根据论坛网友的反映,已经把REBAR这个选项给去掉了,你完全看不到了。

    Above 4G Decoding是干什么的呢?它允许PCIe设备映射超过4G的连续地址空间。如果说你不开这个东西,它在CPU这个寻址空间中映射的是256M的地址空间,但是它也是分层分页来映射的。如果说你平时不进行非常庞大的数据交换,你开不开这个选项其实影响不大。但是如果说你要做高频的大数据交换,比如说大模型推理,或者说是ComfyUI,那么你开这个东西,效率提升还是有的。

    Above 4G Decoding是负责看得见,那么REBAR的功能就是负责拿得到。这个地址空间是可以直接访问,通过CPU直接访问也好,还是另外一个GPU去访问它也好,都是可以的。所以说你的主板如果支持REBAR,然后这个链路上面又支持显卡的P2P通信,那么用它来做张量并行就是够了。当然,前提还是你的PCIe插槽最好是PCIe 4.0×16的,或者是PCIe 5.0×8、×16的都好,3.0的性能还是弱了一点。

    当然这是讲英伟达显卡,那么AMD显卡的情况就比较复杂。比如说你要玩SGLang,它对7900 XTX这种消费级显卡的支持是非常恶劣的,生态非常差,你把它跑起来几乎是不可能的。那么双R9700 Pro可以跑起来,但是两张卡就得2万块钱。我相信你如果已经买了两张这样的卡,你基本上也不用看我的视频,自己肯定知道是怎么配的。

    当然了,7900 XTX这样的A卡,它也可以做串行计算。比如说llama.cpp,也可以把一个模型,比如说前50层放到卡一上,后50层放到卡二上,然后卡一算完之后卡二接着算。这个基础的入门能力它还是有的。

    那么说完大模型,我们再谈ComfyUI。ComfyUI就是说你两张显卡叠加计算能力、叠加显存,这个也是不现实的。但是它也有类似于串行计算的方案。比如说现在有一个叫做Dis PyTorch的东西,ComfyUI MultiGPU的一个节点。这个节点可以干什么呢?就是让卡一负责计算,卡二只是当显存提供者,就相当于一个充电宝一样,卡二全程完全不参与计算,全程由卡一来进行调度。它算完一块之后,会把权重从卡二中拷贝过来,算完之后再把它放回去。

    在这种情况下,它对于主板的性能要求是非常高的。就是你必须要支持REBAR,必须要支持P2P,最好是PCIe 5.0×8以上的,或者PCIe 4.0×16以上的接口,你才能玩得转,要不然性能损耗也是比较大。

    另外一种,就是现在的ComfyUI,我们是可以把不同的节点放到不同的显卡上。比如说你玩LTX 2.3,那么你可以把UNET节点,就是主节点给它放到卡一上,VAE节点放到卡二上。这个就不需要什么其他的第三方插件了,它本身就可以这么分配。那么你把提示词跟相关的参考图片也好,给它喂给主节点,UNET运行完毕之后生成latent文件,你把这个latent文件再传入VAE节点,VAE节点就在卡二上。这样你就不用频繁卸载这个节点,通信效率,包括整个工作流的工作效率就会大大提升。

    AI视频批量.png

    当然了,前面我们谈到的都是一些常规的情况。英伟达显卡还有一些特殊的东西,比如说它的NVLink。你像什么2080 Ti、3090、3090 Ti,它这些消费级的旗舰卡都是支持NVLink的。但是我们要知道,支持NVLink的主板其实也是不太好找的,而且NVLink本身也要钱。虽然说老的NVLink不太贵,但是这个东西玩起来还是有点门槛的,不是说你想玩就玩的。因为论坛有人搞这个NVLink就是翻了车嘛。

    对了,在小主机上,比如说DGX Spark,论坛就有朋友反映,它的高速数据线,你弄一个数据线把两个小盒子给连起来,那么跑DeepSeek V4 Flash这样的MoE大模型,显存也够了,推理的效率、prefill的速度都是够的。当然,如果说你用来跑这种Qwen3.8 27B这样的稠密模型,你单个小盒子来跑的话,它显存也够的,不过它的吐字速度也好,还是prefill速度也好,就非常慢了,非常难受。

    既然已经说到这里,我就跟大家说一下,就是这些小主机往往都是计算单元阉割得非常严重,它的算力是不行的。一般来说就相当于什么4060、4070这个级别,然后带宽小很多,就是慢得一逼。并且它们的散热往往都不太好。你不能说因为它们大显存能够装得下,装得下它算得慢了。

    除非你有一些很明确的需求,比如说你要运行Qwen3.5 122B MoE模型,然后就是为了做简单的一些工具调用、一些文档的处理,或者说把它打造成为一个你的私有知识库,那么它是可以的。你买个什么AI Max 395、400都是可以。或者说你是一个苹果用户,你的内存是统一内存,比如说你有个128G的统一内存,那么你玩MoE的模型,比如说是千问的也好,还是什么其他的大的MoE模型都可以。

    AIMax395迷你主机2.jpg

    但是你要跟独立显卡去比稠密模型、比ComfyUI、比密集计算,那肯定是不行的。而且小盒子一般来说,就是由于比较紧凑,它的散热其实做得往往都不好。一旦长期工作,散热的压力是非常大的。就算你散热能够挺住,在这个狭小的空间中长期高温的话,硬件损耗也是比较严重的。所以说我一般是不推荐大家去买什么小主机的,除非说你明确知道自己想干什么。

    好吧,不知不觉又扯得有点远了。大家有什么问题,欢迎到论坛发帖提问,也欢迎在评论区留言。我以后可能会考虑在“论锤者”这个频道也开启直播,那么我在论锤者频道开直播的时候,大家就可以过来提一些技术性的问题,我们当面交流。

    我必须说明,我本人不是什么百科全书,肯定有很多东西我也不懂。很多东西其实我都是在论坛跟这些大神学的,有些东西我也是问的AI,还有一些东西是我自己从实践中,或者说从论坛其他大神的实践数据中、他们发的帖子中去学习。你不一定是一定要抱着学习的态度来看我的直播,你也可以进来互动、来指导我,我也是非常欢迎的。

    然后,如果说你对于一些科技话题,比如说偏时政的话题,但是我不能讲太敏感的时政,偏时政的一些科技话题,如果想聊的话,比如说中美科技战,我们中国的这种芯片、AI产业的实力,包括说我们的一些科技公司,DeepSeek、华为、小米这些话题、企业,我们中国一些敏感的一些科技技术,也不说敏感吧,就我们中国的一些热点科技技术,因为敏感的我们肯定都不知道,我们只是屁民嘛。

    如果说你想聊的话,就到“老头说”那个频道看看我的直播。我是打算每个星期开一到两次直播,这个开之前,我就在论坛发一个帖子,统计一下有谁愿意到时候过来跟我吹牛的,然后我们线上直接交流。

    我在Discord上开一个房间,大家过来,就是轮到谁了谁就上麦,我们就直接通过语音交流。或者说你愿意在油管直播间打字跟我交流也是可以的,但是有一点点延迟。

    油管:https://www.youtube.com/@抡锤者

    1 条回复 最后回复
    0
    • terryT 在线
      terryT 在线
      terry
      超级版主
      编写于 最后由 编辑
      #2

      Youtube Video

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0

      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

      有了你的建议,这篇帖子会更精彩哦 💗

      注册 登录
      回复
      • 在新帖中回复
      登录后回复
      • 从旧到新
      • 从新到旧
      • 最多赞同


      • 登录

      • 登录或注册以进行搜索。
      • 第一个帖子
        最后一个帖子
      0
      • 版块
      • 最新
      • 标签
      • 热门
      • 用户
      • 群组