<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[新增显卡搭配显卡坞还是另配X99洋垃圾？双显卡、大模型、ComfyUI玩法，AI小主机能不能玩？]]></title><description><![CDATA[<p dir="auto">之前其实我做过很多期视频来谈这个话题，但是论坛跟评论区仍然有不少人发帖询问，我就再讲一次。就是说现在如果你想添置一个新的显卡，你是去买一个显卡坞回来，接到现在的主机上，还是去买一个X99的洋垃圾给它配套？</p>
<p dir="auto">我之前其实是有非常明确的结论，就是肯定要多花一点点钱，去买一个X99的洋垃圾。这样做的好处是什么呢？比如说你现在买了一个显卡坞，回来插到你以前的电脑或者服务器上，那么它是要跟你以前的显卡去分享CPU和内存资源的。其实CPU资源大部分时候是够的，但是在特殊情况下，它也会被争抢、被刷爆，这种情况比较少，但是是有可能发生的。</p>
<p dir="auto">然后内存是更严重的。就是你两张显卡，无论是跑大模型还是跑ComfyUI，都是需要比较大的内存。相信你的主机肯定不是什么X99之类的这些洋垃圾，那你最少是DDR4的内存，甚至是DDR5的内存。你要去给你的主机再增加内存的话，这个钱就远远超过一台X99洋垃圾服务器的钱了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/f69a4f6a-6b3c-41b5-8537-c8bfb39094e3.jpeg" alt="显卡坞 双显卡 AI小主机.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">另外我们要考虑，使用的便利性上也是有本质区别的。如果说你是组装一个X99的洋垃圾，那么你开机关机、远程登录、接显示器这些都是非常方便的。如果说你是买了一个显卡坞，如果你是英伟达的显卡的话，那它操作便利性还能勉强接受，但是也远远比把它装到主机上便利度要差很多。如果说你买的是AMD的显卡，再加上各种驱动Bug、接显示屏，我跟你讲，一大堆的问题，反正非常不方便。再加上现在Windows的系统驱动做得真的是非常烂，这些问题会让你浪费不少时间。</p>
<p dir="auto">那么接下来，我们再从性能方面来对比一下。雷电3、雷电4的这些显卡坞，相当于PCIe 3.0×4的带宽，大概就是3-4GB/s的带宽。雷电5大概翻一倍，就是相当于PCIe 4.0×4，不到8GB/s的带宽。但是我们需要知道，雷电5可就很贵了，雷电5的显卡坞肯定单个显卡坞的价格就要超过整个X99洋垃圾服务器，如果配上电源的话就贵得更多了，因为你买显卡坞也得给它配电源。</p>
<p dir="auto">如果说你用的是Oculink，它的纸面带宽就相当于PCIe 4.0×4，跟雷电5是差不多的。但是由于它没有其他的协议栈开销，没有其他的信道开销，所以它带宽要比雷电5更好一点。而且Oculink有个什么优势呢？它本质上就是PCIe延长线，它没有协议转换，通信延迟的开销基本上是0，可以忽略。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/f9d70acb-ede9-45ac-be7f-423e0d4206fb.jpeg" alt="4060TI主机大.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">然后你雷电3、4还是5，你接到CPU上虽然是直连，但是你这个显卡坞这个地方，它还是PCIe接口，无论是3.0、4.0还是5.0。那么做这个协议转换的时候，你是有通信开销的。第一，你的带宽会受到这个影响；第二，就是转换会增加延迟。</p>
<p dir="auto">那么聊完这个话题，我们就顺便把另外一些朋友的问题也给解答一下，就是大家比较关心用双卡方案怎么组合。就是说大部分时候，我是强烈不推荐个人去组这个双显卡方案的。哪怕你的服务器上装了两张显卡，我还是希望它们各自工作，不要想办法协同。因为只要你想办法协同，你就要面临无尽的折腾，而且大部分时候你的效果肯定达不到1+1=2。</p>
<p dir="auto">最理想的状态，比如说现在你跑的是llama.cpp，你有两个3080 20G显卡，这个时候你就可以用llama.cpp的分层方案。比如说这个模型有60层，你把前面30层放到卡一，后面30层放到卡二。卡一计算完之后，把中间计算张量结果传到卡二，由卡二继续完成。那么同时只有一张3080显卡在工作，但是你获得了相当于40G的连续空间。你本来跑Qwen3.8 27B，显存根本就不够，非常紧张，这样的话两张卡它就够用了，就不紧张了。</p>
<p dir="auto">但是这个串行方案就没有TP方案好。如果说你用的是VLLM或者是SGLang，尤其是SGLang，它双卡TP方案的效率是非常高的。因为TP张量并行相当于它的算力叠加，显存也叠加，虽然做不到1+1=2，但是大概能够做到1+1=1.7。</p>
<p dir="auto">但是我们知道，张量并行对于你的主板是有要求的。就是说你的主板肯定是要有两个，比如说PCIe 4.0×8、×16的接口，然后你的主板要支持Above 4G Decoding，还得支持REBAR，并且还得支持显卡之间的P2P互联，这些都是硬性的要求。当然，如果说你的主板是PCIe 5.0，你能够拆分出两个×8，或者拆分出一个×8、一个×16，就非常不错。因为5.0的带宽比4.0的带宽翻倍了，4.0就是比较基础了。如果说你是3.0的PCIe接口，那么我还是建议你不要搞TP了，效率不高。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/962def12-7c8f-4292-a99a-392e6762870c.jpeg" alt="华南金牌主板CPU套装.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">就以我们比较熟悉的洋垃圾主板来举例，比如说X99CD3，华南金牌的。它有Above 4G Decoding这个选项，也有REBAR这个选项，但是实际上它只能开启Above 4G Decoding，它无法开启REBAR。开启之后，它没有做这个硬件映射，是开不了机的。在X99CD4这个主板上，根据论坛网友的反映，已经把REBAR这个选项给去掉了，你完全看不到了。</p>
<p dir="auto">Above 4G Decoding是干什么的呢？它允许PCIe设备映射超过4G的连续地址空间。如果说你不开这个东西，它在CPU这个寻址空间中映射的是256M的地址空间，但是它也是分层分页来映射的。如果说你平时不进行非常庞大的数据交换，你开不开这个选项其实影响不大。但是如果说你要做高频的大数据交换，比如说大模型推理，或者说是ComfyUI，那么你开这个东西，效率提升还是有的。</p>
<p dir="auto">Above 4G Decoding是负责看得见，那么REBAR的功能就是负责拿得到。这个地址空间是可以直接访问，通过CPU直接访问也好，还是另外一个GPU去访问它也好，都是可以的。所以说你的主板如果支持REBAR，然后这个链路上面又支持显卡的P2P通信，那么用它来做张量并行就是够了。当然，前提还是你的PCIe插槽最好是PCIe 4.0×16的，或者是PCIe 5.0×8、×16的都好，3.0的性能还是弱了一点。</p>
<p dir="auto">当然这是讲英伟达显卡，那么AMD显卡的情况就比较复杂。比如说你要玩SGLang，它对7900 XTX这种消费级显卡的支持是非常恶劣的，生态非常差，你把它跑起来几乎是不可能的。那么双R9700 Pro可以跑起来，但是两张卡就得2万块钱。我相信你如果已经买了两张这样的卡，你基本上也不用看我的视频，自己肯定知道是怎么配的。</p>
<p dir="auto">当然了，7900 XTX这样的A卡，它也可以做串行计算。比如说llama.cpp，也可以把一个模型，比如说前50层放到卡一上，后50层放到卡二上，然后卡一算完之后卡二接着算。这个基础的入门能力它还是有的。</p>
<p dir="auto">那么说完大模型，我们再谈ComfyUI。ComfyUI就是说你两张显卡叠加计算能力、叠加显存，这个也是不现实的。但是它也有类似于串行计算的方案。比如说现在有一个叫做Dis PyTorch的东西，ComfyUI MultiGPU的一个节点。这个节点可以干什么呢？就是让卡一负责计算，卡二只是当显存提供者，就相当于一个充电宝一样，卡二全程完全不参与计算，全程由卡一来进行调度。它算完一块之后，会把权重从卡二中拷贝过来，算完之后再把它放回去。</p>
<p dir="auto">在这种情况下，它对于主板的性能要求是非常高的。就是你必须要支持REBAR，必须要支持P2P，最好是PCIe 5.0×8以上的，或者PCIe 4.0×16以上的接口，你才能玩得转，要不然性能损耗也是比较大。</p>
<p dir="auto">另外一种，就是现在的ComfyUI，我们是可以把不同的节点放到不同的显卡上。比如说你玩LTX 2.3，那么你可以把UNET节点，就是主节点给它放到卡一上，VAE节点放到卡二上。这个就不需要什么其他的第三方插件了，它本身就可以这么分配。那么你把提示词跟相关的参考图片也好，给它喂给主节点，UNET运行完毕之后生成latent文件，你把这个latent文件再传入VAE节点，VAE节点就在卡二上。这样你就不用频繁卸载这个节点，通信效率，包括整个工作流的工作效率就会大大提升。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/ba17f2f4-3490-4079-abe9-b3b6c67e8435.png" alt="AI视频批量.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">当然了，前面我们谈到的都是一些常规的情况。英伟达显卡还有一些特殊的东西，比如说它的NVLink。你像什么2080 Ti、3090、3090 Ti，它这些消费级的旗舰卡都是支持NVLink的。但是我们要知道，支持NVLink的主板其实也是不太好找的，而且NVLink本身也要钱。虽然说老的NVLink不太贵，但是这个东西玩起来还是有点门槛的，不是说你想玩就玩的。因为论坛有人搞这个NVLink就是翻了车嘛。</p>
<p dir="auto">对了，在小主机上，比如说DGX Spark，论坛就有朋友反映，它的高速数据线，你弄一个数据线把两个小盒子给连起来，那么跑DeepSeek V4 Flash这样的MoE大模型，显存也够了，推理的效率、prefill的速度都是够的。当然，如果说你用来跑这种Qwen3.8 27B这样的稠密模型，你单个小盒子来跑的话，它显存也够的，不过它的吐字速度也好，还是prefill速度也好，就非常慢了，非常难受。</p>
<p dir="auto">既然已经说到这里，我就跟大家说一下，就是这些小主机往往都是计算单元阉割得非常严重，它的算力是不行的。一般来说就相当于什么4060、4070这个级别，然后带宽小很多，就是慢得一逼。并且它们的散热往往都不太好。你不能说因为它们大显存能够装得下，装得下它算得慢了。</p>
<p dir="auto">除非你有一些很明确的需求，比如说你要运行Qwen3.5 122B MoE模型，然后就是为了做简单的一些工具调用、一些文档的处理，或者说把它打造成为一个你的私有知识库，那么它是可以的。你买个什么AI Max 395、400都是可以。或者说你是一个苹果用户，你的内存是统一内存，比如说你有个128G的统一内存，那么你玩MoE的模型，比如说是千问的也好，还是什么其他的大的MoE模型都可以。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/f6a8e260-0be5-415b-bbcf-626374486a53.jpg" alt="AIMax395迷你主机2.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto">但是你要跟独立显卡去比稠密模型、比ComfyUI、比密集计算，那肯定是不行的。而且小盒子一般来说，就是由于比较紧凑，它的散热其实做得往往都不好。一旦长期工作，散热的压力是非常大的。就算你散热能够挺住，在这个狭小的空间中长期高温的话，硬件损耗也是比较严重的。所以说我一般是不推荐大家去买什么小主机的，除非说你明确知道自己想干什么。</p>
<p dir="auto">好吧，不知不觉又扯得有点远了。大家有什么问题，欢迎到论坛发帖提问，也欢迎在评论区留言。我以后可能会考虑在“论锤者”这个频道也开启直播，那么我在论锤者频道开直播的时候，大家就可以过来提一些技术性的问题，我们当面交流。</p>
<p dir="auto">我必须说明，我本人不是什么百科全书，肯定有很多东西我也不懂。很多东西其实我都是在论坛跟这些大神学的，有些东西我也是问的AI，还有一些东西是我自己从实践中，或者说从论坛其他大神的实践数据中、他们发的帖子中去学习。你不一定是一定要抱着学习的态度来看我的直播，你也可以进来互动、来指导我，我也是非常欢迎的。</p>
<p dir="auto">然后，如果说你对于一些科技话题，比如说偏时政的话题，但是我不能讲太敏感的时政，偏时政的一些科技话题，如果想聊的话，比如说中美科技战，我们中国的这种芯片、AI产业的实力，包括说我们的一些科技公司，DeepSeek、华为、小米这些话题、企业，我们中国一些敏感的一些科技技术，也不说敏感吧，就我们中国的一些热点科技技术，因为敏感的我们肯定都不知道，我们只是屁民嘛。</p>
<p dir="auto">如果说你想聊的话，就到“老头说”那个频道看看我的直播。我是打算每个星期开一到两次直播，这个开之前，我就在论坛发一个帖子，统计一下有谁愿意到时候过来跟我吹牛的，然后我们线上直接交流。</p>
<p dir="auto">我在Discord上开一个房间，大家过来，就是轮到谁了谁就上麦，我们就直接通过语音交流。或者说你愿意在油管直播间打字跟我交流也是可以的，但是有一点点延迟。</p>
]]></description><link>https://lcz.me/topic/1205/新增显卡搭配显卡坞还是另配x99洋垃圾-双显卡-大模型-comfyui玩法-ai小主机能不能玩</link><generator>RSS for Node</generator><lastBuildDate>Sat, 22 Aug 2026 00:49:01 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1205.rss" rel="self" type="application/rss+xml"/><pubDate>Thu, 20 Aug 2026 02:00:00 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 新增显卡搭配显卡坞还是另配X99洋垃圾？双显卡、大模型、ComfyUI玩法，AI小主机能不能玩？ on Thu, 20 Aug 2026 02:00:00 GMT]]></title><description><![CDATA[<p dir="auto"><a href="https://youtu.be/4fux2XWLrz4" rel="nofollow ugc"><i class="fa fa-youtube" aria-hidden="true"></i> Youtube Video</a></p><div class="js-lazyYT lazyYT-container" data-youtube-id="4fux2XWLrz4" data-width="640" data-height="360" data-parameters style="width:640px;padding-bottom:360px">
 <div class="ytp-thumbnail lazyYT-image-loaded" style="background-image:url(&quot;https://i.ytimg.com/vi/4fux2XWLrz4/hqdefault.jpg&quot;)">
  <button class="ytp-large-play-button ytp-button" tabindex="23" aria-live="assertive" style="transform:scale(0.85)" onclick="$(this).lazyYT(this);return false;">
   <svg height="100%" version="1.1" viewbox="0 0 68 48" width="100%">
    <path class="ytp-large-play-button-bg" d="m .66,37.62 c 0,0 .66,4.70 2.70,6.77 2.58,2.71 5.98,2.63 7.49,2.91 5.43,.52 23.10,.68 23.12,.68 .00,-1.3e-5 14.29,-0.02 23.81,-0.71 1.32,-0.15 4.22,-0.17 6.81,-2.89 2.03,-2.07 2.70,-6.77 2.70,-6.77 0,0 .67,-5.52 .67,-11.04 l 0,-5.17 c 0,-5.52 -0.67,-11.04 -0.67,-11.04 0,0 -0.66,-4.70 -2.70,-6.77 C 62.03,.86 59.13,.84 57.80,.69 48.28,0 34.00,0 34.00,0 33.97,0 19.69,0 10.18,.69 8.85,.84 5.95,.86 3.36,3.58 1.32,5.65 .66,10.35 .66,10.35 c 0,0 -0.55,4.50 -0.66,9.45 l 0,8.36 c .10,4.94 .66,9.45 .66,9.45 z" fill="#1f1f1e" fill-opacity="0.9">
    </path>
    <path d="m 26.96,13.67 18.37,9.62 -18.37,9.55 -0.00,-19.17 z" fill="#fff">
    </path>
    <path d="M 45.02,23.46 45.32,23.28 26.96,13.67 43.32,24.34 45.02,23.46 z" fill="#ccc">
    </path>
   </svg>
  </button>
 </div>
</div><p></p>
]]></description><link>https://lcz.me/post/12962</link><guid isPermaLink="true">https://lcz.me/post/12962</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Thu, 20 Aug 2026 02:00:00 GMT</pubDate></item></channel></rss>