<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[4090 48G用户选择副卡，3080/3090/7900XTX/R9700候选：SGLang、ComfyUI本地部署方案对比！]]></title><description><![CDATA[<p dir="auto">好，本期做一期视频，回答一下论坛观众的这个提问。要不然大家在论坛发帖，还不如在油管评论区发帖的待遇高，这样就不合理了。我们挑选这位叫 Lukun Ge 的幸运观众。他发的帖子是：</p>
<p dir="auto"><strong>背景：</strong> 服务器有一个 4090 48G，64G 内存，主板有两个 PCIe 5.0 ×16 的插槽。<strong>需求为再买一张显卡，解决千问 27B 越狱模型和 ComfyUI 同时运行的需求，有需要写视频剧本的需求，有编程的需求，Hermes 日常事务的需求。</strong></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/9aa4a187-b282-42ac-9d28-c88feb07c25b.jpeg" alt="本地双显卡.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto"><strong>选择有三个。第一，3080 20G。</strong> 缺点是 Qwen 27B 在 SGLang 的环境下上下文太小，价格 3,500 左右。从实际应用的场景，我判断应该是可以 pass。3080 20G 显存缺乏上下文的支持，模型串行部署在两张显卡上之后，Token 输出的速度应该过慢。</p>
<p dir="auto">你的判断基本上是对的，你可以排除。如果说你只是想买一张 3080 20G 的话，那么它是不足以支撑这个玩 SGLang 的。就是这个模型本来 4 比特量化之后大概是 16.5G，剩下 3.5G 的空间，扣除 SGLang 的开销，SGLang 的开销是不小的啊，你就基本上没有上下文了，这个不用想了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/51699901-ba58-474a-9416-048e7b0e7436.png" alt="3080 20G.png" class=" img-fluid img-markdown" /></p>
<p dir="auto"><strong>第二就是 7900 XTX 24G。</strong> 千问 27B 模型应该能够运行，上下文应该可以到 64K，我感觉是刚刚过及格线，价格 5,500，比 3090 性价比要高。近期 3090 的价格是奔着 9,000 的区间在前进，但是 24G 显存还是过于鸡肋，或者有实际应用的朋友可以分享一下，24G 显存在我的需求场景下也是够的。</p>
<p dir="auto">怎么讲呢，如果说你是部署 llama.cpp 或者 vLLM，那么 7900 XTX 24G 可以跑 128K 上下文，而且我是确定测试过的，并且它不会降智、降速，它的速度还是相当不错的。但是如果说你要驱动 SGLang，那么 7900 XTX 它是生态地狱。总之，对于这个 7900 XTX，这个消费级的显卡，AMD 的 SGLang 生态支持不好。要配的话我觉得是比较麻烦的，反正之前我配过，挺难的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/fe20bae8-424d-4bdb-a117-e4e54e3d6035.png" alt="7900xtx蓝宝石.png" class=" img-fluid img-markdown" /></p>
<p dir="auto"><strong>第三就是 R9700 32G。</strong> 千问 27B 模型应该可以跑到 128K 左右的上下文，价格 11,000 左右。京东自营 R9700 32G 无疑是可以满足所有的需求，除了贵 5,500，显卡带宽没有 7900 高，其他的都挺好。</p>
<p dir="auto">那么对此我想说，就是 R9700 它比 7900 XTX 带宽小的这个问题，如果说是在跑 MoE 的小模型上，比如说 35B A3B 的模型上，这个体验差距是不大的。但是跑 27B 模型，这个差距还是蛮大的。而且即便是 7900 XTX，它 960G 的带宽，跑起来由于算力的问题，加上带宽的限制，它其实吐字的速度已经不够了。</p>
<p dir="auto">当然了，网上关于 R9700 32G 跑这个 SGLang，它由于是 RDNA 4 的架构，而且它本身是计算卡，所以说它的生态支持，这个镜像比较成熟，生态支持比 7900 XTX 要更好。这个需要大家自己去尝试一下吧，反正我没有这张卡，本来我是打算买的啊。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/109def67-e6d3-4ccd-93a2-5f84cddd4401.png" alt="蓝宝石AI Pro R9700.png" class=" img-fluid img-markdown" /></p>
<p dir="auto"><strong>下面再读一下他的实际问题。第一，从实际应用场景分享一下经验，A 卡和 N 卡同时在一起的时候，是否存在 Ubuntu 下的兼容性问题？我的查询结果是不会，还是要做一下真实应用的确认。</strong></p>
<p dir="auto">那么我可以现在就确认，你这个问题不会啊，没有兼容性问题。因为我的服务器上就跑着 7900 XTX 跟这个 4090D 48G，那么我是同时装了 ROCm 跟这个 CUDA 的驱动，二者并不冲突，并且二者可以同时跑，而且我就同时跑过，一点问题都没有。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/fd482359-97e7-4ad7-b131-a91ed02f2b55.jpg" alt="机箱显卡2.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto"><strong>第二就是从实际应用的角度分享一下，大家如何兼顾本地模型和 ComfyUI 工作流同时在线的需求？是否这是一个伪需求，或者是一个低频的需求，其实没有必要配两张卡？</strong></p>
<p dir="auto">这个东西叫仁者见仁，智者见智是吧。好比说你说买一个充气娃娃是不是一个伪需求？是不是如果说你有一个女朋友，身高一米六八，然后瓜子脸、鹅蛋脸是吧，长相清秀、肤白貌美，那你买充气娃娃的这个需求就是一个伪需求，是不是？可是如果说你是一个单身 15 年的猥琐男，练就了黄金麒麟臂，那我觉得买一个充气娃娃的需求就不是一个伪需求。就你的具体应用场景要怎么样。</p>
<p dir="auto">就像你刚才在开头说的，你又要去跑这个 Qwen 27B 的越狱模型，又要跟 ComfyUI 同时运行，又要写剧本，又要跑这个 Hermes，还要编程。我觉得按照你这个需求，可能两张显卡都未必够。当然了，两张显卡最低配啊是够的。</p>
<p dir="auto">关于你刚才说的三个方案，3080、7900 XTX 跟 R9700，我说实话，你买哪一张卡加上去都不够。对此呢，我有一个比较怎么说呢，小众的这个建议，就看你愿不愿意采纳。就是你现在把你这个两个 PCIe 5.0 ×16 的主板插槽空出来，把这个 4090 48G 给拿下来，去买两张 3080 20G，或者如果说你有钱的话，去买两张 3090 24G。</p>
<p dir="auto">因为你是 PCIe 5.0 ×16 的插槽，你两张卡 TP 的话，两张 N 卡 TP 跑 SGLang，它的效果是非常好的。就两张 3080 肯定是够了，它的吐字速度，包括这个 Prefill 的速度，应该都是非常不错的。两张 3090 的体验会更好，这个无论如何是要吊打 R9700 的。</p>
<p dir="auto">那么你空出来的 4090 48G 干什么呢？就像我一样，去买个 X99 的洋垃圾，配个 64G 内存，这个价格基本上可以忽略的，可能一千五六百块钱，总体一个平台给你搞定。这样子的话，你这个 4090 48G 专门用来做这个 ComfyUI，然后你以前配置不错的主板跟 CPU 去驱动两张 3080 20G，TP 跑这个 SGLang，这个体验应当会有质的飞跃。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/3747a7e3-1a40-47f1-b75c-de5d56131cb4.jpeg" alt="ubuntu洋垃圾双显卡机箱大.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto"><strong>视频的最后，我还是要总结一下。</strong> 如果说我们没有什么本地抗审查的需求，比如说像这位 Lukun Ge 是吧，可能要写一些雅美蝶的文章、雅美蝶的剧本，那么我们就没有必要在本地部署 AI 大模型，尤其是文本大模型，这是一点必要都没有的。我们就用在线的 DeepSeek V4 Flash、混元 3，或者说是这个小米的 MiMo 模型，性价比都是非常高的。或者我们去订阅一个 GPT Plus，用它的这个什么 GPT Luna 这样的便宜模型，都是可以用的。</p>
<p dir="auto">如果说我们有抗审查的需求，那没办法，就必须要在本地部署模型。本地部署的话，如果说你已经有了两个 PCIe 5.0 ×16 的这种高端主板插槽，那么你买两张 3080，性价比应该是最高的。它用来跑这个 SGLang 双卡 TP 的话，效果是不会差的。如果是两张 3090，效果会更好一点。</p>
<p dir="auto"><strong>文本大模型说完，我们再说音视频本地部署。</strong>  ComfyUI 无论是你跑 Wan、LTX 去做数字人，还是跑 Minimax H3 来做这个短视频，讲实话，现在这个云端 API 还是太贵了，而且有这个废片存在，这个会进一步增加成本。在这种情况下，你如果能够花个两三万块钱，甚至更贵的钱去部署这个 4090 48G，或者说是 RTX Pro 5000、6000，它的性价比我认为是可以的。</p>
<p dir="auto">当然 RTX Pro 6000 有点太贵了。就是起码我认为 4090 48G 和 RTX Pro 5000 这两张显卡，如果你有大量的视频生成需求的话，它们的性价比还是非常高的。</p>
]]></description><link>https://lcz.me/topic/1089/4090-48g用户选择副卡-3080-3090-7900xtx-r9700候选-sglang-comfyui本地部署方案对比</link><generator>RSS for Node</generator><lastBuildDate>Sat, 22 Aug 2026 00:49:02 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1089.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 12 Aug 2026 04:00:00 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 4090 48G用户选择副卡，3080/3090/7900XTX/R9700候选：SGLang、ComfyUI本地部署方案对比！ on Wed, 12 Aug 2026 07:53:33 GMT]]></title><description><![CDATA[<p dir="auto">时间搞错了，16点发布</p>
]]></description><link>https://lcz.me/post/11957</link><guid isPermaLink="true">https://lcz.me/post/11957</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Wed, 12 Aug 2026 07:53:33 GMT</pubDate></item><item><title><![CDATA[Reply to 4090 48G用户选择副卡，3080/3090/7900XTX/R9700候选：SGLang、ComfyUI本地部署方案对比！ on Wed, 12 Aug 2026 04:00:00 GMT]]></title><description><![CDATA[<p dir="auto"><a href="https://youtu.be/8KVAGpK2UPc" rel="nofollow ugc"><i class="fa fa-youtube" aria-hidden="true"></i> Youtube Video</a></p><div class="js-lazyYT lazyYT-container" data-youtube-id="8KVAGpK2UPc" data-width="640" data-height="360" data-parameters style="width:640px;padding-bottom:360px">
 <div class="ytp-thumbnail lazyYT-image-loaded" style="background-image:url(&quot;https://i.ytimg.com/vi/8KVAGpK2UPc/hqdefault.jpg&quot;)">
  <button class="ytp-large-play-button ytp-button" tabindex="23" aria-live="assertive" style="transform:scale(0.85)" onclick="$(this).lazyYT(this);return false;">
   <svg height="100%" version="1.1" viewbox="0 0 68 48" width="100%">
    <path class="ytp-large-play-button-bg" d="m .66,37.62 c 0,0 .66,4.70 2.70,6.77 2.58,2.71 5.98,2.63 7.49,2.91 5.43,.52 23.10,.68 23.12,.68 .00,-1.3e-5 14.29,-0.02 23.81,-0.71 1.32,-0.15 4.22,-0.17 6.81,-2.89 2.03,-2.07 2.70,-6.77 2.70,-6.77 0,0 .67,-5.52 .67,-11.04 l 0,-5.17 c 0,-5.52 -0.67,-11.04 -0.67,-11.04 0,0 -0.66,-4.70 -2.70,-6.77 C 62.03,.86 59.13,.84 57.80,.69 48.28,0 34.00,0 34.00,0 33.97,0 19.69,0 10.18,.69 8.85,.84 5.95,.86 3.36,3.58 1.32,5.65 .66,10.35 .66,10.35 c 0,0 -0.55,4.50 -0.66,9.45 l 0,8.36 c .10,4.94 .66,9.45 .66,9.45 z" fill="#1f1f1e" fill-opacity="0.9">
    </path>
    <path d="m 26.96,13.67 18.37,9.62 -18.37,9.55 -0.00,-19.17 z" fill="#fff">
    </path>
    <path d="M 45.02,23.46 45.32,23.28 26.96,13.67 43.32,24.34 45.02,23.46 z" fill="#ccc">
    </path>
   </svg>
  </button>
 </div>
</div><p></p>
]]></description><link>https://lcz.me/post/11939</link><guid isPermaLink="true">https://lcz.me/post/11939</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Wed, 12 Aug 2026 04:00:00 GMT</pubDate></item></channel></rss>