<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[二张3090通过nvlink跑大模型，有人尝试过吗？]]></title><description><![CDATA[<p dir="auto">二张3090通过nvlink跑大模型，有人尝试过吗？不知道速度会怎么样，现在有一套现成的浪潮服务器 PCIE3.0的，双路 E5-2630 v3，想弄个跑跑玩玩，有大神给个意见不，最近在纠结买4090 48魔改还是买二张3090.</p>
]]></description><link>https://lcz.me/topic/1403</link><generator>RSS for Node</generator><lastBuildDate>Mon, 07 Sep 2026 17:14:03 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1403.rss" rel="self" type="application/rss+xml"/><pubDate>Sat, 29 Aug 2026 13:15:36 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 二张3090通过nvlink跑大模型，有人尝试过吗？ on Mon, 07 Sep 2026 15:57:15 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/wwcd2016" aria-label="Profile: wwcd2016">@<bdi>wwcd2016</bdi></a> 老哥，我现在就是3090+4090 48g，目前是3090跑qwen 3.8 17b，4090跑comfyui minimax h3，出电商带货视频，目前还没有更多的使用场景，老哥有什么建议可以指点下</p>
]]></description><link>https://lcz.me/post/16519</link><guid isPermaLink="true">https://lcz.me/post/16519</guid><dc:creator><![CDATA[Nero丶畅畅]]></dc:creator><pubDate>Mon, 07 Sep 2026 15:57:15 GMT</pubDate></item><item><title><![CDATA[Reply to 二张3090通过nvlink跑大模型，有人尝试过吗？ on Sat, 29 Aug 2026 18:55:22 GMT]]></title><description><![CDATA[<p dir="auto">可以參考我的貼文，最近我又優化 用DFlash2 133t/s(峰值 161) 我再更新上來</p>
]]></description><link>https://lcz.me/post/14837</link><guid isPermaLink="true">https://lcz.me/post/14837</guid><dc:creator><![CDATA[starryskyknight]]></dc:creator><pubDate>Sat, 29 Aug 2026 18:55:22 GMT</pubDate></item><item><title><![CDATA[Reply to 二张3090通过nvlink跑大模型，有人尝试过吗？ on Sat, 29 Aug 2026 16:13:55 GMT]]></title><description><![CDATA[<p dir="auto">正面回答你的纠结：<strong>在你这套平台上，双 3090 是更优解</strong>，理由按重要度排：</p>
<ol>
<li>
<p dir="auto"><strong>平台白送</strong>。浪潮双路 E5-2630 v3 本来就是为多卡设计的：80 条 PCIe 3.0 lanes，双卡 x16 满速，供电和风道比家用机箱强。买 4090 48G 魔改等于把平台闲置，单卡插服务器里有点浪费。</p>
</li>
<li>
<p dir="auto"><strong>显存能力相同</strong>。双 3090 层切/TP 后合计 48G，和 4090 48G 一样：27B 的 Q8（约 30G）、70B 的 Q4（约 40G）都装得下。</p>
</li>
<li>
<p dir="auto"><strong>速度有实测参照</strong>。上面 davidwei0826 的数据（p50 61.34 t/s，int4 + 262K 上下文）就是双 3090+NVLink 在 vLLM TP 模式下的真实水平，多人/Agent 并发场景这正是甜点。注意 431 楼那个 27/39/10 t/s 是 <strong>260W 功率墙锁出来的</strong>，不是卡的真实上限，别被吓到；解锁后 SGLang 40+ 没问题。</p>
</li>
<li>
<p dir="auto"><strong>原厂卡 vs 魔改卡</strong>。4090 48G 是后焊显存：核心体质、显存散热、无保修都是赌点，二手 3090 量大、价格透明、坏了换一张就行。</p>
</li>
</ol>
<p dir="auto">4090 48G 魔改只适合一种人：不想折腾 TP、就要单卡省事、预算够且接受无保修。另外两个提醒：</p>
<ul>
<li>你这平台是 PCIe 3.0，4090 是 4.0 卡插上去带宽减半——对推理影响不大（权重常驻显存），但 prefill 传输会慢一点；3090 也一样，不过层切模式激活传输量小，无所谓。</li>
<li>有人说 4090+7900XTX 混搭是最优解，别信：CUDA 和 ROCm 是两套栈，vLLM 根本没法混跑，那是云玩家建议。</li>
<li>买 NVLink 桥记得选 <strong>3-slot 版本</strong>（3090 三槽厚，2-slot 桥装不上）。</li>
</ul>
]]></description><link>https://lcz.me/post/14826</link><guid isPermaLink="true">https://lcz.me/post/14826</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sat, 29 Aug 2026 16:13:55 GMT</pubDate></item><item><title><![CDATA[Reply to 二张3090通过nvlink跑大模型，有人尝试过吗？ on Sat, 29 Aug 2026 14:41:36 GMT]]></title><description><![CDATA[<p dir="auto">两张nvlink我跑过，用的club-3090的vllm docker. 之前发过一片朋友圈如下：</p>
<p dir="auto">双卡3090+nvlink，模型Qwen3.6-27B-autoround-int4。 kv cache fp8_e5m2, 上下文长度 262144 。采用 <a href="https://github.com/noonghunna/club-3090" rel="nofollow ugc">club-3090</a> 的vllm运行参数和测试脚本 <a href="http://soak-test.sh" rel="nofollow ugc">soak-test.sh</a>， p50_decode_tps：61.34；p95_ttft_ms：4864 。<br />
<img src="https://upload.lcz.me/uploads/e47a592e-8d9c-45b8-b111-b02c22386f19.jpeg" alt="8792b304-2ecb-4aa8-8080-5ba46435e68a-image.jpeg" class=" img-fluid img-markdown" /><br />
<img src="https://upload.lcz.me/uploads/1f6db630-a957-4962-ac78-5dd00df1aab8.jpeg" alt="b34b6252-0370-43b0-8964-8dfa3314ae59-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">不过，最近用了 <a href="https://github.com/syv-ai/qwen38-27b-rtx3090" rel="nofollow ugc">syv-ai/qwen38-27b-rtx3090</a> 用一张3090也跑出了不错的速度（见我<a href="https://lcz.me/topic/1381/3090-24g-%E5%8D%95%E5%8D%A1%E9%83%A8%E7%BD%B2-qwen3.8-27b/6">另一篇帖子</a>。用的int4量化，上下文减到160k， 不支持并发。 不过一个人用的话够了）。</p>
<p dir="auto">我觉得双卡3090跑qwen3.8-27b,最好的场景，应该是多人/Agent并发。 用SGLang的redix tree缓存，加上双卡nvlink高带宽, 再配合HiCache应该有不错的效果。等我有时间和需求时搞一下。</p>
]]></description><link>https://lcz.me/post/14809</link><guid isPermaLink="true">https://lcz.me/post/14809</guid><dc:creator><![CDATA[davidwei0826]]></dc:creator><pubDate>Sat, 29 Aug 2026 14:41:36 GMT</pubDate></item><item><title><![CDATA[Reply to 二张3090通过nvlink跑大模型，有人尝试过吗？ on Sat, 29 Aug 2026 14:12:27 GMT]]></title><description><![CDATA[<p dir="auto">x99,ddr3-32g 2080ti22g+11g+nvlink, Qwen3.8 27B Q4_K_P、128K Q8 KV、embedded MTP<br />
已启用 llama.cpp 的 NVLink P2P 直接交换模式。</p>
<p dir="auto">验证结果：</p>
<ul>
<li>
<p dir="auto">MTP 服务已重启，PID：114030</p>
</li>
<li>
<p dir="auto">进程环境：GGML_CUDA_P2P=1</p>
</li>
<li>
<p dir="auto">GPU0<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2194.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--left_right_arrow" style="height:23px;width:auto;vertical-align:middle" title="↔" alt="↔" />GPU1 P2P 读写：均为 OK</p>
</li>
<li>
<p dir="auto">双卡显存占用：</p>
<ul>
<li>GPU0：7750 MiB</li>
<li>GPU1：14524 MiB</li>
</ul>
</li>
<li>
<p dir="auto">Q8 KV、思考模式、MTP 推测解码及 1,2 分层比例保持不变</p>
</li>
<li>
<p dir="auto">实际推理请求成功，约 38.7 token/s</p>
</li>
</ul>
]]></description><link>https://lcz.me/post/14801</link><guid isPermaLink="true">https://lcz.me/post/14801</guid><dc:creator><![CDATA[passss]]></dc:creator><pubDate>Sat, 29 Aug 2026 14:12:27 GMT</pubDate></item><item><title><![CDATA[Reply to 二张3090通过nvlink跑大模型，有人尝试过吗？ on Sat, 29 Aug 2026 13:56:52 GMT]]></title><description><![CDATA[<p dir="auto">我正好也是双 3090 NVLink，看我的帖子：<a href="https://lcz.me/topic/466/%E5%8F%8C3090-ollama-%E5%8A%A0%E8%BD%BD-q8-%E8%A7%86%E8%A7%89%E6%A8%A1%E5%9E%8B%E7%9E%AC%E9%97%B4%E6%96%AD%E7%94%B5%E9%87%8D%E5%90%AF-%E6%B1%82%E8%80%81%E5%93%A5%E4%BB%AC%E6%8A%8A%E8%84%89">https://lcz.me/topic/466/双3090-ollama-加载-q8-视觉模型瞬间断电重启-求老哥们把脉</a></p>
<p dir="auto">说下真实体验，我这边双 3090+NVLink，功率墙锁定260W，跑qwen3.8-27b-fp8模型</p>
<ul>
<li>llama.cpp：27 tok/s</li>
<li>SGLang：~39 tok/s</li>
<li>vLLM：～10 tok/s</li>
</ul>
]]></description><link>https://lcz.me/post/14799</link><guid isPermaLink="true">https://lcz.me/post/14799</guid><dc:creator><![CDATA[Leon Y]]></dc:creator><pubDate>Sat, 29 Aug 2026 13:56:52 GMT</pubDate></item><item><title><![CDATA[Reply to 二张3090通过nvlink跑大模型，有人尝试过吗？ on Sat, 29 Aug 2026 13:51:57 GMT]]></title><description><![CDATA[<p dir="auto">4090 +3090 最优解 （次优，4090+7900xtx） (最次2*3090 能用不好用。使用场景受限，但合理配置+折腾，也能爽玩。我准备上第二个3090 )<br />
为什么？<br />
2个4090 不合适太贵。</p>
]]></description><link>https://lcz.me/post/14797</link><guid isPermaLink="true">https://lcz.me/post/14797</guid><dc:creator><![CDATA[wwcd2016]]></dc:creator><pubDate>Sat, 29 Aug 2026 13:51:57 GMT</pubDate></item></channel></rss>