<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF]]></title><description><![CDATA[<p dir="auto">在等待QWEN 3.8的时候,还是想折腾一下：<br />
显卡刚刚加一张，电源1200W，主机是MATX的Z390，已经没有位置插显卡了，刷新BIOS后支持X8/X8拆分， 用PCIE延长线将第二个PCIE延长到机箱后面测试。<br />
模型：Qwen3.6-27B-Q6_K.gguf  带MTP（22G，修改版，MTP头是Q8_0）<br />
折腾了一下，参考来源 ：<a href="https://smcleod.net/2026/02/patching-nvidias-driver-and-vllm-to-enable-p2p-on-consumer-gpus/" rel="nofollow ugc">https://smcleod.net/2026/02/patching-nvidias-driver-and-vllm-to-enable-p2p-on-consumer-gpus/</a><br />
P2P驱动已就位：<br />
<img src="https://upload.lcz.me/uploads/12b1abee-7014-4751-9107-8d2466a06041.jpeg" alt="3ce9f842-76db-4218-b954-ae43f3b352f8-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">链接速度太感人了，PCIE 3.0 X8只有8GT/S：<br />
<img src="https://upload.lcz.me/uploads/559ccb7a-0670-4b0d-9fcd-2fc5e0b915f9.jpeg" alt="ad55f815-87d9-4e70-b768-f3ec811466d5-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">vllm始终不理想也不习惯,sglang也未测试。那就还是只有llama.cpp，<br />
直接跑是跑不起来的，有几个错误，意思nccl不兼容。让deepseek调研之后，发现CSDN一个文章（<a href="https://blog.csdn.net/weixin_42431643/article/details/163023731" rel="nofollow ugc">https://blog.csdn.net/weixin_42431643/article/details/163023731</a> ），把llama.cpp丢到镜像里面来跑本机GGUF。按它的方法自建了镜像，启动容器，果然不报错了，推理的时候两张显卡都能高负载运行。</p>
<p dir="auto">以下工程是让它写超级玛丽的HTML5游戏。<br />
<img src="https://upload.lcz.me/uploads/0ee1046c-1633-481e-b9dd-9c61ecf2d9e2.jpeg" alt="2c5604a0-1932-4c38-8235-311942640830-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/efb4ffa2-eb73-4c07-9bca-e8fe5f731f98.jpeg" alt="872bf340-9b84-43e3-a4b6-ed02a7727ceb-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">220K 双F16 上下文，显卡还各余了3-4G，有点浪费了。<br />
<img src="https://upload.lcz.me/uploads/ab9cfe3f-96cc-4982-8bc4-32c8cdbd12a0.jpeg" alt="caa57b7b-517d-42da-8b3b-6198eff05369-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">中途做到一半停住了，说没有多模态，让它跳过也不跳，弹出网页截了一下图，游戏还是挺多问题的。<br />
<img src="https://upload.lcz.me/uploads/830fd526-b4fc-4416-9a50-f50fab6d6826.jpeg" alt="b77a17a8-05b9-4a08-a603-3eab5bbdf090-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">正常解码速度，50-70K (代码会快一点） prefill不理想，35B A3B用buun 分支，基本都是1500++。 这个是官方最新版llama.cpp, 偶尔会有几十t/s的prefill.<br />
<img src="https://upload.lcz.me/uploads/defdf736-08ae-42d1-ad9a-a419c8d7798b.jpeg" alt="a55f2390-992f-4301-9bdd-1e5e6249a49b-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/1099</link><generator>RSS for Node</generator><lastBuildDate>Thu, 10 Sep 2026 00:43:28 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1099.rss" rel="self" type="application/rss+xml"/><pubDate>Thu, 13 Aug 2026 07:43:08 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Thu, 20 Aug 2026 05:42:57 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/laihzang619" aria-label="Profile: laihzang619">@<bdi>laihzang619</bdi></a> 那看来我的P2P还是生效了，管它呢，现在就这样跑着 。<br />
一星期前的帖子了，现在自己回来看都恍如隔世。<br />
<img src="https://upload.lcz.me/uploads/22d513cd-aa79-40c8-ac67-a294d363b638.jpeg" alt="60219a8c-df0e-4029-bcc1-8f86bbdfb03d-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/16a39702-f990-4590-9dd2-75f5b2312a08.jpeg" alt="5c388df5-7a04-4d46-bb76-42af8d2c226f-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/13042</link><guid isPermaLink="true">https://lcz.me/post/13042</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Thu, 20 Aug 2026 05:42:57 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Thu, 20 Aug 2026 05:33:51 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/applejuice" aria-label="Profile: applejuice">@<bdi>applejuice</bdi></a> <img src="https://upload.lcz.me/uploads/1ccdb26b-088b-4181-9787-3ef9c1fdb1b0.jpeg" alt="a644f111-4daf-4ae6-b326-27834a671fb2-image.jpeg" class=" img-fluid img-markdown" /> 是这样测试吗</p>
]]></description><link>https://lcz.me/post/13041</link><guid isPermaLink="true">https://lcz.me/post/13041</guid><dc:creator><![CDATA[laihzang619]]></dc:creator><pubDate>Thu, 20 Aug 2026 05:33:51 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Mon, 17 Aug 2026 11:59:10 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/laihzang619" aria-label="Profile: laihzang619">@<bdi>laihzang619</bdi></a> prefill 呢？</p>
]]></description><link>https://lcz.me/post/12517</link><guid isPermaLink="true">https://lcz.me/post/12517</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Mon, 17 Aug 2026 11:59:10 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Mon, 17 Aug 2026 11:37:51 GMT]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/741f2bc7-9c3d-4f6a-a738-d0ebb59dca17.jpeg" alt="24a2bfb1-1864-47d0-ab76-30c2d4a364cc-image.jpeg" class=" img-fluid img-markdown" /><br />
<img src="https://upload.lcz.me/uploads/a9b9815b-f88c-4707-9f8b-e376b0873168.jpeg" alt="3161be31-1919-4aaf-9fdc-1cc1d3ee2879-image.jpeg" class=" img-fluid img-markdown" />  pcie 4.0 16X 全速   没有nvlink的基准</p>
]]></description><link>https://lcz.me/post/12515</link><guid isPermaLink="true">https://lcz.me/post/12515</guid><dc:creator><![CDATA[laihzang619]]></dc:creator><pubDate>Mon, 17 Aug 2026 11:37:51 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Mon, 17 Aug 2026 11:29:45 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/rock-shi" aria-label="Profile: rock-shi">@<bdi>rock-shi</bdi></a> 3090 的nvlink 1000元</p>
<p dir="auto">也没有50%<br />
prefill 最多30%<br />
decode 差不了多少</p>
]]></description><link>https://lcz.me/post/12514</link><guid isPermaLink="true">https://lcz.me/post/12514</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Mon, 17 Aug 2026 11:29:45 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Mon, 17 Aug 2026 09:37:16 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/stxpnet" aria-label="Profile: stxpnet">@<bdi>stxpnet</bdi></a> 我也是一条缝，用2-slot的桥就行，4cm的。你显卡应该是插的1、3槽吧，正正好。300块钱把3090的性能发挥到极致，预计能给你提高1.5倍左右速度</p>
]]></description><link>https://lcz.me/post/12499</link><guid isPermaLink="true">https://lcz.me/post/12499</guid><dc:creator><![CDATA[rock shi]]></dc:creator><pubDate>Mon, 17 Aug 2026 09:37:16 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Mon, 17 Aug 2026 09:34:12 GMT]]></title><description><![CDATA[<p dir="auto">必须搞个nvlin啊，我正在弄2*2080 22g+nvlink，据说也能用</p>
]]></description><link>https://lcz.me/post/12498</link><guid isPermaLink="true">https://lcz.me/post/12498</guid><dc:creator><![CDATA[rock shi]]></dc:creator><pubDate>Mon, 17 Aug 2026 09:34:12 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Mon, 17 Aug 2026 08:35:47 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/stxpnet" aria-label="Profile: stxpnet">@<bdi>stxpnet</bdi></a><br />
ddr4 跑大模型 好像有点慢<br />
我上次好像看过b站，是我不能接受的速度<br />
ddr5 64gb = 1.5万<br />
要插满都不止 5万块了  只有勉强可用的速度<br />
如果这样的话倒不如 上dgx spark x2</p>
<p dir="auto">dgx spark 网友分享 5万元 可以跑2000 prefill 80 decode<br />
我还故意去查了一下 我这里dgx spark 一架4万...</p>
]]></description><link>https://lcz.me/post/12487</link><guid isPermaLink="true">https://lcz.me/post/12487</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Mon, 17 Aug 2026 08:35:47 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Mon, 17 Aug 2026 08:08:56 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/applejuice" aria-label="Profile: applejuice">@<bdi>applejuice</bdi></a> 嗯，这个我知道的，大概就是让它绑定一个CPU，128G内存专门用来跑MOE模型，想玩一下QWEN 122B A10B或者是LAGUNA S2.1，这样比较省电啊，不用搞两台机，记忆，RAG啥的挂另一颗 CPU上面。</p>
<p dir="auto">我之前还试过可以用纯CPU跑35B A3B 或者QWEN CODER NEXT，有15-20T/S(当时想法是只用来写程序，写代码） 。 但是现在3.8都出来了，QWEN CODER NEXT有点跟不上时代了。</p>
]]></description><link>https://lcz.me/post/12486</link><guid isPermaLink="true">https://lcz.me/post/12486</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Mon, 17 Aug 2026 08:08:56 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Mon, 17 Aug 2026 07:58:53 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/stxpnet" aria-label="Profile: stxpnet">@<bdi>stxpnet</bdi></a><br />
不要搞双路<br />
除非用nvlink<br />
如果pcie 插不在同cpu 会 导致跨QPI, 速度比较慢<br />
我的x99 就是不能插在同一个cpu通道 导致更慢了</p>
]]></description><link>https://lcz.me/post/12485</link><guid isPermaLink="true">https://lcz.me/post/12485</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Mon, 17 Aug 2026 07:58:53 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Mon, 17 Aug 2026 07:53:46 GMT]]></title><description><![CDATA[<p dir="auto">嗯，一是我这主板放不下两个PCIE之间只有一条缝了，没有水冷搞不掂，一换主板我又想上超微X11或X12 双路256G内存,CPU和主板又是大头，所以想想还是算了，目前就还是想试试那个破解P2P，晚上睡觉前让它自己调研写计划看能实现不。 <a class="plugin-mentions-user plugin-mentions-a" href="/user/applejuice" aria-label="Profile: applejuice">@<bdi>applejuice</bdi></a></p>
]]></description><link>https://lcz.me/post/12484</link><guid isPermaLink="true">https://lcz.me/post/12484</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Mon, 17 Aug 2026 07:53:46 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Fri, 14 Aug 2026 14:04:26 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/stxpnet" aria-label="Profile: stxpnet">@<bdi>stxpnet</bdi></a> 没有买nvlink 没搞微调的话就别搞了 1000元 只换来20% prefill</p>
]]></description><link>https://lcz.me/post/12208</link><guid isPermaLink="true">https://lcz.me/post/12208</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Fri, 14 Aug 2026 14:04:26 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Fri, 14 Aug 2026 01:26:40 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/stxpnet" aria-label="Profile: stxpnet">@<bdi>stxpnet</bdi></a> 但是只有27b稠密才能稳定代理hermes啊，要是qwen3.8能替代dp就好了，dp17号大涨价直接不敢用了</p>
]]></description><link>https://lcz.me/post/12101</link><guid isPermaLink="true">https://lcz.me/post/12101</guid><dc:creator><![CDATA[rock shi]]></dc:creator><pubDate>Fri, 14 Aug 2026 01:26:40 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Fri, 14 Aug 2026 01:24:18 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/stxpnet" aria-label="Profile: stxpnet">@<bdi>stxpnet</bdi></a> 几乎就是极限了，在往上只有加nvlink了，prefill提高也不多</p>
]]></description><link>https://lcz.me/post/12100</link><guid isPermaLink="true">https://lcz.me/post/12100</guid><dc:creator><![CDATA[rock shi]]></dc:creator><pubDate>Fri, 14 Aug 2026 01:24:18 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Thu, 13 Aug 2026 08:49:57 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a>  没有nvlink ，跑35B A3B也就增加了上下文，质量没有提升,要跑稠密模型太折腾了。</p>
]]></description><link>https://lcz.me/post/12030</link><guid isPermaLink="true">https://lcz.me/post/12030</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Thu, 13 Aug 2026 08:49:57 GMT</pubDate></item><item><title><![CDATA[Reply to 3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF on Thu, 13 Aug 2026 08:30:37 GMT]]></title><description><![CDATA[<p dir="auto">49年加入国军？现在都等3.8了，不折腾了。</p>
]]></description><link>https://lcz.me/post/12024</link><guid isPermaLink="true">https://lcz.me/post/12024</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Thu, 13 Aug 2026 08:30:37 GMT</pubDate></item></channel></rss>