3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF
-
在等待QWEN 3.8的时候,还是想折腾一下:
显卡刚刚加一张,电源1200W,主机是MATX的Z390,已经没有位置插显卡了,刷新BIOS后支持X8/X8拆分, 用PCIE延长线将第二个PCIE延长到机箱后面测试。
模型:Qwen3.6-27B-Q6_K.gguf 带MTP(22G,修改版,MTP头是Q8_0)
折腾了一下,参考来源 :https://smcleod.net/2026/02/patching-nvidias-driver-and-vllm-to-enable-p2p-on-consumer-gpus/
P2P驱动已就位:

链接速度太感人了,PCIE 3.0 X8只有8GT/S:

vllm始终不理想也不习惯,sglang也未测试。那就还是只有llama.cpp,
直接跑是跑不起来的,有几个错误,意思nccl不兼容。让deepseek调研之后,发现CSDN一个文章(https://blog.csdn.net/weixin_42431643/article/details/163023731 ),把llama.cpp丢到镜像里面来跑本机GGUF。按它的方法自建了镜像,启动容器,果然不报错了,推理的时候两张显卡都能高负载运行。以下工程是让它写超级玛丽的HTML5游戏。


220K 双F16 上下文,显卡还各余了3-4G,有点浪费了。

中途做到一半停住了,说没有多模态,让它跳过也不跳,弹出网页截了一下图,游戏还是挺多问题的。

正常解码速度,50-70K (代码会快一点) prefill不理想,35B A3B用buun 分支,基本都是1500++。 这个是官方最新版llama.cpp, 偶尔会有几十t/s的prefill.

-
,
T terry 锁定了此主题
-
,
T terry 解锁了此主题
-
,
T terry 固定了此主题
-
在等待QWEN 3.8的时候,还是想折腾一下:
显卡刚刚加一张,电源1200W,主机是MATX的Z390,已经没有位置插显卡了,刷新BIOS后支持X8/X8拆分, 用PCIE延长线将第二个PCIE延长到机箱后面测试。
模型:Qwen3.6-27B-Q6_K.gguf 带MTP(22G,修改版,MTP头是Q8_0)
折腾了一下,参考来源 :https://smcleod.net/2026/02/patching-nvidias-driver-and-vllm-to-enable-p2p-on-consumer-gpus/
P2P驱动已就位:

链接速度太感人了,PCIE 3.0 X8只有8GT/S:

vllm始终不理想也不习惯,sglang也未测试。那就还是只有llama.cpp,
直接跑是跑不起来的,有几个错误,意思nccl不兼容。让deepseek调研之后,发现CSDN一个文章(https://blog.csdn.net/weixin_42431643/article/details/163023731 ),把llama.cpp丢到镜像里面来跑本机GGUF。按它的方法自建了镜像,启动容器,果然不报错了,推理的时候两张显卡都能高负载运行。以下工程是让它写超级玛丽的HTML5游戏。


220K 双F16 上下文,显卡还各余了3-4G,有点浪费了。

中途做到一半停住了,说没有多模态,让它跳过也不跳,弹出网页截了一下图,游戏还是挺多问题的。

正常解码速度,50-70K (代码会快一点) prefill不理想,35B A3B用buun 分支,基本都是1500++。 这个是官方最新版llama.cpp, 偶尔会有几十t/s的prefill.

-
,系统 取消固定了此主题
-
@stxpnet 没有买nvlink 没搞微调的话就别搞了 1000元 只换来20% prefill
-
@stxpnet
不要搞双路
除非用nvlink
如果pcie 插不在同cpu 会 导致跨QPI, 速度比较慢
我的x99 就是不能插在同一个cpu通道 导致更慢了 -
@applejuice 嗯,这个我知道的,大概就是让它绑定一个CPU,128G内存专门用来跑MOE模型,想玩一下QWEN 122B A10B或者是LAGUNA S2.1,这样比较省电啊,不用搞两台机,记忆,RAG啥的挂另一颗 CPU上面。
我之前还试过可以用纯CPU跑35B A3B 或者QWEN CODER NEXT,有15-20T/S(当时想法是只用来写程序,写代码) 。 但是现在3.8都出来了,QWEN CODER NEXT有点跟不上时代了。
-
嗯,一是我这主板放不下两个PCIE之间只有一条缝了,没有水冷搞不掂,一换主板我又想上超微X11或X12 双路256G内存,CPU和主板又是大头,所以想想还是算了,目前就还是想试试那个破解P2P,晚上睡觉前让它自己调研写计划看能实现不。 @applejuice
-

pcie 4.0 16X 全速 没有nvlink的基准 -

pcie 4.0 16X 全速 没有nvlink的基准@laihzang619 prefill 呢?
-
此主題已被删除!
-
[[topic:post-is-deleted]]此主題已被删除!
-
@laihzang619 prefill 呢?
@applejuice
是这样测试吗 -

pcie 4.0 16X 全速 没有nvlink的基准

