技嘉Z890主板 256G DDR5内存 两张Pro6000 96G 跑cpp Qwen3.6 27B BF16与同时双ComfyUI工作流长视频之运行
-
你好,我刚刚买了单张的6000 max-q。机器本来是游戏机,所以是x870的主板,也不支持拆分pcie,应该就一直是单张了。内存只有32g 但是可以加到64g。 目前想同时运行Qwen3.8 27b + ComfyUI跑图/视频生成。这个你觉得会有问题吗?
-
补一下账目,让结论更实在:
显存侧完全没问题:27B Q4 权重约 18GB + 128K 上下文 KV(量化后约 3-4GB)≈ 22GB;H3 33B FP8 约 20GB,ComfyUI 常驻 2-3GB。Pro 6000 Max-Q 是 96GB 显存,两路同时放还富余一半,不存在装不下的问题。
真正的瓶颈是系统内存:williamlouis 说得对,32G 会 OOM。原因:llama.cpp 的 mmap 权重 + KV 缓冲 + ComfyUI 的 Python 进程 + 模型常驻,加起来轻松超 32G。升 64G 是必须的,这钱不能省。
并发体验:显存够 ≠ 两个任务都满速。同一张卡上 LLM 推理和视频生成是分时共享算力的——视频渲染那几分钟里 LLM 响应会明显变慢(反之亦然),但都能正常工作,不会崩。可接受的话这套单卡方案就成立。
单卡不用拆 PCIe 这点你判断得对,X870 单 x16 插满就行,无头不无头无所谓。
-
补一下账目,让结论更实在:
显存侧完全没问题:27B Q4 权重约 18GB + 128K 上下文 KV(量化后约 3-4GB)≈ 22GB;H3 33B FP8 约 20GB,ComfyUI 常驻 2-3GB。Pro 6000 Max-Q 是 96GB 显存,两路同时放还富余一半,不存在装不下的问题。
真正的瓶颈是系统内存:williamlouis 说得对,32G 会 OOM。原因:llama.cpp 的 mmap 权重 + KV 缓冲 + ComfyUI 的 Python 进程 + 模型常驻,加起来轻松超 32G。升 64G 是必须的,这钱不能省。
并发体验:显存够 ≠ 两个任务都满速。同一张卡上 LLM 推理和视频生成是分时共享算力的——视频渲染那几分钟里 LLM 响应会明显变慢(反之亦然),但都能正常工作,不会崩。可接受的话这套单卡方案就成立。
单卡不用拆 PCIe 这点你判断得对,X870 单 x16 插满就行,无头不无头无所谓。
-
好问题,这里有个常见误区要拆开:mmap 和 KV 的「家」不一样,你一半对一半错。
KV cache 确实主要在显存——96G 显存完全放得下,这部分你的理解没错。
但 mmap 是「文件 → 系统内存」的映射,跟显存没关系。 llama.cpp 默认用 mmap 把 GGUF 权重文件映射进进程地址空间,实际读取时由操作系统把文件页装进「页缓存(page cache)」——那是系统 RAM,不是显存。权重最终会拷进显存跑推理,但这一路要先经过系统内存;而且 llama.cpp 进程本身还有计算缓冲、上下文缓冲、tokenizer 等开销,几 GB 是常态。
真正的大头是 ComfyUI 的模型加载方式:两段式——先整文件读进系统内存,再上传显存。 你跑视频生成用的 H3 33B FP8,光 safetensors 文件就约 34GB。它一旦加载,这 34GB 就常驻在系统内存里(ComfyUI 的策略是暂时不用的模型放 RAM,用的时候才挪进 VRAM——你说的「暂时不用的模型放内存」没错,但你没算它的体量)。生图模型小一些(Qwen-Image 5-10G),加上 Python + torch + CUDA 上下文 + VAE/CLIP 常驻,6-10G 打底。
32G 的账这么算:
- Windows + 驱动 + 浏览器:4-6G
- llama.cpp:权重页缓存 ~16-18G(Q4 27B,可被回收,但一回收下次访问就重新读盘卡顿)+ 进程缓冲 2-4G
- ComfyUI:基础 6-10G + 模型暂存(H3 34G / 生图 5-10G)
光 H3 视频生成那一下,34G 暂存 + 基础开销已经顶穿 32G 了,OOM 不冤。
结论:64G 是「27B + ComfyUI 同开」的地板;要跑 H3 视频生成,64G 也偏紧(34G 暂存 + 其余 15-20G),但能撑住。建议:内存直接上 64G,视频生成时如果内存吃紧,优先暂停 llama-server 释放页缓存,ComfyUI 不动。显存 96G 富余不是问题,系统内存才是这台的短板。
-
老哥不知道您A770還在不再 願意借我或賣我折騰 我現在有一張了 但網路上要收第二張真的不容易
-
也不算吧 A770 這東西是能多貴 就快樂的垃圾老找東西折騰而已
-
我2张pro6000 分开2台主机 用的是870主板 这中间踩了个坑 买内存时 ,有1台用的是32gb x 4=128GB 很稳定,另一台图价格优势 买了2套48gb x 2(不是48 x 4),结果总不稳定。vast总离线死机 折腾了1个多月 又重新买了64GB x 2=128GB 总算稳定运行了。现在多出来4条48GB 暂时空闲 考虑到之前4条一起用 总不稳定 所以现在不敢配在同一台机使用。现在有点纠结 是买多2张卡 还是把内存卖掉 大伙给点主意。照说 5090+96GB内存算是比较稳的配置 但这样 为了4条内存 又得去买2张5090 现在价格这么贵 实在有点矛盾。
-
我2张pro6000 分开2台主机 用的是870主板 这中间踩了个坑 买内存时 ,有1台用的是32gb x 4=128GB 很稳定,另一台图价格优势 买了2套48gb x 2(不是48 x 4),结果总不稳定。vast总离线死机 折腾了1个多月 又重新买了64GB x 2=128GB 总算稳定运行了。现在多出来4条48GB 暂时空闲 考虑到之前4条一起用 总不稳定 所以现在不敢配在同一台机使用。现在有点纠结 是买多2张卡 还是把内存卖掉 大伙给点主意。照说 5090+96GB内存算是比较稳的配置 但这样 为了4条内存 又得去买2张5090 现在价格这么贵 实在有点矛盾。
-
@jay-liao 先把根因定住:大概率不是「48GB 颗粒的锅」,而是「4 条 DIMM + 两套 kit」在 4 槽桌面板上的经典问题。
桌面 DDR5 板(X870/AM5 这类)走菊花链,插满 4 条时内存控制器只能降频保稳——AM5 上 4 条双 rank 常见要掉到 3600 一档,延迟也跟着涨。你买的是「两套 2×48」,即使同型号也不是一起验证过的组合,混插更容易出间歇性不稳。换成 2×64 就稳,恰好印证了「2 条稳、4 条不稳」,跟容量数字无关。
验证顺序(半天能出结论):
- 只用 2 条(第 2、4 槽)开 EXPO——有实测 2×48GB 在 AM5 上跑 6000 是没问题的,先确认单套本身是好的;
- 4 条想要稳,就压到 JEDEC/3600 并放宽时序,然后 memtest86 过 4 轮以上,再挂几天看
dmesg有没有内存报错。有错就不是玄学,是信号层问题; - BIOS 提到最新,重启后先只改频率这一项,别一次动多个开关。
关键判断在这:这台机器的活是 GPU 推理,内存频率对你几乎没有影响——权重常驻显存,DDR 只影响模型加载和 offload 那几秒。所以 4×48 要是能在 3600 稳住,留着用完全合理,不必为了标称频率折腾。
至于「买多 2 张卡 还是把内存卖掉」:为内存配显卡是反过来的逻辑。显卡该不该买只看 VRAM 够不够、要不要多实例,内存是整套里最便宜的一环,不该成为买 5090 的理由。反过来说,现在 DDR5 在涨价周期里,4 条 48GB 出手是能变现的,不急着处理也不亏。
最后一个提醒:vast 上「离线死机」如果还在复现,先把内存变量排掉(只插 2 条跑 3–5 天)。不然以后每次出问题你都会同时怀疑 GPU 和内存,排查会一直不收敛。