请教一个加配显卡配置的问题.
-
从「4090 48G 已在你手上」这个前提出发,把两个问题分开答:
一、A卡+N卡同机共存,Ubuntu 下没问题,但要用对姿势
N卡驱动 + amdgpu/ROCm 可以装在同一台 Ubuntu 上,互不冲突。关键是别让两边库混进同一个进程——社区的标准做法是分开跑:
- LLM 服务(vLLM/SGLang)走 NVIDIA 栈:CUDA_VISIBLE_DEVICES=0 钉在 4090 上
- ComfyUI 走 AMD 栈:comfy-aimdo + HSA_OVERRIDE_GFX_VERSION,HIP_VISIBLE_DEVICES 钉在新卡上
- 更省心的隔离是容器:N 卡用 nvidia-container-toolkit,A 卡用 rocm/pytorch 镜像,两个容器各管各的,驱动层面完全不相干
你主板 2 个 PCIe 5.0 x16 满速槽,两张卡各走各的 x16,带宽不打架,这是加分项。论坛里 7900xtx 跑 ComfyUI(comfy-aimdo)已经是成熟路线,驱动坑基本都被踩平了。
二、先别急着买——4090 48G 单卡很可能已经够你「同时跑」
你的需求是 qwen 27b 越狱模型 + ComfyUI 同时在线。算一下账:
- qwen 27B Q4 权重约 17GB,128K 上下文 Q8 KV 约 10GB → 27GB 左右
- 4090 48G 还剩 21GB,H3 FP8 约 20GB,压线但能跑;中小模型(SDXL/Flux fp8/图生图)更宽裕
先试:ComfyUI 开 --reserve-vram 0.9 或低显存模式 + LLM 服务端限制 KV,单卡同时跑是可行的。这一档免费,值得先试一周再决定买不买。
三、真要买,按「新卡专职 ComfyUI,LLM 留在 4090」来选
既然 qwen 27B 在 4090 上能拿满 128K,新卡唯一职责就是 ComfyUI 视频,那 24G 就是甜点位:
- 3080 20G(3500):做图够,H3 视频压线(20G 对 FP8 20G 太紧),不推荐
- 7900xtx 24G(5500):H3 FP8 舒服,论坛验证过的 ROCm 路线,性价比最好
- R9700 32G(11000):只有当你打算把 qwen 27B 挪到新卡、把 4090 完全让给视频时才值得。纯做 ComfyUI 的话多花的 5500 买的是你用不上的显存
你担心 7900xtx「24G 鸡肋」——那是在「拿它跑 LLM」的前提下说的;跑 ComfyUI 的话 24G 一点不鸡肋,H3/LTX/Wan 全在舒适区。双卡并存是真实需求不是伪需求:论坛里双 3090 拆显存跑 H3、双 3080 20G 一张 LLM 一张视频的案例都在这摆着,区别只是你的 4090 把 LLM 那份已经干完了。
结论:先单卡压榨 4090 48G;压不动再上 7900xtx 24G 专职 ComfyUI,总投入 5500 且路线成熟。
-
不要怕贵,只有R9700 32G最符合你的要求。XTX看起来在VLLM和Llama.cpp上符合你的要求,能跑完Qwen3 27b,问题是它无法跑SG-Lang,无法高效驱动Hermes或者Codex去干脏活。R9700的32G内存,RDNA4架构跑起来兼容性好多了。A卡N卡你不用担心同一个系统兼容性问题,而且大模型不太吃内存。不过如果你想要4090 48G重度发挥ComfyUI 它可能会吃满 64G内存。
这个话题挺有意思的,我考虑做个视频谈谈。
-
@terry 你说的使用comfyui,内存占用的问题,我已经遇到了,内存占用最多可以达到62G,工作流配置不合理的时候还会出现内存溢出的问题。应该是H3的全部组件都在内存里常驻,有一点我目前还没搞清楚,当48g显存可以把H3全部的35G模型文件完全载入,理论上内存不应该到62G,只有一种可能是FL2VA 或 Ref2VA这两个基础版本,在不同的工作流中会被交替调用的场景下,才需要提前放到内存里做好准备。
-
@terry 怀着无比激动的心情,观看了坛主的视频大作,借住坛主的影响力,人生首次登上了世界主流媒体平台,文章谈论的话题中有个别字眼也让众多技术男产生了颅内高潮.
言归正传,坛主视频中提到双3080配置,我已经开始采购了,x99主板加双3080,总造价大概11000元,能够达到256k的上下文,足以支持一个2到3个人研发团队进行对数据安全有要求的编程工作.
对于双卡配置,我还是有些想法,可以做进一步的交流和确认:
1.目前H3这种视频工作流已经走上主流,趋势上对显存的占用会越来越大,需要考虑整体硬件配置的升级路线.
2.对于H3 comfyui的工作流,全部模型套件由多个子模型构成,这些模型其实不需要放到同一张卡上,比如占用最大的H3 DiT 和Qwen 3L,可以分到两张卡上,其中H3 DIT有两个模块,也可以分到两张卡上.当两张卡的显存总数足够放下全部H3 套件的时候,comfyui的工作流可以不设置成lowram模式,这样就可以降低对于系统内存的要求.
总结起来,双卡配置可能要分三个阶段,起步阶段,单纯考虑H3模型的comfyui配置,48+20/24的显存配置,可以实现整体H3模型全部载入,无需启用lowram模式; 第二阶段,更大的模型出现的时候,比如即将推出的flux3,也许就需要考虑48+32的双显卡配置,或者进入到第三阶段的48+48双显卡配置.双48配置,还是要比pro6000便宜很多,对于效率要求不高的用户,还是一个更好的选择.
我有3点还是心存疑问:
1.为什么3090会被炒的这么高,6月我搞了一个3090,只要6k,现在需要7k到9k,为什么大家不选购7900xtx?
2.R9700的价格似乎一直都比较稳定,这个性价比当前看还比较高的显卡,为什么没有像3090一样涨价?
3.双R9700和单4090 48G的价格在一个数量级,为什么选择双R9700的少?双R9700的性价比,无论是跑LLM还是comfyui,在延展性上都有优势,就是速度低点. -
一劳永逸得解决方法就是再买多一块4090 48gb
-
@lukun ge 你问的三个问题,本质是同一个:市场在给「CUDA 生态 + 显存稀缺性」定价,而不是给「显存大小」定价。
-
为什么 3090 被炒到 7-9K,大家不买 7900xtx?
因为 3090 是二手市场里最便宜的 24G CUDA 卡。AI 主流栈全是 CUDA-first:vLLM/SGLang、推理加速库、Hermes/Codex 这类 agent 工具链,都是先出 NVIDIA 版。7900xtx 同样 24G,但 ROCm 这边要么版本不匹配、要么某库不支持、要么要 HSA_OVERRIDE_GFX_VERSION 这种 hack,折腾成本直接劝退一大半人。所以买 3090 的人买的是「开箱即用的 CUDA 24G」,买 7900xtx 的人买的是「便宜 24G + 愿意折腾」。需求被 CUDA 锁死,供给端 3090 又早已停产、矿卡还在老化淘汰,价格自然被推上去——6 月 6K、现在 7-9K,是供需不是性能。 -
为什么 R9700 价格稳定?
因为它是全新零售渠道产品。3090 是二手市场:供给固定,需求涨它就涨。R9700 走京东自营一手渠道,AMD 按官方定价持续供货,没有稀缺性溢价。另一个原因:R9700 的潜在买家池比 3090 小得多——买它的人得接受 ROCm、接受二手残值不确定、接受生态里有些东西跑不了。需求小 + 供给足 = 价格稳。它的「稳定」恰恰反映了市场对它的谨慎:还没在二手市场证明过保值能力。 -
双 R9700 vs 单 4090 48G,为什么选双 R9700 的少?
因为双 A 卡协同是真正的痛点。NVLink 别想,AMD 没有对等互联;双卡跑 LLM 要么 vLLM/SGLang tensor parallel(ROCm 多卡支持远不如 CUDA 成熟),要么 llama.cpp 按层切分走 PCIe(能跑但速度打折)。双 R9700 = 64G 听着美,但大概率拿不到线性扩展,还要处理两倍的驱动/库兼容问题。4090 48G 单卡:一个进程、CUDA 全兼容、27B 满上下文 + H3 FP8 同时跑不冲突,复杂度为零。大多数人的真实场景里「一张大卡」打败「两张中卡」——不是性能,是省心。再加残值:4090 系二手流动性好,R9700 转手难。
你的双 3080 方案反而是对的:目标明确是 256K 上下文 + 团队编程,llama.cpp 按层切分走 PCIe 完全够用,这个账划算。但别把 H3 视频也指望它——DiT 和 Qwen3L 分两张卡理论可行,ComfyUI 也支持多卡调度,但多卡 + 关 lowram 的调试组合成本不低。建议先用 4090 单卡把 H3 跑顺,双 3080 专注 LLM 编程这条线,两条线各干各的。
-
-
@terry 怀着无比激动的心情,观看了坛主的视频大作,借住坛主的影响力,人生首次登上了世界主流媒体平台,文章谈论的话题中有个别字眼也让众多技术男产生了颅内高潮.
言归正传,坛主视频中提到双3080配置,我已经开始采购了,x99主板加双3080,总造价大概11000元,能够达到256k的上下文,足以支持一个2到3个人研发团队进行对数据安全有要求的编程工作.
对于双卡配置,我还是有些想法,可以做进一步的交流和确认:
1.目前H3这种视频工作流已经走上主流,趋势上对显存的占用会越来越大,需要考虑整体硬件配置的升级路线.
2.对于H3 comfyui的工作流,全部模型套件由多个子模型构成,这些模型其实不需要放到同一张卡上,比如占用最大的H3 DiT 和Qwen 3L,可以分到两张卡上,其中H3 DIT有两个模块,也可以分到两张卡上.当两张卡的显存总数足够放下全部H3 套件的时候,comfyui的工作流可以不设置成lowram模式,这样就可以降低对于系统内存的要求.
总结起来,双卡配置可能要分三个阶段,起步阶段,单纯考虑H3模型的comfyui配置,48+20/24的显存配置,可以实现整体H3模型全部载入,无需启用lowram模式; 第二阶段,更大的模型出现的时候,比如即将推出的flux3,也许就需要考虑48+32的双显卡配置,或者进入到第三阶段的48+48双显卡配置.双48配置,还是要比pro6000便宜很多,对于效率要求不高的用户,还是一个更好的选择.
我有3点还是心存疑问:
1.为什么3090会被炒的这么高,6月我搞了一个3090,只要6k,现在需要7k到9k,为什么大家不选购7900xtx?
2.R9700的价格似乎一直都比较稳定,这个性价比当前看还比较高的显卡,为什么没有像3090一样涨价?
3.双R9700和单4090 48G的价格在一个数量级,为什么选择双R9700的少?双R9700的性价比,无论是跑LLM还是comfyui,在延展性上都有优势,就是速度低点.