想请问各位大神关于VRAM共用的问题,comfyUI + llamacpp 想共用一张3090
-
24G VRAM 同时跑 ComfyUI(生图)和 llama.cpp(Qwen 36B)确实不太现实。Qwen 3.6-27B 即使 Q4_K_M 量化也要约 18G VRAM,ComfyUI 跑 Flux/SDXL 也要 8-12G,加起来远超 24G。
几个实际方案(按推荐顺序):
-
分时复用(最实际):不同时运行,哪个在用就加载哪个。ComfyUI 关掉后再开 llama.cpp,或者反过来。现代 GPU 加载模型很快(10-20 秒),切换成本可以接受
-
llama.cpp CPU offload:如果一定要同时运行,让 llama.cpp 只 offload 少量层到 GPU(--ngl 16,约占 4-5G),大部分推理走 CPU。缺点是推理速度会慢 5-10 倍,但至少可以同时用
-
ComfyUI --lowvram 模式:能大幅降低 VRAM 占用到 4-6G,但生图速度会慢 2-3 倍。配合方案 2 可以同时跑,但两边都慢
-
vLLM / Ollama 限制 GPU 内存:用
--gpu-memory-utilization 0.5或OLLAMA_NUM_PARALLEL=1限制 LLM 只用一半 VRAM,另一半留给 ComfyUI。代价是上下文长度受限 -
最佳长期方案:再加一张卡。预算有限的话,收一张二手 3060 12G(约 1000 元)专门跑 llama.cpp / vLLM,3090 专注 ComfyUI。两张卡分工明确,互不干扰,是最省心的方案
总结:一张 3090 同时跑两个重型任务不现实。分时复用最实际,两张卡最省心。可以先从方案 1 或 2 开始,等体验到位后再考虑加卡。
-
-
27b模型载入就没啥空间了,不可能同时跑。FLux LTX这些模型经常十几个G,不可能同时运行。让Hermes自己切换就好了。它知道怎么管理,自己理解。但是你的Hermes最好是在线模型,如果用本地的,模型卸载了,你的hermes就嗝屁了。或者你让Hermes写一个脚本,自动切换。
-
我就是7900xtx 单卡 一边跑LLM和VOXCPM时没障碍。但只要你要跑comfyui时Hermes就会提示要终止llm或者voxcpm。我现在也考虑在弄一张3090主要comfyui在Linux上跑起来还是不太协调
-
@botio-kuo 你直接告诉 hermes 。我需要配置一个辅助的deepseek-falsh模型。apikey是****。 让他自己改 config.yaml 。
当然,你先的备份好
当然,你干脆把config.yaml 贴给网页 的deepseek 。让他把deppsek改为辅助模型。 它可能考虑比你 的本地模型更加细致。
总之都能改好,
万一没弄好。备份 的覆盖一下,重启,再来。直到搞好。
我的大概也是这么搞好的。
全程你只管测试