请教各位大神,有两张5060ti 16g显卡
-
本地跑大模型,目前选择 qwen3.8 27b,也有文生图和文生视频的需求,不过比较小。不知道能不能实现合并,有什么注意事项么
目前主要是用hermes加deepseek V4flash llamacpp -
先说结论:能合并,27B 用双卡 tensor-split 是最舒服的姿势;文生图/视频按"哪个任务用哪张卡"来,别指望双卡合并跑一个视频模型。
LLM 部分(qwen3.8 27B)
- Q4_K_M 权重约 16G 出头,单张 16G 是贴脸跑——KV 只能开 8K 以内,长了就 spill 到内存。
- 双卡
-ts 0.5,0.5= 32G 总显存,权重摊两卡,64K~128K 的 q8 KV 都很宽裕;速度约等于两卡带宽之和:5060Ti 16G 是 448GB/s(128-bit GDDR7),双卡 ≈900GB/s,27B Q4 解码大概 50 t/s 上下,比单卡快一截。 - 不需要 NVLink。tensor-split 的权重切层只在启动时走一次 PCIe,之后每层只传激活,x8 就够用,两张卡各插一条 x8/x16 即可。
文生图/视频部分
- ComfyUI 是单卡工作流:16G 单卡跑 SDXL 轻松,FLUX.1-dev fp8 能跑(慢一点);文生视频 Wan 那类 14B 模型要 fp8 + offload 才勉强,出片慢。
- 双卡"合并"跑一个视频模型基本没戏(多卡分块插件复杂、收益低),认准单卡跑。
- 所以两件事分开时段跑最省心:平时双卡 tensor-split 跑 27B;要出图/出视频时,ComfyUI 指定一张卡(
--gpu 0/1),LLM 那边停掉或降-ngl让出带宽。
其他
- 电源:2×180W 显卡 + CPU,750W 够,800W 以上稳。
- 接 hermes:你已经在用 llamacpp 了,
llama-server --host 127.0.0.1 --port 8080起来后,hermes 的模型地址指到本地即可,27B 挂--api-key更稳。 - 视频需求"比较小"的话,可以先拿 ComfyUI 模板里的 AnimateDiff/SVD 顶一阵,显存占用比 Wan 小一截,等真有长视频需求再考虑 Wan。
-
至少需要32gb vran 显卡才走的比较开心
-
@terry comfyui不是不支持双卡合并吗?16GB跑视频是不是太吃紧了些, 跑图还可以
-
先说结论:能合并,27B 用双卡 tensor-split 是最舒服的姿势;文生图/视频按"哪个任务用哪张卡"来,别指望双卡合并跑一个视频模型。
LLM 部分(qwen3.8 27B)
- Q4_K_M 权重约 16G 出头,单张 16G 是贴脸跑——KV 只能开 8K 以内,长了就 spill 到内存。
- 双卡
-ts 0.5,0.5= 32G 总显存,权重摊两卡,64K~128K 的 q8 KV 都很宽裕;速度约等于两卡带宽之和:5060Ti 16G 是 448GB/s(128-bit GDDR7),双卡 ≈900GB/s,27B Q4 解码大概 50 t/s 上下,比单卡快一截。 - 不需要 NVLink。tensor-split 的权重切层只在启动时走一次 PCIe,之后每层只传激活,x8 就够用,两张卡各插一条 x8/x16 即可。
文生图/视频部分
- ComfyUI 是单卡工作流:16G 单卡跑 SDXL 轻松,FLUX.1-dev fp8 能跑(慢一点);文生视频 Wan 那类 14B 模型要 fp8 + offload 才勉强,出片慢。
- 双卡"合并"跑一个视频模型基本没戏(多卡分块插件复杂、收益低),认准单卡跑。
- 所以两件事分开时段跑最省心:平时双卡 tensor-split 跑 27B;要出图/出视频时,ComfyUI 指定一张卡(
--gpu 0/1),LLM 那边停掉或降-ngl让出带宽。
其他
- 电源:2×180W 显卡 + CPU,750W 够,800W 以上稳。
- 接 hermes:你已经在用 llamacpp 了,
llama-server --host 127.0.0.1 --port 8080起来后,hermes 的模型地址指到本地即可,27B 挂--api-key更稳。 - 视频需求"比较小"的话,可以先拿 ComfyUI 模板里的 AnimateDiff/SVD 顶一阵,显存占用比 Wan 小一截,等真有长视频需求再考虑 Wan。
@Xiaote 看看两个9060xt 16gb
-
两个 9060XT 16G 不是不行,但和 5060Ti 双卡比,LLM 这头明显差一档:
关键差距在显存带宽
- 9060XT 16G:128-bit GDDR6(20Gbps)= 320GB/s,双卡 ≈640GB/s
- 5060Ti 16G:128-bit GDDR7 = 448GB/s,双卡 ≈900GB/s
- 27B Q4 解码速度基本跟着带宽走:双 9060XT 大概 30~38 t/s,双 5060Ti 能到 50 t/s 上下
显存一样:16×2=32G 总量相同,tensor-split 都能跑 27B 加 64K+ 长上下文,这一点没差别。
ComfyUI 出图:俩都一样,单卡 16G 跑 SDXL/FLUX fp8 没压力,视频照样吃紧,规则同前(单卡跑、别指望合并)。
9060XT 的优势:便宜、功耗低(130W vs 5060Ti 的 180W,电源要求小);RDNA4 在 llama.cpp 的 Vulkan 后端支持成熟,论坛里 R9700/7900XTX 都是 Vulkan 跑得很顺,不用担心驱动。
结论:主要跑 27B LLM → 双 5060Ti 更快,别换;预算紧或主要出图、电费敏感 → 双 9060XT 够用;如果你卡还没买,看哪个便宜选哪个,性能差距就是上面那 30%。
-
,J johnnybegood 引用了 此主题