请教各位大神,有两张5060ti 16g显卡
-
先说结论:能合并,27B 用双卡 tensor-split 是最舒服的姿势;文生图/视频按"哪个任务用哪张卡"来,别指望双卡合并跑一个视频模型。
LLM 部分(qwen3.8 27B)
- Q4_K_M 权重约 16G 出头,单张 16G 是贴脸跑——KV 只能开 8K 以内,长了就 spill 到内存。
- 双卡
-ts 0.5,0.5= 32G 总显存,权重摊两卡,64K~128K 的 q8 KV 都很宽裕;速度约等于两卡带宽之和:5060Ti 16G 是 448GB/s(128-bit GDDR7),双卡 ≈900GB/s,27B Q4 解码大概 50 t/s 上下,比单卡快一截。 - 不需要 NVLink。tensor-split 的权重切层只在启动时走一次 PCIe,之后每层只传激活,x8 就够用,两张卡各插一条 x8/x16 即可。
文生图/视频部分
- ComfyUI 是单卡工作流:16G 单卡跑 SDXL 轻松,FLUX.1-dev fp8 能跑(慢一点);文生视频 Wan 那类 14B 模型要 fp8 + offload 才勉强,出片慢。
- 双卡"合并"跑一个视频模型基本没戏(多卡分块插件复杂、收益低),认准单卡跑。
- 所以两件事分开时段跑最省心:平时双卡 tensor-split 跑 27B;要出图/出视频时,ComfyUI 指定一张卡(
--gpu 0/1),LLM 那边停掉或降-ngl让出带宽。
其他
- 电源:2×180W 显卡 + CPU,750W 够,800W 以上稳。
- 接 hermes:你已经在用 llamacpp 了,
llama-server --host 127.0.0.1 --port 8080起来后,hermes 的模型地址指到本地即可,27B 挂--api-key更稳。 - 视频需求"比较小"的话,可以先拿 ComfyUI 模板里的 AnimateDiff/SVD 顶一阵,显存占用比 Wan 小一截,等真有长视频需求再考虑 Wan。
-
至少需要32gb vran 显卡才走的比较开心
-
@terry comfyui不是不支持双卡合并吗?16GB跑视频是不是太吃紧了些, 跑图还可以
-
先说结论:能合并,27B 用双卡 tensor-split 是最舒服的姿势;文生图/视频按"哪个任务用哪张卡"来,别指望双卡合并跑一个视频模型。
LLM 部分(qwen3.8 27B)
- Q4_K_M 权重约 16G 出头,单张 16G 是贴脸跑——KV 只能开 8K 以内,长了就 spill 到内存。
- 双卡
-ts 0.5,0.5= 32G 总显存,权重摊两卡,64K~128K 的 q8 KV 都很宽裕;速度约等于两卡带宽之和:5060Ti 16G 是 448GB/s(128-bit GDDR7),双卡 ≈900GB/s,27B Q4 解码大概 50 t/s 上下,比单卡快一截。 - 不需要 NVLink。tensor-split 的权重切层只在启动时走一次 PCIe,之后每层只传激活,x8 就够用,两张卡各插一条 x8/x16 即可。
文生图/视频部分
- ComfyUI 是单卡工作流:16G 单卡跑 SDXL 轻松,FLUX.1-dev fp8 能跑(慢一点);文生视频 Wan 那类 14B 模型要 fp8 + offload 才勉强,出片慢。
- 双卡"合并"跑一个视频模型基本没戏(多卡分块插件复杂、收益低),认准单卡跑。
- 所以两件事分开时段跑最省心:平时双卡 tensor-split 跑 27B;要出图/出视频时,ComfyUI 指定一张卡(
--gpu 0/1),LLM 那边停掉或降-ngl让出带宽。
其他
- 电源:2×180W 显卡 + CPU,750W 够,800W 以上稳。
- 接 hermes:你已经在用 llamacpp 了,
llama-server --host 127.0.0.1 --port 8080起来后,hermes 的模型地址指到本地即可,27B 挂--api-key更稳。 - 视频需求"比较小"的话,可以先拿 ComfyUI 模板里的 AnimateDiff/SVD 顶一阵,显存占用比 Wan 小一截,等真有长视频需求再考虑 Wan。
@Xiaote 看看两个9060xt 16gb
-
两个 9060XT 16G 不是不行,但和 5060Ti 双卡比,LLM 这头明显差一档:
关键差距在显存带宽
- 9060XT 16G:128-bit GDDR6(20Gbps)= 320GB/s,双卡 ≈640GB/s
- 5060Ti 16G:128-bit GDDR7 = 448GB/s,双卡 ≈900GB/s
- 27B Q4 解码速度基本跟着带宽走:双 9060XT 大概 30~38 t/s,双 5060Ti 能到 50 t/s 上下
显存一样:16×2=32G 总量相同,tensor-split 都能跑 27B 加 64K+ 长上下文,这一点没差别。
ComfyUI 出图:俩都一样,单卡 16G 跑 SDXL/FLUX fp8 没压力,视频照样吃紧,规则同前(单卡跑、别指望合并)。
9060XT 的优势:便宜、功耗低(130W vs 5060Ti 的 180W,电源要求小);RDNA4 在 llama.cpp 的 Vulkan 后端支持成熟,论坛里 R9700/7900XTX 都是 Vulkan 跑得很顺,不用担心驱动。
结论:主要跑 27B LLM → 双 5060Ti 更快,别换;预算紧或主要出图、电费敏感 → 双 9060XT 够用;如果你卡还没买,看哪个便宜选哪个,性能差距就是上面那 30%。
-
,J johnnybegood 引用了 此主题
-
都不提主板上因为玩法太多。根据兜里的钱玩儿才是正解。
原则上我是买新派,不爱折腾魔改,矿渣,工业退役这些。容易消耗不必要的精力。
在精力和钱做个选择就行了。
当然符合自己的才是最好的。当娱乐折腾一下也未尝不可。
折腾硬件其实是现实生活中一个非常好的娱乐项目。就目前的形式看还能小赚一笔。 -
我最近也纠结是在加一张5060TI 16G 还是加一张4080 12G,又或者7900XTX ,找了好多帖子,好像都没有提及主板,让AI 查的,z890 extreme ,主板就8000,好纠结,希望大佬有时间给个答案,谢谢
主板别为多卡花到 8000。Z890 的 CPU 直连通道有限,双卡通常拆成 x8/x8,或者第二张走芯片组 x4;tensor-split 只在启动时走一次 PCIe,之后每层只传激活,x8/x4 都够用,加钱加在内存/供电/接口上更值。
按 27B 这个目标排一下这三张:
5060Ti 16G:和你手上那张组成 32G,tensor-split 跑 27B Q4 最舒服,双卡带宽约 900GB/s,decode 约 50 t/s;无 NVLink 也能跑。
4080 12G:12G 是硬短板,27B Q4 约 16G,单卡装不下,和 16G 卡配对还会因为 split 后小的那张先爆,不适合当 LLM 卡。
7900XTX 24G:单卡 24G、约 960GB/s,一张卡跑 27B Q4 很稳,最省心;代价是 ROCm/SGLang 生态弱一档、无 FP8。
结论:已有一张 5060Ti 就再加一张,性价比最高;想单卡省心选 7900XTX;4080 12G 放进这个需求里不合适。