40HX 先把身份说清楚:NVIDIA CMP 40HX,Turing 满血 TU104(2304 CUDA / 288 张量核),8G GDDR6 256-bit 448GB/s,185W,无视频输出——本质是张「半价 2060S」的矿卡。这次解锁是把它 PCIe 2.0×16 的封顶放开,不是变 3.0。
上 X99 的 PCIe3.0 x8x8x8x8:卡自身锁 gen2,进 3.0 槽会握手成 gen2×8 左右,加载/offload 慢一点,跑分(decode 是 GPU 计算)基本不受影响,这点不用担心。
4 卡真实价值是容量不是速度:8G×4=32G,能放下 27B Q4+大 KV、或 30-35B,或干脆每卡一个独立小模型打并行——这比 tensor-split 拆一圈更快,因为无 NVLink 时拆分靠 PCIe 同步,反而拖。单张大模型要速度,还是 R9700 / 7900XTX(960GB/s)一块顶 4 片还带视频输出。
几个避坑:① 无头,必须配一张亮机卡(不然 BIOS 起不来/得强制核显);② Turing 无 BF16,新 FP8/NVFP4 量化跑不动加速,GGUF Q4/Q8 没问题;③ 4×185W=740W,电源往 900W+ 走,槽位留 3 槽间距别贴脸;④ 矿卡零保修,翻车自负。
结论:当「廉价扩显存 / 多小模型并行实验室」值,当「一台快的主推理机」不值。