我这个配置能跑啥模型?初来请多关照
-
现有硬件:平台是超微7048GR,64G内存,cpu英特尔E5-2673V4 共2颗cpu 单颗20核40线程,显卡是3块RTX5000 这个是16G显存+1块RTX a4000 也是16G显存,组成64G显存容量。
系统:ubuntu22.04 准备安装sglang,大模型可以用哪个稳定,论坛用deepseek v4的挺多,我这个可以运行吗?
用途对接内网编程和短剧生成等,各位给参谋一下,运行哪个模型更合适? 还有,需要加nvlink吗,RTX5000和RTX a4000的nvlink接口不一样,怎么买nvlink?3slot还是2slot? -
感觉上可以做70b模型服务器。。。
-
感觉上可以做70b模型服务器。。。
-
你的配置很特别,4卡不通过NVLink互联的情况,其实有不少实用的玩法。我针对你的几个问题逐一分析:
-
sglang 装不上的原因
你的 E5-2673V4(Broadwell)只有 AVX2 指令集,没有 AVX-512。sglang 部分底层 kernel 需要 AVX-512 或更新的 x86 优化。建议换成 llama.cpp server 或 vLLM,这两个对 Xeon V4 兼容性更好,llama.cpp 几乎零配置就能跑。 -
没有 NVLink 的情况下,4 张 16G 显存是互相独立的
DeepSeek V4 Flash 最简 FP8 需要约 28G 显存,单卡装不下。MoE 架构跨卡推理也需要 NVLink 做高效通信。所以策略应该是:每张卡各自干活,各跑不同的模型/任务。 -
推荐方案
- 卡1(API推理主力):Qwen3.6-35B-A3B,Q4_K_M 量化约 12-14G 激活参数,单卡 16G 完全够用,RTX5000 上预计 50-60 t/s。做 API 推理完全够用,工具调用能力好。
- 卡2(内网编程辅助):Qwen3.6-14B hybrid 或 DeepSeek Coder V2 Lite,14B 模型量化后约 8-9G,反应快。
- 卡3(短剧生成):单独留给 ComfyUI + WAN2.1 / CogVideo,视频生成需要整卡显存。
- 卡4(其他):跑 llama.cpp server 做一些小任务,或者作为冗余。
- 另外可以用 1-2 张卡跑 vLLM 做 API server,支持多卡分发请求但显存不叠加,每张卡是独立 worker。
- NVLink 不用买
RTX5000 的 NVLink 接口和 RTX A4000 不一样,桥接器不通用的。而且你现在的平台 PCIe 通道数够用(双路 E5 v4 有 80 条),不做 TP 反而省心。
总结:第一条路最稳的是装 llama.cpp server,编译命令用 make LLAMA_CUDA=1,不需要折腾 AVX-512 相关的库。然后再玩 vLLM 或者 sglang 的纯 CUDA 模式。
-
-
@imbiplaza-ASUS 70b模型都是垃圾,没有一个能打的。显卡和设备没问题,但是显存都太小了,TP的话要NV-Link,没有NVLink的话,主板要求就高了。总之不太好折腾。
-
@terry 看来楼主想玩视频生成,16gb vram里我会祝福他,
最近的10eros 1.4 出来了,作者很努力解决了脸部漂移的问题,乘 ltx2.5 还没出来,玩一玩
全部加载需要30gb vram, 试一试了新买的32gb 显卡,感觉简直是怎么玩怎么爽。。。
但是最完美是使用bf16 的版本,这个全部加载需要至少46gb vram