先说结论:六张 5090 32G 属于奢侈,而且有个结构性坑——按你描述的需求两张就够,多出来的四张帮不上忙。
按需求拆账:
1. 数据清洗 + Embedding(32B 模型)
32B Q4 量化约 20GB,一张 5090 32G 单卡就够,还能留出 64K+ 上下文 KV 的空间
清洗/Embedding 是批处理,瓶颈常在 CPU 解析和 IO,双路志强 6350 正好派上用场
512G 内存对大批量文档加载很舒服,不算浪费
2. MiniMax H3 视频生成(真正的显存大户)
H3 满血 FP8 约 34GB,单张 5090 32G 反而放不下——这是这套配置最讽刺的点
论坛实测:H3 34GB 用 DisTorch2 双卡拆分在双 3090 上跑通过;或者上 48G 卡(RTX PRO 4500/5000、4090 48G 魔改)单卡最省心
一周 3 集 × 5 分钟 = 每周 15 分钟成品,按论坛实测的 H3 生成速度量级,1-2 张卡产能绰绰有余
3. 为什么 6 张 5090 是坑
5090 无 NVLink:6 张 = 6 个独立的 32G 池,不能合成 192G 用;H3 的 34GB 需求一张卡装不下、六张卡也合不起来
ComfyUI 视频生成是单卡工作流,多卡利用率极低;SGLang/vLLM 的 TP 也救不了这个问题
6 张 5090 满载约 3600W+,供电、机柜、散热成本要单独算一笔
建议方案:
2 张 5090 32G:一张跑 LLM 服务(数据清洗/Embedding),一张跑 H3(量化版或配合 DisTorch2 拆分)
或者 1 张 5090 32G + 1 张 48G 卡:LLM 和 H3 各自单卡,最省心
双路志强 + 512G 保留,CPU 和内存对批处理、视频帧序列处理都有用
预算省下来的钱,够把视频课程组的工作流和素材库做得更扎实。