公司有LLM做数据清洗和视频生成需求,求大神分析配置
-
超级崇敬的大神们,公司有一个业务要用上本地LLM做数据清洗和Embedding这些,当前测试,32B的DeepSeek和千问模型够用—有保密需要而养,而同时也想养本地视频大模型mini Max H3之类的,给业务内视频课程组做Ai视频—一周有个3集、每集5分钟的视频的目标。
问,双路 志强6350之类的CPU,512G运存,2T2 Raid1硬盘,6个32G的5090,是甜点、奢侈或不够?
先谢过@Jake-Kwoh 你做的视频分辨率是多少?DeepSeek 和Qwen 会有多少人用,并发希望做到多少tps?Minimax H3 和 LLM 的权重需要一起载入显存么?
-
先说结论:六张 5090 32G 属于奢侈,而且有个结构性坑——按你描述的需求两张就够,多出来的四张帮不上忙。
按需求拆账:
1. 数据清洗 + Embedding(32B 模型)
- 32B Q4 量化约 20GB,一张 5090 32G 单卡就够,还能留出 64K+ 上下文 KV 的空间
- 清洗/Embedding 是批处理,瓶颈常在 CPU 解析和 IO,双路志强 6350 正好派上用场
- 512G 内存对大批量文档加载很舒服,不算浪费
2. MiniMax H3 视频生成(真正的显存大户)
- H3 满血 FP8 约 34GB,单张 5090 32G 反而放不下——这是这套配置最讽刺的点
- 论坛实测:H3 34GB 用 DisTorch2 双卡拆分在双 3090 上跑通过;或者上 48G 卡(RTX PRO 4500/5000、4090 48G 魔改)单卡最省心
- 一周 3 集 × 5 分钟 = 每周 15 分钟成品,按论坛实测的 H3 生成速度量级,1-2 张卡产能绰绰有余
3. 为什么 6 张 5090 是坑
- 5090 无 NVLink:6 张 = 6 个独立的 32G 池,不能合成 192G 用;H3 的 34GB 需求一张卡装不下、六张卡也合不起来
- ComfyUI 视频生成是单卡工作流,多卡利用率极低;SGLang/vLLM 的 TP 也救不了这个问题
- 6 张 5090 满载约 3600W+,供电、机柜、散热成本要单独算一笔
建议方案:
- 2 张 5090 32G:一张跑 LLM 服务(数据清洗/Embedding),一张跑 H3(量化版或配合 DisTorch2 拆分)
- 或者 1 张 5090 32G + 1 张 48G 卡:LLM 和 H3 各自单卡,最省心
- 双路志强 + 512G 保留,CPU 和内存对批处理、视频帧序列处理都有用
预算省下来的钱,够把视频课程组的工作流和素材库做得更扎实。