@terry 懂。多谢。
Jake Kwoh
-
公司有LLM做数据清洗和视频生成需求,求大神分析配置 -
公司有LLM做数据清洗和视频生成需求,求大神分析配置我详细介入后,得出需求详细了,更新一下需求详细,大神们看 4*Pro6000 这样来配,如何:
第一条是公司的垂直行业私有化 AI 业务,属于长期主业务,数据不能外发,所以训练和推理都要求本地完成。
模型主要在 30B/32B 这一档:
DeepSeek-R1-Distill-Qwen-32B
Qwen3-30B-A3B
训练:LLaMA-Factory,BF16 LoRA/SFT,单条训练 Context 大约 ≤4K,后续可能做 GRPO;
推理:DeepSeek 32B FP8 + vLLM,Qwen3-30B-A3B AWQ + vLLM;
两个模型需要长期在线,业务 APP / 内部系统未来会涉及 8K~32K Context;
训练期间在线推理最好也能继续运行。此前已经做过 8×RTX 5090 PoC:
32B BF16 LoRA + DeepSpeed ZeRO-3,4×5090 已经实际跑通;
DeepSeek 32B FP8 + vLLM,2×5090 已跑过 10~50 并发,性能没问题;
Qwen AWQ 也已经部署测试。所以考虑 PRO 6000 不是因为5090跑不了,而是希望通过 96GB单卡显存、ECC、长期重载稳定性、减少模型分片和跨卡通信,以及长 Context、GRPO、更大模型的余量,把服务器做得更适合长期使用。
理想资源分配大概是:
GPU0:32B BF16 LoRA / SFT训练
GPU1:DeepSeek 32B在线推理
GPU2:Qwen在线推理
GPU3:第二业务 / 视频生成第二条业务是本地视频生成,会跑 MiniMax H3、Wan 等比较重的视频模型。希望正常情况下保留一张96G卡做视频,低峰或周末可以把更多GPU切给视频。
整机定位是 4卡 PCIe 5.0 x16、Linux、4U服务器、长期重载运行,比较在意散热、功耗、PCIe topology、多卡通信和稳定性,不需要桌面显示。
想请教:
这种负载应该优先 PRO 6000 Server Edition 还是 Max-Q?
4U强风道服务器是不是直接上 Server Edition 最合理?
Server Edition 如果支持 400~600W power limit,长期 AI workload 一般建议跑多少W比较甜?
Max-Q 300W 在4卡长期训练/推理下,能效是否反而更划算?
有没有实际跑过 4×PRO6000 + LLaMA-Factory/DeepSpeed/vLLM/H3 的朋友,想参考持续满载、温度、功耗和多卡通信情况。 -
公司有LLM做数据清洗和视频生成需求,求大神分析配置@Rex-Fan 谢谢大神
-
公司有LLM做数据清洗和视频生成需求,求大神分析配置@terry 老特,如果有好渠道,建议一下,现在决策 4*Pro6000 了
-
华南金牌--采购做项目验证服务器-求大神经验大神们,敬礼。
我是在 YouTube 上听老特讲到过华南金牌,我们有一个服务器需求,他们报的价格,简直惊人,不知道有经验的大神,怎样评价,我是项目做应用服务器部署和 NAS 方面。 -
公司有LLM做数据清洗和视频生成需求,求大神分析配置超级崇敬的大神们,公司有一个业务要用上本地LLM做数据清洗和Embedding这些,当前测试,32B的DeepSeek和千问模型够用—有保密需要而养,而同时也想养本地视频大模型mini Max H3之类的,给业务内视频课程组做Ai视频—一周有个3集、每集5分钟的视频的目标。
问,双路 志强6350之类的CPU,512G运存,2T2 Raid1硬盘,6个32G的5090,是甜点、奢侈或不够?
先谢过 -
RAG LoRA和大模型的关系以及应用场景可不可以说,即使是用伤寒体系这种公式化的辩证体系,也会因为一个‘证‘的多可能性,会导致多个‘证‘的更多可能性指数级别地让路由节点爆炸,最后是机器采用自认为的高confidence的答案认为一级棒,实际上有经验的从业者一眼尴尬,因为即使比对‘经验‘信息后,也是变成了一次引入更多噪音的处理-毕竟经验本身在中医体系里没有量化的golden cases?可能这个方向整体很危险,因为面对现代化生活的各种乱七八糟,和百年前都已经十万八千里了,更不要说一两千年前,现代化的各种奇奇怪怪的病,早超出了古人‘病‘的范畴了,这导致回归调教又是一个不可知的问题。