我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?
-
RTX Pro 6000 Max-Q 论坛数据汇总
1. 完整规格(论坛共识 / NVIDIA 官方)
项目 RTX Pro 6000 Max-Q 对比 Pro 6000(非 Max-Q) 显存 96 GB GDDR7 96 GB GDDR7 带宽 1.79 TB/s 1.79 TB/s TDP 300 W(功耗减半) 600 W 架构 Blackwell Blackwell AI TOPS 3511 4000 形态 双槽 双槽 核心卖点:在保留 96G 显存 + 1.79 TB/s 带宽的同时,把功耗从 600W 压到 300W,非常适合多卡高密度工作站部署。
2. 论坛实测记录
# 来源 主题标题 配置 性能数据 1 TID 19 / PID 171 迁移 wsl 上的包到 Linux ubuntu 22.04 2× RTX 3090Ti + Pro 6000 Max-Q(共 3 卡 72G) 从 WSL 迁 Linux 跑 LTX 视频 2 TID 284 / PID 3326 关于本地版的模型 U9 285K + 192G 内存 + Pro 6000 Max-Q 整机 96G 单卡,从 OpenClaw 改用 Hermes;192G 系统内存可做 CPU 卸载 3 TID 966 / PID 10925 Pro 6000 Max-Q + Qwen3.6 MTP 开到 20 Pro 6000 Max-Q + Qwen3.6-27B + vLLM MTP=20, 241.9 t/s(单路) 4 TID 966 / PID 10928 同上 同上 MTP=30/40 → 350 t/s(效率递减) 5 TID 966 / PID 10939 同上 同上 batch=4 并发 ~1000 t/s(GPU util 0.55)
3. Tony Xu 实测性能曲线(Pro 6000 Max-Q + Qwen3.6-27B + vLLM)
MTP 参数 Draft 接受率 单路生成速度 备注 MTP=3 86.3% ~85 t/s 基准 MTP=10 92.0% ~242 t/s 收益明显 MTP=20 96.1% 241-249 t/s 接受率最高 MTP=30/40 — ~350 t/s 接受率已饱和,边际收益递减 batch=4 并发 — ~1000 t/s GPU util 仍仅 0.55 作者注:在 0.55 GPU 利用率下已能稳定 1000 t/s,作者认为若解锁到 0.92 utilization,理论上可达 1800 t/s。
4. 关键结论
- 96G 不是瓶颈:跑 Qwen3.6-27B BF16 单路时显存绰绰有余,KV cache 占用 < 30%
- 功耗优势决定部署形态:标准 600W 装 4 卡机箱电源压力大,Max-Q 300W 装 4 卡仅 1200W,主流 1600-2000W 电源即可
- MTP 收益存在拐点:MTP=20 时接受率 96% 已接近饱和,再上调到 30/40 收益下降
- 高并发友好:batch=4 单卡就能跑 ~1000 t/s,4×Max-Q 集群可达 4000+ t/s 推理
-
RTX Pro 6000 Max-Q 论坛数据汇总
1. 完整规格(论坛共识 / NVIDIA 官方)
项目 RTX Pro 6000 Max-Q 对比 Pro 6000(非 Max-Q) 显存 96 GB GDDR7 96 GB GDDR7 带宽 1.79 TB/s 1.79 TB/s TDP 300 W(功耗减半) 600 W 架构 Blackwell Blackwell AI TOPS 3511 4000 形态 双槽 双槽 核心卖点:在保留 96G 显存 + 1.79 TB/s 带宽的同时,把功耗从 600W 压到 300W,非常适合多卡高密度工作站部署。
2. 论坛实测记录
# 来源 主题标题 配置 性能数据 1 TID 19 / PID 171 迁移 wsl 上的包到 Linux ubuntu 22.04 2× RTX 3090Ti + Pro 6000 Max-Q(共 3 卡 72G) 从 WSL 迁 Linux 跑 LTX 视频 2 TID 284 / PID 3326 关于本地版的模型 U9 285K + 192G 内存 + Pro 6000 Max-Q 整机 96G 单卡,从 OpenClaw 改用 Hermes;192G 系统内存可做 CPU 卸载 3 TID 966 / PID 10925 Pro 6000 Max-Q + Qwen3.6 MTP 开到 20 Pro 6000 Max-Q + Qwen3.6-27B + vLLM MTP=20, 241.9 t/s(单路) 4 TID 966 / PID 10928 同上 同上 MTP=30/40 → 350 t/s(效率递减) 5 TID 966 / PID 10939 同上 同上 batch=4 并发 ~1000 t/s(GPU util 0.55)
3. Tony Xu 实测性能曲线(Pro 6000 Max-Q + Qwen3.6-27B + vLLM)
MTP 参数 Draft 接受率 单路生成速度 备注 MTP=3 86.3% ~85 t/s 基准 MTP=10 92.0% ~242 t/s 收益明显 MTP=20 96.1% 241-249 t/s 接受率最高 MTP=30/40 — ~350 t/s 接受率已饱和,边际收益递减 batch=4 并发 — ~1000 t/s GPU util 仍仅 0.55 作者注:在 0.55 GPU 利用率下已能稳定 1000 t/s,作者认为若解锁到 0.92 utilization,理论上可达 1800 t/s。
4. 关键结论
- 96G 不是瓶颈:跑 Qwen3.6-27B BF16 单路时显存绰绰有余,KV cache 占用 < 30%
- 功耗优势决定部署形态:标准 600W 装 4 卡机箱电源压力大,Max-Q 300W 装 4 卡仅 1200W,主流 1600-2000W 电源即可
- MTP 收益存在拐点:MTP=20 时接受率 96% 已接近饱和,再上调到 30/40 收益下降
- 高并发友好:batch=4 单卡就能跑 ~1000 t/s,4×Max-Q 集群可达 4000+ t/s 推理
-
@imbiplaza-ASUS 我 qwen3.8 27B q4km + mtp 128K 单路中缓存在85左右,没中 65左右, 正常长程工作跑完 55左右, 很保守了, 感觉好像散热不怎么好, 想把涡轮换成三个静音风扇那种。3090 24G
-
三个静音风扇 的想法 没必要。换个房间放是正解。
有不少测试已经测试了三风扇方案。
1.容易搞废。放在第一条。这是重点。
2.换完一样很吵。具体看别人的测试视频把。
3.小火龙不建议加大投资。并且你越改。贬值越多。跑着吧。玩腻了就脱手。现在这个时间点是回血的好时机。 -
,
T terry 固定了此主题
-
@imbiplaza-ASUS 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論
RTX pro 6000 600W
優點: 性能滿血 滿執行的時候音量較小
缺點: 也是有燒接口的風險RTX pro 6000 max Q 300W
優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口
缺點: 性能大約下降7-15% 跑滿載 聲音不小在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收
-
@imbiplaza-ASUS 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論
RTX pro 6000 600W
優點: 性能滿血 滿執行的時候音量較小
缺點: 也是有燒接口的風險RTX pro 6000 max Q 300W
優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口
缺點: 性能大約下降7-15% 跑滿載 聲音不小在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收
等多三年,我们去捡 rtxpro 的洋垃圾
-
-
我沒有Mac Mini, Macbook Pro, Mac Studio, 但根據網路使用者的反饋是Mac適合跑 MoE model, 不適合跑 Dense model, 未來看看MoE和 Dense models 的發展吧 只要生活上和工作上夠用 都很好

-
補充一下雙5060TI的速度感覺也沒那麼不堪,就是顯存小硬傷,生視頻不好玩!


-
補充一下雙5060TI的速度感覺也沒那麼不堪,就是顯存小硬傷,生視頻不好玩!


上4 5060呗
-
@applejuice 5060 出掉了前陣子呆灣這兩張5060比一張9700還貴,我直接出掉換兩張9700。16G想玩minimax h3很痛苦= = !
-
補充一下雙5060TI的速度感覺也沒那麼不堪,就是顯存小硬傷,生視頻不好玩!


@PEN-CHI-LIN 使用LLM足够了
-
,系统 取消固定了此主题


