我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?
-
数据来源: lcz.me 论坛「抡锤者」AI 硬件 + LLM 讨论区 | 覆盖主题: 535 | 首手记录: 1371 条 → 去重后 133 个配置组合 |
*本文为AI整理,人工简单校对,必然存在少许事实性错误,请知悉。人类不对此负责。对某项内容有疑问的,最后一列有引用序号,文末有HTML引用链接,请到里面找到对应文章自行阅读。
表格按 合并后总显存 划分(双卡 = 两卡之和,如 2× RTX 4090 = 48G)。每行 = 同一显卡组合在论坛的多次部署归并,列出最具代表性的配置。「魔改」指 20G/22G/48G/72G/96G 改卡或非公版配置。
预算/场景 推荐显存 论坛常见配置 跑得最稳的模型 配套技术 入门 / 学生机 8-12G RTX 3060 12G / 4060 / 2080 Ti 22G 魔改 Qwen3.6-35B-A3B (Q4) / Qwen3.6-27B (Q4) MTP、APEX 量化、MoE CPU offload 主流性价比 24G RTX 3090 / 4090 / RX 7900 XTX Qwen3.6-27B、Qwen3.8-27B、Gemma-3/4、DeepSeek V4 Flash MTP、TurboQuant、vLLM、llama.cpp Vulkan、ROCm 32G 甜品 32G R9700 32G / RTX 5090 / RTX 4080S 32G 魔改 Qwen3.6-27B Q4 → FP8/BF16 满血 MTP、DFlash、TurboQuant、vLLM + HiCache 双卡甜蜜点 48G 2× RTX 3090 / 2× 4090 / 2× 7900 XTX Qwen3.6-27B + 长上下文 / 27B BF16 NVLink、张量并行 (TP=2)、MTP、SGLang 多卡 4×96G 384G 4× Pro 6000 / 2× H200 / 4× DGX Spark 27B 训练 + 推理、Qwen3.6-72B LoRA + ZeRO-3、MTP、DFlash2 Mac 统一内存党 96-256G M5 Max / M5 Ultra / M3 Ultra DeepSeek V4 Flash (Q2/Q4)、Qwen3.6-27B 8bit oMLX、TurboQuant、DSpark、kv-disk 小型机 / 集群 128-512G DGX Spark GB10、双 GB10、4×DGX Spark DeepSeek V4 Flash 完整 NVFP4 / GLM-5.2 Quantrio SGLang + RadixAttention、200G 网络互联、DSpark 目录
- 4-16G 显存 (31 个组合, 129 条原始)
- 16-32G 显存 (36 个组合, 791 条原始)
- 32-96G 显存 (52 个组合, 304 条原始)
- 96-256G 显存 (21 个组合, 73 条原始)
- 256G+ 显存 (11 个组合, 14 条原始)
4-16G 显存
31 个配置组合(合并自论坛 129 条相似部署)
显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用 2× RTX 3070(Dell R730 + 双路 E5-2680v4 56核 +…) 2×8G = 16G Qwen3.6-35B-A3B APEX 17.3GB llama.cpp --n-cpu-moe 32, --spec-type draft-mtp, --reasoning off, --jinja, -ngl 99 等 36-40 t/s (日常), 60 t/s (代码), 52 t/s (数学), 45-50 t/s (200K), 40-50 t/s (多模态) @ 200K (236K 多模态极限) [^1] Apple M4 16G Qwen 27B, Qwen3.5B A3B, Qwen2.5-14B 等 6 4-bit llama.cpp OpenCL, Metal 35B A3B 20-30 t/s; 30-35 t/s (35B), 50-60 t/s (24B), 90 t/s (多线程) [^3] Apple M5 16G Qwen3.6-27B 8bit oMLX 等 — 十几 t/s @ 96K [^4] RTX 2080 8G Qwen3.6-27B NVFP4 — MTP — [^6] RTX 2080 Ti 11G Qwen3.6, Qwen3.6-27B 等 5 Q4, Q4_K_M llama.cpp, Hermes MTP 等 25 t/s @ 32K; 234 t/s, 55 t/s @ 100K [^7] RTX 3060(RTX 3060 笔记本 + M1 Max 64G MacB…) 12G Qwen3, Qwen3.6-27B Q4_K_M llama.cpp, ComfyUI Vulkan, ROCm, CUDA, flash-attn, Flash-Attn 等 50.9 t/s, 53.8 t/s, 49.6 t/s, 29.9 t/s, 52.1 t/s, 38.3 t/s, 35.9 t/s, 53 t/s @ 128K; 0.8 t/s [^8] RTX 3070(i7-12700 + 32G×2 RAM + Windows…) 8G Qwen3.6-35B-A3B Q4_K_M llama.cpp, CUDA 12.4 CPU 20 线程, MTP, 多模态, CPU Offload, MoE 等 25 t/s; 32768 [^9] RTX 3080 10G Qwen3.6-27B 等 6 Q4_K_M llama.cpp 等 MTP 等 32 t/s @ 65K; 45 t/s @ 256K [^10] RTX 3080 Ti(X99) 12G Qwen Q4_K_M llama.cpp, ComfyUI MTP, Dflash, ROCm, CUDA, Q8_0 等 84 t/s @ 128K [^11] RTX 4060 8G Qwen3.6-35B-A3B APEX I-Mini 13.7GB llama.cpp, CUDA 12.4, Hermes 等 APEX 等 30+ t/s, 45-50 t/s (代码), 35-38 t/s (长输出), 499 tok/s (prompt) @ 16384-65536 [^12] RTX 4060 Ti 16G Qwen3.8-27B XS-PRO 刘悦整合包, Linux 等 PCIe 3.0 x4, MTP off, FlashAttn, q8/q4 KV 18.9 tok/s @ 64K [^13] RTX 4070 12G Qwen3.6-35B-A3B Q4_K_M llama.cpp CUDA, cuBLAS 短文本42.3 t/s, Thinking 42.1 t/s, 120K prefill 346.6秒/346 t/s @ 128K; 32k prefill 356 t/s, 65k 350 t/s, 120k 346 t/s @ 120K [^14] RTX 4070 Ti(Intel i9-14900KF + 31.7GB RAM) 16G Qwen3.8-27B UD-Q3_K_XL — — 10 几 t/s @ 64K [^15] RTX 4070 Ti(14600KF + DDR4 3200 + 4070TI S…) 16G Qwen3.6-27B Q4_K_M, Qwen3.5-9B Q8_0 Q4_K_M, Q8_0 llama.cpp, Ollama, Hermes 等 — 16K-128K [^16] RTX 4080 16G Qwen3.6-27B GPTQ vllm MTP, mmproj, CUDA 256K [^17] RTX 4080 Super(DIY) 16G Qwen3.6-27B, Qwen3.8-27B 等 4 UD-Q4_K_XL, UD-XL llama.cpp 等 MTP, GPU 直通, ReBAR, Above 4G Decoding, Resizable BAR 等 89 tok/s (median, peak 105), 35K prefill 1900 tok/s @ 307200 (262144 native + 32K concurrent); 27 t/s @ 48K [^18] RTX 5060 Ti(14600KF + 5060Ti 16G) 16G Qwen3.6, Gemma4, Qwen3.6-27b 等 7 UD-IQ4_XS, Q4_K_M llama.cpp MTP, CUDA 41 t/s @ 64K; 50 t/s @ 62K [^19] RTX 5060 Ti(llama.cpp + rpc RTX 5060ti 16G…) 16G Qwen3.6-27B — llama.cpp, RPC — 18 t/s [^20] RTX 5070 12G — FP4 — CUDA, NVLink — [^21] RTX 5070 Ti(Ryzen 7 9800X3D) 16G Qwen3.6-27B, Qwen3.8-27B 等 9 Q4_K_M llama.cpp, Hermes q4_0, CUDA 等 38-43 t/s @ 32K; 39.2 t/s, 15.2 t/s, 026 t/s, 14.4 t/s, 049 t/s, 13.3 t/s, 15 t/s @ 128K [^22] RTX 5080 16G Qwen3.6-27B, Qwen3.6-35B-A3B 等 8 Q4_K_M llama.cpp MTP 36 t/s @ 132K; 48 t/s @ 256K [^23] RTX 6800 XT 16G Qwen3.6-27B IQ3_XXS llama.cpp, opencode, hermes MTP, -ctk q4_0, -ctv q4_0, --spec-draft-p-min 0.75, --reasoning-budget 512 等 28-38 t/s (TG), 200 t/s (prefill 64K) @ 128K [^24] Tesla P4 8G e2b — — — 18 t/s [^25] V100(V100 + RTX 5600 Ti) 16G Qwen3.6-27B IQ4_XS, Q8_K_XL ik_llama.cpp, llama.cpp TurboQuant, -ctk q4_0 -khad, -ctv q4_0 -vhad, -fa, --cont-batching 等 25-27 t/s @ 100K; 390K [^26] v100 16G Qwen3.6-27B — llama.cpp TurboQuant, q4_0 28 t/s [^27] 16-32G 显存
36 个配置组合(合并自论坛 791 条相似部署)
显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用 2× RTX 2060 2×12G = 24G Ornith-1.0-35B-Heretic-MTP-APEX-I-Quality — llama.cpp MTP prefill 1279 t/s, decode 88.8 t/s peak 91.7 t/s @ 2048 [^28] 2× RTX 2080 Ti 2×11G = 22G Qwen3.8-27B-FP8, Qwen3.8-27B 等 4 FP8 vLLM, llama.cpp NVLink 等 38.7 t/s @ 128K; 27B 20 t/s @ 64K-128K [^29] 2× RTX 3060 2×12G = 24G Qwen3.6-27B, Qwen3.6-35B-A3B Q4KM, Q4_K_M llama.cpp RotorQuant, TurboQuant, ngram, --spec-type ngram-mod, -ngl 9 等 2.84 t/s (27B), 35 t/s (35B-A3B) @ 87475; ~100 t/s @ 192K [^30] 2× RTX 3080 Ti(i7-7700K + Z270 + PCIe 3.0 x8/…) 2×12G = 24G Qwen3.6-27B Q4_K_M llama.cpp MTP, --spec-draft-n-max 3, q4_0 KV, layer-split, power cap 300W 61 t/s @ 100K [^31] 2× RTX 5060 Ti(Mac Mini M4 24GB + 2×5060Ti) 2×16G = 32G Qwen3-27B NVFP4 hermes, llama.cpp, DeepSeek V4 Flash 等 TP, NVLink — [^32] 2× RTX 5060 Ti(Intel i5-7500 32GB) 2×16G = 32G Qwen3.6-27B, MiniMax H3, Wan 2.1 等 5 Q4_K_P llama.cpp, ComfyUI tensor parallel, NVFP4, MTP 20-22 tok/s, 124帧50分-1小时6分 @ 256 [^33] 2× RTX 5070 Ti(DIY) 2×16G = 32G Qwen3.8-27B, Qwen3.6-35B-A3B UD-Q5_K_XL llama.cpp, DSH 等 MTP, q8_0, TP, tensor split, layer split 等 70 t/s @ 262K; 75 t/s @ 131K [^34] 2× RTX 5080 2×16G = 32G Qwen3.6-27B Q4_K_M vLLM, SGlang TP=2, tensor parallel — [^35] 2× RTX 6800 XT 2×16G = 32G Ornith-1.5-35B-A3B, Qwen3.6-35B-A3B — llama.cpp turboquant, HIP 51 t/s [^36] 2× V100(DIY 双 V100) 2×16G = 32G Qwen3.8-27B Q8 llama.cpp MTP, mtp 2, HBM2, KV cache, prompt cache 等 43-52 t/s @ 32K; 713.66 t/s @ 49K [^37] RTX 2080 Ti (22G 魔改) 22G Qwen3.6-27B 等 7 Q4_K_M llama.cpp, ComfyUI, llama-server 等 MTP, flash-attn 等 33 t/s @ 128K; 24 t/s @ 64K [^38] RTX 3080 (20G 魔改) 20G Qwen3.6-27B 等 8 Q4_0, FP8 llama.cpp 等 Flash Attention, KV offload, NVLink, TB4, eGPU 等 125 t/s (短ctx), 61 t/s (100K+), 3460 tok/s prefill @ 256K; 33 t/s, +MTP 40+ t/s, 接Hermes 28-29 t/s @ 64K [^39] RTX 3090 (24G 魔改) 24G Qwen3.6-27B, Qwen3.6-27B-autoround, Qwen3.6-27B-AWQ-INT4 等 5 AutoRound INT4, AWQ INT4 vLLM, llama.cpp, Hermes 等 MTP, speculative sampling, TurboQuant 3-bit, turboquant_4bit_nc, TurboQuant 等 40-50 t/s, Draft acceptance 40-60% @ 48K; 140 t/s (peak), 80-100 t/s (long session) @ 170K [^40] RTX 4080 Super (32G 魔改) 32G Qwen3.8-27B, dealignai/Qwen3.8-27B-CRACK — Windows 11, llama.cpp MTP=3, Q8 KV, 320W, 250W 63.56 t/s @ 262K [^41] RTX 7900 XT (20G 魔改)(Windows 11) 20G Qwen3.5 27B, Qwen3.6 27B Q4_K_M LM Studio, ROCm — 23-24 t/s @ 20K [^42] RTX 7900 XTX (24G 魔改) 24G Qwen3.6-27B-Q4_K_M 等 10 Q4_K_M, Q8_0 (DFlash draft), Q4_K_M llama.cpp, ROCm, Ollama 等 FlashAttention, MTP, speculative decoding, DFlash, DDTree 等 56 t/s (DFlash 优化后) @ 32K; 72.5 t/s (gen), 478.7 ms PP, 842 t/s long context PP @ 262K [^43] 4090D(X99 AD4) 24G DeepSeek, Qwen3.6-27B 等 8 INT32, F16 ComfyUI 等 CUDA, MTP, Flash-Attn, q4_0, q8_0 等 29.7 t/s, 46.8 t/s @ 262K; 32 t/s, 80 t/s [^44] Intel B70 Pro 32G Qwen3.6-27B Q4_K_M vllm, comfyui, docker 等 docker, XPU 等 16 并发稳定; 26 并发 299→10+ t/s 抖动 [^45] M2 Pro(RX 7900 XTX 24G + RTX 3080 Ti …) 32G Qwen3.8-27B, GPT-OSS-120B, Cold-Fusion Qwen3.8-27B 等 5 Q5_K_M,UD-Q4_K_XL,UD-IQ4_XS,MXFP4 llama.cpp, FreeToken, NUMA MTP, MTP D3, MTP xhigh, MTP off, FTW 等 14.30 t/s @ 12K [^46] P40(Z77老主板魔改BIOS) 24G Gemma4 26 — — above 4G decoding, resizable bar 42 t/s [^47] R9700(DIY) 32G Qwen3.8-27B, Qwen3.6-27B, MiniMax H3 等 24 Q4_K_M, Q5 llama.cpp 等 ROCm, CUDA, MTP, Vulkan, flash-attn 等 53 t/s @ 128K; 59.8 t/s @ 256K [^48] R9700(x99 E5 2666v3) 32G Qwen3.8-27B, Qwen3.6-27B, Ornith-1.0-35B-Q5_K_M 等 24 Q4_K_M, Q5_K_M llama.cpp, ROCm, Vulkan 等 MTP 等 pp128 886 t/s, tg64 25.73 t/s, +MTP 35+/s @ 256K; pp128 886 t/s, tg64 25.73 t/s, +MTP 35+ t/s 256K ctx @ 256K [^49] RTX 3090(X99) 24G Qwen3.6-27B, Qwen3.8-27B, DeepSeek 等 40 Q4_K_M, BF16 llama.cpp 等 MTP, CUDA, NVLink, q8_0, TurboQuant 等 50-65 t/s @ 65K; prompt 874 tok/s, 38-43 t/s @ 105K [^50] RTX 3090 Ti 24G Qwen3.6-27B, Qwen3.8-27B 等 8 Q4_K_M llama.cpp, llama-server 等 MTP, CUDA 等 100 t/s @ 262K; INT8 5min, BF16 90s, NVFP4 60s [^51] RTX 4080 Super(Ubuntu 24) 32G Qwen3.6-27B AWQ/autoround/GPTQ vllm 等 MTP conc=32 无MTP 704 tps, MTP=2 622 tps @ 262K; 单并发无MTP 37, MTP=1 54, MTP=2 65, MTP=3 70 t/s; 8并发350 tps, 16并发400 tps [^52] RTX 4090 24G Qwen3.6-27B, DeepSeek flash, Qwen3.8-27B 等 12 FP8, Q4_K_M ComfyUI, llama.cpp, Hermes 等 MTP, CUDA, PCIe P2P, Above 4G Decoding, Resizable BAR 等 63-76 tok/s @ 262144; 76 t/s @ 256K [^53] RTX 5000 24G Qwen3.6-27B Q4_K_M ComfyUI MTP — [^54] RTX 5090(DIY) 32G Qwen3.8-27B, Qwen3.6-27B, Qwen3.6-27b 等 19 NVFP4, FP8 llama.cpp, Hermes, vllm 等 MTP, CUDA, mmproj, flash-attn, draft-mtp 等 20 t/s @ 132K; 143 t/s @ 262K [^55] RTX 7900(X99) 24G Qwen3.6 27B 等 8 NVFP4 llama.cpp 等 ROCm, Vulkan 等 30 t/s @ 128K; 30 t/s @ 128K [^56] RTX 7900 XTX(X99) 24G Qwen3.6-27B 等 39 Q4_K_M, Q4 llama.cpp 等 MTP, ROCm 等 pp:970t/s tg:29t/s @ 256K; <30 t/s @ 256K [^57] RTX Pro 4000(X99) 24G Qwen2.5-32B — vllm, Ollama ROCm, CUDA, FP4 — [^58] RTX Pro 4500(DIY Ryzen 7 3700X) 32G Qwen3.8-27B 等 6 Q4_K_M, UD-Q4_K_XL llama.cpp 等 MTP 等 API 58-60 t/s, 长续46-51 t/s, MTP短83 t/s, 接受率0.995 @ 200K; 24.5 t/s @ 256K [^59] RTX Pro 4500(RTX Pro 4500) 32G Qwen3.6-27B, Qwen3.6-27B-PrismaSCOUT, Qwen3.6-27B-PrismaAURA 等 17 NVFP4 vLLM MTP 等 74.74 t/s (100K), 61 t/s (200K) @ 210K; 64.84 t/s (100K) @ 100K [^60] 32-96G 显存
52 个配置组合(合并自论坛 304 条相似部署)
显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用 4× RTX 3090 4×24G = 96G — FP8 vllm MTP, CUDA 262K [^62] 4× RTX 5060 Ti(5060ti 16G x4 + 华南 H12D-8D) 4×16G = 64G Qwen3.6 27B Q4_K_M SGLang, vLLM, llama.cpp tensor parallel, TP=4 — [^63] 4× RTX 7900 XTX 4×24G = 96G Qwen 27B, Qwen3.6-35B, Qwen3.6-27B W4A16 vLLM, JartX/rdna3_full_stack, Hermes 等 RDNA3W4A16LinearKernel, INT8, INT4, WMMA, split-KV 等 1388-1450 t/s @ 32K; 40 t/s, 5 t/s [^64] 3× RTX 3090 (24G 魔改) 3×24G = 72G Qwen3.6 27B Q6_K Q6_K LM Studio, Hermes, vLLM — 17-18 t/s @ 128K [^65] 3× R9700(DIY 4090 48G + R9700 32G + AI …) 3×32G = 96G MiniMax2.7 230B-A10B, Qwen3.5-122B-A10B, Qwen3.6-35B-A3B 等 4 UD-IQ4_XS / UD-Q4_K_XL / Q5_K_XL / AWQ-6Bit / UD-Q6_K_XL / UD-Q4_K_XL llama.cpp, vllm tensor-split, MTP, 显卡坞, llama-benchy 27.74t/s (230B 3卡), 53.63t/s (122B双卡), 162.10t/s (35B 4090), 115.47t/s (27B AWQ vLLM MTP) @ 256K [^66] 3× RTX 3090 3×24G = 72G Qwen3.6-35B-A3B, Qwen3.6-27B, Qwen3-Embedding 等 4 — gpustack, ragflow, obsidian 等 NVLink 2080Ti x2 27B 20 t/s @ 64K-128K [^67] 3× RTX 5090 3×32G = 96G Qwen3.8-27B Q8_0 llama.cpp --parallel, flash-attn, KV q8_0, CUDA 13.3 42-43 t/s (单路), 56 t/s (5路聚合) @ 32K×5=163840 [^68] 2× RTX 2080 Ti (22G 魔改) 2×22G = 44G Qwen3.8-27B, Qwen3.8-27B-FP8, Qwen3.6-35B-A3B 等 4 FP8, Q4_K_M llama.cpp docker, CUDA 13.0.3, vLLM 等 tensor parallel, MTP 等 101.89 t/s; 131K [^69] 2× RTX 3080 (20G 魔改) 2×20G = 40G Qwen3.6-27B 等 8 INT, AWQ SGLang, llama.cpp 等 MTP, TP 等 FP8: 38 t/s; AWQ: 53-54 t/s; AWQ-MTP: 65-83 t/s @ 170K (FP8), 380K (AWQ), 260K (AWQ-MTP); 44.29 t/s [^70] 2× RTX 3090 (24G 魔改) 2×24G = 48G Qwen3.6-27B Heretic — llama.cpp, ComfyUI NVLink, tensor parallel, TP=2 68 t/s (NVLink), 65.6 t/s (无 NVLink) [^71] 2× RTX 4090 (48G 魔改) 2×48G = 96G Qwen3.5B MoE Q4, Wan 2.1, Qwen3-72B 等 10 Q4, Q4/Q8 llama.cpp 等 PCIe 等 70B Q4 15-25 t/s; 120K [^72] 2× A10(Aliyun ECS Xeon Platinum 8369B) 2×24G = 48G Qwen3.8-Flash-Next UD-Q4_K_XL llama.cpp CPU offload, MoE, PCIe 4.0 x16 13.91 tok/s @ 130K [^73] 2× Intel B70 2×32G = 64G Qwen3.8-27B 等 6 FP8 vLLM, Docker 等 TP=2, FP8 KV, prefix-caching 等 33.3 t/s @ 16K; 13 t/s [^74] 2× Intel B70 Pro 2×32G = 64G — — vllm, comfyui, docker XPU, wan, ltx2.3 — [^75] 2× R9700(X99) 2×32G = 64G Qwen3.8-27B 等 6 FP8, Q8 llama.cpp 等 layer split, MTP, PP, RCCL, ROCm 等 44.9 t/s @ 163K; 36 t/s @ 128K [^76] 2× R9700(x99 E5 2666v3 1200W) 2×32G = 64G Qwen3.6-27B, MiniMax H3, Wan2.2 等 4 Q4_K_M llama.cpp, ollama, ComfyUI tensor split, ROCm 6.3 27B Q4 15-20 t/s [^77] 2× RTX 3090(DIY) 2×24G = 48G Qwen3.8-27B 等 22 AWQ, AWQ INT4 SGLang 等 NVLink 等 decode 50-70 t/s代码, 35B A3B prefill 1500+ @ 220K; 双并发60 t/s, 单流120+ t/s, benchlocal 79% @ 262K [^78] 2× RTX 3090 Ti(华南金牌 X99 + Z40 + 长城 1250W + 32…) 2×24G = 48G Qwen3.6-27B — LM Studio, llama.cpp, vllm TurboQuant, MTP, PCIe 2.0 x1 20 t/s (双卡), 39 t/s (3090单卡 LM Studio), 8 t/s (35B-A3B 旧机器); 80K [^79] 2× RTX 4080 Super 2×32G = 64G Qwen3.6 27B 等 5 Q4_K_M llama.cpp, Hermes, ComfyUI 等 x8/x8, split-mode layer, x8+x8 PCIe 27B Q4 30-60 t/s; V4 Flash 40-50 decode 30-70 coding @ 27B; 27B Q4 30-60 t/s [^80] 2× RTX 4090 2×24G = 48G Qwen3.8-27B FP8 SGLang, DSH, comfyui — 24 tok/s [^81] 2× RTX 5090 2×32G = 64G Qwen3.8-27B, Qwen3.8-27B-BF16, Qwen3.8-27B-mmproj-F16 等 4 BF16 llama.cpp 等 NVLink, tensor split, MTP off, flash attention, q8_0 KV 等 48.05 tok/s @ 140000; 5090 decode ≈ 2.5x R9700, prefill ≈ 3x R9700 [^82] 2× RTX 6000 2×48G = 96G Qwen3.6-27B, Qwen3.6 27B Q4_K_M Q4_K_M llama.cpp — 2-5 t/s [^83] 2× RTX 7900 XTX(DIY) 2×24G = 48G Qwen3.8-27B 等 12 Q4_K_M, Q4 llama.cpp 等 MTP, TP=2, DFlash, ROCm, tensor parallel 等 34 t/s @ 64K; 22 t/s @ 64K [^84] 2× V100 32G(2x V100 32G (无 NVLink)) 2×32G = 64G Qwen3.6-27B Q8, Ornith-1.0-35B Q8, Qwen3.6-27B Q8_0 Q8_0 llama.cpp — V100 Q8 30 t/s, Ornith-35B Q8 ~100 t/s, PP 800-950 t/s @ 200K x 3; prefill 900 t/s, 30 tok/s @ 200K x 3 [^85] 170HX (40G 魔改) 40G Qwen 27B-70B QLoRA PyTorch 等 HBM2 — [^86] 170HX (64G 魔改) 64G Qwen3.8-27B, Qwen3.8 Flash w8a16 / Q4, w8a16 sglang, vllm DFlash, DFlash2 100 t/s (32K), 60 t/s (200K), 300 t/s (并发), 20 t/s (Flash) @ 262K; 196 t/s (Ornith单路), 740 t/s (Ornith 10并发) @ 262K [^87] RTX 4090 (48G 魔改)(PCIe 5 x16 双槽) 48G Qwen3.6-27B-FP8, Qwen 27B 越狱, SDXL 等 26 FP8, Q4 SGLang 等 MTP, HSA_OVERRIDE_GFX_VERSION, HIP_VISIBLE_DEVICES, CUDA_VISIBLE_DEVICES, tensor parallel 等 Decode快, 但编程一塌糊涂 @ 128K; vLLM 200K ctx 27B @ 200K [^88] RTX Pro 5000 (48G 魔改) 48G — — comfyui LTX 2.3, sulphur — [^89] RTX Pro 5000 (72G 魔改) 72G Qwen3.6 27B, MiniMax H3, Qwen3.8-27B Q4/Q8, FP8 ComfyUI 等 ROCm, DirectML, ZLUDA, MTP, NEXTN 等 Q4 prefill 2384 t/s decode 59.14 t/s; Q8 prefill 2335 decode 38.28 t/s @ 4K; 80 t/s @ 262K [^90] H100 80G — — Ollama, llama.cpp Vulkan, ROCm, CUDA, Flash-Attn 50 t/s [^91] L20 48G Qwen3.6-27B FP8 vllm CUDA, MTP 33.41 t/s @ 128K; 130K [^92] L40S 48G Qwen3.6-27B-MTP-GGUF 等 4 FP8 vllm MTP 50 t/s @ 260K; 2000 t/s [^93] M1 Max(M1 Max MacBook Pro 64G) 64G Qwen3.5-35B-A3B 4-bit OMLX — 30 几 t/s [^94] M3 Max(MacBook Pro 16" M3 Max 14C CPU…) 64G Qwen3.5-27B, Qwen3.6-27B 4-bit Ollama, MLX, ComfyUI 等 MPS backend, unified memory — [^95] M4 Pro(Mac M4 Pro 64G) 48G DeepSeek V*Flash-Vision-Exp — ds4 SSD streaming 10 t/s [^97] M5 Pro(M5 Pro 64G) 64G Qwen3.6-27B, Qwen3.6-35B-A3B Q4 LM Studio, MTPLX, oMLX 等 MTP 80-90 t/s (短), 50-60 t/s (长) @ 64K; 35B-A3B 50+ t/s (64K), 27B 19+ t/s (64K, MTP), 35A3 prefill 300+ t/s @ 64K+ [^98] RTX 3080 40G Qwen3.6-27B — llama.cpp MTP, 魔改 35-60 t/s @ 128K [^99] RTX 6000 48G Qwen3.6 27B 等 4 FP8 vllm, ComfyUI CUDA — [^100] RTX Pro 5000 48G Qwen3.8-27B-FP8, Qwen3.8-Flash-Next, Qwen3.8-27B 等 6 FP8, UD-Q4_K_XL SGLang, FlashInfer, Unsloth Studio 等 MTP, EAGLE, HiCache, TP=2, mamba-radix-cache 等 60.5 t/s @ 262K; 30 tok/s (64K/128K), 230-250 tok/s prefill, 24-28 tok/s (vision) @ 128K [^101] RTX Pro 6000(Ubuntu 24.04) 96G Qwen3.8-27B, Qwen3.8-27B-NVFP4, Qwen3.6 27B 等 10 NVFP4 SGLang, ComfyUI, vLLM 等 MTP, DFlash2, TP=2, NVLink, Turboquant 等 MTP=3: 71.2 t/s; MTP=10/20: 241.9 t/s; MTP=30/40: 350 t/s; MTP=20 241.9 t/s, MTP=30/40 350 t/s [^102] W7900(Windows 11) 48G H3, Qwen3.8-27B, Qwen3.6-27B Q4, Q4_K_M ComfyUI, llama.cpp MTP, Vulkan, KV q4_0, mmproj, vision 50 t/s (原 20 t/s) @ 262144 [^103] h100 80G Qwen3.5-397B-A17B, Qwen3.5, Qwen2-VL-72B 等 8 BF16 vllm tensor parallel, FP8, BF16 — [^104] 96-256G 显存
21 个配置组合(合并自论坛 73 条相似部署)
显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用 8× RTX 3090(ubuntu) 8×24G = 192G Qwen3.6-27B — llama.cpp, hermes, TG 等 tensor parallel, NVLink, 分布式 — [^106] 4× Intel B70 Pro(4×B70 Pro) 4×32G = 128G Qwen3.8B FP8 vllm — 57.08 t/s (单卡 8B), 400W 开机, 600W 两卡, 4 卡 4 视频+1 LLM [^107] 4× L20 4×48G = 192G Qwen3.6-27B-MTP-GGUF 等 7 FP8 llama.cpp MTP, CUDA, flash-attn 7.5 t/s @ 256K [^108] 4× R9700(技嘉G292-Z20 + AMD 7K62 + 128G) 4×32G = 128G Qwen3.8-27B-FP8, Qwen3.8-27B FP8 vllm 等 MTP, tensor-parallel-size 4, chunked prefill, prefix caching, AITER 等 192.51 tok/s (bench), <10 tok/s (hermes multi-user) @ 180000; 64.6 t/s (单卡), 16.4 t/s (2卡layer), 13.7 t/s (2卡tensor), 3.9 t/s (8卡TP=8) [^109] 2× RTX Pro 5000 (72G 魔改) 2×72G = 144G Qwen3.8 27B FP8/NVFP4 SGLang MTP, tensor parallel — [^110] 2× DGX SPARK(2x DGX SPARK GB10 cluster) 2×128G = 256G DeepSeek V*Flash-DSpark FP4+FP8 vLLM — 45-65 t/s [^111] 2× DGX Spark 2×128G = 256G DeepSeek V*Flash NVFP4 SGLang, DSpark 200G网络互联 测速40-50 t/s, coding 30-70, pp 2000 @ 500K; 单流首token 2-8s, 50-80 t/s; 6并发150-200 t/s; V4 flash 2000 pp 30 decode @ 1M [^112] 2× GB10(Asus Ascent GX10 (双GB10)) 2×128G = 256G DeepSeek V*Flash-0731, Qwen3.8-27B FP8+NVFP4 hermes, DSH, SGLang 等 SGLang, DSpark, Radix PP 1500-2500 t/s, decode 35-76 t/s, 单会话最高76.7 t/s [^113] 2× M1 Max(X99) 2×64G = 128G Qwen3.6-14B, Qwen3.6-27B Q4_K_M llama.cpp, vllm, mlx tensor parallel, TP 32, Q4_K_M 32K [^114] 2× RTX Pro 6000 2×96G = 192G Qwen3.8-27B, DeepSeek, Qwen3.6-35B-A3B 等 4 FP16/BF16 Linux, comfyui, LTX 2.3 NVLink, BF16, 魔改 BF16 27B ~29 t/s [^115] DGX Spark(DGX Spark) 128G Qwen3.8-27B, DeepSeek V*Flash 等 10 NVFP4 SGLang, Hermes, vllm 等 NVFP4, DSpark 等 Q4 90-100 t/s, BF16 27B ~29 t/s; 数学43.6 t/s, 代码34 t/s, Hermes tool calling 92/100 [^116] GB10(DGX Spark) 128G Qwen3.8-Flash-Next, Qwen3.6 27B Q8, DeepSeek Q2 NVFP4 vllm, SGLang MTP PP 1500-2000 t/s, decode 30 t/s, KV 630K [^117] M3 Ultra(Mac Studio M3 Ultra) 192G DeepSeek V*Flash, Qwen3.6-27B Q2 MLX 等 kv-disk 64G, unified memory 512GB/s, DFlash, TurboQuant, SpecPrefill 等 30 t/s @ 131072; 23 t/s (普通), 109.4 t/s (DFlash 短上下文), 39.6 t/s (2x batched) @ 4096-8192 [^118] M5 MAX 128G — — llama.cpp tensor parallel, MTP 25 t/s; 17 t/s [^119] M5 Max 128G Qwen3.8-27B, Qwen3.6-27B 等 11 Q4 llama.cpp, oMLX, MLX 等 MTP 等 Q8 MTP 40t/s, Q4 MTP 30t/s, Q6 MTP 40-50t/s, Youssofal混合8bit 40t/s @ 32K; pp1024/tg128: 881.6/63.6 t/s; pp16k/tg128: 630.6/56.6 t/s; 16-20 t/s一般 @ 16K [^120] M5 Max 128G Qwen3.6-35B A3B, Qwen3.6-27B 8bit, Qwen3.6-27B 等 11 — oMLX, Hermes, LM Studio 等 TurboQuant, KV cache 8bit, thinking on, cpu-moe, expert-offload 35B-A3B: PP 963.7, TG 50.8 t/s; 27B-OptiQ: PP 254.4, TG 17.1 t/s; DS V4 Flash 2bit: PP 270, TG 35 t/s @ 128K [^121] M5 Ultra(Mac Studio M5 Ultra 256G+2TB) 256G Qwen3.8-27B, DeepSeek V*Flash 等 8 Q4 llama.cpp unified memory 41 t/s @ 128K; 70 t/s (96G M5 Ultra Qwen3.8-27B) [^122] M5 max(DGX Spark) 128G — Q4 — MTP 25 t/s @ 64K [^123] Mac Studio 256G Qwen3.6-27b, DeepSeek V*Flash Q4_K_M SGLang, Hermes — 50 t/s, 400 t/s @ 128K; 10 t/s [^124] 256G+ 显存
11 个配置组合(合并自论坛 14 条相似部署)
显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用 10× DGX SPARK(10x DGX SPARK GB10 cluster wit…) 10×128G = 1280G GLM 5.2 — — — 2x tok/s @ 320K x 10 [^125] 6× RTX 8000(DIY 6xRTX 8000) 6×48G = 288G Qwen3.8-27B, Ornith-1.0-35B, Qwen3.6-35B Q8 llama.cpp, new-api Turing 672GB/s, tensor-split, CUDA 7.5 Qwen3.8-27B 27ms/token (32-36 t/s 2并发), Qwen3.6-35B-A3B 202 t/s (2并发), Ornith-1.0-35B 181 t/s (2并发) @ 256K (单), 128K (双) [^128] 4× DGX Spark(4x DGX Spark cluster) 4×128G = 512G GLM-5.2-Quantrio-INT4-INT8-Mixed INT4+INT8 Mixed vLLM DFlash concurrency 1: 40.3 t/s, 4: 95.7 t/s; PP 506-690 t/s [^129] 4× Pro 6000 4×96G = 384G DeepSeek-R1-Distill-Qwen-32B, Qwen3-30B-A3B, MiniMax H3 等 5 FP8 vLLM, LLaMA-Factory, DeepSpeed 等 LoRA, ZeRO-3, GRPO, ECC 等 32K; 4K [^130] 4× RTX Pro 6000(办公室) 4×96G = 384G — — vllm, SGLang vgpu — [^131] 2× B200(Apptainer container) 2×192G = 384G Qwen3.8-27B-FP8 FP8 vllm DFlash2, TP2, flashinfer, speculative, dflash 232 t/s (18req), 363 t/s (11req), 1114 t/s (2req), 3247.7 t/s (引擎) @ 254000 [^133] 引用列表附件。引用列表133条.html
少了一个 Rtxpro 6000 Max Q
-
少了一个 Rtxpro 6000 Max Q
@imbiplaza-ASUS 估计是跟 rtx6000 合并了, 一开始几百行,人工简单校对了一下, 为了精简还是合并删除了不少。 这东西就是个参考, 也没想弄的特别细, 否则就需要详细人工校对了。不过如果有明显的错误可以标出来, 我标个颜色什么的。
-

8x3090 可以用nvlink 吗?
@applejuice 这个倒不是说8卡可以nvlink, 而是归总一下相关联的技术名称,你也不知道他是不是两两nvlink了, 如果有疑问可以去引用帖子原文查看。如果是个明显错误, 回头我标注一下。
-
@imbiplaza-ASUS 估计是跟 rtx6000 合并了, 一开始几百行,人工简单校对了一下, 为了精简还是合并删除了不少。 这东西就是个参考, 也没想弄的特别细, 否则就需要详细人工校对了。不过如果有明显的错误可以标出来, 我标个颜色什么的。
-
@imbiplaza-ASUS 我强烈怀疑这个说法, 性能不会差这么多, 反而有些人说因为限了功率, 效率反而上去了呢, 如果在计算机房用, 肯定有差距, 如果个人用, 反而是maxq好吧, 也要看实际使用环境的。
-
@imbiplaza-ASUS 我强烈怀疑这个说法, 性能不会差这么多, 反而有些人说因为限了功率, 效率反而上去了呢, 如果在计算机房用, 肯定有差距, 如果个人用, 反而是maxq好吧, 也要看实际使用环境的。
-
-
RTX Pro 6000 Max-Q 论坛数据汇总
1. 完整规格(论坛共识 / NVIDIA 官方)
项目 RTX Pro 6000 Max-Q 对比 Pro 6000(非 Max-Q) 显存 96 GB GDDR7 96 GB GDDR7 带宽 1.79 TB/s 1.79 TB/s TDP 300 W(功耗减半) 600 W 架构 Blackwell Blackwell AI TOPS 3511 4000 形态 双槽 双槽 核心卖点:在保留 96G 显存 + 1.79 TB/s 带宽的同时,把功耗从 600W 压到 300W,非常适合多卡高密度工作站部署。
2. 论坛实测记录
# 来源 主题标题 配置 性能数据 1 TID 19 / PID 171 迁移 wsl 上的包到 Linux ubuntu 22.04 2× RTX 3090Ti + Pro 6000 Max-Q(共 3 卡 72G) 从 WSL 迁 Linux 跑 LTX 视频 2 TID 284 / PID 3326 关于本地版的模型 U9 285K + 192G 内存 + Pro 6000 Max-Q 整机 96G 单卡,从 OpenClaw 改用 Hermes;192G 系统内存可做 CPU 卸载 3 TID 966 / PID 10925 Pro 6000 Max-Q + Qwen3.6 MTP 开到 20 Pro 6000 Max-Q + Qwen3.6-27B + vLLM MTP=20, 241.9 t/s(单路) 4 TID 966 / PID 10928 同上 同上 MTP=30/40 → 350 t/s(效率递减) 5 TID 966 / PID 10939 同上 同上 batch=4 并发 ~1000 t/s(GPU util 0.55)
3. Tony Xu 实测性能曲线(Pro 6000 Max-Q + Qwen3.6-27B + vLLM)
MTP 参数 Draft 接受率 单路生成速度 备注 MTP=3 86.3% ~85 t/s 基准 MTP=10 92.0% ~242 t/s 收益明显 MTP=20 96.1% 241-249 t/s 接受率最高 MTP=30/40 — ~350 t/s 接受率已饱和,边际收益递减 batch=4 并发 — ~1000 t/s GPU util 仍仅 0.55 作者注:在 0.55 GPU 利用率下已能稳定 1000 t/s,作者认为若解锁到 0.92 utilization,理论上可达 1800 t/s。
4. 关键结论
- 96G 不是瓶颈:跑 Qwen3.6-27B BF16 单路时显存绰绰有余,KV cache 占用 < 30%
- 功耗优势决定部署形态:标准 600W 装 4 卡机箱电源压力大,Max-Q 300W 装 4 卡仅 1200W,主流 1600-2000W 电源即可
- MTP 收益存在拐点:MTP=20 时接受率 96% 已接近饱和,再上调到 30/40 收益下降
- 高并发友好:batch=4 单卡就能跑 ~1000 t/s,4×Max-Q 集群可达 4000+ t/s 推理
-
RTX Pro 6000 Max-Q 论坛数据汇总
1. 完整规格(论坛共识 / NVIDIA 官方)
项目 RTX Pro 6000 Max-Q 对比 Pro 6000(非 Max-Q) 显存 96 GB GDDR7 96 GB GDDR7 带宽 1.79 TB/s 1.79 TB/s TDP 300 W(功耗减半) 600 W 架构 Blackwell Blackwell AI TOPS 3511 4000 形态 双槽 双槽 核心卖点:在保留 96G 显存 + 1.79 TB/s 带宽的同时,把功耗从 600W 压到 300W,非常适合多卡高密度工作站部署。
2. 论坛实测记录
# 来源 主题标题 配置 性能数据 1 TID 19 / PID 171 迁移 wsl 上的包到 Linux ubuntu 22.04 2× RTX 3090Ti + Pro 6000 Max-Q(共 3 卡 72G) 从 WSL 迁 Linux 跑 LTX 视频 2 TID 284 / PID 3326 关于本地版的模型 U9 285K + 192G 内存 + Pro 6000 Max-Q 整机 96G 单卡,从 OpenClaw 改用 Hermes;192G 系统内存可做 CPU 卸载 3 TID 966 / PID 10925 Pro 6000 Max-Q + Qwen3.6 MTP 开到 20 Pro 6000 Max-Q + Qwen3.6-27B + vLLM MTP=20, 241.9 t/s(单路) 4 TID 966 / PID 10928 同上 同上 MTP=30/40 → 350 t/s(效率递减) 5 TID 966 / PID 10939 同上 同上 batch=4 并发 ~1000 t/s(GPU util 0.55)
3. Tony Xu 实测性能曲线(Pro 6000 Max-Q + Qwen3.6-27B + vLLM)
MTP 参数 Draft 接受率 单路生成速度 备注 MTP=3 86.3% ~85 t/s 基准 MTP=10 92.0% ~242 t/s 收益明显 MTP=20 96.1% 241-249 t/s 接受率最高 MTP=30/40 — ~350 t/s 接受率已饱和,边际收益递减 batch=4 并发 — ~1000 t/s GPU util 仍仅 0.55 作者注:在 0.55 GPU 利用率下已能稳定 1000 t/s,作者认为若解锁到 0.92 utilization,理论上可达 1800 t/s。
4. 关键结论
- 96G 不是瓶颈:跑 Qwen3.6-27B BF16 单路时显存绰绰有余,KV cache 占用 < 30%
- 功耗优势决定部署形态:标准 600W 装 4 卡机箱电源压力大,Max-Q 300W 装 4 卡仅 1200W,主流 1600-2000W 电源即可
- MTP 收益存在拐点:MTP=20 时接受率 96% 已接近饱和,再上调到 30/40 收益下降
- 高并发友好:batch=4 单卡就能跑 ~1000 t/s,4×Max-Q 集群可达 4000+ t/s 推理
-
@imbiplaza-ASUS 我 qwen3.8 27B q4km + mtp 128K 单路中缓存在85左右,没中 65左右, 正常长程工作跑完 55左右, 很保守了, 感觉好像散热不怎么好, 想把涡轮换成三个静音风扇那种。3090 24G
-
三个静音风扇 的想法 没必要。换个房间放是正解。
有不少测试已经测试了三风扇方案。
1.容易搞废。放在第一条。这是重点。
2.换完一样很吵。具体看别人的测试视频把。
3.小火龙不建议加大投资。并且你越改。贬值越多。跑着吧。玩腻了就脱手。现在这个时间点是回血的好时机。 -
,
T terry 固定了此主题
-
@imbiplaza-ASUS 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論
RTX pro 6000 600W
優點: 性能滿血 滿執行的時候音量較小
缺點: 也是有燒接口的風險RTX pro 6000 max Q 300W
優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口
缺點: 性能大約下降7-15% 跑滿載 聲音不小在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收
-
@imbiplaza-ASUS 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論
RTX pro 6000 600W
優點: 性能滿血 滿執行的時候音量較小
缺點: 也是有燒接口的風險RTX pro 6000 max Q 300W
優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口
缺點: 性能大約下降7-15% 跑滿載 聲音不小在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收
等多三年,我们去捡 rtxpro 的洋垃圾
