<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？]]></title><description><![CDATA[<p dir="auto">数据来源: <a href="http://lcz.me" rel="nofollow ugc">lcz.me</a> 论坛「抡锤者」AI 硬件 + LLM 讨论区　|　覆盖主题: 535　|　首手记录: 1371 条 → 去重后 133 个配置组合　|</p>
<h4>*本文为AI整理，人工简单校对，必然存在少许事实性错误，请知悉。人类不对此负责。对某项内容有疑问的，最后一列有引用序号，文末有HTML引用链接，请到里面找到对应文章自行阅读。</h4>
<blockquote>
<p dir="auto">表格按 合并后总显存 划分（双卡 = 两卡之和，如 2× RTX 4090 = 48G）。每行 = 同一显卡组合在论坛的多次部署归并，列出最具代表性的配置。「魔改」指 20G/22G/48G/72G/96G 改卡或非公版配置。</p>
</blockquote>
<h2></h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
</tr>
</thead>
<tbody>
<tr>
<td>预算/场景</td>
<td>推荐显存</td>
<td>论坛常见配置</td>
<td>跑得最稳的模型</td>
<td>配套技术</td>
</tr>
<tr>
<td>入门 / 学生机</td>
<td>8-12G</td>
<td>RTX 3060 12G / 4060 / 2080 Ti 22G 魔改</td>
<td>Qwen3.6-35B-A3B (Q4) / Qwen3.6-27B (Q4)</td>
<td>MTP、APEX 量化、MoE CPU offload</td>
</tr>
<tr>
<td>主流性价比</td>
<td>24G</td>
<td>RTX 3090 / 4090 / RX 7900 XTX</td>
<td>Qwen3.6-27B、Qwen3.8-27B、Gemma-3/4、DeepSeek V4 Flash</td>
<td>MTP、TurboQuant、vLLM、llama.cpp Vulkan、ROCm</td>
</tr>
<tr>
<td>32G 甜品</td>
<td>32G</td>
<td>R9700 32G / RTX 5090 / RTX 4080S 32G 魔改</td>
<td>Qwen3.6-27B Q4 → FP8/BF16 满血</td>
<td>MTP、DFlash、TurboQuant、vLLM + HiCache</td>
</tr>
<tr>
<td>双卡甜蜜点</td>
<td>48G</td>
<td>2× RTX 3090 / 2× 4090 / 2× 7900 XTX</td>
<td>Qwen3.6-27B + 长上下文 / 27B BF16</td>
<td>NVLink、张量并行 (TP=2)、MTP、SGLang</td>
</tr>
<tr>
<td>多卡 4×96G</td>
<td>384G</td>
<td>4× Pro 6000 / 2× H200 / 4× DGX Spark</td>
<td>27B 训练 + 推理、Qwen3.6-72B</td>
<td>LoRA + ZeRO-3、MTP、DFlash2</td>
</tr>
<tr>
<td>Mac 统一内存党</td>
<td>96-256G</td>
<td>M5 Max / M5 Ultra / M3 Ultra</td>
<td>DeepSeek V4 Flash (Q2/Q4)、Qwen3.6-27B 8bit</td>
<td>oMLX、TurboQuant、DSpark、kv-disk</td>
</tr>
<tr>
<td>小型机 / 集群</td>
<td>128-512G</td>
<td>DGX Spark GB10、双 GB10、4×DGX Spark</td>
<td>DeepSeek V4 Flash 完整 NVFP4 / GLM-5.2 Quantrio</td>
<td>SGLang + RadixAttention、200G 网络互联、DSpark</td>
</tr>
</tbody>
</table>
<h2>目录</h2>
<ul>
<li><a href="#4-16g-%E6%98%BE%E5%AD%98">4-16G 显存</a>　(31 个组合, 129 条原始)</li>
<li><a href="#16-32g-%E6%98%BE%E5%AD%98">16-32G 显存</a>　(36 个组合, 791 条原始)</li>
<li><a href="#32-96g-%E6%98%BE%E5%AD%98">32-96G 显存</a>　(52 个组合, 304 条原始)</li>
<li><a href="#96-256g-%E6%98%BE%E5%AD%98">96-256G 显存</a>　(21 个组合, 73 条原始)</li>
<li><a href="#256g+-%E6%98%BE%E5%AD%98">256G+ 显存</a>　(11 个组合, 14 条原始)</li>
</ul>
<h2>4-16G 显存</h2>
<p dir="auto">31 个配置组合（合并自论坛 129 条相似部署）</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
</tr>
</thead>
<tbody>
<tr>
<td>显卡 (含魔改与机器)</td>
<td>总显存</td>
<td>可跑模型</td>
<td>量化</td>
<td>环境</td>
<td>关键技术</td>
<td>速度 / 上下文</td>
<td>引用</td>
</tr>
<tr>
<td>2× RTX 3070（Dell R730 + 双路 E5-2680v4 56核 +…）</td>
<td>2×8G = 16G</td>
<td>Qwen3.6-35B-A3B</td>
<td>APEX 17.3GB</td>
<td>llama.cpp</td>
<td>--n-cpu-moe 32, --spec-type draft-mtp, --reasoning off, --jinja, -ngl 99 等</td>
<td>36-40 t/s (日常), 60 t/s (代码), 52 t/s (数学), 45-50 t/s (200K), 40-50 t/s (多模态) @ 200K (236K 多模态极限)</td>
<td>[^1]</td>
</tr>
<tr>
<td>Apple M4</td>
<td>16G</td>
<td>Qwen 27B, Qwen3.5B A3B, Qwen2.5-14B 等 6</td>
<td>4-bit</td>
<td>llama.cpp</td>
<td>OpenCL, Metal</td>
<td>35B A3B 20-30 t/s; 30-35 t/s (35B), 50-60 t/s (24B), 90 t/s (多线程)</td>
<td>[^3]</td>
</tr>
<tr>
<td>Apple M5</td>
<td>16G</td>
<td>Qwen3.6-27B</td>
<td>8bit</td>
<td>oMLX 等</td>
<td>—</td>
<td>十几 t/s @ 96K</td>
<td>[^4]</td>
</tr>
<tr>
<td>RTX 2080</td>
<td>8G</td>
<td>Qwen3.6-27B</td>
<td>NVFP4</td>
<td>—</td>
<td>MTP</td>
<td>—</td>
<td>[^6]</td>
</tr>
<tr>
<td>RTX 2080 Ti</td>
<td>11G</td>
<td>Qwen3.6, Qwen3.6-27B 等 5</td>
<td>Q4, Q4_K_M</td>
<td>llama.cpp, Hermes</td>
<td>MTP 等</td>
<td>25 t/s @ 32K; 234 t/s, 55 t/s @ 100K</td>
<td>[^7]</td>
</tr>
<tr>
<td>RTX 3060（RTX 3060 笔记本 + M1 Max 64G MacB…）</td>
<td>12G</td>
<td>Qwen3, Qwen3.6-27B</td>
<td>Q4_K_M</td>
<td>llama.cpp, ComfyUI</td>
<td>Vulkan, ROCm, CUDA, flash-attn, Flash-Attn 等</td>
<td>50.9 t/s, 53.8 t/s, 49.6 t/s, 29.9 t/s, 52.1 t/s, 38.3 t/s, 35.9 t/s, 53 t/s @ 128K; 0.8 t/s</td>
<td>[^8]</td>
</tr>
<tr>
<td>RTX 3070（i7-12700 + 32G×2 RAM + Windows…）</td>
<td>8G</td>
<td>Qwen3.6-35B-A3B</td>
<td>Q4_K_M</td>
<td>llama.cpp, CUDA 12.4</td>
<td>CPU 20 线程, MTP, 多模态, CPU Offload, MoE 等</td>
<td>25 t/s; 32768</td>
<td>[^9]</td>
</tr>
<tr>
<td>RTX 3080</td>
<td>10G</td>
<td>Qwen3.6-27B 等 6</td>
<td>Q4_K_M</td>
<td>llama.cpp 等</td>
<td>MTP 等</td>
<td>32 t/s @ 65K; 45 t/s @ 256K</td>
<td>[^10]</td>
</tr>
<tr>
<td>RTX 3080 Ti（X99）</td>
<td>12G</td>
<td>Qwen</td>
<td>Q4_K_M</td>
<td>llama.cpp, ComfyUI</td>
<td>MTP, Dflash, ROCm, CUDA, Q8_0 等</td>
<td>84 t/s @ 128K</td>
<td>[^11]</td>
</tr>
<tr>
<td>RTX 4060</td>
<td>8G</td>
<td>Qwen3.6-35B-A3B</td>
<td>APEX I-Mini 13.7GB</td>
<td>llama.cpp, CUDA 12.4, Hermes 等</td>
<td>APEX 等</td>
<td>30+ t/s, 45-50 t/s (代码), 35-38 t/s (长输出), 499 tok/s (prompt) @ 16384-65536</td>
<td>[^12]</td>
</tr>
<tr>
<td>RTX 4060 Ti</td>
<td>16G</td>
<td>Qwen3.8-27B</td>
<td>XS-PRO</td>
<td>刘悦整合包, Linux 等</td>
<td>PCIe 3.0 x4, MTP off, FlashAttn, q8/q4 KV</td>
<td>18.9 tok/s @ 64K</td>
<td>[^13]</td>
</tr>
<tr>
<td>RTX 4070</td>
<td>12G</td>
<td>Qwen3.6-35B-A3B</td>
<td>Q4_K_M</td>
<td>llama.cpp</td>
<td>CUDA, cuBLAS</td>
<td>短文本42.3 t/s, Thinking 42.1 t/s, 120K prefill 346.6秒/346 t/s @ 128K; 32k prefill 356 t/s, 65k 350 t/s, 120k 346 t/s @ 120K</td>
<td>[^14]</td>
</tr>
<tr>
<td>RTX 4070 Ti（Intel i9-14900KF + 31.7GB RAM）</td>
<td>16G</td>
<td>Qwen3.8-27B</td>
<td>UD-Q3_K_XL</td>
<td>—</td>
<td>—</td>
<td>10 几 t/s @ 64K</td>
<td>[^15]</td>
</tr>
<tr>
<td>RTX 4070 Ti（14600KF + DDR4 3200 + 4070TI S…）</td>
<td>16G</td>
<td>Qwen3.6-27B Q4_K_M, Qwen3.5-9B Q8_0</td>
<td>Q4_K_M, Q8_0</td>
<td>llama.cpp, Ollama, Hermes 等</td>
<td>—</td>
<td>16K-128K</td>
<td>[^16]</td>
</tr>
<tr>
<td>RTX 4080</td>
<td>16G</td>
<td>Qwen3.6-27B</td>
<td>GPTQ</td>
<td>vllm</td>
<td>MTP, mmproj, CUDA</td>
<td>256K</td>
<td>[^17]</td>
</tr>
<tr>
<td>RTX 4080 Super（DIY）</td>
<td>16G</td>
<td>Qwen3.6-27B, Qwen3.8-27B 等 4</td>
<td>UD-Q4_K_XL, UD-XL</td>
<td>llama.cpp 等</td>
<td>MTP, GPU 直通, ReBAR, Above 4G Decoding, Resizable BAR 等</td>
<td>89 tok/s (median, peak 105), 35K prefill 1900 tok/s @ 307200 (262144 native + 32K concurrent); 27 t/s @ 48K</td>
<td>[^18]</td>
</tr>
<tr>
<td>RTX 5060 Ti（14600KF + 5060Ti 16G）</td>
<td>16G</td>
<td>Qwen3.6, Gemma4, Qwen3.6-27b 等 7</td>
<td>UD-IQ4_XS, Q4_K_M</td>
<td>llama.cpp</td>
<td>MTP, CUDA</td>
<td>41 t/s @ 64K; 50 t/s @ 62K</td>
<td>[^19]</td>
</tr>
<tr>
<td>RTX 5060 Ti（llama.cpp + rpc RTX 5060ti 16G…）</td>
<td>16G</td>
<td>Qwen3.6-27B</td>
<td>—</td>
<td>llama.cpp, RPC</td>
<td>—</td>
<td>18 t/s</td>
<td>[^20]</td>
</tr>
<tr>
<td>RTX 5070</td>
<td>12G</td>
<td>—</td>
<td>FP4</td>
<td>—</td>
<td>CUDA, NVLink</td>
<td>—</td>
<td>[^21]</td>
</tr>
<tr>
<td>RTX 5070 Ti（Ryzen 7 9800X3D）</td>
<td>16G</td>
<td>Qwen3.6-27B, Qwen3.8-27B 等 9</td>
<td>Q4_K_M</td>
<td>llama.cpp, Hermes</td>
<td>q4_0, CUDA 等</td>
<td>38-43 t/s @ 32K; 39.2 t/s, 15.2 t/s, 026 t/s, 14.4 t/s, 049 t/s, 13.3 t/s, 15 t/s @ 128K</td>
<td>[^22]</td>
</tr>
<tr>
<td>RTX 5080</td>
<td>16G</td>
<td>Qwen3.6-27B, Qwen3.6-35B-A3B 等 8</td>
<td>Q4_K_M</td>
<td>llama.cpp</td>
<td>MTP</td>
<td>36 t/s @ 132K; 48 t/s @ 256K</td>
<td>[^23]</td>
</tr>
<tr>
<td>RTX 6800 XT</td>
<td>16G</td>
<td>Qwen3.6-27B</td>
<td>IQ3_XXS</td>
<td>llama.cpp, opencode, hermes</td>
<td>MTP, -ctk q4_0, -ctv q4_0, --spec-draft-p-min 0.75, --reasoning-budget 512 等</td>
<td>28-38 t/s (TG), 200 t/s (prefill 64K) @ 128K</td>
<td>[^24]</td>
</tr>
<tr>
<td>Tesla P4</td>
<td>8G</td>
<td>e2b</td>
<td>—</td>
<td>—</td>
<td>—</td>
<td>18 t/s</td>
<td>[^25]</td>
</tr>
<tr>
<td>V100（V100 + RTX 5600 Ti）</td>
<td>16G</td>
<td>Qwen3.6-27B</td>
<td>IQ4_XS, Q8_K_XL</td>
<td>ik_llama.cpp, llama.cpp</td>
<td>TurboQuant, -ctk q4_0 -khad, -ctv q4_0 -vhad, -fa, --cont-batching 等</td>
<td>25-27 t/s @ 100K; 390K</td>
<td>[^26]</td>
</tr>
<tr>
<td>v100</td>
<td>16G</td>
<td>Qwen3.6-27B</td>
<td>—</td>
<td>llama.cpp</td>
<td>TurboQuant, q4_0</td>
<td>28 t/s</td>
<td>[^27]</td>
</tr>
</tbody>
</table>
<h2>16-32G 显存</h2>
<p dir="auto">36 个配置组合（合并自论坛 791 条相似部署）</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
</tr>
</thead>
<tbody>
<tr>
<td>显卡 (含魔改与机器)</td>
<td>总显存</td>
<td>可跑模型</td>
<td>量化</td>
<td>环境</td>
<td>关键技术</td>
<td>速度 / 上下文</td>
<td>引用</td>
</tr>
<tr>
<td>2× RTX 2060</td>
<td>2×12G = 24G</td>
<td>Ornith-1.0-35B-Heretic-MTP-APEX-I-Quality</td>
<td>—</td>
<td>llama.cpp</td>
<td>MTP</td>
<td>prefill 1279 t/s, decode 88.8 t/s peak 91.7 t/s @ 2048</td>
<td>[^28]</td>
</tr>
<tr>
<td>2× RTX 2080 Ti</td>
<td>2×11G = 22G</td>
<td>Qwen3.8-27B-FP8, Qwen3.8-27B 等 4</td>
<td>FP8</td>
<td>vLLM, llama.cpp</td>
<td>NVLink 等</td>
<td>38.7 t/s @ 128K; 27B 20 t/s @ 64K-128K</td>
<td>[^29]</td>
</tr>
<tr>
<td>2× RTX 3060</td>
<td>2×12G = 24G</td>
<td>Qwen3.6-27B, Qwen3.6-35B-A3B</td>
<td>Q4KM, Q4_K_M</td>
<td>llama.cpp</td>
<td>RotorQuant, TurboQuant, ngram, --spec-type ngram-mod, -ngl 9 等</td>
<td>2.84 t/s (27B), 35 t/s (35B-A3B) @ 87475; ~100 t/s @ 192K</td>
<td>[^30]</td>
</tr>
<tr>
<td>2× RTX 3080 Ti（i7-7700K + Z270 + PCIe 3.0 x8/…）</td>
<td>2×12G = 24G</td>
<td>Qwen3.6-27B</td>
<td>Q4_K_M</td>
<td>llama.cpp</td>
<td>MTP, --spec-draft-n-max 3, q4_0 KV, layer-split, power cap 300W</td>
<td>61 t/s @ 100K</td>
<td>[^31]</td>
</tr>
<tr>
<td>2× RTX 5060 Ti（Mac Mini M4 24GB + 2×5060Ti）</td>
<td>2×16G = 32G</td>
<td>Qwen3-27B</td>
<td>NVFP4</td>
<td>hermes, llama.cpp, DeepSeek V4 Flash 等</td>
<td>TP, NVLink</td>
<td>—</td>
<td>[^32]</td>
</tr>
<tr>
<td>2× RTX 5060 Ti（Intel i5-7500 32GB）</td>
<td>2×16G = 32G</td>
<td>Qwen3.6-27B, MiniMax H3, Wan 2.1 等 5</td>
<td>Q4_K_P</td>
<td>llama.cpp, ComfyUI</td>
<td>tensor parallel, NVFP4, MTP</td>
<td>20-22 tok/s, 124帧50分-1小时6分 @ 256</td>
<td>[^33]</td>
</tr>
<tr>
<td>2× RTX 5070 Ti（DIY）</td>
<td>2×16G = 32G</td>
<td>Qwen3.8-27B, Qwen3.6-35B-A3B</td>
<td>UD-Q5_K_XL</td>
<td>llama.cpp, DSH 等</td>
<td>MTP, q8_0, TP, tensor split, layer split 等</td>
<td>70 t/s @ 262K; 75 t/s @ 131K</td>
<td>[^34]</td>
</tr>
<tr>
<td>2× RTX 5080</td>
<td>2×16G = 32G</td>
<td>Qwen3.6-27B</td>
<td>Q4_K_M</td>
<td>vLLM, SGlang</td>
<td>TP=2, tensor parallel</td>
<td>—</td>
<td>[^35]</td>
</tr>
<tr>
<td>2× RTX 6800 XT</td>
<td>2×16G = 32G</td>
<td>Ornith-1.5-35B-A3B, Qwen3.6-35B-A3B</td>
<td>—</td>
<td>llama.cpp</td>
<td>turboquant, HIP</td>
<td>51 t/s</td>
<td>[^36]</td>
</tr>
<tr>
<td>2× V100（DIY 双 V100）</td>
<td>2×16G = 32G</td>
<td>Qwen3.8-27B</td>
<td>Q8</td>
<td>llama.cpp</td>
<td>MTP, mtp 2, HBM2, KV cache, prompt cache 等</td>
<td>43-52 t/s @ 32K; 713.66 t/s @ 49K</td>
<td>[^37]</td>
</tr>
<tr>
<td>RTX 2080 Ti (22G 魔改)</td>
<td>22G</td>
<td>Qwen3.6-27B 等 7</td>
<td>Q4_K_M</td>
<td>llama.cpp, ComfyUI, llama-server 等</td>
<td>MTP, flash-attn 等</td>
<td>33 t/s @ 128K; 24 t/s @ 64K</td>
<td>[^38]</td>
</tr>
<tr>
<td>RTX 3080 (20G 魔改)</td>
<td>20G</td>
<td>Qwen3.6-27B 等 8</td>
<td>Q4_0, FP8</td>
<td>llama.cpp 等</td>
<td>Flash Attention, KV offload, NVLink, TB4, eGPU 等</td>
<td>125 t/s (短ctx), 61 t/s (100K+), 3460 tok/s prefill @ 256K; 33 t/s, +MTP 40+ t/s, 接Hermes 28-29 t/s @ 64K</td>
<td>[^39]</td>
</tr>
<tr>
<td>RTX 3090 (24G 魔改)</td>
<td>24G</td>
<td>Qwen3.6-27B, Qwen3.6-27B-autoround, Qwen3.6-27B-AWQ-INT4 等 5</td>
<td>AutoRound INT4, AWQ INT4</td>
<td>vLLM, llama.cpp, Hermes 等</td>
<td>MTP, speculative sampling, TurboQuant 3-bit, turboquant_4bit_nc, TurboQuant 等</td>
<td>40-50 t/s, Draft acceptance 40-60% @ 48K; 140 t/s (peak), 80-100 t/s (long session) @ 170K</td>
<td>[^40]</td>
</tr>
<tr>
<td>RTX 4080 Super (32G 魔改)</td>
<td>32G</td>
<td>Qwen3.8-27B, dealignai/Qwen3.8-27B-CRACK</td>
<td>—</td>
<td>Windows 11, llama.cpp</td>
<td>MTP=3, Q8 KV, 320W, 250W</td>
<td>63.56 t/s @ 262K</td>
<td>[^41]</td>
</tr>
<tr>
<td>RTX 7900 XT (20G 魔改)（Windows 11）</td>
<td>20G</td>
<td>Qwen3.5 27B, Qwen3.6 27B</td>
<td>Q4_K_M</td>
<td>LM Studio, ROCm</td>
<td>—</td>
<td>23-24 t/s @ 20K</td>
<td>[^42]</td>
</tr>
<tr>
<td>RTX 7900 XTX (24G 魔改)</td>
<td>24G</td>
<td>Qwen3.6-27B-Q4_K_M 等 10</td>
<td>Q4_K_M, Q8_0 (DFlash draft), Q4_K_M</td>
<td>llama.cpp, ROCm, Ollama 等</td>
<td>FlashAttention, MTP, speculative decoding, DFlash, DDTree 等</td>
<td>56 t/s (DFlash 优化后) @ 32K; 72.5 t/s (gen), 478.7 ms PP, 842 t/s long context PP @ 262K</td>
<td>[^43]</td>
</tr>
<tr>
<td>4090D（X99 AD4）</td>
<td>24G</td>
<td>DeepSeek, Qwen3.6-27B 等 8</td>
<td>INT32, F16</td>
<td>ComfyUI 等</td>
<td>CUDA, MTP, Flash-Attn, q4_0, q8_0 等</td>
<td>29.7 t/s, 46.8 t/s @ 262K; 32 t/s, 80 t/s</td>
<td>[^44]</td>
</tr>
<tr>
<td>Intel B70 Pro</td>
<td>32G</td>
<td>Qwen3.6-27B</td>
<td>Q4_K_M</td>
<td>vllm, comfyui, docker 等</td>
<td>docker, XPU 等</td>
<td>16 并发稳定; 26 并发 299→10+ t/s 抖动</td>
<td>[^45]</td>
</tr>
<tr>
<td>M2 Pro（RX 7900 XTX 24G + RTX 3080 Ti …）</td>
<td>32G</td>
<td>Qwen3.8-27B, GPT-OSS-120B, Cold-Fusion Qwen3.8-27B 等 5</td>
<td>Q5_K_M,UD-Q4_K_XL,UD-IQ4_XS,MXFP4</td>
<td>llama.cpp, FreeToken, NUMA</td>
<td>MTP, MTP D3, MTP xhigh, MTP off, FTW 等</td>
<td>14.30 t/s @ 12K</td>
<td>[^46]</td>
</tr>
<tr>
<td>P40（Z77老主板魔改BIOS）</td>
<td>24G</td>
<td>Gemma4 26</td>
<td>—</td>
<td>—</td>
<td>above 4G decoding, resizable bar</td>
<td>42 t/s</td>
<td>[^47]</td>
</tr>
<tr>
<td>R9700（DIY）</td>
<td>32G</td>
<td>Qwen3.8-27B, Qwen3.6-27B, MiniMax H3 等 24</td>
<td>Q4_K_M, Q5</td>
<td>llama.cpp 等</td>
<td>ROCm, CUDA, MTP, Vulkan, flash-attn 等</td>
<td>53 t/s @ 128K; 59.8 t/s @ 256K</td>
<td>[^48]</td>
</tr>
<tr>
<td>R9700（x99 E5 2666v3）</td>
<td>32G</td>
<td>Qwen3.8-27B, Qwen3.6-27B, Ornith-1.0-35B-Q5_K_M 等 24</td>
<td>Q4_K_M, Q5_K_M</td>
<td>llama.cpp, ROCm, Vulkan 等</td>
<td>MTP 等</td>
<td>pp128 886 t/s, tg64 25.73 t/s, +MTP 35+/s @ 256K; pp128 886 t/s, tg64 25.73 t/s, +MTP 35+ t/s 256K ctx @ 256K</td>
<td>[^49]</td>
</tr>
<tr>
<td>RTX 3090（X99）</td>
<td>24G</td>
<td>Qwen3.6-27B, Qwen3.8-27B, DeepSeek 等 40</td>
<td>Q4_K_M, BF16</td>
<td>llama.cpp 等</td>
<td>MTP, CUDA, NVLink, q8_0, TurboQuant 等</td>
<td>50-65 t/s @ 65K; prompt 874 tok/s, 38-43 t/s @ 105K</td>
<td>[^50]</td>
</tr>
<tr>
<td>RTX 3090 Ti</td>
<td>24G</td>
<td>Qwen3.6-27B, Qwen3.8-27B 等 8</td>
<td>Q4_K_M</td>
<td>llama.cpp, llama-server 等</td>
<td>MTP, CUDA 等</td>
<td>100 t/s @ 262K; INT8 5min, BF16 90s, NVFP4 60s</td>
<td>[^51]</td>
</tr>
<tr>
<td>RTX 4080 Super（Ubuntu 24）</td>
<td>32G</td>
<td>Qwen3.6-27B</td>
<td>AWQ/autoround/GPTQ</td>
<td>vllm 等</td>
<td>MTP</td>
<td>conc=32 无MTP 704 tps, MTP=2 622 tps @ 262K; 单并发无MTP 37, MTP=1 54, MTP=2 65, MTP=3 70 t/s; 8并发350 tps, 16并发400 tps</td>
<td>[^52]</td>
</tr>
<tr>
<td>RTX 4090</td>
<td>24G</td>
<td>Qwen3.6-27B, DeepSeek flash, Qwen3.8-27B 等 12</td>
<td>FP8, Q4_K_M</td>
<td>ComfyUI, llama.cpp, Hermes 等</td>
<td>MTP, CUDA, PCIe P2P, Above 4G Decoding, Resizable BAR 等</td>
<td>63-76 tok/s @ 262144; 76 t/s @ 256K</td>
<td>[^53]</td>
</tr>
<tr>
<td>RTX 5000</td>
<td>24G</td>
<td>Qwen3.6-27B</td>
<td>Q4_K_M</td>
<td>ComfyUI</td>
<td>MTP</td>
<td>—</td>
<td>[^54]</td>
</tr>
<tr>
<td>RTX 5090（DIY）</td>
<td>32G</td>
<td>Qwen3.8-27B, Qwen3.6-27B, Qwen3.6-27b 等 19</td>
<td>NVFP4, FP8</td>
<td>llama.cpp, Hermes, vllm 等</td>
<td>MTP, CUDA, mmproj, flash-attn, draft-mtp 等</td>
<td>20 t/s @ 132K; 143 t/s @ 262K</td>
<td>[^55]</td>
</tr>
<tr>
<td>RTX 7900（X99）</td>
<td>24G</td>
<td>Qwen3.6 27B 等 8</td>
<td>NVFP4</td>
<td>llama.cpp 等</td>
<td>ROCm, Vulkan 等</td>
<td>30 t/s @ 128K; 30 t/s @ 128K</td>
<td>[^56]</td>
</tr>
<tr>
<td>RTX 7900 XTX（X99）</td>
<td>24G</td>
<td>Qwen3.6-27B 等 39</td>
<td>Q4_K_M, Q4</td>
<td>llama.cpp 等</td>
<td>MTP, ROCm 等</td>
<td>pp:970t/s tg:29t/s @ 256K; &lt;30 t/s @ 256K</td>
<td>[^57]</td>
</tr>
<tr>
<td>RTX Pro 4000（X99）</td>
<td>24G</td>
<td>Qwen2.5-32B</td>
<td>—</td>
<td>vllm, Ollama</td>
<td>ROCm, CUDA, FP4</td>
<td>—</td>
<td>[^58]</td>
</tr>
<tr>
<td>RTX Pro 4500（DIY Ryzen 7 3700X）</td>
<td>32G</td>
<td>Qwen3.8-27B 等 6</td>
<td>Q4_K_M, UD-Q4_K_XL</td>
<td>llama.cpp 等</td>
<td>MTP 等</td>
<td>API 58-60 t/s, 长续46-51 t/s, MTP短83 t/s, 接受率0.995 @ 200K; 24.5 t/s @ 256K</td>
<td>[^59]</td>
</tr>
<tr>
<td>RTX Pro 4500（RTX Pro 4500）</td>
<td>32G</td>
<td>Qwen3.6-27B, Qwen3.6-27B-PrismaSCOUT, Qwen3.6-27B-PrismaAURA 等 17</td>
<td>NVFP4</td>
<td>vLLM</td>
<td>MTP 等</td>
<td>74.74 t/s (100K), 61 t/s (200K) @ 210K; 64.84 t/s (100K) @ 100K</td>
<td>[^60]</td>
</tr>
</tbody>
</table>
<h2>32-96G 显存</h2>
<p dir="auto">52 个配置组合（合并自论坛 304 条相似部署）</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
</tr>
</thead>
<tbody>
<tr>
<td>显卡 (含魔改与机器)</td>
<td>总显存</td>
<td>可跑模型</td>
<td>量化</td>
<td>环境</td>
<td>关键技术</td>
<td>速度 / 上下文</td>
<td>引用</td>
</tr>
<tr>
<td>4× RTX 3090</td>
<td>4×24G = 96G</td>
<td>—</td>
<td>FP8</td>
<td>vllm</td>
<td>MTP, CUDA</td>
<td>262K</td>
<td>[^62]</td>
</tr>
<tr>
<td>4× RTX 5060 Ti（5060ti 16G x4 + 华南 H12D-8D）</td>
<td>4×16G = 64G</td>
<td>Qwen3.6 27B</td>
<td>Q4_K_M</td>
<td>SGLang, vLLM, llama.cpp</td>
<td>tensor parallel, TP=4</td>
<td>—</td>
<td>[^63]</td>
</tr>
<tr>
<td>4× RTX 7900 XTX</td>
<td>4×24G = 96G</td>
<td>Qwen 27B, Qwen3.6-35B, Qwen3.6-27B</td>
<td>W4A16</td>
<td>vLLM, JartX/rdna3_full_stack, Hermes 等</td>
<td>RDNA3W4A16LinearKernel, INT8, INT4, WMMA, split-KV 等</td>
<td>1388-1450 t/s @ 32K; 40 t/s, 5 t/s</td>
<td>[^64]</td>
</tr>
<tr>
<td>3× RTX 3090 (24G 魔改)</td>
<td>3×24G = 72G</td>
<td>Qwen3.6 27B Q6_K</td>
<td>Q6_K</td>
<td>LM Studio, Hermes, vLLM</td>
<td>—</td>
<td>17-18 t/s @ 128K</td>
<td>[^65]</td>
</tr>
<tr>
<td>3× R9700（DIY 4090 48G + R9700 32G + AI …）</td>
<td>3×32G = 96G</td>
<td>MiniMax2.7 230B-A10B, Qwen3.5-122B-A10B, Qwen3.6-35B-A3B 等 4</td>
<td>UD-IQ4_XS / UD-Q4_K_XL / Q5_K_XL / AWQ-6Bit / UD-Q6_K_XL / UD-Q4_K_XL</td>
<td>llama.cpp, vllm</td>
<td>tensor-split, MTP, 显卡坞, llama-benchy</td>
<td>27.74t/s (230B 3卡), 53.63t/s (122B双卡), 162.10t/s (35B 4090), 115.47t/s (27B AWQ vLLM MTP) @ 256K</td>
<td>[^66]</td>
</tr>
<tr>
<td>3× RTX 3090</td>
<td>3×24G = 72G</td>
<td>Qwen3.6-35B-A3B, Qwen3.6-27B, Qwen3-Embedding 等 4</td>
<td>—</td>
<td>gpustack, ragflow, obsidian 等</td>
<td>NVLink</td>
<td>2080Ti x2 27B 20 t/s @ 64K-128K</td>
<td>[^67]</td>
</tr>
<tr>
<td>3× RTX 5090</td>
<td>3×32G = 96G</td>
<td>Qwen3.8-27B</td>
<td>Q8_0</td>
<td>llama.cpp</td>
<td>--parallel, flash-attn, KV q8_0, CUDA 13.3</td>
<td>42-43 t/s (单路), 56 t/s (5路聚合) @ 32K×5=163840</td>
<td>[^68]</td>
</tr>
<tr>
<td>2× RTX 2080 Ti (22G 魔改)</td>
<td>2×22G = 44G</td>
<td>Qwen3.8-27B, Qwen3.8-27B-FP8, Qwen3.6-35B-A3B 等 4</td>
<td>FP8, Q4_K_M</td>
<td>llama.cpp docker, CUDA 13.0.3, vLLM 等</td>
<td>tensor parallel, MTP 等</td>
<td>101.89 t/s; 131K</td>
<td>[^69]</td>
</tr>
<tr>
<td>2× RTX 3080 (20G 魔改)</td>
<td>2×20G = 40G</td>
<td>Qwen3.6-27B 等 8</td>
<td>INT, AWQ</td>
<td>SGLang, llama.cpp 等</td>
<td>MTP, TP 等</td>
<td>FP8: 38 t/s; AWQ: 53-54 t/s; AWQ-MTP: 65-83 t/s @ 170K (FP8), 380K (AWQ), 260K (AWQ-MTP); 44.29 t/s</td>
<td>[^70]</td>
</tr>
<tr>
<td>2× RTX 3090 (24G 魔改)</td>
<td>2×24G = 48G</td>
<td>Qwen3.6-27B Heretic</td>
<td>—</td>
<td>llama.cpp, ComfyUI</td>
<td>NVLink, tensor parallel, TP=2</td>
<td>68 t/s (NVLink), 65.6 t/s (无 NVLink)</td>
<td>[^71]</td>
</tr>
<tr>
<td>2× RTX 4090 (48G 魔改)</td>
<td>2×48G = 96G</td>
<td>Qwen3.5B MoE Q4, Wan 2.1, Qwen3-72B 等 10</td>
<td>Q4, Q4/Q8</td>
<td>llama.cpp 等</td>
<td>PCIe 等</td>
<td>70B Q4 15-25 t/s; 120K</td>
<td>[^72]</td>
</tr>
<tr>
<td>2× A10（Aliyun ECS Xeon Platinum 8369B）</td>
<td>2×24G = 48G</td>
<td>Qwen3.8-Flash-Next</td>
<td>UD-Q4_K_XL</td>
<td>llama.cpp</td>
<td>CPU offload, MoE, PCIe 4.0 x16</td>
<td>13.91 tok/s @ 130K</td>
<td>[^73]</td>
</tr>
<tr>
<td>2× Intel B70</td>
<td>2×32G = 64G</td>
<td>Qwen3.8-27B 等 6</td>
<td>FP8</td>
<td>vLLM, Docker 等</td>
<td>TP=2, FP8 KV, prefix-caching 等</td>
<td>33.3 t/s @ 16K; 13 t/s</td>
<td>[^74]</td>
</tr>
<tr>
<td>2× Intel B70 Pro</td>
<td>2×32G = 64G</td>
<td>—</td>
<td>—</td>
<td>vllm, comfyui, docker</td>
<td>XPU, wan, ltx2.3</td>
<td>—</td>
<td>[^75]</td>
</tr>
<tr>
<td>2× R9700（X99）</td>
<td>2×32G = 64G</td>
<td>Qwen3.8-27B 等 6</td>
<td>FP8, Q8</td>
<td>llama.cpp 等</td>
<td>layer split, MTP, PP, RCCL, ROCm 等</td>
<td>44.9 t/s @ 163K; 36 t/s @ 128K</td>
<td>[^76]</td>
</tr>
<tr>
<td>2× R9700（x99 E5 2666v3 1200W）</td>
<td>2×32G = 64G</td>
<td>Qwen3.6-27B, MiniMax H3, Wan2.2 等 4</td>
<td>Q4_K_M</td>
<td>llama.cpp, ollama, ComfyUI</td>
<td>tensor split, ROCm 6.3</td>
<td>27B Q4 15-20 t/s</td>
<td>[^77]</td>
</tr>
<tr>
<td>2× RTX 3090（DIY）</td>
<td>2×24G = 48G</td>
<td>Qwen3.8-27B 等 22</td>
<td>AWQ, AWQ INT4</td>
<td>SGLang 等</td>
<td>NVLink 等</td>
<td>decode 50-70 t/s代码, 35B A3B prefill 1500+ @ 220K; 双并发60 t/s, 单流120+ t/s, benchlocal 79% @ 262K</td>
<td>[^78]</td>
</tr>
<tr>
<td>2× RTX 3090 Ti（华南金牌 X99 + Z40 + 长城 1250W + 32…）</td>
<td>2×24G = 48G</td>
<td>Qwen3.6-27B</td>
<td>—</td>
<td>LM Studio, llama.cpp, vllm</td>
<td>TurboQuant, MTP, PCIe 2.0 x1</td>
<td>20 t/s (双卡), 39 t/s (3090单卡 LM Studio), 8 t/s (35B-A3B 旧机器); 80K</td>
<td>[^79]</td>
</tr>
<tr>
<td>2× RTX 4080 Super</td>
<td>2×32G = 64G</td>
<td>Qwen3.6 27B 等 5</td>
<td>Q4_K_M</td>
<td>llama.cpp, Hermes, ComfyUI 等</td>
<td>x8/x8, split-mode layer, x8+x8 PCIe</td>
<td>27B Q4 30-60 t/s; V4 Flash 40-50 decode 30-70 coding @ 27B; 27B Q4 30-60 t/s</td>
<td>[^80]</td>
</tr>
<tr>
<td>2× RTX 4090</td>
<td>2×24G = 48G</td>
<td>Qwen3.8-27B</td>
<td>FP8</td>
<td>SGLang, DSH, comfyui</td>
<td>—</td>
<td>24 tok/s</td>
<td>[^81]</td>
</tr>
<tr>
<td>2× RTX 5090</td>
<td>2×32G = 64G</td>
<td>Qwen3.8-27B, Qwen3.8-27B-BF16, Qwen3.8-27B-mmproj-F16 等 4</td>
<td>BF16</td>
<td>llama.cpp 等</td>
<td>NVLink, tensor split, MTP off, flash attention, q8_0 KV 等</td>
<td>48.05 tok/s @ 140000; 5090 decode ≈ 2.5x R9700, prefill ≈ 3x R9700</td>
<td>[^82]</td>
</tr>
<tr>
<td>2× RTX 6000</td>
<td>2×48G = 96G</td>
<td>Qwen3.6-27B, Qwen3.6 27B Q4_K_M</td>
<td>Q4_K_M</td>
<td>llama.cpp</td>
<td>—</td>
<td>2-5 t/s</td>
<td>[^83]</td>
</tr>
<tr>
<td>2× RTX 7900 XTX（DIY）</td>
<td>2×24G = 48G</td>
<td>Qwen3.8-27B 等 12</td>
<td>Q4_K_M, Q4</td>
<td>llama.cpp 等</td>
<td>MTP, TP=2, DFlash, ROCm, tensor parallel 等</td>
<td>34 t/s @ 64K; 22 t/s @ 64K</td>
<td>[^84]</td>
</tr>
<tr>
<td>2× V100 32G（2x V100 32G (无 NVLink)）</td>
<td>2×32G = 64G</td>
<td>Qwen3.6-27B Q8, Ornith-1.0-35B Q8, Qwen3.6-27B Q8_0</td>
<td>Q8_0</td>
<td>llama.cpp</td>
<td>—</td>
<td>V100 Q8 30 t/s, Ornith-35B Q8 ~100 t/s, PP 800-950 t/s @ 200K x 3; prefill 900 t/s, 30 tok/s @ 200K x 3</td>
<td>[^85]</td>
</tr>
<tr>
<td>170HX (40G 魔改)</td>
<td>40G</td>
<td>Qwen 27B-70B</td>
<td>QLoRA</td>
<td>PyTorch 等</td>
<td>HBM2</td>
<td>—</td>
<td>[^86]</td>
</tr>
<tr>
<td>170HX (64G 魔改)</td>
<td>64G</td>
<td>Qwen3.8-27B, Qwen3.8 Flash</td>
<td>w8a16 / Q4, w8a16</td>
<td>sglang, vllm</td>
<td>DFlash, DFlash2</td>
<td>100 t/s (32K), 60 t/s (200K), 300 t/s (并发), 20 t/s (Flash) @ 262K; 196 t/s (Ornith单路), 740 t/s (Ornith 10并发) @ 262K</td>
<td>[^87]</td>
</tr>
<tr>
<td>RTX 4090 (48G 魔改)（PCIe 5 x16 双槽）</td>
<td>48G</td>
<td>Qwen3.6-27B-FP8, Qwen 27B 越狱, SDXL 等 26</td>
<td>FP8, Q4</td>
<td>SGLang 等</td>
<td>MTP, HSA_OVERRIDE_GFX_VERSION, HIP_VISIBLE_DEVICES, CUDA_VISIBLE_DEVICES, tensor parallel 等</td>
<td>Decode快, 但编程一塌糊涂 @ 128K; vLLM 200K ctx 27B @ 200K</td>
<td>[^88]</td>
</tr>
<tr>
<td>RTX Pro 5000 (48G 魔改)</td>
<td>48G</td>
<td>—</td>
<td>—</td>
<td>comfyui</td>
<td>LTX 2.3, sulphur</td>
<td>—</td>
<td>[^89]</td>
</tr>
<tr>
<td>RTX Pro 5000 (72G 魔改)</td>
<td>72G</td>
<td>Qwen3.6 27B, MiniMax H3, Qwen3.8-27B</td>
<td>Q4/Q8, FP8</td>
<td>ComfyUI 等</td>
<td>ROCm, DirectML, ZLUDA, MTP, NEXTN 等</td>
<td>Q4 prefill 2384 t/s decode 59.14 t/s; Q8 prefill 2335 decode 38.28 t/s @ 4K; 80 t/s @ 262K</td>
<td>[^90]</td>
</tr>
<tr>
<td>H100</td>
<td>80G</td>
<td>—</td>
<td>—</td>
<td>Ollama, llama.cpp</td>
<td>Vulkan, ROCm, CUDA, Flash-Attn</td>
<td>50 t/s</td>
<td>[^91]</td>
</tr>
<tr>
<td>L20</td>
<td>48G</td>
<td>Qwen3.6-27B</td>
<td>FP8</td>
<td>vllm</td>
<td>CUDA, MTP</td>
<td>33.41 t/s @ 128K; 130K</td>
<td>[^92]</td>
</tr>
<tr>
<td>L40S</td>
<td>48G</td>
<td>Qwen3.6-27B-MTP-GGUF 等 4</td>
<td>FP8</td>
<td>vllm</td>
<td>MTP</td>
<td>50 t/s @ 260K; 2000 t/s</td>
<td>[^93]</td>
</tr>
<tr>
<td>M1 Max（M1 Max MacBook Pro 64G）</td>
<td>64G</td>
<td>Qwen3.5-35B-A3B</td>
<td>4-bit</td>
<td>OMLX</td>
<td>—</td>
<td>30 几 t/s</td>
<td>[^94]</td>
</tr>
<tr>
<td>M3 Max（MacBook Pro 16" M3 Max 14C CPU…）</td>
<td>64G</td>
<td>Qwen3.5-27B, Qwen3.6-27B</td>
<td>4-bit</td>
<td>Ollama, MLX, ComfyUI 等</td>
<td>MPS backend, unified memory</td>
<td>—</td>
<td>[^95]</td>
</tr>
<tr>
<td>M4 Pro（Mac M4 Pro 64G）</td>
<td>48G</td>
<td>DeepSeek V*Flash-Vision-Exp</td>
<td>—</td>
<td>ds4</td>
<td>SSD streaming</td>
<td>10 t/s</td>
<td>[^97]</td>
</tr>
<tr>
<td>M5 Pro（M5 Pro 64G）</td>
<td>64G</td>
<td>Qwen3.6-27B, Qwen3.6-35B-A3B</td>
<td>Q4</td>
<td>LM Studio, MTPLX, oMLX 等</td>
<td>MTP</td>
<td>80-90 t/s (短), 50-60 t/s (长) @ 64K; 35B-A3B 50+ t/s (64K), 27B 19+ t/s (64K, MTP), 35A3 prefill 300+ t/s @ 64K+</td>
<td>[^98]</td>
</tr>
<tr>
<td>RTX 3080</td>
<td>40G</td>
<td>Qwen3.6-27B</td>
<td>—</td>
<td>llama.cpp</td>
<td>MTP, 魔改</td>
<td>35-60 t/s @ 128K</td>
<td>[^99]</td>
</tr>
<tr>
<td>RTX 6000</td>
<td>48G</td>
<td>Qwen3.6 27B 等 4</td>
<td>FP8</td>
<td>vllm, ComfyUI</td>
<td>CUDA</td>
<td>—</td>
<td>[^100]</td>
</tr>
<tr>
<td>RTX Pro 5000</td>
<td>48G</td>
<td>Qwen3.8-27B-FP8, Qwen3.8-Flash-Next, Qwen3.8-27B 等 6</td>
<td>FP8, UD-Q4_K_XL</td>
<td>SGLang, FlashInfer, Unsloth Studio 等</td>
<td>MTP, EAGLE, HiCache, TP=2, mamba-radix-cache 等</td>
<td>60.5 t/s @ 262K; 30 tok/s (64K/128K), 230-250 tok/s prefill, 24-28 tok/s (vision) @ 128K</td>
<td>[^101]</td>
</tr>
<tr>
<td>RTX Pro 6000（Ubuntu 24.04）</td>
<td>96G</td>
<td>Qwen3.8-27B, Qwen3.8-27B-NVFP4, Qwen3.6 27B 等 10</td>
<td>NVFP4</td>
<td>SGLang, ComfyUI, vLLM 等</td>
<td>MTP, DFlash2, TP=2, NVLink, Turboquant 等</td>
<td>MTP=3: 71.2 t/s; MTP=10/20: 241.9 t/s; MTP=30/40: 350 t/s; MTP=20 241.9 t/s, MTP=30/40 350 t/s</td>
<td>[^102]</td>
</tr>
<tr>
<td>W7900（Windows 11）</td>
<td>48G</td>
<td>H3, Qwen3.8-27B, Qwen3.6-27B</td>
<td>Q4, Q4_K_M</td>
<td>ComfyUI, llama.cpp</td>
<td>MTP, Vulkan, KV q4_0, mmproj, vision</td>
<td>50 t/s (原 20 t/s) @ 262144</td>
<td>[^103]</td>
</tr>
<tr>
<td>h100</td>
<td>80G</td>
<td>Qwen3.5-397B-A17B, Qwen3.5, Qwen2-VL-72B 等 8</td>
<td>BF16</td>
<td>vllm</td>
<td>tensor parallel, FP8, BF16</td>
<td>—</td>
<td>[^104]</td>
</tr>
</tbody>
</table>
<h2>96-256G 显存</h2>
<p dir="auto">21 个配置组合（合并自论坛 73 条相似部署）</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
</tr>
</thead>
<tbody>
<tr>
<td>显卡 (含魔改与机器)</td>
<td>总显存</td>
<td>可跑模型</td>
<td>量化</td>
<td>环境</td>
<td>关键技术</td>
<td>速度 / 上下文</td>
<td>引用</td>
</tr>
<tr>
<td>8× RTX 3090（ubuntu）</td>
<td>8×24G = 192G</td>
<td>Qwen3.6-27B</td>
<td>—</td>
<td>llama.cpp, hermes, TG 等</td>
<td>tensor parallel, NVLink, 分布式</td>
<td>—</td>
<td>[^106]</td>
</tr>
<tr>
<td>4× Intel B70 Pro（4×B70 Pro）</td>
<td>4×32G = 128G</td>
<td>Qwen3.8B</td>
<td>FP8</td>
<td>vllm</td>
<td>—</td>
<td>57.08 t/s (单卡 8B), 400W 开机, 600W 两卡, 4 卡 4 视频+1 LLM</td>
<td>[^107]</td>
</tr>
<tr>
<td>4× L20</td>
<td>4×48G = 192G</td>
<td>Qwen3.6-27B-MTP-GGUF 等 7</td>
<td>FP8</td>
<td>llama.cpp</td>
<td>MTP, CUDA, flash-attn</td>
<td>7.5 t/s @ 256K</td>
<td>[^108]</td>
</tr>
<tr>
<td>4× R9700（技嘉G292-Z20 + AMD 7K62 + 128G）</td>
<td>4×32G = 128G</td>
<td>Qwen3.8-27B-FP8, Qwen3.8-27B</td>
<td>FP8</td>
<td>vllm 等</td>
<td>MTP, tensor-parallel-size 4, chunked prefill, prefix caching, AITER 等</td>
<td>192.51 tok/s (bench), &lt;10 tok/s (hermes multi-user) @ 180000; 64.6 t/s (单卡), 16.4 t/s (2卡layer), 13.7 t/s (2卡tensor), 3.9 t/s (8卡TP=8)</td>
<td>[^109]</td>
</tr>
<tr>
<td>2× RTX Pro 5000 (72G 魔改)</td>
<td>2×72G = 144G</td>
<td>Qwen3.8 27B</td>
<td>FP8/NVFP4</td>
<td>SGLang</td>
<td>MTP, tensor parallel</td>
<td>—</td>
<td>[^110]</td>
</tr>
<tr>
<td>2× DGX SPARK（2x DGX SPARK GB10 cluster）</td>
<td>2×128G = 256G</td>
<td>DeepSeek V*Flash-DSpark</td>
<td>FP4+FP8</td>
<td>vLLM</td>
<td>—</td>
<td>45-65 t/s</td>
<td>[^111]</td>
</tr>
<tr>
<td>2× DGX Spark</td>
<td>2×128G = 256G</td>
<td>DeepSeek V*Flash</td>
<td>NVFP4</td>
<td>SGLang, DSpark</td>
<td>200G网络互联</td>
<td>测速40-50 t/s, coding 30-70, pp 2000 @ 500K; 单流首token 2-8s, 50-80 t/s; 6并发150-200 t/s; V4 flash 2000 pp 30 decode @ 1M</td>
<td>[^112]</td>
</tr>
<tr>
<td>2× GB10（Asus Ascent GX10 (双GB10)）</td>
<td>2×128G = 256G</td>
<td>DeepSeek V*Flash-0731, Qwen3.8-27B</td>
<td>FP8+NVFP4</td>
<td>hermes, DSH, SGLang 等</td>
<td>SGLang, DSpark, Radix</td>
<td>PP 1500-2500 t/s, decode 35-76 t/s, 单会话最高76.7 t/s</td>
<td>[^113]</td>
</tr>
<tr>
<td>2× M1 Max（X99）</td>
<td>2×64G = 128G</td>
<td>Qwen3.6-14B, Qwen3.6-27B</td>
<td>Q4_K_M</td>
<td>llama.cpp, vllm, mlx</td>
<td>tensor parallel, TP 32, Q4_K_M</td>
<td>32K</td>
<td>[^114]</td>
</tr>
<tr>
<td>2× RTX Pro 6000</td>
<td>2×96G = 192G</td>
<td>Qwen3.8-27B, DeepSeek, Qwen3.6-35B-A3B 等 4</td>
<td>FP16/BF16</td>
<td>Linux, comfyui, LTX 2.3</td>
<td>NVLink, BF16, 魔改</td>
<td>BF16 27B ~29 t/s</td>
<td>[^115]</td>
</tr>
<tr>
<td>DGX Spark（DGX Spark）</td>
<td>128G</td>
<td>Qwen3.8-27B, DeepSeek V*Flash 等 10</td>
<td>NVFP4</td>
<td>SGLang, Hermes, vllm 等</td>
<td>NVFP4, DSpark 等</td>
<td>Q4 90-100 t/s, BF16 27B ~29 t/s; 数学43.6 t/s, 代码34 t/s, Hermes tool calling 92/100</td>
<td>[^116]</td>
</tr>
<tr>
<td>GB10（DGX Spark）</td>
<td>128G</td>
<td>Qwen3.8-Flash-Next, Qwen3.6 27B Q8, DeepSeek Q2</td>
<td>NVFP4</td>
<td>vllm, SGLang</td>
<td>MTP</td>
<td>PP 1500-2000 t/s, decode 30 t/s, KV 630K</td>
<td>[^117]</td>
</tr>
<tr>
<td>M3 Ultra（Mac Studio M3 Ultra）</td>
<td>192G</td>
<td>DeepSeek V*Flash, Qwen3.6-27B</td>
<td>Q2</td>
<td>MLX 等</td>
<td>kv-disk 64G, unified memory 512GB/s, DFlash, TurboQuant, SpecPrefill 等</td>
<td>30 t/s @ 131072; 23 t/s (普通), 109.4 t/s (DFlash 短上下文), 39.6 t/s (2x batched) @ 4096-8192</td>
<td>[^118]</td>
</tr>
<tr>
<td>M5 MAX</td>
<td>128G</td>
<td>—</td>
<td>—</td>
<td>llama.cpp</td>
<td>tensor parallel, MTP</td>
<td>25 t/s; 17 t/s</td>
<td>[^119]</td>
</tr>
<tr>
<td>M5 Max</td>
<td>128G</td>
<td>Qwen3.8-27B, Qwen3.6-27B 等 11</td>
<td>Q4</td>
<td>llama.cpp, oMLX, MLX 等</td>
<td>MTP 等</td>
<td>Q8 MTP 40t/s, Q4 MTP 30t/s, Q6 MTP 40-50t/s, Youssofal混合8bit 40t/s @ 32K; pp1024/tg128: 881.6/63.6 t/s; pp16k/tg128: 630.6/56.6 t/s; 16-20 t/s一般 @ 16K</td>
<td>[^120]</td>
</tr>
<tr>
<td>M5 Max</td>
<td>128G</td>
<td>Qwen3.6-35B A3B, Qwen3.6-27B 8bit, Qwen3.6-27B 等 11</td>
<td>—</td>
<td>oMLX, Hermes, LM Studio 等</td>
<td>TurboQuant, KV cache 8bit, thinking on, cpu-moe, expert-offload</td>
<td>35B-A3B: PP 963.7, TG 50.8 t/s; 27B-OptiQ: PP 254.4, TG 17.1 t/s; DS V4 Flash 2bit: PP 270, TG 35 t/s @ 128K</td>
<td>[^121]</td>
</tr>
<tr>
<td>M5 Ultra（Mac Studio M5 Ultra 256G+2TB）</td>
<td>256G</td>
<td>Qwen3.8-27B, DeepSeek V*Flash 等 8</td>
<td>Q4</td>
<td>llama.cpp</td>
<td>unified memory</td>
<td>41 t/s @ 128K; 70 t/s (96G M5 Ultra Qwen3.8-27B)</td>
<td>[^122]</td>
</tr>
<tr>
<td>M5 max（DGX Spark）</td>
<td>128G</td>
<td>—</td>
<td>Q4</td>
<td>—</td>
<td>MTP</td>
<td>25 t/s @ 64K</td>
<td>[^123]</td>
</tr>
<tr>
<td>Mac Studio</td>
<td>256G</td>
<td>Qwen3.6-27b, DeepSeek V*Flash</td>
<td>Q4_K_M</td>
<td>SGLang, Hermes</td>
<td>—</td>
<td>50 t/s, 400 t/s @ 128K; 10 t/s</td>
<td>[^124]</td>
</tr>
</tbody>
</table>
<h2>256G+ 显存</h2>
<p dir="auto">11 个配置组合（合并自论坛 14 条相似部署）</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
</tr>
</thead>
<tbody>
<tr>
<td>显卡 (含魔改与机器)</td>
<td>总显存</td>
<td>可跑模型</td>
<td>量化</td>
<td>环境</td>
<td>关键技术</td>
<td>速度 / 上下文</td>
<td>引用</td>
</tr>
<tr>
<td>10× DGX SPARK（10x DGX SPARK GB10 cluster wit…）</td>
<td>10×128G = 1280G</td>
<td>GLM 5.2</td>
<td>—</td>
<td>—</td>
<td>—</td>
<td>2x tok/s @ 320K x 10</td>
<td>[^125]</td>
</tr>
<tr>
<td>6× RTX 8000（DIY 6xRTX 8000）</td>
<td>6×48G = 288G</td>
<td>Qwen3.8-27B, Ornith-1.0-35B, Qwen3.6-35B</td>
<td>Q8</td>
<td>llama.cpp, new-api</td>
<td>Turing 672GB/s, tensor-split, CUDA 7.5</td>
<td>Qwen3.8-27B 27ms/token (32-36 t/s 2并发), Qwen3.6-35B-A3B 202 t/s (2并发), Ornith-1.0-35B 181 t/s (2并发) @ 256K (单), 128K (双)</td>
<td>[^128]</td>
</tr>
<tr>
<td>4× DGX Spark（4x DGX Spark cluster）</td>
<td>4×128G = 512G</td>
<td>GLM-5.2-Quantrio-INT4-INT8-Mixed</td>
<td>INT4+INT8 Mixed</td>
<td>vLLM</td>
<td>DFlash</td>
<td>concurrency 1: 40.3 t/s, 4: 95.7 t/s; PP 506-690 t/s</td>
<td>[^129]</td>
</tr>
<tr>
<td>4× Pro 6000</td>
<td>4×96G = 384G</td>
<td>DeepSeek-R1-Distill-Qwen-32B, Qwen3-30B-A3B, MiniMax H3 等 5</td>
<td>FP8</td>
<td>vLLM, LLaMA-Factory, DeepSpeed 等</td>
<td>LoRA, ZeRO-3, GRPO, ECC 等</td>
<td>32K; 4K</td>
<td>[^130]</td>
</tr>
<tr>
<td>4× RTX Pro 6000（办公室）</td>
<td>4×96G = 384G</td>
<td>—</td>
<td>—</td>
<td>vllm, SGLang</td>
<td>vgpu</td>
<td>—</td>
<td>[^131]</td>
</tr>
<tr>
<td>2× B200（Apptainer container）</td>
<td>2×192G = 384G</td>
<td>Qwen3.8-27B-FP8</td>
<td>FP8</td>
<td>vllm</td>
<td>DFlash2, TP2, flashinfer, speculative, dflash</td>
<td>232 t/s (18req), 363 t/s (11req), 1114 t/s (2req), 3247.7 t/s (引擎) @ 254000</td>
<td>[^133]</td>
</tr>
</tbody>
</table>
<h2>引用列表附件。<a href="https://upload.lcz.me/uploads/47788ea8-0b66-44f4-b35b-1f8a7fcbd96c.html" rel="nofollow ugc">引用列表133条.html</a></h2>
]]></description><link>https://lcz.me/topic/1506</link><generator>RSS for Node</generator><lastBuildDate>Mon, 07 Sep 2026 16:51:02 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1506.rss" rel="self" type="application/rss+xml"/><pubDate>Sat, 05 Sep 2026 01:32:45 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Mon, 07 Sep 2026 03:53:06 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/pen-chi-lin" aria-label="Profile: PEN-CHI-LIN">@<bdi>PEN-CHI-LIN</bdi></a> 使用LLM足够了</p>
]]></description><link>https://lcz.me/post/16339</link><guid isPermaLink="true">https://lcz.me/post/16339</guid><dc:creator><![CDATA[80zhangyan]]></dc:creator><pubDate>Mon, 07 Sep 2026 03:53:06 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Mon, 07 Sep 2026 02:20:37 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/applejuice" aria-label="Profile: applejuice">@<bdi>applejuice</bdi></a> 5060 出掉了前陣子呆灣這兩張5060比一張9700還貴，我直接出掉換兩張9700。16G想玩minimax h3很痛苦= = !</p>
]]></description><link>https://lcz.me/post/16324</link><guid isPermaLink="true">https://lcz.me/post/16324</guid><dc:creator><![CDATA[PEN CHI LIN]]></dc:creator><pubDate>Mon, 07 Sep 2026 02:20:37 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Mon, 07 Sep 2026 01:49:32 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/pen-chi-lin" aria-label="Profile: PEN-CHI-LIN">@<bdi>PEN-CHI-LIN</bdi></a></p>
<p dir="auto">上4 5060呗</p>
]]></description><link>https://lcz.me/post/16316</link><guid isPermaLink="true">https://lcz.me/post/16316</guid><dc:creator><![CDATA[applejuice]]></dc:creator><pubDate>Mon, 07 Sep 2026 01:49:32 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Mon, 07 Sep 2026 01:29:06 GMT]]></title><description><![CDATA[<p dir="auto">補充一下雙5060TI的速度感覺也沒那麼不堪，就是顯存小硬傷，生視頻不好玩!</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/ff391a02-b0ea-44c3-aa0c-5ebdb058837a.png" alt="2026-09-07_090743.png" class=" img-fluid img-markdown" /><br />
<img src="https://upload.lcz.me/uploads/f60c3938-d1b7-4711-84ca-897540c3650f.png" alt="2026-09-07_090602.png" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/16312</link><guid isPermaLink="true">https://lcz.me/post/16312</guid><dc:creator><![CDATA[PEN CHI LIN]]></dc:creator><pubDate>Mon, 07 Sep 2026 01:29:06 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sun, 06 Sep 2026 08:43:00 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/kos-or" aria-label="Profile: kos-or">@<bdi>kos-or</bdi></a> 是的是的<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f44d.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--+1" style="height:23px;width:auto;vertical-align:middle" title=":+1:" alt="👍" /></p>
]]></description><link>https://lcz.me/post/16175</link><guid isPermaLink="true">https://lcz.me/post/16175</guid><dc:creator><![CDATA[rock shi]]></dc:creator><pubDate>Sun, 06 Sep 2026 08:43:00 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sun, 06 Sep 2026 07:57:58 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/rock-shi" aria-label="Profile: rock-shi">@<bdi>rock-shi</bdi></a></p>
<p dir="auto">我沒有Mac Mini, Macbook Pro, Mac Studio, 但根據網路使用者的反饋是Mac適合跑 MoE model, 不適合跑 Dense model, 未來看看MoE和 Dense models 的發展吧 只要生活上和工作上夠用 都很好 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f60a.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--blush" style="height:23px;width:auto;vertical-align:middle" title=":blush:" alt="😊" /></p>
]]></description><link>https://lcz.me/post/16172</link><guid isPermaLink="true">https://lcz.me/post/16172</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Sun, 06 Sep 2026 07:57:58 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sun, 06 Sep 2026 07:48:55 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/kos-or" aria-label="Profile: kos-or">@<bdi>kos-or</bdi></a> 对于准96g mac用户，还是蛮期待未来迭代。毕竟大参数里只有它能塞得进96g mac，显存空间弥补了70b规模的断档</p>
]]></description><link>https://lcz.me/post/16169</link><guid isPermaLink="true">https://lcz.me/post/16169</guid><dc:creator><![CDATA[rock shi]]></dc:creator><pubDate>Sun, 06 Sep 2026 07:48:55 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sun, 06 Sep 2026 07:02:14 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a></p>
<p dir="auto">Reddit 網友們也是在討論 qwen3.8 Flash next 體驗沒27B好, 沒必要為了qwen3.8 Flash next 升級硬體, 使用27B就夠應付大多數的場景</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/f9842510-c389-4319-ae13-45fc6aad0807.jpeg" alt="e72e48f5-7c37-4ae1-bf83-882115e53ab0-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/16156</link><guid isPermaLink="true">https://lcz.me/post/16156</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Sun, 06 Sep 2026 07:02:14 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sun, 06 Sep 2026 04:09:55 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 27b目前确实太天花板了</p>
]]></description><link>https://lcz.me/post/16129</link><guid isPermaLink="true">https://lcz.me/post/16129</guid><dc:creator><![CDATA[rock shi]]></dc:creator><pubDate>Sun, 06 Sep 2026 04:09:55 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sun, 06 Sep 2026 03:59:15 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/rock-shi" aria-label="Profile: rock-shi">@<bdi>rock-shi</bdi></a> 这是个不错的选择，但是这个模型很慢，体验没27B好，好处是知识面全。</p>
]]></description><link>https://lcz.me/post/16119</link><guid isPermaLink="true">https://lcz.me/post/16119</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Sun, 06 Sep 2026 03:59:15 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sun, 06 Sep 2026 02:25:56 GMT]]></title><description><![CDATA[<p dir="auto">96g还可以跑qwen3.8 Flash next 4bit量化，n-gram放在ssd</p>
]]></description><link>https://lcz.me/post/16099</link><guid isPermaLink="true">https://lcz.me/post/16099</guid><dc:creator><![CDATA[rock shi]]></dc:creator><pubDate>Sun, 06 Sep 2026 02:25:56 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sun, 06 Sep 2026 01:40:46 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/chu-hao-lung" aria-label="Profile: Chu-Hao-Lung">@<bdi>Chu-Hao-Lung</bdi></a></p>
<p dir="auto">等多三年，我们去捡 rtxpro 的洋垃圾</p>
]]></description><link>https://lcz.me/post/16091</link><guid isPermaLink="true">https://lcz.me/post/16091</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Sun, 06 Sep 2026 01:40:46 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sun, 06 Sep 2026 01:25:27 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/imbiplaza-asus" aria-label="Profile: imbiplaza-ASUS">@<bdi>imbiplaza-ASUS</bdi></a> 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論</p>
<p dir="auto">RTX pro 6000 600W<br />
優點: 性能滿血 滿執行的時候音量較小<br />
缺點: 也是有燒接口的風險</p>
<p dir="auto">RTX pro 6000 max Q 300W<br />
優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口<br />
缺點: 性能大約下降7-15% 跑滿載 聲音不小</p>
<p dir="auto">在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收</p>
]]></description><link>https://lcz.me/post/16089</link><guid isPermaLink="true">https://lcz.me/post/16089</guid><dc:creator><![CDATA[Chu Hao-Lung]]></dc:creator><pubDate>Sun, 06 Sep 2026 01:25:27 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sat, 05 Sep 2026 13:09:43 GMT]]></title><description><![CDATA[<p dir="auto">集結論壇精華 感謝 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f642.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--slightly_smiling_face" style="height:23px;width:auto;vertical-align:middle" title=":)" alt="🙂" /></p>
]]></description><link>https://lcz.me/post/16032</link><guid isPermaLink="true">https://lcz.me/post/16032</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Sat, 05 Sep 2026 13:09:43 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sat, 05 Sep 2026 10:37:19 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 用手机试了一下，横屏正好能把表格看全。。。这玩意也不好整，本来以为很简单，就用在线模型整的，结果搞了好几轮把我5小时额度都干爆了才弄完，早知道用本地模型了。</p>
]]></description><link>https://lcz.me/post/16018</link><guid isPermaLink="true">https://lcz.me/post/16018</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sat, 05 Sep 2026 10:37:19 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sat, 05 Sep 2026 09:40:34 GMT]]></title><description><![CDATA[<p dir="auto">以后总结表格在4列以内，不然手机看起来受罪，让AI整理即可。数据挺充分，以后我会整理更多专题页面，方便新人观看。也让一些论坛优质老帖能发挥余热。</p>
]]></description><link>https://lcz.me/post/16009</link><guid isPermaLink="true">https://lcz.me/post/16009</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Sat, 05 Sep 2026 09:40:34 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sat, 05 Sep 2026 08:51:15 GMT]]></title><description><![CDATA[<p dir="auto">三个静音风扇 的想法 没必要。换个房间放是正解。<br />
有不少测试已经测试了三风扇方案。<br />
1.容易搞废。放在第一条。这是重点。<br />
2.换完一样很吵。具体看别人的测试视频把。<br />
3.小火龙不建议加大投资。并且你越改。贬值越多。跑着吧。玩腻了就脱手。现在这个时间点是回血的好时机。</p>
]]></description><link>https://lcz.me/post/15996</link><guid isPermaLink="true">https://lcz.me/post/15996</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Sat, 05 Sep 2026 08:51:15 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sat, 05 Sep 2026 04:27:06 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/imbiplaza-asus" aria-label="Profile: imbiplaza-ASUS">@<bdi>imbiplaza-ASUS</bdi></a> 我 qwen3.8 27B q4km + mtp 128K 单路中缓存在85左右，没中 65左右， 正常长程工作跑完 55左右， 很保守了， 感觉好像散热不怎么好， 想把涡轮换成三个静音风扇那种。3090 24G</p>
]]></description><link>https://lcz.me/post/15961</link><guid isPermaLink="true">https://lcz.me/post/15961</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sat, 05 Sep 2026 04:27:06 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sat, 05 Sep 2026 04:15:51 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/johnnybegood" aria-label="Profile: johnnybegood">@<bdi>johnnybegood</bdi></a></p>
<p dir="auto">看来我保持rtxpro 4500 32gb 单路 50 t/s 即可</p>
<p dir="auto">因为始终单路 qwen3.8 27b 喂不饱96gb vram...</p>
]]></description><link>https://lcz.me/post/15958</link><guid isPermaLink="true">https://lcz.me/post/15958</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Sat, 05 Sep 2026 04:15:51 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sat, 05 Sep 2026 03:55:08 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/imbiplaza-asus" aria-label="Profile: imbiplaza-ASUS">@<bdi>imbiplaza-ASUS</bdi></a></p>
<h1>RTX Pro 6000 Max-Q 论坛数据汇总</h1>
<h2>1. 完整规格（论坛共识 / NVIDIA 官方）</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>RTX Pro 6000 Max-Q</th>
<th>对比 Pro 6000（非 Max-Q）</th>
</tr>
</thead>
<tbody>
<tr>
<td>显存</td>
<td>96 GB GDDR7</td>
<td>96 GB GDDR7</td>
</tr>
<tr>
<td>带宽</td>
<td>1.79 TB/s</td>
<td>1.79 TB/s</td>
</tr>
<tr>
<td>TDP</td>
<td><strong>300 W</strong>（功耗减半）</td>
<td>600 W</td>
</tr>
<tr>
<td>架构</td>
<td>Blackwell</td>
<td>Blackwell</td>
</tr>
<tr>
<td>AI TOPS</td>
<td>3511</td>
<td>4000</td>
</tr>
<tr>
<td>形态</td>
<td>双槽</td>
<td>双槽</td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto"><strong>核心卖点</strong>：在保留 96G 显存 + 1.79 TB/s 带宽的同时，把功耗从 600W 压到 300W，非常适合多卡高密度工作站部署。</p>
</blockquote>
<hr />
<h2>2. 论坛实测记录</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>#</th>
<th>来源</th>
<th>主题标题</th>
<th>配置</th>
<th>性能数据</th>
</tr>
</thead>
<tbody>
<tr>
<td>1</td>
<td><a href="https://lcz.me/topic/19/19/%E8%BF%81%E7%A7%BBwsl%E4%B8%8A%E7%9A%84%E5%8C%85-%E5%88%B0linux-ubuntu-22.04#171">TID 19 / PID 171</a></td>
<td>迁移 wsl 上的包到 Linux ubuntu 22.04</td>
<td>2× RTX 3090Ti + Pro 6000 Max-Q（共 3 卡 72G）</td>
<td>从 WSL 迁 Linux 跑 LTX 视频</td>
</tr>
<tr>
<td>2</td>
<td><a href="https://lcz.me/topic/284/284/%E9%97%9C%E6%96%BC%E6%9C%AC%E5%9C%B0%E7%89%88%E7%9A%84%E6%A8%A1%E5%9E%8B#3326">TID 284 / PID 3326</a></td>
<td>关于本地版的模型</td>
<td>U9 285K + 192G 内存 + Pro 6000 Max-Q</td>
<td>整机 96G 单卡，从 OpenClaw 改用 Hermes；192G 系统内存可做 CPU 卸载</td>
</tr>
<tr>
<td>3</td>
<td><a href="https://lcz.me/topic/966/966/rtx-pro-6000-max-q%E9%85%8D%E5%90%88qwen3.6-mtp%E5%BC%80%E5%88%B020%E6%94%B6%E8%8E%B7%E5%89%8D%E6%89%80%E6%9C%89%E8%A7%81%E7%9A%84%E6%95%88%E7%8E%87#10925">TID 966 / PID 10925</a></td>
<td>Pro 6000 Max-Q + Qwen3.6 MTP 开到 20</td>
<td>Pro 6000 Max-Q + Qwen3.6-27B + vLLM</td>
<td><strong>MTP=20, 241.9 t/s（单路）</strong></td>
</tr>
<tr>
<td>4</td>
<td><a href="https://lcz.me/topic/966/966/...#10928">TID 966 / PID 10928</a></td>
<td>同上</td>
<td>同上</td>
<td>MTP=30/40 → <strong>350 t/s</strong>（效率递减）</td>
</tr>
<tr>
<td>5</td>
<td><a href="https://lcz.me/topic/966/966/...#10939">TID 966 / PID 10939</a></td>
<td>同上</td>
<td>同上</td>
<td><strong>batch=4 并发 ~1000 t/s</strong>（GPU util 0.55）</td>
</tr>
</tbody>
</table>
<hr />
<h2>3. Tony Xu 实测性能曲线（Pro 6000 Max-Q + Qwen3.6-27B + vLLM）</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>MTP 参数</th>
<th>Draft 接受率</th>
<th>单路生成速度</th>
<th>备注</th>
</tr>
</thead>
<tbody>
<tr>
<td>MTP=3</td>
<td>86.3%</td>
<td>~85 t/s</td>
<td>基准</td>
</tr>
<tr>
<td>MTP=10</td>
<td>92.0%</td>
<td>~242 t/s</td>
<td>收益明显</td>
</tr>
<tr>
<td>MTP=20</td>
<td>96.1%</td>
<td>241-249 t/s</td>
<td>接受率最高</td>
</tr>
<tr>
<td>MTP=30/40</td>
<td>—</td>
<td>~350 t/s</td>
<td>接受率已饱和，边际收益递减</td>
</tr>
<tr>
<td><strong>batch=4 并发</strong></td>
<td>—</td>
<td><strong>~1000 t/s</strong></td>
<td>GPU util 仍仅 0.55</td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto"><strong>作者注</strong>：在 0.55 GPU 利用率下已能稳定 1000 t/s，作者认为若解锁到 0.92 utilization，理论上可达 1800 t/s。</p>
</blockquote>
<hr />
<h2>4. 关键结论</h2>
<ol>
<li><strong>96G 不是瓶颈</strong>：跑 Qwen3.6-27B BF16 单路时显存绰绰有余，KV cache 占用 &lt; 30%</li>
<li><strong>功耗优势决定部署形态</strong>：标准 600W 装 4 卡机箱电源压力大，Max-Q 300W 装 4 卡仅 1200W，主流 1600-2000W 电源即可</li>
<li><strong>MTP 收益存在拐点</strong>：MTP=20 时接受率 96% 已接近饱和，再上调到 30/40 收益下降</li>
<li><strong>高并发友好</strong>：batch=4 单卡就能跑 ~1000 t/s，4×Max-Q 集群可达 4000+ t/s 推理</li>
</ol>
]]></description><link>https://lcz.me/post/15950</link><guid isPermaLink="true">https://lcz.me/post/15950</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sat, 05 Sep 2026 03:55:08 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sat, 05 Sep 2026 03:51:16 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/johnnybegood" aria-label="Profile: johnnybegood">@<bdi>johnnybegood</bdi></a></p>
<p dir="auto">可能是效率高了。。。</p>
<p dir="auto">但是大部分我看的都是600w满血版本</p>
]]></description><link>https://lcz.me/post/15947</link><guid isPermaLink="true">https://lcz.me/post/15947</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Sat, 05 Sep 2026 03:51:16 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sat, 05 Sep 2026 03:49:11 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/imbiplaza-asus" aria-label="Profile: imbiplaza-ASUS">@<bdi>imbiplaza-ASUS</bdi></a> 我强烈怀疑这个说法， 性能不会差这么多， 反而有些人说因为限了功率， 效率反而上去了呢， 如果在计算机房用， 肯定有差距， 如果个人用， 反而是maxq好吧， 也要看实际使用环境的。</p>
]]></description><link>https://lcz.me/post/15945</link><guid isPermaLink="true">https://lcz.me/post/15945</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sat, 05 Sep 2026 03:49:11 GMT</pubDate></item><item><title><![CDATA[Reply to 我的显存是（8G、12G、24G、32G、48G… 512G）的话，到底能做什么？ on Sat, 05 Sep 2026 03:41:11 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/johnnybegood" aria-label="Profile: johnnybegood">@<bdi>johnnybegood</bdi></a></p>
<p dir="auto">因为我听说maxq 300w只是慢 20% 价格也是便宜20%...</p>
<p dir="auto">但是听说实测慢50%</p>
]]></description><link>https://lcz.me/post/15943</link><guid isPermaLink="true">https://lcz.me/post/15943</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Sat, 05 Sep 2026 03:41:11 GMT</pubDate></item></channel></rss>