跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. 我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?

我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?

已定时 已固定 已锁定 已移动 AI硬件
29 帖子 10 发布者 479 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • J 离线
    J 离线
    johnnybegood
    劳动模范 技术大牛
    编写于 最后由 johnnybegood 编辑
    #1

    数据来源: lcz.me 论坛「抡锤者」AI 硬件 + LLM 讨论区 | 覆盖主题: 535 | 首手记录: 1371 条 → 去重后 133 个配置组合 |

    *本文为AI整理,人工简单校对,必然存在少许事实性错误,请知悉。人类不对此负责。对某项内容有疑问的,最后一列有引用序号,文末有HTML引用链接,请到里面找到对应文章自行阅读。

    表格按 合并后总显存 划分(双卡 = 两卡之和,如 2× RTX 4090 = 48G)。每行 = 同一显卡组合在论坛的多次部署归并,列出最具代表性的配置。「魔改」指 20G/22G/48G/72G/96G 改卡或非公版配置。

    预算/场景 推荐显存 论坛常见配置 跑得最稳的模型 配套技术
    入门 / 学生机 8-12G RTX 3060 12G / 4060 / 2080 Ti 22G 魔改 Qwen3.6-35B-A3B (Q4) / Qwen3.6-27B (Q4) MTP、APEX 量化、MoE CPU offload
    主流性价比 24G RTX 3090 / 4090 / RX 7900 XTX Qwen3.6-27B、Qwen3.8-27B、Gemma-3/4、DeepSeek V4 Flash MTP、TurboQuant、vLLM、llama.cpp Vulkan、ROCm
    32G 甜品 32G R9700 32G / RTX 5090 / RTX 4080S 32G 魔改 Qwen3.6-27B Q4 → FP8/BF16 满血 MTP、DFlash、TurboQuant、vLLM + HiCache
    双卡甜蜜点 48G 2× RTX 3090 / 2× 4090 / 2× 7900 XTX Qwen3.6-27B + 长上下文 / 27B BF16 NVLink、张量并行 (TP=2)、MTP、SGLang
    多卡 4×96G 384G 4× Pro 6000 / 2× H200 / 4× DGX Spark 27B 训练 + 推理、Qwen3.6-72B LoRA + ZeRO-3、MTP、DFlash2
    Mac 统一内存党 96-256G M5 Max / M5 Ultra / M3 Ultra DeepSeek V4 Flash (Q2/Q4)、Qwen3.6-27B 8bit oMLX、TurboQuant、DSpark、kv-disk
    小型机 / 集群 128-512G DGX Spark GB10、双 GB10、4×DGX Spark DeepSeek V4 Flash 完整 NVFP4 / GLM-5.2 Quantrio SGLang + RadixAttention、200G 网络互联、DSpark

    目录

    • 4-16G 显存 (31 个组合, 129 条原始)
    • 16-32G 显存 (36 个组合, 791 条原始)
    • 32-96G 显存 (52 个组合, 304 条原始)
    • 96-256G 显存 (21 个组合, 73 条原始)
    • 256G+ 显存 (11 个组合, 14 条原始)

    4-16G 显存

    31 个配置组合(合并自论坛 129 条相似部署)

    显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用
    2× RTX 3070(Dell R730 + 双路 E5-2680v4 56核 +…) 2×8G = 16G Qwen3.6-35B-A3B APEX 17.3GB llama.cpp --n-cpu-moe 32, --spec-type draft-mtp, --reasoning off, --jinja, -ngl 99 等 36-40 t/s (日常), 60 t/s (代码), 52 t/s (数学), 45-50 t/s (200K), 40-50 t/s (多模态) @ 200K (236K 多模态极限) [^1]
    Apple M4 16G Qwen 27B, Qwen3.5B A3B, Qwen2.5-14B 等 6 4-bit llama.cpp OpenCL, Metal 35B A3B 20-30 t/s; 30-35 t/s (35B), 50-60 t/s (24B), 90 t/s (多线程) [^3]
    Apple M5 16G Qwen3.6-27B 8bit oMLX 等 — 十几 t/s @ 96K [^4]
    RTX 2080 8G Qwen3.6-27B NVFP4 — MTP — [^6]
    RTX 2080 Ti 11G Qwen3.6, Qwen3.6-27B 等 5 Q4, Q4_K_M llama.cpp, Hermes MTP 等 25 t/s @ 32K; 234 t/s, 55 t/s @ 100K [^7]
    RTX 3060(RTX 3060 笔记本 + M1 Max 64G MacB…) 12G Qwen3, Qwen3.6-27B Q4_K_M llama.cpp, ComfyUI Vulkan, ROCm, CUDA, flash-attn, Flash-Attn 等 50.9 t/s, 53.8 t/s, 49.6 t/s, 29.9 t/s, 52.1 t/s, 38.3 t/s, 35.9 t/s, 53 t/s @ 128K; 0.8 t/s [^8]
    RTX 3070(i7-12700 + 32G×2 RAM + Windows…) 8G Qwen3.6-35B-A3B Q4_K_M llama.cpp, CUDA 12.4 CPU 20 线程, MTP, 多模态, CPU Offload, MoE 等 25 t/s; 32768 [^9]
    RTX 3080 10G Qwen3.6-27B 等 6 Q4_K_M llama.cpp 等 MTP 等 32 t/s @ 65K; 45 t/s @ 256K [^10]
    RTX 3080 Ti(X99) 12G Qwen Q4_K_M llama.cpp, ComfyUI MTP, Dflash, ROCm, CUDA, Q8_0 等 84 t/s @ 128K [^11]
    RTX 4060 8G Qwen3.6-35B-A3B APEX I-Mini 13.7GB llama.cpp, CUDA 12.4, Hermes 等 APEX 等 30+ t/s, 45-50 t/s (代码), 35-38 t/s (长输出), 499 tok/s (prompt) @ 16384-65536 [^12]
    RTX 4060 Ti 16G Qwen3.8-27B XS-PRO 刘悦整合包, Linux 等 PCIe 3.0 x4, MTP off, FlashAttn, q8/q4 KV 18.9 tok/s @ 64K [^13]
    RTX 4070 12G Qwen3.6-35B-A3B Q4_K_M llama.cpp CUDA, cuBLAS 短文本42.3 t/s, Thinking 42.1 t/s, 120K prefill 346.6秒/346 t/s @ 128K; 32k prefill 356 t/s, 65k 350 t/s, 120k 346 t/s @ 120K [^14]
    RTX 4070 Ti(Intel i9-14900KF + 31.7GB RAM) 16G Qwen3.8-27B UD-Q3_K_XL — — 10 几 t/s @ 64K [^15]
    RTX 4070 Ti(14600KF + DDR4 3200 + 4070TI S…) 16G Qwen3.6-27B Q4_K_M, Qwen3.5-9B Q8_0 Q4_K_M, Q8_0 llama.cpp, Ollama, Hermes 等 — 16K-128K [^16]
    RTX 4080 16G Qwen3.6-27B GPTQ vllm MTP, mmproj, CUDA 256K [^17]
    RTX 4080 Super(DIY) 16G Qwen3.6-27B, Qwen3.8-27B 等 4 UD-Q4_K_XL, UD-XL llama.cpp 等 MTP, GPU 直通, ReBAR, Above 4G Decoding, Resizable BAR 等 89 tok/s (median, peak 105), 35K prefill 1900 tok/s @ 307200 (262144 native + 32K concurrent); 27 t/s @ 48K [^18]
    RTX 5060 Ti(14600KF + 5060Ti 16G) 16G Qwen3.6, Gemma4, Qwen3.6-27b 等 7 UD-IQ4_XS, Q4_K_M llama.cpp MTP, CUDA 41 t/s @ 64K; 50 t/s @ 62K [^19]
    RTX 5060 Ti(llama.cpp + rpc RTX 5060ti 16G…) 16G Qwen3.6-27B — llama.cpp, RPC — 18 t/s [^20]
    RTX 5070 12G — FP4 — CUDA, NVLink — [^21]
    RTX 5070 Ti(Ryzen 7 9800X3D) 16G Qwen3.6-27B, Qwen3.8-27B 等 9 Q4_K_M llama.cpp, Hermes q4_0, CUDA 等 38-43 t/s @ 32K; 39.2 t/s, 15.2 t/s, 026 t/s, 14.4 t/s, 049 t/s, 13.3 t/s, 15 t/s @ 128K [^22]
    RTX 5080 16G Qwen3.6-27B, Qwen3.6-35B-A3B 等 8 Q4_K_M llama.cpp MTP 36 t/s @ 132K; 48 t/s @ 256K [^23]
    RTX 6800 XT 16G Qwen3.6-27B IQ3_XXS llama.cpp, opencode, hermes MTP, -ctk q4_0, -ctv q4_0, --spec-draft-p-min 0.75, --reasoning-budget 512 等 28-38 t/s (TG), 200 t/s (prefill 64K) @ 128K [^24]
    Tesla P4 8G e2b — — — 18 t/s [^25]
    V100(V100 + RTX 5600 Ti) 16G Qwen3.6-27B IQ4_XS, Q8_K_XL ik_llama.cpp, llama.cpp TurboQuant, -ctk q4_0 -khad, -ctv q4_0 -vhad, -fa, --cont-batching 等 25-27 t/s @ 100K; 390K [^26]
    v100 16G Qwen3.6-27B — llama.cpp TurboQuant, q4_0 28 t/s [^27]

    16-32G 显存

    36 个配置组合(合并自论坛 791 条相似部署)

    显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用
    2× RTX 2060 2×12G = 24G Ornith-1.0-35B-Heretic-MTP-APEX-I-Quality — llama.cpp MTP prefill 1279 t/s, decode 88.8 t/s peak 91.7 t/s @ 2048 [^28]
    2× RTX 2080 Ti 2×11G = 22G Qwen3.8-27B-FP8, Qwen3.8-27B 等 4 FP8 vLLM, llama.cpp NVLink 等 38.7 t/s @ 128K; 27B 20 t/s @ 64K-128K [^29]
    2× RTX 3060 2×12G = 24G Qwen3.6-27B, Qwen3.6-35B-A3B Q4KM, Q4_K_M llama.cpp RotorQuant, TurboQuant, ngram, --spec-type ngram-mod, -ngl 9 等 2.84 t/s (27B), 35 t/s (35B-A3B) @ 87475; ~100 t/s @ 192K [^30]
    2× RTX 3080 Ti(i7-7700K + Z270 + PCIe 3.0 x8/…) 2×12G = 24G Qwen3.6-27B Q4_K_M llama.cpp MTP, --spec-draft-n-max 3, q4_0 KV, layer-split, power cap 300W 61 t/s @ 100K [^31]
    2× RTX 5060 Ti(Mac Mini M4 24GB + 2×5060Ti) 2×16G = 32G Qwen3-27B NVFP4 hermes, llama.cpp, DeepSeek V4 Flash 等 TP, NVLink — [^32]
    2× RTX 5060 Ti(Intel i5-7500 32GB) 2×16G = 32G Qwen3.6-27B, MiniMax H3, Wan 2.1 等 5 Q4_K_P llama.cpp, ComfyUI tensor parallel, NVFP4, MTP 20-22 tok/s, 124帧50分-1小时6分 @ 256 [^33]
    2× RTX 5070 Ti(DIY) 2×16G = 32G Qwen3.8-27B, Qwen3.6-35B-A3B UD-Q5_K_XL llama.cpp, DSH 等 MTP, q8_0, TP, tensor split, layer split 等 70 t/s @ 262K; 75 t/s @ 131K [^34]
    2× RTX 5080 2×16G = 32G Qwen3.6-27B Q4_K_M vLLM, SGlang TP=2, tensor parallel — [^35]
    2× RTX 6800 XT 2×16G = 32G Ornith-1.5-35B-A3B, Qwen3.6-35B-A3B — llama.cpp turboquant, HIP 51 t/s [^36]
    2× V100(DIY 双 V100) 2×16G = 32G Qwen3.8-27B Q8 llama.cpp MTP, mtp 2, HBM2, KV cache, prompt cache 等 43-52 t/s @ 32K; 713.66 t/s @ 49K [^37]
    RTX 2080 Ti (22G 魔改) 22G Qwen3.6-27B 等 7 Q4_K_M llama.cpp, ComfyUI, llama-server 等 MTP, flash-attn 等 33 t/s @ 128K; 24 t/s @ 64K [^38]
    RTX 3080 (20G 魔改) 20G Qwen3.6-27B 等 8 Q4_0, FP8 llama.cpp 等 Flash Attention, KV offload, NVLink, TB4, eGPU 等 125 t/s (短ctx), 61 t/s (100K+), 3460 tok/s prefill @ 256K; 33 t/s, +MTP 40+ t/s, 接Hermes 28-29 t/s @ 64K [^39]
    RTX 3090 (24G 魔改) 24G Qwen3.6-27B, Qwen3.6-27B-autoround, Qwen3.6-27B-AWQ-INT4 等 5 AutoRound INT4, AWQ INT4 vLLM, llama.cpp, Hermes 等 MTP, speculative sampling, TurboQuant 3-bit, turboquant_4bit_nc, TurboQuant 等 40-50 t/s, Draft acceptance 40-60% @ 48K; 140 t/s (peak), 80-100 t/s (long session) @ 170K [^40]
    RTX 4080 Super (32G 魔改) 32G Qwen3.8-27B, dealignai/Qwen3.8-27B-CRACK — Windows 11, llama.cpp MTP=3, Q8 KV, 320W, 250W 63.56 t/s @ 262K [^41]
    RTX 7900 XT (20G 魔改)(Windows 11) 20G Qwen3.5 27B, Qwen3.6 27B Q4_K_M LM Studio, ROCm — 23-24 t/s @ 20K [^42]
    RTX 7900 XTX (24G 魔改) 24G Qwen3.6-27B-Q4_K_M 等 10 Q4_K_M, Q8_0 (DFlash draft), Q4_K_M llama.cpp, ROCm, Ollama 等 FlashAttention, MTP, speculative decoding, DFlash, DDTree 等 56 t/s (DFlash 优化后) @ 32K; 72.5 t/s (gen), 478.7 ms PP, 842 t/s long context PP @ 262K [^43]
    4090D(X99 AD4) 24G DeepSeek, Qwen3.6-27B 等 8 INT32, F16 ComfyUI 等 CUDA, MTP, Flash-Attn, q4_0, q8_0 等 29.7 t/s, 46.8 t/s @ 262K; 32 t/s, 80 t/s [^44]
    Intel B70 Pro 32G Qwen3.6-27B Q4_K_M vllm, comfyui, docker 等 docker, XPU 等 16 并发稳定; 26 并发 299→10+ t/s 抖动 [^45]
    M2 Pro(RX 7900 XTX 24G + RTX 3080 Ti …) 32G Qwen3.8-27B, GPT-OSS-120B, Cold-Fusion Qwen3.8-27B 等 5 Q5_K_M,UD-Q4_K_XL,UD-IQ4_XS,MXFP4 llama.cpp, FreeToken, NUMA MTP, MTP D3, MTP xhigh, MTP off, FTW 等 14.30 t/s @ 12K [^46]
    P40(Z77老主板魔改BIOS) 24G Gemma4 26 — — above 4G decoding, resizable bar 42 t/s [^47]
    R9700(DIY) 32G Qwen3.8-27B, Qwen3.6-27B, MiniMax H3 等 24 Q4_K_M, Q5 llama.cpp 等 ROCm, CUDA, MTP, Vulkan, flash-attn 等 53 t/s @ 128K; 59.8 t/s @ 256K [^48]
    R9700(x99 E5 2666v3) 32G Qwen3.8-27B, Qwen3.6-27B, Ornith-1.0-35B-Q5_K_M 等 24 Q4_K_M, Q5_K_M llama.cpp, ROCm, Vulkan 等 MTP 等 pp128 886 t/s, tg64 25.73 t/s, +MTP 35+/s @ 256K; pp128 886 t/s, tg64 25.73 t/s, +MTP 35+ t/s 256K ctx @ 256K [^49]
    RTX 3090(X99) 24G Qwen3.6-27B, Qwen3.8-27B, DeepSeek 等 40 Q4_K_M, BF16 llama.cpp 等 MTP, CUDA, NVLink, q8_0, TurboQuant 等 50-65 t/s @ 65K; prompt 874 tok/s, 38-43 t/s @ 105K [^50]
    RTX 3090 Ti 24G Qwen3.6-27B, Qwen3.8-27B 等 8 Q4_K_M llama.cpp, llama-server 等 MTP, CUDA 等 100 t/s @ 262K; INT8 5min, BF16 90s, NVFP4 60s [^51]
    RTX 4080 Super(Ubuntu 24) 32G Qwen3.6-27B AWQ/autoround/GPTQ vllm 等 MTP conc=32 无MTP 704 tps, MTP=2 622 tps @ 262K; 单并发无MTP 37, MTP=1 54, MTP=2 65, MTP=3 70 t/s; 8并发350 tps, 16并发400 tps [^52]
    RTX 4090 24G Qwen3.6-27B, DeepSeek flash, Qwen3.8-27B 等 12 FP8, Q4_K_M ComfyUI, llama.cpp, Hermes 等 MTP, CUDA, PCIe P2P, Above 4G Decoding, Resizable BAR 等 63-76 tok/s @ 262144; 76 t/s @ 256K [^53]
    RTX 5000 24G Qwen3.6-27B Q4_K_M ComfyUI MTP — [^54]
    RTX 5090(DIY) 32G Qwen3.8-27B, Qwen3.6-27B, Qwen3.6-27b 等 19 NVFP4, FP8 llama.cpp, Hermes, vllm 等 MTP, CUDA, mmproj, flash-attn, draft-mtp 等 20 t/s @ 132K; 143 t/s @ 262K [^55]
    RTX 7900(X99) 24G Qwen3.6 27B 等 8 NVFP4 llama.cpp 等 ROCm, Vulkan 等 30 t/s @ 128K; 30 t/s @ 128K [^56]
    RTX 7900 XTX(X99) 24G Qwen3.6-27B 等 39 Q4_K_M, Q4 llama.cpp 等 MTP, ROCm 等 pp:970t/s tg:29t/s @ 256K; <30 t/s @ 256K [^57]
    RTX Pro 4000(X99) 24G Qwen2.5-32B — vllm, Ollama ROCm, CUDA, FP4 — [^58]
    RTX Pro 4500(DIY Ryzen 7 3700X) 32G Qwen3.8-27B 等 6 Q4_K_M, UD-Q4_K_XL llama.cpp 等 MTP 等 API 58-60 t/s, 长续46-51 t/s, MTP短83 t/s, 接受率0.995 @ 200K; 24.5 t/s @ 256K [^59]
    RTX Pro 4500(RTX Pro 4500) 32G Qwen3.6-27B, Qwen3.6-27B-PrismaSCOUT, Qwen3.6-27B-PrismaAURA 等 17 NVFP4 vLLM MTP 等 74.74 t/s (100K), 61 t/s (200K) @ 210K; 64.84 t/s (100K) @ 100K [^60]

    32-96G 显存

    52 个配置组合(合并自论坛 304 条相似部署)

    显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用
    4× RTX 3090 4×24G = 96G — FP8 vllm MTP, CUDA 262K [^62]
    4× RTX 5060 Ti(5060ti 16G x4 + 华南 H12D-8D) 4×16G = 64G Qwen3.6 27B Q4_K_M SGLang, vLLM, llama.cpp tensor parallel, TP=4 — [^63]
    4× RTX 7900 XTX 4×24G = 96G Qwen 27B, Qwen3.6-35B, Qwen3.6-27B W4A16 vLLM, JartX/rdna3_full_stack, Hermes 等 RDNA3W4A16LinearKernel, INT8, INT4, WMMA, split-KV 等 1388-1450 t/s @ 32K; 40 t/s, 5 t/s [^64]
    3× RTX 3090 (24G 魔改) 3×24G = 72G Qwen3.6 27B Q6_K Q6_K LM Studio, Hermes, vLLM — 17-18 t/s @ 128K [^65]
    3× R9700(DIY 4090 48G + R9700 32G + AI …) 3×32G = 96G MiniMax2.7 230B-A10B, Qwen3.5-122B-A10B, Qwen3.6-35B-A3B 等 4 UD-IQ4_XS / UD-Q4_K_XL / Q5_K_XL / AWQ-6Bit / UD-Q6_K_XL / UD-Q4_K_XL llama.cpp, vllm tensor-split, MTP, 显卡坞, llama-benchy 27.74t/s (230B 3卡), 53.63t/s (122B双卡), 162.10t/s (35B 4090), 115.47t/s (27B AWQ vLLM MTP) @ 256K [^66]
    3× RTX 3090 3×24G = 72G Qwen3.6-35B-A3B, Qwen3.6-27B, Qwen3-Embedding 等 4 — gpustack, ragflow, obsidian 等 NVLink 2080Ti x2 27B 20 t/s @ 64K-128K [^67]
    3× RTX 5090 3×32G = 96G Qwen3.8-27B Q8_0 llama.cpp --parallel, flash-attn, KV q8_0, CUDA 13.3 42-43 t/s (单路), 56 t/s (5路聚合) @ 32K×5=163840 [^68]
    2× RTX 2080 Ti (22G 魔改) 2×22G = 44G Qwen3.8-27B, Qwen3.8-27B-FP8, Qwen3.6-35B-A3B 等 4 FP8, Q4_K_M llama.cpp docker, CUDA 13.0.3, vLLM 等 tensor parallel, MTP 等 101.89 t/s; 131K [^69]
    2× RTX 3080 (20G 魔改) 2×20G = 40G Qwen3.6-27B 等 8 INT, AWQ SGLang, llama.cpp 等 MTP, TP 等 FP8: 38 t/s; AWQ: 53-54 t/s; AWQ-MTP: 65-83 t/s @ 170K (FP8), 380K (AWQ), 260K (AWQ-MTP); 44.29 t/s [^70]
    2× RTX 3090 (24G 魔改) 2×24G = 48G Qwen3.6-27B Heretic — llama.cpp, ComfyUI NVLink, tensor parallel, TP=2 68 t/s (NVLink), 65.6 t/s (无 NVLink) [^71]
    2× RTX 4090 (48G 魔改) 2×48G = 96G Qwen3.5B MoE Q4, Wan 2.1, Qwen3-72B 等 10 Q4, Q4/Q8 llama.cpp 等 PCIe 等 70B Q4 15-25 t/s; 120K [^72]
    2× A10(Aliyun ECS Xeon Platinum 8369B) 2×24G = 48G Qwen3.8-Flash-Next UD-Q4_K_XL llama.cpp CPU offload, MoE, PCIe 4.0 x16 13.91 tok/s @ 130K [^73]
    2× Intel B70 2×32G = 64G Qwen3.8-27B 等 6 FP8 vLLM, Docker 等 TP=2, FP8 KV, prefix-caching 等 33.3 t/s @ 16K; 13 t/s [^74]
    2× Intel B70 Pro 2×32G = 64G — — vllm, comfyui, docker XPU, wan, ltx2.3 — [^75]
    2× R9700(X99) 2×32G = 64G Qwen3.8-27B 等 6 FP8, Q8 llama.cpp 等 layer split, MTP, PP, RCCL, ROCm 等 44.9 t/s @ 163K; 36 t/s @ 128K [^76]
    2× R9700(x99 E5 2666v3 1200W) 2×32G = 64G Qwen3.6-27B, MiniMax H3, Wan2.2 等 4 Q4_K_M llama.cpp, ollama, ComfyUI tensor split, ROCm 6.3 27B Q4 15-20 t/s [^77]
    2× RTX 3090(DIY) 2×24G = 48G Qwen3.8-27B 等 22 AWQ, AWQ INT4 SGLang 等 NVLink 等 decode 50-70 t/s代码, 35B A3B prefill 1500+ @ 220K; 双并发60 t/s, 单流120+ t/s, benchlocal 79% @ 262K [^78]
    2× RTX 3090 Ti(华南金牌 X99 + Z40 + 长城 1250W + 32…) 2×24G = 48G Qwen3.6-27B — LM Studio, llama.cpp, vllm TurboQuant, MTP, PCIe 2.0 x1 20 t/s (双卡), 39 t/s (3090单卡 LM Studio), 8 t/s (35B-A3B 旧机器); 80K [^79]
    2× RTX 4080 Super 2×32G = 64G Qwen3.6 27B 等 5 Q4_K_M llama.cpp, Hermes, ComfyUI 等 x8/x8, split-mode layer, x8+x8 PCIe 27B Q4 30-60 t/s; V4 Flash 40-50 decode 30-70 coding @ 27B; 27B Q4 30-60 t/s [^80]
    2× RTX 4090 2×24G = 48G Qwen3.8-27B FP8 SGLang, DSH, comfyui — 24 tok/s [^81]
    2× RTX 5090 2×32G = 64G Qwen3.8-27B, Qwen3.8-27B-BF16, Qwen3.8-27B-mmproj-F16 等 4 BF16 llama.cpp 等 NVLink, tensor split, MTP off, flash attention, q8_0 KV 等 48.05 tok/s @ 140000; 5090 decode ≈ 2.5x R9700, prefill ≈ 3x R9700 [^82]
    2× RTX 6000 2×48G = 96G Qwen3.6-27B, Qwen3.6 27B Q4_K_M Q4_K_M llama.cpp — 2-5 t/s [^83]
    2× RTX 7900 XTX(DIY) 2×24G = 48G Qwen3.8-27B 等 12 Q4_K_M, Q4 llama.cpp 等 MTP, TP=2, DFlash, ROCm, tensor parallel 等 34 t/s @ 64K; 22 t/s @ 64K [^84]
    2× V100 32G(2x V100 32G (无 NVLink)) 2×32G = 64G Qwen3.6-27B Q8, Ornith-1.0-35B Q8, Qwen3.6-27B Q8_0 Q8_0 llama.cpp — V100 Q8 30 t/s, Ornith-35B Q8 ~100 t/s, PP 800-950 t/s @ 200K x 3; prefill 900 t/s, 30 tok/s @ 200K x 3 [^85]
    170HX (40G 魔改) 40G Qwen 27B-70B QLoRA PyTorch 等 HBM2 — [^86]
    170HX (64G 魔改) 64G Qwen3.8-27B, Qwen3.8 Flash w8a16 / Q4, w8a16 sglang, vllm DFlash, DFlash2 100 t/s (32K), 60 t/s (200K), 300 t/s (并发), 20 t/s (Flash) @ 262K; 196 t/s (Ornith单路), 740 t/s (Ornith 10并发) @ 262K [^87]
    RTX 4090 (48G 魔改)(PCIe 5 x16 双槽) 48G Qwen3.6-27B-FP8, Qwen 27B 越狱, SDXL 等 26 FP8, Q4 SGLang 等 MTP, HSA_OVERRIDE_GFX_VERSION, HIP_VISIBLE_DEVICES, CUDA_VISIBLE_DEVICES, tensor parallel 等 Decode快, 但编程一塌糊涂 @ 128K; vLLM 200K ctx 27B @ 200K [^88]
    RTX Pro 5000 (48G 魔改) 48G — — comfyui LTX 2.3, sulphur — [^89]
    RTX Pro 5000 (72G 魔改) 72G Qwen3.6 27B, MiniMax H3, Qwen3.8-27B Q4/Q8, FP8 ComfyUI 等 ROCm, DirectML, ZLUDA, MTP, NEXTN 等 Q4 prefill 2384 t/s decode 59.14 t/s; Q8 prefill 2335 decode 38.28 t/s @ 4K; 80 t/s @ 262K [^90]
    H100 80G — — Ollama, llama.cpp Vulkan, ROCm, CUDA, Flash-Attn 50 t/s [^91]
    L20 48G Qwen3.6-27B FP8 vllm CUDA, MTP 33.41 t/s @ 128K; 130K [^92]
    L40S 48G Qwen3.6-27B-MTP-GGUF 等 4 FP8 vllm MTP 50 t/s @ 260K; 2000 t/s [^93]
    M1 Max(M1 Max MacBook Pro 64G) 64G Qwen3.5-35B-A3B 4-bit OMLX — 30 几 t/s [^94]
    M3 Max(MacBook Pro 16" M3 Max 14C CPU…) 64G Qwen3.5-27B, Qwen3.6-27B 4-bit Ollama, MLX, ComfyUI 等 MPS backend, unified memory — [^95]
    M4 Pro(Mac M4 Pro 64G) 48G DeepSeek V*Flash-Vision-Exp — ds4 SSD streaming 10 t/s [^97]
    M5 Pro(M5 Pro 64G) 64G Qwen3.6-27B, Qwen3.6-35B-A3B Q4 LM Studio, MTPLX, oMLX 等 MTP 80-90 t/s (短), 50-60 t/s (长) @ 64K; 35B-A3B 50+ t/s (64K), 27B 19+ t/s (64K, MTP), 35A3 prefill 300+ t/s @ 64K+ [^98]
    RTX 3080 40G Qwen3.6-27B — llama.cpp MTP, 魔改 35-60 t/s @ 128K [^99]
    RTX 6000 48G Qwen3.6 27B 等 4 FP8 vllm, ComfyUI CUDA — [^100]
    RTX Pro 5000 48G Qwen3.8-27B-FP8, Qwen3.8-Flash-Next, Qwen3.8-27B 等 6 FP8, UD-Q4_K_XL SGLang, FlashInfer, Unsloth Studio 等 MTP, EAGLE, HiCache, TP=2, mamba-radix-cache 等 60.5 t/s @ 262K; 30 tok/s (64K/128K), 230-250 tok/s prefill, 24-28 tok/s (vision) @ 128K [^101]
    RTX Pro 6000(Ubuntu 24.04) 96G Qwen3.8-27B, Qwen3.8-27B-NVFP4, Qwen3.6 27B 等 10 NVFP4 SGLang, ComfyUI, vLLM 等 MTP, DFlash2, TP=2, NVLink, Turboquant 等 MTP=3: 71.2 t/s; MTP=10/20: 241.9 t/s; MTP=30/40: 350 t/s; MTP=20 241.9 t/s, MTP=30/40 350 t/s [^102]
    W7900(Windows 11) 48G H3, Qwen3.8-27B, Qwen3.6-27B Q4, Q4_K_M ComfyUI, llama.cpp MTP, Vulkan, KV q4_0, mmproj, vision 50 t/s (原 20 t/s) @ 262144 [^103]
    h100 80G Qwen3.5-397B-A17B, Qwen3.5, Qwen2-VL-72B 等 8 BF16 vllm tensor parallel, FP8, BF16 — [^104]

    96-256G 显存

    21 个配置组合(合并自论坛 73 条相似部署)

    显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用
    8× RTX 3090(ubuntu) 8×24G = 192G Qwen3.6-27B — llama.cpp, hermes, TG 等 tensor parallel, NVLink, 分布式 — [^106]
    4× Intel B70 Pro(4×B70 Pro) 4×32G = 128G Qwen3.8B FP8 vllm — 57.08 t/s (单卡 8B), 400W 开机, 600W 两卡, 4 卡 4 视频+1 LLM [^107]
    4× L20 4×48G = 192G Qwen3.6-27B-MTP-GGUF 等 7 FP8 llama.cpp MTP, CUDA, flash-attn 7.5 t/s @ 256K [^108]
    4× R9700(技嘉G292-Z20 + AMD 7K62 + 128G) 4×32G = 128G Qwen3.8-27B-FP8, Qwen3.8-27B FP8 vllm 等 MTP, tensor-parallel-size 4, chunked prefill, prefix caching, AITER 等 192.51 tok/s (bench), <10 tok/s (hermes multi-user) @ 180000; 64.6 t/s (单卡), 16.4 t/s (2卡layer), 13.7 t/s (2卡tensor), 3.9 t/s (8卡TP=8) [^109]
    2× RTX Pro 5000 (72G 魔改) 2×72G = 144G Qwen3.8 27B FP8/NVFP4 SGLang MTP, tensor parallel — [^110]
    2× DGX SPARK(2x DGX SPARK GB10 cluster) 2×128G = 256G DeepSeek V*Flash-DSpark FP4+FP8 vLLM — 45-65 t/s [^111]
    2× DGX Spark 2×128G = 256G DeepSeek V*Flash NVFP4 SGLang, DSpark 200G网络互联 测速40-50 t/s, coding 30-70, pp 2000 @ 500K; 单流首token 2-8s, 50-80 t/s; 6并发150-200 t/s; V4 flash 2000 pp 30 decode @ 1M [^112]
    2× GB10(Asus Ascent GX10 (双GB10)) 2×128G = 256G DeepSeek V*Flash-0731, Qwen3.8-27B FP8+NVFP4 hermes, DSH, SGLang 等 SGLang, DSpark, Radix PP 1500-2500 t/s, decode 35-76 t/s, 单会话最高76.7 t/s [^113]
    2× M1 Max(X99) 2×64G = 128G Qwen3.6-14B, Qwen3.6-27B Q4_K_M llama.cpp, vllm, mlx tensor parallel, TP 32, Q4_K_M 32K [^114]
    2× RTX Pro 6000 2×96G = 192G Qwen3.8-27B, DeepSeek, Qwen3.6-35B-A3B 等 4 FP16/BF16 Linux, comfyui, LTX 2.3 NVLink, BF16, 魔改 BF16 27B ~29 t/s [^115]
    DGX Spark(DGX Spark) 128G Qwen3.8-27B, DeepSeek V*Flash 等 10 NVFP4 SGLang, Hermes, vllm 等 NVFP4, DSpark 等 Q4 90-100 t/s, BF16 27B ~29 t/s; 数学43.6 t/s, 代码34 t/s, Hermes tool calling 92/100 [^116]
    GB10(DGX Spark) 128G Qwen3.8-Flash-Next, Qwen3.6 27B Q8, DeepSeek Q2 NVFP4 vllm, SGLang MTP PP 1500-2000 t/s, decode 30 t/s, KV 630K [^117]
    M3 Ultra(Mac Studio M3 Ultra) 192G DeepSeek V*Flash, Qwen3.6-27B Q2 MLX 等 kv-disk 64G, unified memory 512GB/s, DFlash, TurboQuant, SpecPrefill 等 30 t/s @ 131072; 23 t/s (普通), 109.4 t/s (DFlash 短上下文), 39.6 t/s (2x batched) @ 4096-8192 [^118]
    M5 MAX 128G — — llama.cpp tensor parallel, MTP 25 t/s; 17 t/s [^119]
    M5 Max 128G Qwen3.8-27B, Qwen3.6-27B 等 11 Q4 llama.cpp, oMLX, MLX 等 MTP 等 Q8 MTP 40t/s, Q4 MTP 30t/s, Q6 MTP 40-50t/s, Youssofal混合8bit 40t/s @ 32K; pp1024/tg128: 881.6/63.6 t/s; pp16k/tg128: 630.6/56.6 t/s; 16-20 t/s一般 @ 16K [^120]
    M5 Max 128G Qwen3.6-35B A3B, Qwen3.6-27B 8bit, Qwen3.6-27B 等 11 — oMLX, Hermes, LM Studio 等 TurboQuant, KV cache 8bit, thinking on, cpu-moe, expert-offload 35B-A3B: PP 963.7, TG 50.8 t/s; 27B-OptiQ: PP 254.4, TG 17.1 t/s; DS V4 Flash 2bit: PP 270, TG 35 t/s @ 128K [^121]
    M5 Ultra(Mac Studio M5 Ultra 256G+2TB) 256G Qwen3.8-27B, DeepSeek V*Flash 等 8 Q4 llama.cpp unified memory 41 t/s @ 128K; 70 t/s (96G M5 Ultra Qwen3.8-27B) [^122]
    M5 max(DGX Spark) 128G — Q4 — MTP 25 t/s @ 64K [^123]
    Mac Studio 256G Qwen3.6-27b, DeepSeek V*Flash Q4_K_M SGLang, Hermes — 50 t/s, 400 t/s @ 128K; 10 t/s [^124]

    256G+ 显存

    11 个配置组合(合并自论坛 14 条相似部署)

    显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用
    10× DGX SPARK(10x DGX SPARK GB10 cluster wit…) 10×128G = 1280G GLM 5.2 — — — 2x tok/s @ 320K x 10 [^125]
    6× RTX 8000(DIY 6xRTX 8000) 6×48G = 288G Qwen3.8-27B, Ornith-1.0-35B, Qwen3.6-35B Q8 llama.cpp, new-api Turing 672GB/s, tensor-split, CUDA 7.5 Qwen3.8-27B 27ms/token (32-36 t/s 2并发), Qwen3.6-35B-A3B 202 t/s (2并发), Ornith-1.0-35B 181 t/s (2并发) @ 256K (单), 128K (双) [^128]
    4× DGX Spark(4x DGX Spark cluster) 4×128G = 512G GLM-5.2-Quantrio-INT4-INT8-Mixed INT4+INT8 Mixed vLLM DFlash concurrency 1: 40.3 t/s, 4: 95.7 t/s; PP 506-690 t/s [^129]
    4× Pro 6000 4×96G = 384G DeepSeek-R1-Distill-Qwen-32B, Qwen3-30B-A3B, MiniMax H3 等 5 FP8 vLLM, LLaMA-Factory, DeepSpeed 等 LoRA, ZeRO-3, GRPO, ECC 等 32K; 4K [^130]
    4× RTX Pro 6000(办公室) 4×96G = 384G — — vllm, SGLang vgpu — [^131]
    2× B200(Apptainer container) 2×192G = 384G Qwen3.8-27B-FP8 FP8 vllm DFlash2, TP2, flashinfer, speculative, dflash 232 t/s (18req), 363 t/s (11req), 1114 t/s (2req), 3247.7 t/s (引擎) @ 254000 [^133]

    引用列表附件。引用列表133条.html

    imbiplaza ASUSI 1 条回复 最后回复
    3
    • J johnnybegood

      数据来源: lcz.me 论坛「抡锤者」AI 硬件 + LLM 讨论区 | 覆盖主题: 535 | 首手记录: 1371 条 → 去重后 133 个配置组合 |

      *本文为AI整理,人工简单校对,必然存在少许事实性错误,请知悉。人类不对此负责。对某项内容有疑问的,最后一列有引用序号,文末有HTML引用链接,请到里面找到对应文章自行阅读。

      表格按 合并后总显存 划分(双卡 = 两卡之和,如 2× RTX 4090 = 48G)。每行 = 同一显卡组合在论坛的多次部署归并,列出最具代表性的配置。「魔改」指 20G/22G/48G/72G/96G 改卡或非公版配置。

      预算/场景 推荐显存 论坛常见配置 跑得最稳的模型 配套技术
      入门 / 学生机 8-12G RTX 3060 12G / 4060 / 2080 Ti 22G 魔改 Qwen3.6-35B-A3B (Q4) / Qwen3.6-27B (Q4) MTP、APEX 量化、MoE CPU offload
      主流性价比 24G RTX 3090 / 4090 / RX 7900 XTX Qwen3.6-27B、Qwen3.8-27B、Gemma-3/4、DeepSeek V4 Flash MTP、TurboQuant、vLLM、llama.cpp Vulkan、ROCm
      32G 甜品 32G R9700 32G / RTX 5090 / RTX 4080S 32G 魔改 Qwen3.6-27B Q4 → FP8/BF16 满血 MTP、DFlash、TurboQuant、vLLM + HiCache
      双卡甜蜜点 48G 2× RTX 3090 / 2× 4090 / 2× 7900 XTX Qwen3.6-27B + 长上下文 / 27B BF16 NVLink、张量并行 (TP=2)、MTP、SGLang
      多卡 4×96G 384G 4× Pro 6000 / 2× H200 / 4× DGX Spark 27B 训练 + 推理、Qwen3.6-72B LoRA + ZeRO-3、MTP、DFlash2
      Mac 统一内存党 96-256G M5 Max / M5 Ultra / M3 Ultra DeepSeek V4 Flash (Q2/Q4)、Qwen3.6-27B 8bit oMLX、TurboQuant、DSpark、kv-disk
      小型机 / 集群 128-512G DGX Spark GB10、双 GB10、4×DGX Spark DeepSeek V4 Flash 完整 NVFP4 / GLM-5.2 Quantrio SGLang + RadixAttention、200G 网络互联、DSpark

      目录

      • 4-16G 显存 (31 个组合, 129 条原始)
      • 16-32G 显存 (36 个组合, 791 条原始)
      • 32-96G 显存 (52 个组合, 304 条原始)
      • 96-256G 显存 (21 个组合, 73 条原始)
      • 256G+ 显存 (11 个组合, 14 条原始)

      4-16G 显存

      31 个配置组合(合并自论坛 129 条相似部署)

      显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用
      2× RTX 3070(Dell R730 + 双路 E5-2680v4 56核 +…) 2×8G = 16G Qwen3.6-35B-A3B APEX 17.3GB llama.cpp --n-cpu-moe 32, --spec-type draft-mtp, --reasoning off, --jinja, -ngl 99 等 36-40 t/s (日常), 60 t/s (代码), 52 t/s (数学), 45-50 t/s (200K), 40-50 t/s (多模态) @ 200K (236K 多模态极限) [^1]
      Apple M4 16G Qwen 27B, Qwen3.5B A3B, Qwen2.5-14B 等 6 4-bit llama.cpp OpenCL, Metal 35B A3B 20-30 t/s; 30-35 t/s (35B), 50-60 t/s (24B), 90 t/s (多线程) [^3]
      Apple M5 16G Qwen3.6-27B 8bit oMLX 等 — 十几 t/s @ 96K [^4]
      RTX 2080 8G Qwen3.6-27B NVFP4 — MTP — [^6]
      RTX 2080 Ti 11G Qwen3.6, Qwen3.6-27B 等 5 Q4, Q4_K_M llama.cpp, Hermes MTP 等 25 t/s @ 32K; 234 t/s, 55 t/s @ 100K [^7]
      RTX 3060(RTX 3060 笔记本 + M1 Max 64G MacB…) 12G Qwen3, Qwen3.6-27B Q4_K_M llama.cpp, ComfyUI Vulkan, ROCm, CUDA, flash-attn, Flash-Attn 等 50.9 t/s, 53.8 t/s, 49.6 t/s, 29.9 t/s, 52.1 t/s, 38.3 t/s, 35.9 t/s, 53 t/s @ 128K; 0.8 t/s [^8]
      RTX 3070(i7-12700 + 32G×2 RAM + Windows…) 8G Qwen3.6-35B-A3B Q4_K_M llama.cpp, CUDA 12.4 CPU 20 线程, MTP, 多模态, CPU Offload, MoE 等 25 t/s; 32768 [^9]
      RTX 3080 10G Qwen3.6-27B 等 6 Q4_K_M llama.cpp 等 MTP 等 32 t/s @ 65K; 45 t/s @ 256K [^10]
      RTX 3080 Ti(X99) 12G Qwen Q4_K_M llama.cpp, ComfyUI MTP, Dflash, ROCm, CUDA, Q8_0 等 84 t/s @ 128K [^11]
      RTX 4060 8G Qwen3.6-35B-A3B APEX I-Mini 13.7GB llama.cpp, CUDA 12.4, Hermes 等 APEX 等 30+ t/s, 45-50 t/s (代码), 35-38 t/s (长输出), 499 tok/s (prompt) @ 16384-65536 [^12]
      RTX 4060 Ti 16G Qwen3.8-27B XS-PRO 刘悦整合包, Linux 等 PCIe 3.0 x4, MTP off, FlashAttn, q8/q4 KV 18.9 tok/s @ 64K [^13]
      RTX 4070 12G Qwen3.6-35B-A3B Q4_K_M llama.cpp CUDA, cuBLAS 短文本42.3 t/s, Thinking 42.1 t/s, 120K prefill 346.6秒/346 t/s @ 128K; 32k prefill 356 t/s, 65k 350 t/s, 120k 346 t/s @ 120K [^14]
      RTX 4070 Ti(Intel i9-14900KF + 31.7GB RAM) 16G Qwen3.8-27B UD-Q3_K_XL — — 10 几 t/s @ 64K [^15]
      RTX 4070 Ti(14600KF + DDR4 3200 + 4070TI S…) 16G Qwen3.6-27B Q4_K_M, Qwen3.5-9B Q8_0 Q4_K_M, Q8_0 llama.cpp, Ollama, Hermes 等 — 16K-128K [^16]
      RTX 4080 16G Qwen3.6-27B GPTQ vllm MTP, mmproj, CUDA 256K [^17]
      RTX 4080 Super(DIY) 16G Qwen3.6-27B, Qwen3.8-27B 等 4 UD-Q4_K_XL, UD-XL llama.cpp 等 MTP, GPU 直通, ReBAR, Above 4G Decoding, Resizable BAR 等 89 tok/s (median, peak 105), 35K prefill 1900 tok/s @ 307200 (262144 native + 32K concurrent); 27 t/s @ 48K [^18]
      RTX 5060 Ti(14600KF + 5060Ti 16G) 16G Qwen3.6, Gemma4, Qwen3.6-27b 等 7 UD-IQ4_XS, Q4_K_M llama.cpp MTP, CUDA 41 t/s @ 64K; 50 t/s @ 62K [^19]
      RTX 5060 Ti(llama.cpp + rpc RTX 5060ti 16G…) 16G Qwen3.6-27B — llama.cpp, RPC — 18 t/s [^20]
      RTX 5070 12G — FP4 — CUDA, NVLink — [^21]
      RTX 5070 Ti(Ryzen 7 9800X3D) 16G Qwen3.6-27B, Qwen3.8-27B 等 9 Q4_K_M llama.cpp, Hermes q4_0, CUDA 等 38-43 t/s @ 32K; 39.2 t/s, 15.2 t/s, 026 t/s, 14.4 t/s, 049 t/s, 13.3 t/s, 15 t/s @ 128K [^22]
      RTX 5080 16G Qwen3.6-27B, Qwen3.6-35B-A3B 等 8 Q4_K_M llama.cpp MTP 36 t/s @ 132K; 48 t/s @ 256K [^23]
      RTX 6800 XT 16G Qwen3.6-27B IQ3_XXS llama.cpp, opencode, hermes MTP, -ctk q4_0, -ctv q4_0, --spec-draft-p-min 0.75, --reasoning-budget 512 等 28-38 t/s (TG), 200 t/s (prefill 64K) @ 128K [^24]
      Tesla P4 8G e2b — — — 18 t/s [^25]
      V100(V100 + RTX 5600 Ti) 16G Qwen3.6-27B IQ4_XS, Q8_K_XL ik_llama.cpp, llama.cpp TurboQuant, -ctk q4_0 -khad, -ctv q4_0 -vhad, -fa, --cont-batching 等 25-27 t/s @ 100K; 390K [^26]
      v100 16G Qwen3.6-27B — llama.cpp TurboQuant, q4_0 28 t/s [^27]

      16-32G 显存

      36 个配置组合(合并自论坛 791 条相似部署)

      显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用
      2× RTX 2060 2×12G = 24G Ornith-1.0-35B-Heretic-MTP-APEX-I-Quality — llama.cpp MTP prefill 1279 t/s, decode 88.8 t/s peak 91.7 t/s @ 2048 [^28]
      2× RTX 2080 Ti 2×11G = 22G Qwen3.8-27B-FP8, Qwen3.8-27B 等 4 FP8 vLLM, llama.cpp NVLink 等 38.7 t/s @ 128K; 27B 20 t/s @ 64K-128K [^29]
      2× RTX 3060 2×12G = 24G Qwen3.6-27B, Qwen3.6-35B-A3B Q4KM, Q4_K_M llama.cpp RotorQuant, TurboQuant, ngram, --spec-type ngram-mod, -ngl 9 等 2.84 t/s (27B), 35 t/s (35B-A3B) @ 87475; ~100 t/s @ 192K [^30]
      2× RTX 3080 Ti(i7-7700K + Z270 + PCIe 3.0 x8/…) 2×12G = 24G Qwen3.6-27B Q4_K_M llama.cpp MTP, --spec-draft-n-max 3, q4_0 KV, layer-split, power cap 300W 61 t/s @ 100K [^31]
      2× RTX 5060 Ti(Mac Mini M4 24GB + 2×5060Ti) 2×16G = 32G Qwen3-27B NVFP4 hermes, llama.cpp, DeepSeek V4 Flash 等 TP, NVLink — [^32]
      2× RTX 5060 Ti(Intel i5-7500 32GB) 2×16G = 32G Qwen3.6-27B, MiniMax H3, Wan 2.1 等 5 Q4_K_P llama.cpp, ComfyUI tensor parallel, NVFP4, MTP 20-22 tok/s, 124帧50分-1小时6分 @ 256 [^33]
      2× RTX 5070 Ti(DIY) 2×16G = 32G Qwen3.8-27B, Qwen3.6-35B-A3B UD-Q5_K_XL llama.cpp, DSH 等 MTP, q8_0, TP, tensor split, layer split 等 70 t/s @ 262K; 75 t/s @ 131K [^34]
      2× RTX 5080 2×16G = 32G Qwen3.6-27B Q4_K_M vLLM, SGlang TP=2, tensor parallel — [^35]
      2× RTX 6800 XT 2×16G = 32G Ornith-1.5-35B-A3B, Qwen3.6-35B-A3B — llama.cpp turboquant, HIP 51 t/s [^36]
      2× V100(DIY 双 V100) 2×16G = 32G Qwen3.8-27B Q8 llama.cpp MTP, mtp 2, HBM2, KV cache, prompt cache 等 43-52 t/s @ 32K; 713.66 t/s @ 49K [^37]
      RTX 2080 Ti (22G 魔改) 22G Qwen3.6-27B 等 7 Q4_K_M llama.cpp, ComfyUI, llama-server 等 MTP, flash-attn 等 33 t/s @ 128K; 24 t/s @ 64K [^38]
      RTX 3080 (20G 魔改) 20G Qwen3.6-27B 等 8 Q4_0, FP8 llama.cpp 等 Flash Attention, KV offload, NVLink, TB4, eGPU 等 125 t/s (短ctx), 61 t/s (100K+), 3460 tok/s prefill @ 256K; 33 t/s, +MTP 40+ t/s, 接Hermes 28-29 t/s @ 64K [^39]
      RTX 3090 (24G 魔改) 24G Qwen3.6-27B, Qwen3.6-27B-autoround, Qwen3.6-27B-AWQ-INT4 等 5 AutoRound INT4, AWQ INT4 vLLM, llama.cpp, Hermes 等 MTP, speculative sampling, TurboQuant 3-bit, turboquant_4bit_nc, TurboQuant 等 40-50 t/s, Draft acceptance 40-60% @ 48K; 140 t/s (peak), 80-100 t/s (long session) @ 170K [^40]
      RTX 4080 Super (32G 魔改) 32G Qwen3.8-27B, dealignai/Qwen3.8-27B-CRACK — Windows 11, llama.cpp MTP=3, Q8 KV, 320W, 250W 63.56 t/s @ 262K [^41]
      RTX 7900 XT (20G 魔改)(Windows 11) 20G Qwen3.5 27B, Qwen3.6 27B Q4_K_M LM Studio, ROCm — 23-24 t/s @ 20K [^42]
      RTX 7900 XTX (24G 魔改) 24G Qwen3.6-27B-Q4_K_M 等 10 Q4_K_M, Q8_0 (DFlash draft), Q4_K_M llama.cpp, ROCm, Ollama 等 FlashAttention, MTP, speculative decoding, DFlash, DDTree 等 56 t/s (DFlash 优化后) @ 32K; 72.5 t/s (gen), 478.7 ms PP, 842 t/s long context PP @ 262K [^43]
      4090D(X99 AD4) 24G DeepSeek, Qwen3.6-27B 等 8 INT32, F16 ComfyUI 等 CUDA, MTP, Flash-Attn, q4_0, q8_0 等 29.7 t/s, 46.8 t/s @ 262K; 32 t/s, 80 t/s [^44]
      Intel B70 Pro 32G Qwen3.6-27B Q4_K_M vllm, comfyui, docker 等 docker, XPU 等 16 并发稳定; 26 并发 299→10+ t/s 抖动 [^45]
      M2 Pro(RX 7900 XTX 24G + RTX 3080 Ti …) 32G Qwen3.8-27B, GPT-OSS-120B, Cold-Fusion Qwen3.8-27B 等 5 Q5_K_M,UD-Q4_K_XL,UD-IQ4_XS,MXFP4 llama.cpp, FreeToken, NUMA MTP, MTP D3, MTP xhigh, MTP off, FTW 等 14.30 t/s @ 12K [^46]
      P40(Z77老主板魔改BIOS) 24G Gemma4 26 — — above 4G decoding, resizable bar 42 t/s [^47]
      R9700(DIY) 32G Qwen3.8-27B, Qwen3.6-27B, MiniMax H3 等 24 Q4_K_M, Q5 llama.cpp 等 ROCm, CUDA, MTP, Vulkan, flash-attn 等 53 t/s @ 128K; 59.8 t/s @ 256K [^48]
      R9700(x99 E5 2666v3) 32G Qwen3.8-27B, Qwen3.6-27B, Ornith-1.0-35B-Q5_K_M 等 24 Q4_K_M, Q5_K_M llama.cpp, ROCm, Vulkan 等 MTP 等 pp128 886 t/s, tg64 25.73 t/s, +MTP 35+/s @ 256K; pp128 886 t/s, tg64 25.73 t/s, +MTP 35+ t/s 256K ctx @ 256K [^49]
      RTX 3090(X99) 24G Qwen3.6-27B, Qwen3.8-27B, DeepSeek 等 40 Q4_K_M, BF16 llama.cpp 等 MTP, CUDA, NVLink, q8_0, TurboQuant 等 50-65 t/s @ 65K; prompt 874 tok/s, 38-43 t/s @ 105K [^50]
      RTX 3090 Ti 24G Qwen3.6-27B, Qwen3.8-27B 等 8 Q4_K_M llama.cpp, llama-server 等 MTP, CUDA 等 100 t/s @ 262K; INT8 5min, BF16 90s, NVFP4 60s [^51]
      RTX 4080 Super(Ubuntu 24) 32G Qwen3.6-27B AWQ/autoround/GPTQ vllm 等 MTP conc=32 无MTP 704 tps, MTP=2 622 tps @ 262K; 单并发无MTP 37, MTP=1 54, MTP=2 65, MTP=3 70 t/s; 8并发350 tps, 16并发400 tps [^52]
      RTX 4090 24G Qwen3.6-27B, DeepSeek flash, Qwen3.8-27B 等 12 FP8, Q4_K_M ComfyUI, llama.cpp, Hermes 等 MTP, CUDA, PCIe P2P, Above 4G Decoding, Resizable BAR 等 63-76 tok/s @ 262144; 76 t/s @ 256K [^53]
      RTX 5000 24G Qwen3.6-27B Q4_K_M ComfyUI MTP — [^54]
      RTX 5090(DIY) 32G Qwen3.8-27B, Qwen3.6-27B, Qwen3.6-27b 等 19 NVFP4, FP8 llama.cpp, Hermes, vllm 等 MTP, CUDA, mmproj, flash-attn, draft-mtp 等 20 t/s @ 132K; 143 t/s @ 262K [^55]
      RTX 7900(X99) 24G Qwen3.6 27B 等 8 NVFP4 llama.cpp 等 ROCm, Vulkan 等 30 t/s @ 128K; 30 t/s @ 128K [^56]
      RTX 7900 XTX(X99) 24G Qwen3.6-27B 等 39 Q4_K_M, Q4 llama.cpp 等 MTP, ROCm 等 pp:970t/s tg:29t/s @ 256K; <30 t/s @ 256K [^57]
      RTX Pro 4000(X99) 24G Qwen2.5-32B — vllm, Ollama ROCm, CUDA, FP4 — [^58]
      RTX Pro 4500(DIY Ryzen 7 3700X) 32G Qwen3.8-27B 等 6 Q4_K_M, UD-Q4_K_XL llama.cpp 等 MTP 等 API 58-60 t/s, 长续46-51 t/s, MTP短83 t/s, 接受率0.995 @ 200K; 24.5 t/s @ 256K [^59]
      RTX Pro 4500(RTX Pro 4500) 32G Qwen3.6-27B, Qwen3.6-27B-PrismaSCOUT, Qwen3.6-27B-PrismaAURA 等 17 NVFP4 vLLM MTP 等 74.74 t/s (100K), 61 t/s (200K) @ 210K; 64.84 t/s (100K) @ 100K [^60]

      32-96G 显存

      52 个配置组合(合并自论坛 304 条相似部署)

      显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用
      4× RTX 3090 4×24G = 96G — FP8 vllm MTP, CUDA 262K [^62]
      4× RTX 5060 Ti(5060ti 16G x4 + 华南 H12D-8D) 4×16G = 64G Qwen3.6 27B Q4_K_M SGLang, vLLM, llama.cpp tensor parallel, TP=4 — [^63]
      4× RTX 7900 XTX 4×24G = 96G Qwen 27B, Qwen3.6-35B, Qwen3.6-27B W4A16 vLLM, JartX/rdna3_full_stack, Hermes 等 RDNA3W4A16LinearKernel, INT8, INT4, WMMA, split-KV 等 1388-1450 t/s @ 32K; 40 t/s, 5 t/s [^64]
      3× RTX 3090 (24G 魔改) 3×24G = 72G Qwen3.6 27B Q6_K Q6_K LM Studio, Hermes, vLLM — 17-18 t/s @ 128K [^65]
      3× R9700(DIY 4090 48G + R9700 32G + AI …) 3×32G = 96G MiniMax2.7 230B-A10B, Qwen3.5-122B-A10B, Qwen3.6-35B-A3B 等 4 UD-IQ4_XS / UD-Q4_K_XL / Q5_K_XL / AWQ-6Bit / UD-Q6_K_XL / UD-Q4_K_XL llama.cpp, vllm tensor-split, MTP, 显卡坞, llama-benchy 27.74t/s (230B 3卡), 53.63t/s (122B双卡), 162.10t/s (35B 4090), 115.47t/s (27B AWQ vLLM MTP) @ 256K [^66]
      3× RTX 3090 3×24G = 72G Qwen3.6-35B-A3B, Qwen3.6-27B, Qwen3-Embedding 等 4 — gpustack, ragflow, obsidian 等 NVLink 2080Ti x2 27B 20 t/s @ 64K-128K [^67]
      3× RTX 5090 3×32G = 96G Qwen3.8-27B Q8_0 llama.cpp --parallel, flash-attn, KV q8_0, CUDA 13.3 42-43 t/s (单路), 56 t/s (5路聚合) @ 32K×5=163840 [^68]
      2× RTX 2080 Ti (22G 魔改) 2×22G = 44G Qwen3.8-27B, Qwen3.8-27B-FP8, Qwen3.6-35B-A3B 等 4 FP8, Q4_K_M llama.cpp docker, CUDA 13.0.3, vLLM 等 tensor parallel, MTP 等 101.89 t/s; 131K [^69]
      2× RTX 3080 (20G 魔改) 2×20G = 40G Qwen3.6-27B 等 8 INT, AWQ SGLang, llama.cpp 等 MTP, TP 等 FP8: 38 t/s; AWQ: 53-54 t/s; AWQ-MTP: 65-83 t/s @ 170K (FP8), 380K (AWQ), 260K (AWQ-MTP); 44.29 t/s [^70]
      2× RTX 3090 (24G 魔改) 2×24G = 48G Qwen3.6-27B Heretic — llama.cpp, ComfyUI NVLink, tensor parallel, TP=2 68 t/s (NVLink), 65.6 t/s (无 NVLink) [^71]
      2× RTX 4090 (48G 魔改) 2×48G = 96G Qwen3.5B MoE Q4, Wan 2.1, Qwen3-72B 等 10 Q4, Q4/Q8 llama.cpp 等 PCIe 等 70B Q4 15-25 t/s; 120K [^72]
      2× A10(Aliyun ECS Xeon Platinum 8369B) 2×24G = 48G Qwen3.8-Flash-Next UD-Q4_K_XL llama.cpp CPU offload, MoE, PCIe 4.0 x16 13.91 tok/s @ 130K [^73]
      2× Intel B70 2×32G = 64G Qwen3.8-27B 等 6 FP8 vLLM, Docker 等 TP=2, FP8 KV, prefix-caching 等 33.3 t/s @ 16K; 13 t/s [^74]
      2× Intel B70 Pro 2×32G = 64G — — vllm, comfyui, docker XPU, wan, ltx2.3 — [^75]
      2× R9700(X99) 2×32G = 64G Qwen3.8-27B 等 6 FP8, Q8 llama.cpp 等 layer split, MTP, PP, RCCL, ROCm 等 44.9 t/s @ 163K; 36 t/s @ 128K [^76]
      2× R9700(x99 E5 2666v3 1200W) 2×32G = 64G Qwen3.6-27B, MiniMax H3, Wan2.2 等 4 Q4_K_M llama.cpp, ollama, ComfyUI tensor split, ROCm 6.3 27B Q4 15-20 t/s [^77]
      2× RTX 3090(DIY) 2×24G = 48G Qwen3.8-27B 等 22 AWQ, AWQ INT4 SGLang 等 NVLink 等 decode 50-70 t/s代码, 35B A3B prefill 1500+ @ 220K; 双并发60 t/s, 单流120+ t/s, benchlocal 79% @ 262K [^78]
      2× RTX 3090 Ti(华南金牌 X99 + Z40 + 长城 1250W + 32…) 2×24G = 48G Qwen3.6-27B — LM Studio, llama.cpp, vllm TurboQuant, MTP, PCIe 2.0 x1 20 t/s (双卡), 39 t/s (3090单卡 LM Studio), 8 t/s (35B-A3B 旧机器); 80K [^79]
      2× RTX 4080 Super 2×32G = 64G Qwen3.6 27B 等 5 Q4_K_M llama.cpp, Hermes, ComfyUI 等 x8/x8, split-mode layer, x8+x8 PCIe 27B Q4 30-60 t/s; V4 Flash 40-50 decode 30-70 coding @ 27B; 27B Q4 30-60 t/s [^80]
      2× RTX 4090 2×24G = 48G Qwen3.8-27B FP8 SGLang, DSH, comfyui — 24 tok/s [^81]
      2× RTX 5090 2×32G = 64G Qwen3.8-27B, Qwen3.8-27B-BF16, Qwen3.8-27B-mmproj-F16 等 4 BF16 llama.cpp 等 NVLink, tensor split, MTP off, flash attention, q8_0 KV 等 48.05 tok/s @ 140000; 5090 decode ≈ 2.5x R9700, prefill ≈ 3x R9700 [^82]
      2× RTX 6000 2×48G = 96G Qwen3.6-27B, Qwen3.6 27B Q4_K_M Q4_K_M llama.cpp — 2-5 t/s [^83]
      2× RTX 7900 XTX(DIY) 2×24G = 48G Qwen3.8-27B 等 12 Q4_K_M, Q4 llama.cpp 等 MTP, TP=2, DFlash, ROCm, tensor parallel 等 34 t/s @ 64K; 22 t/s @ 64K [^84]
      2× V100 32G(2x V100 32G (无 NVLink)) 2×32G = 64G Qwen3.6-27B Q8, Ornith-1.0-35B Q8, Qwen3.6-27B Q8_0 Q8_0 llama.cpp — V100 Q8 30 t/s, Ornith-35B Q8 ~100 t/s, PP 800-950 t/s @ 200K x 3; prefill 900 t/s, 30 tok/s @ 200K x 3 [^85]
      170HX (40G 魔改) 40G Qwen 27B-70B QLoRA PyTorch 等 HBM2 — [^86]
      170HX (64G 魔改) 64G Qwen3.8-27B, Qwen3.8 Flash w8a16 / Q4, w8a16 sglang, vllm DFlash, DFlash2 100 t/s (32K), 60 t/s (200K), 300 t/s (并发), 20 t/s (Flash) @ 262K; 196 t/s (Ornith单路), 740 t/s (Ornith 10并发) @ 262K [^87]
      RTX 4090 (48G 魔改)(PCIe 5 x16 双槽) 48G Qwen3.6-27B-FP8, Qwen 27B 越狱, SDXL 等 26 FP8, Q4 SGLang 等 MTP, HSA_OVERRIDE_GFX_VERSION, HIP_VISIBLE_DEVICES, CUDA_VISIBLE_DEVICES, tensor parallel 等 Decode快, 但编程一塌糊涂 @ 128K; vLLM 200K ctx 27B @ 200K [^88]
      RTX Pro 5000 (48G 魔改) 48G — — comfyui LTX 2.3, sulphur — [^89]
      RTX Pro 5000 (72G 魔改) 72G Qwen3.6 27B, MiniMax H3, Qwen3.8-27B Q4/Q8, FP8 ComfyUI 等 ROCm, DirectML, ZLUDA, MTP, NEXTN 等 Q4 prefill 2384 t/s decode 59.14 t/s; Q8 prefill 2335 decode 38.28 t/s @ 4K; 80 t/s @ 262K [^90]
      H100 80G — — Ollama, llama.cpp Vulkan, ROCm, CUDA, Flash-Attn 50 t/s [^91]
      L20 48G Qwen3.6-27B FP8 vllm CUDA, MTP 33.41 t/s @ 128K; 130K [^92]
      L40S 48G Qwen3.6-27B-MTP-GGUF 等 4 FP8 vllm MTP 50 t/s @ 260K; 2000 t/s [^93]
      M1 Max(M1 Max MacBook Pro 64G) 64G Qwen3.5-35B-A3B 4-bit OMLX — 30 几 t/s [^94]
      M3 Max(MacBook Pro 16" M3 Max 14C CPU…) 64G Qwen3.5-27B, Qwen3.6-27B 4-bit Ollama, MLX, ComfyUI 等 MPS backend, unified memory — [^95]
      M4 Pro(Mac M4 Pro 64G) 48G DeepSeek V*Flash-Vision-Exp — ds4 SSD streaming 10 t/s [^97]
      M5 Pro(M5 Pro 64G) 64G Qwen3.6-27B, Qwen3.6-35B-A3B Q4 LM Studio, MTPLX, oMLX 等 MTP 80-90 t/s (短), 50-60 t/s (长) @ 64K; 35B-A3B 50+ t/s (64K), 27B 19+ t/s (64K, MTP), 35A3 prefill 300+ t/s @ 64K+ [^98]
      RTX 3080 40G Qwen3.6-27B — llama.cpp MTP, 魔改 35-60 t/s @ 128K [^99]
      RTX 6000 48G Qwen3.6 27B 等 4 FP8 vllm, ComfyUI CUDA — [^100]
      RTX Pro 5000 48G Qwen3.8-27B-FP8, Qwen3.8-Flash-Next, Qwen3.8-27B 等 6 FP8, UD-Q4_K_XL SGLang, FlashInfer, Unsloth Studio 等 MTP, EAGLE, HiCache, TP=2, mamba-radix-cache 等 60.5 t/s @ 262K; 30 tok/s (64K/128K), 230-250 tok/s prefill, 24-28 tok/s (vision) @ 128K [^101]
      RTX Pro 6000(Ubuntu 24.04) 96G Qwen3.8-27B, Qwen3.8-27B-NVFP4, Qwen3.6 27B 等 10 NVFP4 SGLang, ComfyUI, vLLM 等 MTP, DFlash2, TP=2, NVLink, Turboquant 等 MTP=3: 71.2 t/s; MTP=10/20: 241.9 t/s; MTP=30/40: 350 t/s; MTP=20 241.9 t/s, MTP=30/40 350 t/s [^102]
      W7900(Windows 11) 48G H3, Qwen3.8-27B, Qwen3.6-27B Q4, Q4_K_M ComfyUI, llama.cpp MTP, Vulkan, KV q4_0, mmproj, vision 50 t/s (原 20 t/s) @ 262144 [^103]
      h100 80G Qwen3.5-397B-A17B, Qwen3.5, Qwen2-VL-72B 等 8 BF16 vllm tensor parallel, FP8, BF16 — [^104]

      96-256G 显存

      21 个配置组合(合并自论坛 73 条相似部署)

      显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用
      8× RTX 3090(ubuntu) 8×24G = 192G Qwen3.6-27B — llama.cpp, hermes, TG 等 tensor parallel, NVLink, 分布式 — [^106]
      4× Intel B70 Pro(4×B70 Pro) 4×32G = 128G Qwen3.8B FP8 vllm — 57.08 t/s (单卡 8B), 400W 开机, 600W 两卡, 4 卡 4 视频+1 LLM [^107]
      4× L20 4×48G = 192G Qwen3.6-27B-MTP-GGUF 等 7 FP8 llama.cpp MTP, CUDA, flash-attn 7.5 t/s @ 256K [^108]
      4× R9700(技嘉G292-Z20 + AMD 7K62 + 128G) 4×32G = 128G Qwen3.8-27B-FP8, Qwen3.8-27B FP8 vllm 等 MTP, tensor-parallel-size 4, chunked prefill, prefix caching, AITER 等 192.51 tok/s (bench), <10 tok/s (hermes multi-user) @ 180000; 64.6 t/s (单卡), 16.4 t/s (2卡layer), 13.7 t/s (2卡tensor), 3.9 t/s (8卡TP=8) [^109]
      2× RTX Pro 5000 (72G 魔改) 2×72G = 144G Qwen3.8 27B FP8/NVFP4 SGLang MTP, tensor parallel — [^110]
      2× DGX SPARK(2x DGX SPARK GB10 cluster) 2×128G = 256G DeepSeek V*Flash-DSpark FP4+FP8 vLLM — 45-65 t/s [^111]
      2× DGX Spark 2×128G = 256G DeepSeek V*Flash NVFP4 SGLang, DSpark 200G网络互联 测速40-50 t/s, coding 30-70, pp 2000 @ 500K; 单流首token 2-8s, 50-80 t/s; 6并发150-200 t/s; V4 flash 2000 pp 30 decode @ 1M [^112]
      2× GB10(Asus Ascent GX10 (双GB10)) 2×128G = 256G DeepSeek V*Flash-0731, Qwen3.8-27B FP8+NVFP4 hermes, DSH, SGLang 等 SGLang, DSpark, Radix PP 1500-2500 t/s, decode 35-76 t/s, 单会话最高76.7 t/s [^113]
      2× M1 Max(X99) 2×64G = 128G Qwen3.6-14B, Qwen3.6-27B Q4_K_M llama.cpp, vllm, mlx tensor parallel, TP 32, Q4_K_M 32K [^114]
      2× RTX Pro 6000 2×96G = 192G Qwen3.8-27B, DeepSeek, Qwen3.6-35B-A3B 等 4 FP16/BF16 Linux, comfyui, LTX 2.3 NVLink, BF16, 魔改 BF16 27B ~29 t/s [^115]
      DGX Spark(DGX Spark) 128G Qwen3.8-27B, DeepSeek V*Flash 等 10 NVFP4 SGLang, Hermes, vllm 等 NVFP4, DSpark 等 Q4 90-100 t/s, BF16 27B ~29 t/s; 数学43.6 t/s, 代码34 t/s, Hermes tool calling 92/100 [^116]
      GB10(DGX Spark) 128G Qwen3.8-Flash-Next, Qwen3.6 27B Q8, DeepSeek Q2 NVFP4 vllm, SGLang MTP PP 1500-2000 t/s, decode 30 t/s, KV 630K [^117]
      M3 Ultra(Mac Studio M3 Ultra) 192G DeepSeek V*Flash, Qwen3.6-27B Q2 MLX 等 kv-disk 64G, unified memory 512GB/s, DFlash, TurboQuant, SpecPrefill 等 30 t/s @ 131072; 23 t/s (普通), 109.4 t/s (DFlash 短上下文), 39.6 t/s (2x batched) @ 4096-8192 [^118]
      M5 MAX 128G — — llama.cpp tensor parallel, MTP 25 t/s; 17 t/s [^119]
      M5 Max 128G Qwen3.8-27B, Qwen3.6-27B 等 11 Q4 llama.cpp, oMLX, MLX 等 MTP 等 Q8 MTP 40t/s, Q4 MTP 30t/s, Q6 MTP 40-50t/s, Youssofal混合8bit 40t/s @ 32K; pp1024/tg128: 881.6/63.6 t/s; pp16k/tg128: 630.6/56.6 t/s; 16-20 t/s一般 @ 16K [^120]
      M5 Max 128G Qwen3.6-35B A3B, Qwen3.6-27B 8bit, Qwen3.6-27B 等 11 — oMLX, Hermes, LM Studio 等 TurboQuant, KV cache 8bit, thinking on, cpu-moe, expert-offload 35B-A3B: PP 963.7, TG 50.8 t/s; 27B-OptiQ: PP 254.4, TG 17.1 t/s; DS V4 Flash 2bit: PP 270, TG 35 t/s @ 128K [^121]
      M5 Ultra(Mac Studio M5 Ultra 256G+2TB) 256G Qwen3.8-27B, DeepSeek V*Flash 等 8 Q4 llama.cpp unified memory 41 t/s @ 128K; 70 t/s (96G M5 Ultra Qwen3.8-27B) [^122]
      M5 max(DGX Spark) 128G — Q4 — MTP 25 t/s @ 64K [^123]
      Mac Studio 256G Qwen3.6-27b, DeepSeek V*Flash Q4_K_M SGLang, Hermes — 50 t/s, 400 t/s @ 128K; 10 t/s [^124]

      256G+ 显存

      11 个配置组合(合并自论坛 14 条相似部署)

      显卡 (含魔改与机器) 总显存 可跑模型 量化 环境 关键技术 速度 / 上下文 引用
      10× DGX SPARK(10x DGX SPARK GB10 cluster wit…) 10×128G = 1280G GLM 5.2 — — — 2x tok/s @ 320K x 10 [^125]
      6× RTX 8000(DIY 6xRTX 8000) 6×48G = 288G Qwen3.8-27B, Ornith-1.0-35B, Qwen3.6-35B Q8 llama.cpp, new-api Turing 672GB/s, tensor-split, CUDA 7.5 Qwen3.8-27B 27ms/token (32-36 t/s 2并发), Qwen3.6-35B-A3B 202 t/s (2并发), Ornith-1.0-35B 181 t/s (2并发) @ 256K (单), 128K (双) [^128]
      4× DGX Spark(4x DGX Spark cluster) 4×128G = 512G GLM-5.2-Quantrio-INT4-INT8-Mixed INT4+INT8 Mixed vLLM DFlash concurrency 1: 40.3 t/s, 4: 95.7 t/s; PP 506-690 t/s [^129]
      4× Pro 6000 4×96G = 384G DeepSeek-R1-Distill-Qwen-32B, Qwen3-30B-A3B, MiniMax H3 等 5 FP8 vLLM, LLaMA-Factory, DeepSpeed 等 LoRA, ZeRO-3, GRPO, ECC 等 32K; 4K [^130]
      4× RTX Pro 6000(办公室) 4×96G = 384G — — vllm, SGLang vgpu — [^131]
      2× B200(Apptainer container) 2×192G = 384G Qwen3.8-27B-FP8 FP8 vllm DFlash2, TP2, flashinfer, speculative, dflash 232 t/s (18req), 363 t/s (11req), 1114 t/s (2req), 3247.7 t/s (引擎) @ 254000 [^133]

      引用列表附件。引用列表133条.html

      imbiplaza ASUSI 在线
      imbiplaza ASUSI 在线
      imbiplaza ASUS
      至尊王者
      编写于 最后由 编辑
      #2

      @johnnybegood

      少了一个 Rtxpro 6000 Max Q

      https://lcz.me/project/dcs

      J 1 条回复 最后回复
      0
      • A 离线
        A 离线
        applejuice
        技术大牛 劳动模范
        编写于 最后由 编辑
        #3

        09b4872f-9160-46f1-a284-c24e3d8b2b86-image.jpeg

        8x3090 可以用nvlink 吗?

        J 1 条回复 最后回复
        0
        • imbiplaza ASUSI imbiplaza ASUS

          @johnnybegood

          少了一个 Rtxpro 6000 Max Q

          J 离线
          J 离线
          johnnybegood
          劳动模范 技术大牛
          编写于 最后由 编辑
          #4

          @imbiplaza-ASUS 估计是跟 rtx6000 合并了, 一开始几百行,人工简单校对了一下, 为了精简还是合并删除了不少。 这东西就是个参考, 也没想弄的特别细, 否则就需要详细人工校对了。不过如果有明显的错误可以标出来, 我标个颜色什么的。

          imbiplaza ASUSI 1 条回复 最后回复
          0
          • A applejuice

            09b4872f-9160-46f1-a284-c24e3d8b2b86-image.jpeg

            8x3090 可以用nvlink 吗?

            J 离线
            J 离线
            johnnybegood
            劳动模范 技术大牛
            编写于 最后由 编辑
            #5

            @applejuice 这个倒不是说8卡可以nvlink, 而是归总一下相关联的技术名称,你也不知道他是不是两两nvlink了, 如果有疑问可以去引用帖子原文查看。如果是个明显错误, 回头我标注一下。

            1 条回复 最后回复
            0
            • J johnnybegood

              @imbiplaza-ASUS 估计是跟 rtx6000 合并了, 一开始几百行,人工简单校对了一下, 为了精简还是合并删除了不少。 这东西就是个参考, 也没想弄的特别细, 否则就需要详细人工校对了。不过如果有明显的错误可以标出来, 我标个颜色什么的。

              imbiplaza ASUSI 在线
              imbiplaza ASUSI 在线
              imbiplaza ASUS
              至尊王者
              编写于 最后由 imbiplaza ASUS 编辑
              #6

              @johnnybegood

              因为我听说maxq 300w只是慢 20% 价格也是便宜20%...

              但是听说实测慢50%

              https://lcz.me/project/dcs

              J 1 条回复 最后回复
              0
              • imbiplaza ASUSI imbiplaza ASUS

                @johnnybegood

                因为我听说maxq 300w只是慢 20% 价格也是便宜20%...

                但是听说实测慢50%

                J 离线
                J 离线
                johnnybegood
                劳动模范 技术大牛
                编写于 最后由 编辑
                #7

                @imbiplaza-ASUS 我强烈怀疑这个说法, 性能不会差这么多, 反而有些人说因为限了功率, 效率反而上去了呢, 如果在计算机房用, 肯定有差距, 如果个人用, 反而是maxq好吧, 也要看实际使用环境的。

                imbiplaza ASUSI 1 条回复 最后回复
                0
                • J johnnybegood

                  @imbiplaza-ASUS 我强烈怀疑这个说法, 性能不会差这么多, 反而有些人说因为限了功率, 效率反而上去了呢, 如果在计算机房用, 肯定有差距, 如果个人用, 反而是maxq好吧, 也要看实际使用环境的。

                  imbiplaza ASUSI 在线
                  imbiplaza ASUSI 在线
                  imbiplaza ASUS
                  至尊王者
                  编写于 最后由 编辑
                  #8

                  @johnnybegood

                  可能是效率高了。。。

                  但是大部分我看的都是600w满血版本

                  https://lcz.me/project/dcs

                  J Chu Hao-LungC 3 条回复 最后回复
                  0
                  • imbiplaza ASUSI imbiplaza ASUS

                    @johnnybegood

                    可能是效率高了。。。

                    但是大部分我看的都是600w满血版本

                    J 离线
                    J 离线
                    johnnybegood
                    劳动模范 技术大牛
                    编写于 最后由 编辑
                    #9
                    此主題已被删除!
                    1 条回复 最后回复
                    0
                    • imbiplaza ASUSI imbiplaza ASUS

                      @johnnybegood

                      可能是效率高了。。。

                      但是大部分我看的都是600w满血版本

                      J 离线
                      J 离线
                      johnnybegood
                      劳动模范 技术大牛
                      编写于 最后由 johnnybegood 编辑
                      #10

                      @imbiplaza-ASUS

                      RTX Pro 6000 Max-Q 论坛数据汇总

                      1. 完整规格(论坛共识 / NVIDIA 官方)

                      项目 RTX Pro 6000 Max-Q 对比 Pro 6000(非 Max-Q)
                      显存 96 GB GDDR7 96 GB GDDR7
                      带宽 1.79 TB/s 1.79 TB/s
                      TDP 300 W(功耗减半) 600 W
                      架构 Blackwell Blackwell
                      AI TOPS 3511 4000
                      形态 双槽 双槽

                      核心卖点:在保留 96G 显存 + 1.79 TB/s 带宽的同时,把功耗从 600W 压到 300W,非常适合多卡高密度工作站部署。


                      2. 论坛实测记录

                      # 来源 主题标题 配置 性能数据
                      1 TID 19 / PID 171 迁移 wsl 上的包到 Linux ubuntu 22.04 2× RTX 3090Ti + Pro 6000 Max-Q(共 3 卡 72G) 从 WSL 迁 Linux 跑 LTX 视频
                      2 TID 284 / PID 3326 关于本地版的模型 U9 285K + 192G 内存 + Pro 6000 Max-Q 整机 96G 单卡,从 OpenClaw 改用 Hermes;192G 系统内存可做 CPU 卸载
                      3 TID 966 / PID 10925 Pro 6000 Max-Q + Qwen3.6 MTP 开到 20 Pro 6000 Max-Q + Qwen3.6-27B + vLLM MTP=20, 241.9 t/s(单路)
                      4 TID 966 / PID 10928 同上 同上 MTP=30/40 → 350 t/s(效率递减)
                      5 TID 966 / PID 10939 同上 同上 batch=4 并发 ~1000 t/s(GPU util 0.55)

                      3. Tony Xu 实测性能曲线(Pro 6000 Max-Q + Qwen3.6-27B + vLLM)

                      MTP 参数 Draft 接受率 单路生成速度 备注
                      MTP=3 86.3% ~85 t/s 基准
                      MTP=10 92.0% ~242 t/s 收益明显
                      MTP=20 96.1% 241-249 t/s 接受率最高
                      MTP=30/40 — ~350 t/s 接受率已饱和,边际收益递减
                      batch=4 并发 — ~1000 t/s GPU util 仍仅 0.55

                      作者注:在 0.55 GPU 利用率下已能稳定 1000 t/s,作者认为若解锁到 0.92 utilization,理论上可达 1800 t/s。


                      4. 关键结论

                      1. 96G 不是瓶颈:跑 Qwen3.6-27B BF16 单路时显存绰绰有余,KV cache 占用 < 30%
                      2. 功耗优势决定部署形态:标准 600W 装 4 卡机箱电源压力大,Max-Q 300W 装 4 卡仅 1200W,主流 1600-2000W 电源即可
                      3. MTP 收益存在拐点:MTP=20 时接受率 96% 已接近饱和,再上调到 30/40 收益下降
                      4. 高并发友好:batch=4 单卡就能跑 ~1000 t/s,4×Max-Q 集群可达 4000+ t/s 推理
                      imbiplaza ASUSI 1 条回复 最后回复
                      0
                      • J johnnybegood

                        @imbiplaza-ASUS

                        RTX Pro 6000 Max-Q 论坛数据汇总

                        1. 完整规格(论坛共识 / NVIDIA 官方)

                        项目 RTX Pro 6000 Max-Q 对比 Pro 6000(非 Max-Q)
                        显存 96 GB GDDR7 96 GB GDDR7
                        带宽 1.79 TB/s 1.79 TB/s
                        TDP 300 W(功耗减半) 600 W
                        架构 Blackwell Blackwell
                        AI TOPS 3511 4000
                        形态 双槽 双槽

                        核心卖点:在保留 96G 显存 + 1.79 TB/s 带宽的同时,把功耗从 600W 压到 300W,非常适合多卡高密度工作站部署。


                        2. 论坛实测记录

                        # 来源 主题标题 配置 性能数据
                        1 TID 19 / PID 171 迁移 wsl 上的包到 Linux ubuntu 22.04 2× RTX 3090Ti + Pro 6000 Max-Q(共 3 卡 72G) 从 WSL 迁 Linux 跑 LTX 视频
                        2 TID 284 / PID 3326 关于本地版的模型 U9 285K + 192G 内存 + Pro 6000 Max-Q 整机 96G 单卡,从 OpenClaw 改用 Hermes;192G 系统内存可做 CPU 卸载
                        3 TID 966 / PID 10925 Pro 6000 Max-Q + Qwen3.6 MTP 开到 20 Pro 6000 Max-Q + Qwen3.6-27B + vLLM MTP=20, 241.9 t/s(单路)
                        4 TID 966 / PID 10928 同上 同上 MTP=30/40 → 350 t/s(效率递减)
                        5 TID 966 / PID 10939 同上 同上 batch=4 并发 ~1000 t/s(GPU util 0.55)

                        3. Tony Xu 实测性能曲线(Pro 6000 Max-Q + Qwen3.6-27B + vLLM)

                        MTP 参数 Draft 接受率 单路生成速度 备注
                        MTP=3 86.3% ~85 t/s 基准
                        MTP=10 92.0% ~242 t/s 收益明显
                        MTP=20 96.1% 241-249 t/s 接受率最高
                        MTP=30/40 — ~350 t/s 接受率已饱和,边际收益递减
                        batch=4 并发 — ~1000 t/s GPU util 仍仅 0.55

                        作者注:在 0.55 GPU 利用率下已能稳定 1000 t/s,作者认为若解锁到 0.92 utilization,理论上可达 1800 t/s。


                        4. 关键结论

                        1. 96G 不是瓶颈:跑 Qwen3.6-27B BF16 单路时显存绰绰有余,KV cache 占用 < 30%
                        2. 功耗优势决定部署形态:标准 600W 装 4 卡机箱电源压力大,Max-Q 300W 装 4 卡仅 1200W,主流 1600-2000W 电源即可
                        3. MTP 收益存在拐点:MTP=20 时接受率 96% 已接近饱和,再上调到 30/40 收益下降
                        4. 高并发友好:batch=4 单卡就能跑 ~1000 t/s,4×Max-Q 集群可达 4000+ t/s 推理
                        imbiplaza ASUSI 在线
                        imbiplaza ASUSI 在线
                        imbiplaza ASUS
                        至尊王者
                        编写于 最后由 编辑
                        #11

                        @johnnybegood

                        看来我保持rtxpro 4500 32gb 单路 50 t/s 即可

                        因为始终单路 qwen3.8 27b 喂不饱96gb vram...

                        https://lcz.me/project/dcs

                        J 1 条回复 最后回复
                        0
                        • imbiplaza ASUSI imbiplaza ASUS

                          @johnnybegood

                          看来我保持rtxpro 4500 32gb 单路 50 t/s 即可

                          因为始终单路 qwen3.8 27b 喂不饱96gb vram...

                          J 离线
                          J 离线
                          johnnybegood
                          劳动模范 技术大牛
                          编写于 最后由 johnnybegood 编辑
                          #12

                          @imbiplaza-ASUS 我 qwen3.8 27B q4km + mtp 128K 单路中缓存在85左右,没中 65左右, 正常长程工作跑完 55左右, 很保守了, 感觉好像散热不怎么好, 想把涡轮换成三个静音风扇那种。3090 24G

                          1 条回复 最后回复
                          0
                          • williamlouisW 离线
                            williamlouisW 离线
                            williamlouis
                            超级版主
                            编写于 最后由 编辑
                            #13

                            三个静音风扇 的想法 没必要。换个房间放是正解。
                            有不少测试已经测试了三风扇方案。
                            1.容易搞废。放在第一条。这是重点。
                            2.换完一样很吵。具体看别人的测试视频把。
                            3.小火龙不建议加大投资。并且你越改。贬值越多。跑着吧。玩腻了就脱手。现在这个时间点是回血的好时机。

                            个人主页:xlkj.org Telegram https://t.me/xlkjorg

                            1 条回复 最后回复
                            0
                            • terryT 在线
                              terryT 在线
                              terry
                              超级版主
                              编写于 最后由 编辑
                              #14

                              以后总结表格在4列以内,不然手机看起来受罪,让AI整理即可。数据挺充分,以后我会整理更多专题页面,方便新人观看。也让一些论坛优质老帖能发挥余热。

                              油管:https://www.youtube.com/@抡锤者

                              J 1 条回复 最后回复
                              0
                              • ,terryT terry 固定了此主题
                              • terryT terry

                                以后总结表格在4列以内,不然手机看起来受罪,让AI整理即可。数据挺充分,以后我会整理更多专题页面,方便新人观看。也让一些论坛优质老帖能发挥余热。

                                J 离线
                                J 离线
                                johnnybegood
                                劳动模范 技术大牛
                                编写于 最后由 johnnybegood 编辑
                                #15

                                @terry 用手机试了一下,横屏正好能把表格看全。。。这玩意也不好整,本来以为很简单,就用在线模型整的,结果搞了好几轮把我5小时额度都干爆了才弄完,早知道用本地模型了。

                                1 条回复 最后回复
                                0
                                • kos orK 离线
                                  kos orK 离线
                                  kos or
                                  技术大牛 劳动模范
                                  编写于 最后由 编辑
                                  #16

                                  集結論壇精華 感謝 🙂

                                  1 条回复 最后回复
                                  0
                                  • imbiplaza ASUSI imbiplaza ASUS

                                    @johnnybegood

                                    可能是效率高了。。。

                                    但是大部分我看的都是600w满血版本

                                    Chu Hao-LungC 离线
                                    Chu Hao-LungC 离线
                                    Chu Hao-Lung
                                    编写于 最后由 编辑
                                    #17

                                    @imbiplaza-ASUS 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論

                                    RTX pro 6000 600W
                                    優點: 性能滿血 滿執行的時候音量較小
                                    缺點: 也是有燒接口的風險

                                    RTX pro 6000 max Q 300W
                                    優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口
                                    缺點: 性能大約下降7-15% 跑滿載 聲音不小

                                    在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收

                                    imbiplaza ASUSI 1 条回复 最后回复
                                    0
                                    • Chu Hao-LungC Chu Hao-Lung

                                      @imbiplaza-ASUS 我也糾結這個點很久 以下都是個人論點 歡迎理性開放討論

                                      RTX pro 6000 600W
                                      優點: 性能滿血 滿執行的時候音量較小
                                      缺點: 也是有燒接口的風險

                                      RTX pro 6000 max Q 300W
                                      優點: 體積較小 省電 適合多卡執行 不太需要擔心燒口
                                      缺點: 性能大約下降7-15% 跑滿載 聲音不小

                                      在各方面考慮下 以及長遠使用 我還是選擇max Q, 至於價位 在美國兩張卡是一樣的 如果要二手賣給卡販子 600W 他們比較願意收

                                      imbiplaza ASUSI 在线
                                      imbiplaza ASUSI 在线
                                      imbiplaza ASUS
                                      至尊王者
                                      编写于 最后由 编辑
                                      #18

                                      @Chu-Hao-Lung

                                      等多三年,我们去捡 rtxpro 的洋垃圾

                                      https://lcz.me/project/dcs

                                      1 条回复 最后回复
                                      0
                                      • rock shiR 离线
                                        rock shiR 离线
                                        rock shi
                                        劳动模范 德高望重
                                        编写于 最后由 编辑
                                        #19

                                        96g还可以跑qwen3.8 Flash next 4bit量化,n-gram放在ssd

                                        主机:GPU0-3080 20g(H3),GPU1-3080 20g(Zimage)
                                        副机:2x2080ti 22g,vllm+qwen3.8-27b-fp8-16kv-128k

                                        terryT 1 条回复 最后回复
                                        0
                                        • rock shiR rock shi

                                          96g还可以跑qwen3.8 Flash next 4bit量化,n-gram放在ssd

                                          terryT 在线
                                          terryT 在线
                                          terry
                                          超级版主
                                          编写于 最后由 编辑
                                          #20

                                          @rock-shi 这是个不错的选择,但是这个模型很慢,体验没27B好,好处是知识面全。

                                          油管:https://www.youtube.com/@抡锤者

                                          rock shiR kos orK 2 条回复 最后回复
                                          1

                                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                          有了你的建议,这篇帖子会更精彩哦 💗

                                          注册 登录
                                          回复
                                          • 在新帖中回复
                                          登录后回复
                                          • 从旧到新
                                          • 从新到旧
                                          • 最多赞同


                                          • 登录

                                          • 登录或注册以进行搜索。
                                          • 第一个帖子
                                            最后一个帖子
                                          0
                                          • 版块
                                          • 最新
                                          • 标签
                                          • 热门
                                          • 用户
                                          • 群组