27B VS 35B VS 125B,新鲜出炉
-
结论:
27B Qwen3.8-27B dense 首token 0.47s 30.4 tok/s 加载 14s
35B Qwen3.6-35B A3B 首token 1.46s 25.1 tok/s 加载 10s
125B Qwen3.8-Flash-Next A3B 首token 7.69s 8.4 tok/s 加载 18s配置:
【27B】Qwen3.8-27B-Uncensored-Q4_K_M.gguf (16G, dense 密集模型)
模型文件 : ~/models/Qwen3.8-27B-Uncensored-Q4_K_M.gguf
量化 : Q4_K_M,dense(无 MoE,27B 参数全参与计算)
端口 : 8081
启动参数 :
--host 0.0.0.0 --port 8081
-m <模型路径>
-ngl 999 # 全 GPU
-c 262144 # 256K 上下文
-b 2048 -ub 2048
-fa on # flash attention
-ctk q4_0 -ctv q4_0 # KV cache 量化
--jinja --reasoning-preserve
-np 1
--threads 8 --threads-batch 44 # decode 8线程防超订,prefill 44线程
(脚本: ~/qwen-server/start-27b.sh)【35B】Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf (20G, MoE A3B)
模型文件 : ~/models/qwen3.6-35b-uncensored/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf
量化 : Q4_K_M,MoE 35B 总参数 / 3B 激活
端口 : 8084
启动参数 :
--host 0.0.0.0 --port 8084
-m <模型路径>
-ngl 999 # 所有层先映射 GPU
-ncmoe 24 # 24 个 MoE 专家踢到 CPU 内存(省显存)
-c 204800 # 200K 上下文
-b 2048 -ub 2048
-fa on
-ctk q4_0 -ctv q4_0
--jinja --reasoning-preserve
-np 1
--threads 44 --threads-batch 44
(脚本: ~/qwen-server/start-35b-expert-offload.sh)【125B】Qwen3.8-Flash-Next-UD-Q4_K_XL (4 分片共 104G, MoE A3B/512专家)
模型文件 : ~/models/Qwen3.8-Flash-Next/UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf
(-m 指向 00001,llama.cpp 自动识别同目录其余 3 片)
量化 : UD-Q4_K_XL,实测总参数 176.94B / A3B 激活 / 512 专家
端口 : 8085(无生产脚本,测试/对比时用)
启动参数 :
--host 127.0.0.1 --port 8085
-m <00001-of-00004.gguf>
-ngl 999
-ncmoe 40 # 40 个专家走 CPU 内存(最优值,见下)
-c 8192 # 测试用 8K,可按需调大
-b 1024 -ub 1024
-fa on
-ctk q4_0 -ctv q4_0
--jinja --reasoning-preserve
-np 1
--threads 44 --threads-batch 44 -
@weidong 128 d3+7900xtx