

M5 Max 128g 短会话MTP 38 token/s, claude code 长会话28 token/s,整体效果还可以啊。
I
im17me
@im17me
-
对 M5 MAX 跑本地大模型有点失望 -
【求助】vLLM 单卡 3090 部署 Qwen3.6-27B-INT4,开启 MTP 投机采样触发无限复读(死循环)3090单卡跑llama.cpp,比vllm强。显存不够。3090单卡vllm极限配置。
vllm serve /home/ubuntu/models/Qwen3.6-27B-AWQ-INT4
--served-model-name Qwen3.6-27B-AWQ-INT4
--host 0.0.0.0
--port 8080
--gpu-memory-utilization 0.98
--max-model-len 40960
--max-num-seqs 4
--max-num-batched-tokens 4096
--kv-cache-dtype fp8
--quantization compressed-tensors