双卡TP 3090 跑 Qwen3-VL-32B-Instruct-AWQ-4bit 做视觉分析
-
source ~/sglang_env/bin/activate
export MASTER_ADDR=127.0.0.1
export MASTER_PORT=29500
export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
SGLANG_USE_CUDA_IPC_TRANSPORT=0
SGLANG_VLM_CACHE_SIZE_MB=0
python -m sglang.launch_server
--model-path /home/jhhotel/models/Qwen3-VL-32B-Instruct-AWQ-4bit
--served-model-name Qwen3.8-27B
--kv-cache-dtype fp8_e4m3
--tp-size 2
--host 0.0.0.0
--port 30000
--trust-remote-code
--enable-cache-report
--log-level info
--max-running-requests 8
--mem-fraction-static 0.65
--chunked-prefill-size 4096
--attention-backend flashinfer
--mm-attention-backend sdpa
--enable-metrics
--cuda-graph-backend-prefill disabled
--cuda-graph-backend-decode disabled
--enable-multimodal
先上启动配置 费半天劲才配通
华南金牌 华南金牌H12D-8D 搭EPYC 7452处理器 128G 三星 PRO990 2T



所有风扇散热进行改造


模型太老了 没有MTP 没有任何加速 也就是 16token/s了 预填充600到900左右
