这个是我调了一周的sglang配置。
主要目的是单线程,没有MTP,速度30t/s,有500K上下文。
上了MTP,速度有60t/s,有300k上下文。最主要的是QWEN3.6-27B-FP8也不聪明。。但是又觉得有时候比云API聪明。
主要是我的soul。md 明确了,所有问题优先社区找到答案。。处理问题的能力提升了一些。
#!/bin/bash
# SGLang 0.5.15 — sglang serve (官方推荐方式)
# Qwen3.6-27B-MTP | RTX 4090D 48G
set -euo pipefail
# 路径与环境
readonly SGLANG_VENV="/mnt/dataM4/venv_sglang"
readonly MODEL_PATH="/mnt/dataM4/models/Qwen3.6-27B-AEON-Ultimate-Uncensored-FP8-MTP"
export HF_HOME="/root/.cache/huggingface"
export TRITON_CACHE_DIR="/root/sglang_cache/triton/cache"
export TORCHINDUCTOR_CACHE_DIR="/root/sglang_cache/torch_compile"
export FLASH_ATTENTION_CUTE_CACHE_DIR="/root/sglang_cache/flash_attn_cute_cache"
export CUDA_HOME=/usr/local/cuda-12.8
export PATH="$CUDA_HOME/bin:$PATH"
export LD_LIBRARY_PATH="$CUDA_HOME/lib64"
export LD_LIBRARY_PATH="/mnt/dataM4/venv_sglang/lib/python3.11/site-packages/nvidia/cusparselt/lib:$LD_LIBRARY_PATH"
export CUDAHOSTCXX=/usr/bin/gcc-12
export CC=/usr/bin/gcc-12
export CXX=/usr/bin/g++-12
export PYTORCH_ALLOC_CONF="expandable_segments:True"
export CUDA_DEVICE_ORDER="PCI_BUS_ID"
export CUDA_VISIBLE_DEVICES="0"
export FLASHINFER_DISABLE_VERSION_CHECK=1
export FLASH_ATTENTION_CUTE_DSL_CACHE_ENABLED=1
source "${SGLANG_VENV}/bin/activate"
SGLANG_ARGS=(
--model-path "${MODEL_PATH}"
--host 0.0.0.0
--port 30000
--trust-remote-code
--tp-size 1
--attention-backend flashinfer
--mamba-backend flashinfer
--kv-cache-dtype fp8_e4m3
--page-size 16
--mem-fraction-static 0.93
--max-running-requests 1
--prefill-max-requests 1
--schedule-policy lpm
--schedule-conservativeness 1.0
--mamba-radix-cache-strategy extra_buffer
--mamba-ssm-dtype bfloat16
--mamba-full-memory-ratio 0.08
--speculative-algorithm nextn
--speculative-num-steps 2
--speculative-eagle-topk 1
--speculative-num-draft-tokens 2
--tool-call-parser qwen3_coder
--reasoning-parser qwen3
--preferred-sampling-params '{"temperature": 0.7, "repetition_penalty": 1.2, "frequency_penalty": 0.5, "presence_penalty": 0.3}'
--enable-dynamic-chunking
--chunked-prefill-size 16384
--radix-eviction-policy lru
--enable-metrics
--enable-streaming-session
--enable-request-time-stats-logging
--log-requests
--log-requests-level 0
--decode-log-interval 60
)
# 启动
readonly SGLOG="/dev/shm/sglang/sglang.log"
mkdir -p "$(dirname "$SGLOG")"
# 日志轮转
if ! pgrep -f sglang_log_rotate > /dev/null 2>&1; then
nohup bash /root/sglang_log_rotate.sh >/dev/null 2>&1 &
fi
exec sglang serve "${SGLANG_ARGS[@]}" >>"$SGLOG" 2>&1