从dflash2换到dspark,代码的质量感觉上了一个台阶。
速度从110 t/s 掉到平均 85 t/s 还是可以的,任务量不小,一直在跟踪进度,react 转 react native web。

_折騰_
-
qwen3.8-27b-w4a16-awq 已经持续跑了15个小时了 -
Qwen releases Qwen3.8-Flash-Next! 來了RTX PRO 6000 跑起来都累,27B养老吧!
-
4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQllama.app Qwen3.8 27B Q6K DFlash2 实测速度也还可以,持续写入平均在96 tok/s 上下浮动,Q6模型比W4A16-AWQ的精度高出1%-2%(理论值,实际感知不大),但模型大小多出8个G左右。 两个模型目前基本达到理想配置了,已经没有能力再提升了。
-
M5 Max/Ultral AI性能强悍?苹果、AMD、英伟达AI小主机AI性能全面分析,潜力很大但统一内存并非万能!朋友M5 MACBOOK 128G 跑27B都非常拉夸,不是硬件不行,而是目前配套框架还不给力,看着我的4090的速度,他直掉眼泪。。。
-
4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ@xiaote 正常编码没问题,效果很好。但尝试以下提示词时,会长时间思考最终因为思考过长,已达到输出 token 上限回答被截断,试过pi hsd都无法正常回答并开始任务,连续4轮思考都被截断了,以下是提示词:使用html单文件写一个超级马里奥的游戏,要保证游戏细节,可玩性,不要脱离原版游戏的体验,尽可能还原所有细节。
有没有成功的?实测开启 HiCache 输出速度会砍掉一半!
-
4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ根据 xiaote 的建议,这是目前测试下来我认为最优的启动参数了,目前实际测下来 11 轮 · 373 步 首 token 平均 1.9s · 112 tok/s
#!/usr/bin/env bash
SGLang + DFlash2 投机解码
set -euo pipefail
ROOT_DIR="$(cd "$(dirname "${BASH_SOURCE[0]}")/.." && pwd)"
VENV_DIR="${ROOT_DIR}/venv"
MODEL_DIR="${ROOT_DIR}/models"MODEL_PATH="${MODEL_PATH:-${MODEL_DIR}/Qwen3.8-27B-W4A16-AWQ}"
DFlash2 草稿模型
DRAFT_MODEL_PATH="${DRAFT_MODEL_PATH:-${MODEL_DIR}/Qwen3.8-27B-DFlash2-FP8-tcclaviger}"
DRAFT_QUANTIZATION="${DRAFT_QUANTIZATION:-fp8}"SERVED_MODEL_NAME="${SERVED_MODEL_NAME:-qwen3.8-27b-w4a16-awq-dflash2}"
CONTEXT_LENGTH="${CONTEXT_LENGTH:-163840}"
KV_CACHE_DTYPE="${KV_CACHE_DTYPE:-bfloat16}"
MEM_FRACTION_STATIC="${MEM_FRACTION_STATIC:-0.91}"
MAX_TOTAL_TOKENS="${MAX_TOTAL_TOKENS:-163840}"
DRAFT_TOKENS="${DRAFT_TOKENS:-8}"
CHUNKED_PREFILL_SIZE="${CHUNKED_PREFILL_SIZE:-4096}"
MAX_PREFILL_TOKENS="${MAX_PREFILL_TOKENS:-16384}"
RANDOM_SEED="${RANDOM_SEED:-123456789}"
HOST="${HOST:-0.0.0.0}"
PORT="${PORT:-8199}"
API_KEY="${API_KEY:-dummy}"
LOG_FILE="${LOG_FILE:-${ROOT_DIR}/logs/sglang-dflash2.log}"CUDA 13.3
export CUDA_HOME="${CUDA_HOME:-/home/root1/code/llm/cuda-toolkit}"
export PATH="${CUDA_HOME}/bin:${PATH}"
export LD_LIBRARY_PATH="${CUDA_HOME}/lib:${LD_LIBRARY_PATH:-}"for p in "${MODEL_PATH}" "${DRAFT_MODEL_PATH}"; do
if [[ ! -e "${p}" ]]; then
echo "模型文件缺失: ${p}" >&2
exit 1
fi
doneif ss -ltn "sport = :${PORT}" | tail -n +2 | grep -q .; then
echo "端口 ${PORT} 已被占用" >&2
exit 2
fimkdir -p "$(dirname "${LOG_FILE}")"
echo "启动 ${SERVED_MODEL_NAME} @ ${HOST}:${PORT} (ctx=${CONTEXT_LENGTH}, DFLASH2, kv=${KV_CACHE_DTYPE})"
exec "${VENV_DIR}/bin/python" -m sglang.launch_server
--model-path "${MODEL_PATH}"
--served-model-name "${SERVED_MODEL_NAME}"
--speculative-algorithm DFLASH
--speculative-draft-model-path "${DRAFT_MODEL_PATH}"
--speculative-num-draft-tokens "${DRAFT_TOKENS}"
--speculative-draft-model-quantization "${DRAFT_QUANTIZATION}"
--tool-call-parser qwen3_coder
--reasoning-parser qwen3
--default-chat-template-kwargs '{"reasoning_effort":"medium"}'
--attention-backend flashinfer
--speculative-draft-attention-backend triton
--linear-attn-backend triton
--chunked-prefill-size "${CHUNKED_PREFILL_SIZE}"
--max-prefill-tokens "${MAX_PREFILL_TOKENS}"
--mamba-radix-cache-strategy extra_buffer_lazy
--max-mamba-cache-size 12
--cuda-graph-max-bs-decode 8
--context-length "${CONTEXT_LENGTH}"
--kv-cache-dtype "${KV_CACHE_DTYPE}"
--mem-fraction-static "${MEM_FRACTION_STATIC}"
--max-total-tokens "${MAX_TOTAL_TOKENS}"
--random-seed "${RANDOM_SEED}"
--host "${HOST}"
--port "${PORT}"
--api-key "${API_KEY}"
--sleep-on-idle
--enable-cache-report
--enable-metrics
--log-level info > "${LOG_FILE}" 2>&1 -
4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ@terry 就是想再压榨一下4090的性能吧,肯定想越快越好,稍后我再测试几组参数,晚些把完整启动脚本贴出来。
-
4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ@Xiaote 我使用的是https://huggingface.co/philbert440/Qwen3.8-27B-W4A16-AWQ/tree/main 模型,大小18.7 GB,感觉质量上与Q6感觉不出大的区别。我会按你的建议进行实测一下。非常感谢!
-
SGLang HiCache实测:KV缓存放进内存和SSD,多开Agent终于舒服了,5090/RTX Pro5000/4080S 32G/4090 48G等显卡福音!实测开启--hicache-size tok/s 掉的太厉害,直接打折。。。
-
4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ这个速度还有没有提升空间了?同配置同模型下,还有更高的token速度吗?请晒出参数,学习一下。
配置:4090 魔改48GB 64GB内存
SGlang版本:0.5.19.dev20260825+g1fa32d50e1
实测DSH,长时间多轮写码 平均 110 tok/s
参数:
│ --model-path /home/root1/code/llm/sglang/models/Qwen3.8-27B-W4A16-AWQ
│ --served-model-name qwen3.8-27b-w4a16-awq-dflash2
│ --speculative-algorithm DFLASH
│ --speculative-draft-model-path /home/root1/code/llm/sglang/models/Qwen3.8-27B-DFlash2
│ --speculative-num-draft-tokens 8
│ --speculative-draft-model-quantization unquant
│ --default-chat-template-kwargs {"reasoning_effort":"medium"}
│ --attention-backend flashinfer(主模型)
│ --speculative-draft-attention-backend triton(草稿,滑窗)
│ --linear-attn-backend triton(GDN/mamba 层)
│ --context-length 250000
│ --kv-cache-dtype fp8_e4m3
│ --mem-fraction-static 0.75
│ --max-total-tokens 240000