看图看图。。这个性能起飞了。
4090D-48G-27B-FP8 无MTP 30t/s,perfill 速度2500-3500,平均2800+

-
sglang 05.16 历史性性能升级perfill 直冲3500+ -
AMD AI Pro R9700 LLM调教这个是我调了一周的sglang配置。
主要目的是单线程,没有MTP,速度30t/s,有500K上下文。
上了MTP,速度有60t/s,有300k上下文。最主要的是QWEN3.6-27B-FP8也不聪明。。但是又觉得有时候比云API聪明。
主要是我的soul。md 明确了,所有问题优先社区找到答案。。处理问题的能力提升了一些。#!/bin/bash # SGLang 0.5.15 — sglang serve (官方推荐方式) # Qwen3.6-27B-MTP | RTX 4090D 48G set -euo pipefail # 路径与环境 readonly SGLANG_VENV="/mnt/dataM4/venv_sglang" readonly MODEL_PATH="/mnt/dataM4/models/Qwen3.6-27B-AEON-Ultimate-Uncensored-FP8-MTP" export HF_HOME="/root/.cache/huggingface" export TRITON_CACHE_DIR="/root/sglang_cache/triton/cache" export TORCHINDUCTOR_CACHE_DIR="/root/sglang_cache/torch_compile" export FLASH_ATTENTION_CUTE_CACHE_DIR="/root/sglang_cache/flash_attn_cute_cache" export CUDA_HOME=/usr/local/cuda-12.8 export PATH="$CUDA_HOME/bin:$PATH" export LD_LIBRARY_PATH="$CUDA_HOME/lib64" export LD_LIBRARY_PATH="/mnt/dataM4/venv_sglang/lib/python3.11/site-packages/nvidia/cusparselt/lib:$LD_LIBRARY_PATH" export CUDAHOSTCXX=/usr/bin/gcc-12 export CC=/usr/bin/gcc-12 export CXX=/usr/bin/g++-12 export PYTORCH_ALLOC_CONF="expandable_segments:True" export CUDA_DEVICE_ORDER="PCI_BUS_ID" export CUDA_VISIBLE_DEVICES="0" export FLASHINFER_DISABLE_VERSION_CHECK=1 export FLASH_ATTENTION_CUTE_DSL_CACHE_ENABLED=1 source "${SGLANG_VENV}/bin/activate" SGLANG_ARGS=( --model-path "${MODEL_PATH}" --host 0.0.0.0 --port 30000 --trust-remote-code --tp-size 1 --attention-backend flashinfer --mamba-backend flashinfer --kv-cache-dtype fp8_e4m3 --page-size 16 --mem-fraction-static 0.93 --max-running-requests 1 --prefill-max-requests 1 --schedule-policy lpm --schedule-conservativeness 1.0 --mamba-radix-cache-strategy extra_buffer --mamba-ssm-dtype bfloat16 --mamba-full-memory-ratio 0.08 --speculative-algorithm nextn --speculative-num-steps 2 --speculative-eagle-topk 1 --speculative-num-draft-tokens 2 --tool-call-parser qwen3_coder --reasoning-parser qwen3 --preferred-sampling-params '{"temperature": 0.7, "repetition_penalty": 1.2, "frequency_penalty": 0.5, "presence_penalty": 0.3}' --enable-dynamic-chunking --chunked-prefill-size 16384 --radix-eviction-policy lru --enable-metrics --enable-streaming-session --enable-request-time-stats-logging --log-requests --log-requests-level 0 --decode-log-interval 60 ) # 启动 readonly SGLOG="/dev/shm/sglang/sglang.log" mkdir -p "$(dirname "$SGLOG")" # 日志轮转 if ! pgrep -f sglang_log_rotate > /dev/null 2>&1; then nohup bash /root/sglang_log_rotate.sh >/dev/null 2>&1 & fi exec sglang serve "${SGLANG_ARGS[@]}" >>"$SGLOG" 2>&1 -
QWEN3.8-27B 解决工具调用和空思考循环的问题。社区里面有一个作者改进的模板实测有效。
https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates -
hermes还真的有个DeepSeek现在的用法是,hermes main跑deepseek v4 flash 1m缓存调用。所有的执行全是本地QWEN3.6 27B执行,v4只需要大脑拆分任务和调用,hermes main直接禁用所有工具只允许调度。。速度上天了。在也不担心上下文了。最主要的是,解放了本地模型的上下文焦虑。v4召回准确度又很无解。7个小时任务跑下来不到1毛钱。。
-
AMD AI Pro R9700 LLM调教@fcme PP不知道150K上下文速度能打50t/s,200k的上下文时候大概也是在50t/s,这个有mtp。如果不开MTP稳定100K内31t/s,超过150k 27t/s的样子。速度不能和云API对比
-
SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置@566656661 这个不知道,我起手就用的sglang。vllm和llamacpp速度太慢了,用了sglang回不去了。
-
新手想問Qwen3.8-27B搭配opencode的問題搜一下qwen fix 或者看我发的贴子
-
SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置硬件环境:
CPU:2667v2x2
RAM:DDR3 128G(1066)
GF:RTX4090D-48G
SGlang 上下文:500K,上下文内容100-200k也能保持28t/s的推理速度
模型:Qwen3.6-27B-FP8
SGLANG顶峰值解码速度32/s,平均值28t/s,Prefill速度:1400-1600t/s。
和VLLM、llamacpp对比,快大概百分之30-50%。
吐槽一下llamacpp,15t/s的解码速率,gguf得多差啊!还是只有我这样配置问题?
vllm还在测试中。。#!/bin/bash # SGLang 0.5.15 — sglang serve # Qwen3.6-27B-MTP | RTX 4090D 48G set -euo pipefail readonly SGLANG_VENV="/mnt/dataM4/venv_sglang" readonly MODEL_PATH="/mnt/dataM4/models/Qwen3.6-27B-AEON-Ultimate-Uncensored-FP8-MTP" export HF_HOME="/root/.cache/huggingface" export TRITON_CACHE_DIR="/root/sglang_cache/triton/cache" export TORCHINDUCTOR_CACHE_DIR="/root/sglang_cache/torch_compile" export FLASH_ATTENTION_CUTE_CACHE_DIR="/root/sglang_cache/flash_attn_cute_cache" export CUDA_HOME=/usr/local/cuda-12.8 export PATH="$CUDA_HOME/bin:$PATH" export LD_LIBRARY_PATH="$CUDA_HOME/lib64" export LD_LIBRARY_PATH="/mnt/dataM4/venv_sglang/lib/python3.11/site-packages/nvidia/cusparselt/lib:$LD_LIBRARY_PATH" export CUDAHOSTCXX=/usr/bin/gcc-12 export CC=/usr/bin/gcc-12 export CXX=/usr/bin/g++-12 # 🔴 修正拼写 export PYTORCH_CUDA_ALLOC_CONF="expandable_segments:True" export CUDA_DEVICE_ORDER="PCI_BUS_ID" export CUDA_VISIBLE_DEVICES="0" export FLASHINFER_DISABLE_VERSION_CHECK=1 export FLASH_ATTENTION_CUTE_DSL_CACHE_ENABLED=1 source "${SGLANG_VENV}/bin/activate" SGLANG_ARGS=( --model-path "${MODEL_PATH}" --host 0.0.0.0 --port 30000 --trust-remote-code --tp-size 1 --attention-backend flashinfer --mamba-backend flashinfer --kv-cache-dtype fp8_e4m3 --page-size 8 --mem-fraction-static 0.94 --max-running-requests 2 --prefill-max-requests 1 --schedule-policy lpm --schedule-conservativeness 1 --mamba-radix-cache-strategy extra_buffer --mamba-ssm-dtype bfloat16 --mamba-full-memory-ratio 0.08 --tool-call-parser qwen3_coder --reasoning-parser qwen3 --preferred-sampling-params '{"temperature": 0.6, "repetition_penalty": 1.2, "frequency_penalty": 0.5, "presence_penalty": 0.3}' --chunked-prefill-size 4096 --max-prefill-tokens 8192 --context-length 262144 --radix-eviction-policy lru --cuda-graph-max-bs-decode 2 --cuda-graph-bs-decode 1 2 #--enable-metrics #--enable-streaming-session #--enable-request-time-stats-logging #--log-requests --log-requests-level 0 --decode-log-interval 300 # 🟡 降低日志频率 # 🟢 關閉 Uvicorn Access Log (排除所有路徑) --uvicorn-access-log-exclude-prefixes / ) # 🟡 日志改到磁盘,避免占用系统内存 readonly SGLOG="/dev/shm/sglang/sglang.log" mkdir -p "$(dirname "$SGLOG")" # 日志轮转 if ! pgrep -f sglang_log_rotate > /dev/null 2>&1; then nohup bash /root/sglang_log_rotate.sh >/dev/null 2>&1 & fi exec sglang serve "${SGLANG_ARGS[@]}" >>"$SGLOG" 2>&1 -
SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置@terry prefill 1800-1400平均值。但是这个值我就是不清楚在4090D上面属于什么水平。cpp跑只有几百,vllm好像也不太行。
-
双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功@smax 用越狱的FP8的都还不错,MTP真不能开,模型的原理是概率推测,TMP开启后会导致幻觉增加的风险,原因很简单,在模型推理里面错一个字后面的内容就往错的方向发展了。只有一个一个字的推,才能保证幻觉最低。
-
SGLANG 0.5.17+deepseek harness+Q3.8-27B-FP8 最恐怖的地方来了。最强的地方,居然是缓存命中率,做到99%的命中,太JB夸张了。
claude code ,codex,hermes,open code,Qwen这些智能体框架,最大的缺点就是在system+tools+ass的时候回破坏前缀。导致缓存失效。deepseek harness 感觉就是专门给sglang做适配的。缓存命中绝了。。基本是,没有prefill,只有要满200k上下文的时候prefill一下。。爽的批爆!!!工具也要干啥claude code啦!
如图
-
SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置#!/bin/bash # Qwen3.6-27B-Fable Q6_K — llama.cpp 启动配置(优化版) # GPU: RTX 4090D (48G) | 模型: 64 层混合 (16 Full Attention + 48 SSM) # 目标:全 GPU 卸载,0 层在 CPU # 优化:Q8_0→Q6_K + KV q4_0 + 线程调优,目标 25-28 t/s set -e # ═══════════════════════════════════════════ # 参数说明(每个都加注释) # ═══════════════════════════════════════════ MODEL="/mnt/dataM4/models/Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-Q8_0.gguf" # --gpu-layers 64: 全部 64 层都加载到 GPU 显存(不卸载到 CPU) # 如果设 32 就只有前 32 层在 GPU,后 32 层在 CPU,速度减半 GPU_LAYERS=64 # --ctx-size 262144: 上下文窗口 262K tokens(模型原生支持 262144) # 显存开销:KV Cache ~8GB(q8_0 量化) CTX_SIZE=262144 # --batch-size 8192: 逻辑 batch(prefill 阶段一次处理多少 token) # 决定 prompt 阶段的速度,越大 prefilled 越快 BATCH_SIZE=8192 # --ubatch-size 4096: 物理 batch(GPU 计算缓冲大小) # GPU 内存里同时计算的 token 数,不超过显存 UBATCH_SIZE=4096 # --threads 6: 生成阶段 CPU 线程数(每生成 1 个 token) # 纯 GPU 时影响不大,设小点省 CPU,避免线程调度开销 THREADS=6 # --threads-batch 8: Prefill 阶段 CPU 线程数(处理 prompt) # 降低到 8,减少 CPU 竞争,GPU 是瓶颈不是 CPU THREADS_BATCH=8 # --temp 0.7: 采样温度(0=确定性强,1.0=随机性强) TEMP=0.6 # --top-p 0.95: Nucleus 采样,累积概率到 0.95 截断 TOP_P=0.95 # --top-k 20: 只选概率最高的 20 个 token 参与采样 TOP_K=20 # --flash-attn on: 开启 Flash Attention(RTX 4090D SM89 原生支持) # 对 Qwen3.5 混合架构的 Full Attention 层有显著加速 FLASH_ATTN=on # --cache-type-k/v q4_0: KV Cache 用 Q4_0 量化(大幅降低带宽压力) # 实测:q4_0 KV cache 对生成质量影响<1%,但 decode 速度提升 10-15% # bf16=16bit(大精度), q8_0=8bit, q4_0=4bit(最佳性价比) CACHE_TYPE=q8_0 # --port 11434: 默认 Ollama 兼容端口 PORT=11434 # ═══════════════════════════════════════════ # 启动命令 — 全 GPU,无 CPU offload # ═══════════════════════════════════════════ exec llama-server \ --model "$MODEL" \ --port "$PORT" \ --ctx-size "$CTX_SIZE" \ --batch-size "$BATCH_SIZE" \ --ubatch-size "$UBATCH_SIZE" \ --gpu-layers "$GPU_LAYERS" \ --threads "$THREADS" \ --threads-batch "$THREADS_BATCH" \ --temp "$TEMP" \ --top-p "$TOP_P" \ --top-k "$TOP_K" \ --flash-attn "$FLASH_ATTN" \ --cache-type-k "$CACHE_TYPE" \ --cache-type-v "$CACHE_TYPE" \ --no-mmap \ --mlock -ngl 99,你llamacpp 跑45t/s?贴一下参数呗,有点夸张啊,我怎么设置都上不去。我是按照sglang的思路设置的。不开MTP45t/s 很顶啊。prefill cpp确实不快。我用sglang显存很容易到47G。你这个占用只有41.5g,咋配置的。?sglang 频繁上下文 prefill 也解决了。基本上随便浪了。命中率99%
-
交作业:X99 CD3+E5 2666 +128G DDR3 + AMD AI Pro 9700,成功安装ubuntu,等不及跟大家分享。后续再更新哇咔咔,我打算X79+2667 V22+128G+R97002(未购入),一张跑QWEN3.6 27B一张跑wan2.2,但是一直不清楚,QWEN3.6 27B,输入速度怎么看,X79和X99差距对推理提升不是很大,就没升级X99的动力了。部署QWEN3.6 27B的问题在于,kvcache能不能打满256B,并且能支持几个并发,很关心,选MTP还是DFLASH+googeKV缓存技术。
-
交作业:X99 CD3+E5 2666 +128G DDR3 + AMD AI Pro 9700,成功安装ubuntu,等不及跟大家分享。后续再更新https://github.com/jagsan-cyber/turboquant-rocm-llamacpp ,DFLASH+TurboQuant+AMD R9700 直接支持了,QWEN3.6 27B跑量化6,还保持256K上下文实现了。