SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置
-
@566656661 这个不知道,我起手就用的sglang。vllm和llamacpp速度太慢了,用了sglang回不去了。
-
@566656661 这个不知道,我起手就用的sglang。vllm和llamacpp速度太慢了,用了sglang回不去了。
-
@566656661 @用户名违规
SG-Lang好用,说真的,我今天测试了下,确实很好。 -
吐槽一下llamacpp,15t/s的解码速率,gguf得多差啊!还是只有我这样配置问题? vllm还在测试中。。VLLM不要测试了,其实高不成低不就,要跑Agent,目前就是SG-Lang+Qwen3.6 27b最好用。Llama.cpp 是你自己的设置问题我,我什么都不优化,不开MTP都45t/s,它的问题就是缓存不行,prefill慢到吐血。我今天明天发两个视频,第二个视频里我录个实际的效果你去对比下,看看速度如何。
我这边用AWQ的模型不行,不知道哪里出了问题,你可以贴下参数,我用的是FP8模型。然后上下文是开满了,长期运行之后,占用了41.5G 显存,驱动Herms速度比Llama.cpp和VLLM快多了。
-
吐槽一下llamacpp,15t/s的解码速率,gguf得多差啊!还是只有我这样配置问题? vllm还在测试中。。VLLM不要测试了,其实高不成低不就,要跑Agent,目前就是SG-Lang+Qwen3.6 27b最好用。Llama.cpp 是你自己的设置问题我,我什么都不优化,不开MTP都45t/s,它的问题就是缓存不行,prefill慢到吐血。我今天明天发两个视频,第二个视频里我录个实际的效果你去对比下,看看速度如何。
我这边用AWQ的模型不行,不知道哪里出了问题,你可以贴下参数,我用的是FP8模型。然后上下文是开满了,长期运行之后,占用了41.5G 显存,驱动Herms速度比Llama.cpp和VLLM快多了。
#!/bin/bash # Qwen3.6-27B-Fable Q6_K — llama.cpp 启动配置(优化版) # GPU: RTX 4090D (48G) | 模型: 64 层混合 (16 Full Attention + 48 SSM) # 目标:全 GPU 卸载,0 层在 CPU # 优化:Q8_0→Q6_K + KV q4_0 + 线程调优,目标 25-28 t/s set -e # ═══════════════════════════════════════════ # 参数说明(每个都加注释) # ═══════════════════════════════════════════ MODEL="/mnt/dataM4/models/Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-Q8_0.gguf" # --gpu-layers 64: 全部 64 层都加载到 GPU 显存(不卸载到 CPU) # 如果设 32 就只有前 32 层在 GPU,后 32 层在 CPU,速度减半 GPU_LAYERS=64 # --ctx-size 262144: 上下文窗口 262K tokens(模型原生支持 262144) # 显存开销:KV Cache ~8GB(q8_0 量化) CTX_SIZE=262144 # --batch-size 8192: 逻辑 batch(prefill 阶段一次处理多少 token) # 决定 prompt 阶段的速度,越大 prefilled 越快 BATCH_SIZE=8192 # --ubatch-size 4096: 物理 batch(GPU 计算缓冲大小) # GPU 内存里同时计算的 token 数,不超过显存 UBATCH_SIZE=4096 # --threads 6: 生成阶段 CPU 线程数(每生成 1 个 token) # 纯 GPU 时影响不大,设小点省 CPU,避免线程调度开销 THREADS=6 # --threads-batch 8: Prefill 阶段 CPU 线程数(处理 prompt) # 降低到 8,减少 CPU 竞争,GPU 是瓶颈不是 CPU THREADS_BATCH=8 # --temp 0.7: 采样温度(0=确定性强,1.0=随机性强) TEMP=0.6 # --top-p 0.95: Nucleus 采样,累积概率到 0.95 截断 TOP_P=0.95 # --top-k 20: 只选概率最高的 20 个 token 参与采样 TOP_K=20 # --flash-attn on: 开启 Flash Attention(RTX 4090D SM89 原生支持) # 对 Qwen3.5 混合架构的 Full Attention 层有显著加速 FLASH_ATTN=on # --cache-type-k/v q4_0: KV Cache 用 Q4_0 量化(大幅降低带宽压力) # 实测:q4_0 KV cache 对生成质量影响<1%,但 decode 速度提升 10-15% # bf16=16bit(大精度), q8_0=8bit, q4_0=4bit(最佳性价比) CACHE_TYPE=q8_0 # --port 11434: 默认 Ollama 兼容端口 PORT=11434 # ═══════════════════════════════════════════ # 启动命令 — 全 GPU,无 CPU offload # ═══════════════════════════════════════════ exec llama-server \ --model "$MODEL" \ --port "$PORT" \ --ctx-size "$CTX_SIZE" \ --batch-size "$BATCH_SIZE" \ --ubatch-size "$UBATCH_SIZE" \ --gpu-layers "$GPU_LAYERS" \ --threads "$THREADS" \ --threads-batch "$THREADS_BATCH" \ --temp "$TEMP" \ --top-p "$TOP_P" \ --top-k "$TOP_K" \ --flash-attn "$FLASH_ATTN" \ --cache-type-k "$CACHE_TYPE" \ --cache-type-v "$CACHE_TYPE" \ --no-mmap \ --mlock -ngl 99,你llamacpp 跑45t/s?贴一下参数呗,有点夸张啊,我怎么设置都上不去。我是按照sglang的思路设置的。不开MTP45t/s 很顶啊。prefill cpp确实不快。我用sglang显存很容易到47G。你这个占用只有41.5g,咋配置的。?sglang 频繁上下文 prefill 也解决了。基本上随便浪了。命中率99%
-
跟着 https://github.com/mattbucci/2x-3090-GA102-300-A1-sglang-inference
我也用起来了 3090x2python -m sglang.launch_server
--model-path /home/ccadmin/AI/models/hf-mattbucci/Qwen3.6-27B-AWQ
--tensor-parallel-size 2
--dtype float16
--kv-cache-dtype fp8_e4m3
--context-length 262144
--mem-fraction-static 0.85
--max-running-requests 8
--chunked-prefill-size 8192
--num-continuous-decode-steps 32
--trust-remote-code
--watchdog-timeout 600
--port 30000
--host 0.0.0.0
--enable-metrics
--disable-custom-all-reduce
--served-model-name qwen36-dense
--max-mamba-cache-size 8
--chat-template …/Qwen3.6-27B-AWQ/chat_template.jinja
--reasoning-parser qwen3
--sampling-defaults model
--tool-call-parser qwen3_coder
--sampling-backend pytorchPrefill (time-to-first-token,
max_tokens=1)Prompt tokens TTFT (s) Prefill rate (tok/s) 1,344 1.12 1,203 5,352 3.83 1,398 10,680 7.71 1,386 21,336 15.58 1,369 42,672 33.41 1,277 Typical — ~1,350 Decode (steady-state generation)
Metric Value Completion tokens 571 Time (s) 9.16 Decode rate 62.3 tok/s GPU utilization 98% Power draw 244 W (cap) Repo ref (w/ NVLink) 69 tok/s -
跟着 https://github.com/mattbucci/2x-3090-GA102-300-A1-sglang-inference
我也用起来了 3090x2python -m sglang.launch_server
--model-path /home/ccadmin/AI/models/hf-mattbucci/Qwen3.6-27B-AWQ
--tensor-parallel-size 2
--dtype float16
--kv-cache-dtype fp8_e4m3
--context-length 262144
--mem-fraction-static 0.85
--max-running-requests 8
--chunked-prefill-size 8192
--num-continuous-decode-steps 32
--trust-remote-code
--watchdog-timeout 600
--port 30000
--host 0.0.0.0
--enable-metrics
--disable-custom-all-reduce
--served-model-name qwen36-dense
--max-mamba-cache-size 8
--chat-template …/Qwen3.6-27B-AWQ/chat_template.jinja
--reasoning-parser qwen3
--sampling-defaults model
--tool-call-parser qwen3_coder
--sampling-backend pytorchPrefill (time-to-first-token,
max_tokens=1)Prompt tokens TTFT (s) Prefill rate (tok/s) 1,344 1.12 1,203 5,352 3.83 1,398 10,680 7.71 1,386 21,336 15.58 1,369 42,672 33.41 1,277 Typical — ~1,350 Decode (steady-state generation)
Metric Value Completion tokens 571 Time (s) 9.16 Decode rate 62.3 tok/s GPU utilization 98% Power draw 244 W (cap) Repo ref (w/ NVLink) 69 tok/s @applejuice 你是啥显卡。两张3090?
-
@applejuice 你是啥显卡。两张3090?
-
请问大家在用本地模型驱动Hermes agent的时候怎么检测/记录/统计模型的pp/tg 速度? 有特定的工具或者特定的设置吗?
-
#!/bin/bash # Qwen3.6-27B-Fable Q6_K — llama.cpp 启动配置(优化版) # GPU: RTX 4090D (48G) | 模型: 64 层混合 (16 Full Attention + 48 SSM) # 目标:全 GPU 卸载,0 层在 CPU # 优化:Q8_0→Q6_K + KV q4_0 + 线程调优,目标 25-28 t/s set -e # ═══════════════════════════════════════════ # 参数说明(每个都加注释) # ═══════════════════════════════════════════ MODEL="/mnt/dataM4/models/Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-Q8_0.gguf" # --gpu-layers 64: 全部 64 层都加载到 GPU 显存(不卸载到 CPU) # 如果设 32 就只有前 32 层在 GPU,后 32 层在 CPU,速度减半 GPU_LAYERS=64 # --ctx-size 262144: 上下文窗口 262K tokens(模型原生支持 262144) # 显存开销:KV Cache ~8GB(q8_0 量化) CTX_SIZE=262144 # --batch-size 8192: 逻辑 batch(prefill 阶段一次处理多少 token) # 决定 prompt 阶段的速度,越大 prefilled 越快 BATCH_SIZE=8192 # --ubatch-size 4096: 物理 batch(GPU 计算缓冲大小) # GPU 内存里同时计算的 token 数,不超过显存 UBATCH_SIZE=4096 # --threads 6: 生成阶段 CPU 线程数(每生成 1 个 token) # 纯 GPU 时影响不大,设小点省 CPU,避免线程调度开销 THREADS=6 # --threads-batch 8: Prefill 阶段 CPU 线程数(处理 prompt) # 降低到 8,减少 CPU 竞争,GPU 是瓶颈不是 CPU THREADS_BATCH=8 # --temp 0.7: 采样温度(0=确定性强,1.0=随机性强) TEMP=0.6 # --top-p 0.95: Nucleus 采样,累积概率到 0.95 截断 TOP_P=0.95 # --top-k 20: 只选概率最高的 20 个 token 参与采样 TOP_K=20 # --flash-attn on: 开启 Flash Attention(RTX 4090D SM89 原生支持) # 对 Qwen3.5 混合架构的 Full Attention 层有显著加速 FLASH_ATTN=on # --cache-type-k/v q4_0: KV Cache 用 Q4_0 量化(大幅降低带宽压力) # 实测:q4_0 KV cache 对生成质量影响<1%,但 decode 速度提升 10-15% # bf16=16bit(大精度), q8_0=8bit, q4_0=4bit(最佳性价比) CACHE_TYPE=q8_0 # --port 11434: 默认 Ollama 兼容端口 PORT=11434 # ═══════════════════════════════════════════ # 启动命令 — 全 GPU,无 CPU offload # ═══════════════════════════════════════════ exec llama-server \ --model "$MODEL" \ --port "$PORT" \ --ctx-size "$CTX_SIZE" \ --batch-size "$BATCH_SIZE" \ --ubatch-size "$UBATCH_SIZE" \ --gpu-layers "$GPU_LAYERS" \ --threads "$THREADS" \ --threads-batch "$THREADS_BATCH" \ --temp "$TEMP" \ --top-p "$TOP_P" \ --top-k "$TOP_K" \ --flash-attn "$FLASH_ATTN" \ --cache-type-k "$CACHE_TYPE" \ --cache-type-v "$CACHE_TYPE" \ --no-mmap \ --mlock -ngl 99,你llamacpp 跑45t/s?贴一下参数呗,有点夸张啊,我怎么设置都上不去。我是按照sglang的思路设置的。不开MTP45t/s 很顶啊。prefill cpp确实不快。我用sglang显存很容易到47G。你这个占用只有41.5g,咋配置的。?sglang 频繁上下文 prefill 也解决了。基本上随便浪了。命中率99%
@用户名违规 Llama.cpp的参数过往帖子里有很多,你自己随便找。我都很久没用了。我的FP8占用参数发给你看:
容器内部:#!/bin/bash ln -sf /host-libs/libcuda.so.1 /usr/lib/x86_64-linux-gnu/libcuda.so.1 2>/dev/null ldconfig 2>/dev/null sglang serve --model-path /models/Qwen/Qwen3.6-27B-FP8 --host 0.0.0.0 --port 30000 --trust-remote-code --mem-fraction-static 0.8 --context-length 262144如果在宿主机上:
#!/bin/bash docker rm -f sglang 2>/dev/null docker run --rm --pid=host --privileged busybox pkill -f sglang::scheduler 2>/dev/null sleep 2 docker run -d --ipc=host --network=host --shm-size 32g --name sglang --restart unless-stopped --device /dev/nvidia0:/dev/nvidia0 --device /dev/nvidiactl:/dev/nvidiactl --device /dev/nvidia-uvm:/dev/nvidia-uvm --device /dev/nvidia-modeset:/dev/nvidia-modeset --entrypoint /bin/bash -v ~/docker/models:/models -v ~/docker:/scripts -v /usr/lib/x86_64-linux-gnu:/host-libs:ro -e LD_LIBRARY_PATH=/host-libs -e CUDA_VISIBLE_DEVICES=0 -e http_proxy= -e https_proxy= -e HTTP_PROXY= -e HTTPS_PROXY= -e NO_PROXY='*' lmsysorg/sglang:v0.5.15.post1 -c '/scripts/run_think.sh' echo '等待40秒...' sleep 40 docker logs sglang --tail 3 2>/dev/null | grep -E 'Uvicorn|running on' && echo '服务就绪!' || echo '检查: docker logs sglang' ~这都是Hermes自己配置的,我没参与调一个字母,建议你把你的Llama.cpp交给Hermes配置。你这个模型我不想用,有FP8版本的,干嘛换Q8的呢,Q8毫无意义,我希望用AWQ,或者Q4量化的,节约显存。
把这个复制给你的AI就能看懂了,当前我运行了22个小时,很稳定。
-
跟着 https://github.com/mattbucci/2x-3090-GA102-300-A1-sglang-inference
我也用起来了 3090x2python -m sglang.launch_server
--model-path /home/ccadmin/AI/models/hf-mattbucci/Qwen3.6-27B-AWQ
--tensor-parallel-size 2
--dtype float16
--kv-cache-dtype fp8_e4m3
--context-length 262144
--mem-fraction-static 0.85
--max-running-requests 8
--chunked-prefill-size 8192
--num-continuous-decode-steps 32
--trust-remote-code
--watchdog-timeout 600
--port 30000
--host 0.0.0.0
--enable-metrics
--disable-custom-all-reduce
--served-model-name qwen36-dense
--max-mamba-cache-size 8
--chat-template …/Qwen3.6-27B-AWQ/chat_template.jinja
--reasoning-parser qwen3
--sampling-defaults model
--tool-call-parser qwen3_coder
--sampling-backend pytorchPrefill (time-to-first-token,
max_tokens=1)Prompt tokens TTFT (s) Prefill rate (tok/s) 1,344 1.12 1,203 5,352 3.83 1,398 10,680 7.71 1,386 21,336 15.58 1,369 42,672 33.41 1,277 Typical — ~1,350 Decode (steady-state generation)
Metric Value Completion tokens 571 Time (s) 9.16 Decode rate 62.3 tok/s GPU utilization 98% Power draw 244 W (cap) Repo ref (w/ NVLink) 69 tok/s -
@applejuice 这个我可以参考下,抄作业,有空弄下。awq的还是值得玩的。你Hermes调度时,有思考过程吗?
-
,
T terry 固定了此主题
-
,系统 取消固定了此主题
