SGLang运行Qwen3.6-27B-AWQ/FP8成功(双3080 20G)
-
SGLang运行Qwen3.6-27B-AWQ/FP8成功(双3080 20G)
目录
- Qwen3.6-27B-FP8
- Qwen3.6-27B-AWQ-INT4
- Qwen3.6-27B-AWQ-MTP
- 会话测试
- 最后
Qwen3.6-27B-FP8

- 生成速度 38t/s,非常稳定
- 总上下文长度纯文推理到170K左右,显存吃紧
Qwen3.6-27B-AWQ-INT4

- 生成速度 ~53-54 token/s
- 总上下文长度 380k 左右(应该还可优化),显存充裕
Qwen3.6-27B-AWQ-MTP

- 生成速度 65–83 token/s
- 总上下文长度 260k 左右(应该还可优化),显存充裕
对话测试


-3.

最后
- SGLang版本0.5.16
- 启动参数只需很基本的参数即可,无需太复杂
- 之前没成功可能:1. SGLang版本问题 2. CUDA-tools版本与torch版本匹配问题
- 随问随答的感觉很好,mama再也不用担心等太久花谢了
-
我雙5070ti 16gb llama.cpp用Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-Q5_K_M.gguf,跑hermes 問去洗車的問題。


SGLang 學習中!!~
@terry 好的,跑題了^^!!