昨天又繼續跟我的hermes一起研究(其實都是它的功勞啦)報告如下
雙 RTX 2080 Ti 22GB 跑 Qwen3.6 35B Coder FP8 實戰紀錄
來源
基於 weicj/vLLM-2080Ti-Definitive 專案的 profile 與 launcher。
硬體
2× RTX 2080 Ti 22GB + NVLink
GPU 功耗上限 200W
模型
Jackrong/Qwopus3.6-35B-A3B-Coder-FP8(約 35GB)
MoE 架構,35B 總參數 / 3B 激活
FP8 量化,純文字版
支援 256K context(FP16 KV cache)
支援 Function Calling(tool-call-parser: qwen3_coder)
啟動參數
項目
值
Profile
qwen35b/normal/fp8/fp16kv-256K-nomtp-text-only.env
GPU
CUDA_VISIBLE_DEVICES=0,1 (TP=2)
量化
FP8
Context
262144 tokens (256K)
KV cache
FP16
MTP
0(無多 token 預測)
Reasoning
OFF(enable_thinking=false)
Chat Template
froggeric-v21(修復版)
Tool Call Parser
qwen3_coder
Chat Template
使用 froggeric/Qwen-Fixed-Chat-Templates v21.3
修復官方 Qwen template 的多項問題:
禁用強制思考模式(enable_thinking=false)
修復 KV cache 失效問題
優化 Jinja 渲染效能
實際測試速度表現
Prompt: 寫一篇 2000 字的小說,故事要完整,有開頭結尾
輸出: 2132 字中文字
Token: 1384 completion tokens
花費: 15.14 秒
速度: 91.4 tok/s
結束: stop(自然結束)
項目
數據
生成速度(暖機後)
91.4 tok/s
TTFT(首個 token)
~11ms
最大小說產出
2132 字 / 1384 tokens / 15.14s
我滿足了