RTX PRO 5000 72G SgLang 跑 Qwen3.8-27B FP8
-
source ~/sglang_env/bin/activate
SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server
--model-path /home/jhhotel/models/models/Qwen--Qwen3.8-27B-FP8/snapshots/master
--served-model-name Qwen3.8-27B-FP8
--attention-backend flashinfer
--kv-cache-dtype fp8_e4m3
--chunked-prefill-size 2048
--context-length 262144
--mem-fraction-static 0.90
--reasoning-parser qwen3
--tool-call-parser qwen3_coder
--speculative-algo NEXTN
--speculative-num-steps 3
--speculative-eagle-topk 1
--speculative-num-draft-tokens 4
--host 0.0.0.0
--port 30000
--enable-cache-report \Ubuntu24.04







生产速度在55-80t/s 预填充6000左右 延时0.336 这些数据都是在单会话情况下的测试
-
不错。抄作业。66.5度 声音也起来了。汗。涡轮。
-
不错。抄作业。66.5度 声音也起来了。汗。涡轮。
-
,
T terry 固定了此主题
-
72G的核心就是可以同时开3个session的全量上下文。配合上几乎不掉速的2线程并发,是真正的生产级别。
48GB我用下来现在的掣肘就是kvcache不够用,只能单会话满上下文。
这就导致无法发挥LLM框架的全部效率。 -
,系统 取消固定了此主题

