@Xiaote 手里有一张5090,两张4090,都是非公三风扇,有什么物美价廉的方案能都插上,或者插两张也行。
ran z
-
魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec -
魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec请教,x670e或者am4板子,能插两张三风扇的卡吗?先不说散热,就3.5槽的卡能插进去就行
-
SGLang HiCache 三层 KV 缓存实测:32GB Blackwell 单卡跑通 Qwen3.8-27B懂了,得换系统才能跑,目前win11+wsl2的方案看来还是白费。
感谢楼主!

-
SGLang HiCache 三层 KV 缓存实测:32GB Blackwell 单卡跑通 Qwen3.8-27B【比着葫芦画葫芦失败】SGLang 0.5.18 + Qwen3.8-27B-NVFP4 在 WSL2 上 decode 崩溃(mrope CUDA illegal memory access),通过dsh由deepseek v4 flash处理,结果失败,请楼主指点
环境
项目 详情
硬件:i9 14900k 192G ddr5 RTX 5090
系统 Windows 11 + WSL2,NVIDIA 驱动 610.74(WDDM 模式)
框架 sglang 0.5.18(发帖时为最新版,PyPI / tuna 上无 0.5.19+)
模型 RadixArk Qwen3.8-27B-NVFP4
现象
decode 阶段 CUDA illegal memory access,崩在 _compute_mrope_positions_decode(vision token 的 3D 位置编码路径)。纯文本输入也会崩,可稳定复现。已排除项(逐项对照过楼主参数)
楼主(原生 Linux + systemd + RTX PRO 4500)的完整启动参数我已全套对齐复测,仍崩在同一位置:--hicache-size 32 --mem-fraction-static 0.85 --max-running-requests 1 --context-length 131072 --reasoning-parser qwen3 --tool-call-parser qwen3_coder
参数逐项调过:hicache-size 96→32、mem-fraction-static 0.60 / 0.72 / 0.85,均无效
进程保活(setsid)无关;缺 libssl(JIT 链接)无关
--language-model-only:sglang 目前只支持 MuseGlimmer,对本模型不可用
根因(已锁定)
模型自带 README 写明:"Dense Multimodal … Input Type(s): Text, image, and video"
"Attention weights use FP8, while MTP and vision tensors retain the source BF16"
"Preferred Operating System(s): Linux"
即 config 带 vision: true,sglang 0.5.18 将其按多模态模型处理,decode 走 mrope 路径。楼主原生 Linux 环境走这条路径不炸;WSL2 + WDDM 驱动下同一路径直接崩。这是环境差异,参数抄得再准也绕不过去。我看到的三条路
升级 sglang(>0.5.18):修复多模态 mrope decode——目前不可行,0.5.18 就是已发布最新版(0.5.19 / 0.6.0 / 0.5.20 均不存在),只能等上游发版
换纯语言版 checkpoint:找一个无 vision_config 的 Qwen3.8-27B NVFP4/FP8,sglang 就不会走多模态 mrope decode——当前 WSL2 上最可行
原生 Linux 跑:README 官方支持的 OS,但成本高(需双系统或其他 Linux 机器)
想请帮忙的
有没有无 vision 的 Qwen3.8-27B NVFP4 / FP8 checkpoint?RadixArk 或社区是否出过纯语言版?
有没有人在 WSL2 上跑多模态 sglang 踩过同样的 mrope 崩溃?有 workaround 吗(除了换环境)?
上游 sglang 有没有已知计划修多模态 mrope decode?
现状
先用 llama.cpp 顶着:Q5_K_P + 262K ctx(llama-server 监听 8080),稳定可用;SGLang HiCache 方案等上述解法落地后再开。 -
SGLang HiCache 三层 KV 缓存实测:32GB Blackwell 单卡跑通 Qwen3.8-27B请教一下,20.14 GB(NVFP4)直接塞显存就行了,为啥还要搞HiCache呢?只是可用多会话吗?谢谢!
-
自研工作流,最新进展说的实在,确实如此!
-
3090 24G 跑QWOPUS 3.6 27B mtp 131K上下文 KV(Q8_0) 55TOK/S 智能开关思考- 最终配置,再也不折腾了(6月14日更新)5090移动版也是24g,能抄作业吗?
-
llama.cpp+qwen3.6-27b 初步测试@rock-shi 那就对了,24G跑128K上下文+MTP资源不够
我27 q4量化,kv均q8_0量化,上下文128k,MTP, 5090laptop 24GRAM,开thinking,50+tps,快的起飞啊
厉害!一样的卡,大哥能给个作业抄吗?14900k,32g内存,llama.cpp,感谢!