SGLang HiCache 三层 KV 缓存实测:32GB Blackwell 单卡跑通 Qwen3.8-27B
-
@ran-z HiCache 的实际价值
坦白说,HiCache 在单用户场景下最大的价值不是"跑更大上下文",而是多会话 KV 复用免 prefill。GPU 上直接跑 ~101K tokens(全速)
超出部分由 HiCache L2 从 RAM 换入(有延迟)
重启服务后,之前的 KV 从 L2 恢复,不用重新 prefill
多会话切换时,不活跃会话的 KV 换到 RAM,活跃的留在 VRAM
对比 llama.cpp 的 150K 全 VRAM 方案:llama.cpp 速度更快(全在 GPU 上,零搬运延迟)
SGLang HiCache 胜在会话复用(重启免 prefill) -
【比着葫芦画葫芦失败】SGLang 0.5.18 + Qwen3.8-27B-NVFP4 在 WSL2 上 decode 崩溃(mrope CUDA illegal memory access),通过dsh由deepseek v4 flash处理,结果失败,请楼主指点
环境
项目 详情
硬件:i9 14900k 192G ddr5 RTX 5090
系统 Windows 11 + WSL2,NVIDIA 驱动 610.74(WDDM 模式)
框架 sglang 0.5.18(发帖时为最新版,PyPI / tuna 上无 0.5.19+)
模型 RadixArk Qwen3.8-27B-NVFP4
现象
decode 阶段 CUDA illegal memory access,崩在 _compute_mrope_positions_decode(vision token 的 3D 位置编码路径)。纯文本输入也会崩,可稳定复现。已排除项(逐项对照过楼主参数)
楼主(原生 Linux + systemd + RTX PRO 4500)的完整启动参数我已全套对齐复测,仍崩在同一位置:--hicache-size 32 --mem-fraction-static 0.85 --max-running-requests 1 --context-length 131072 --reasoning-parser qwen3 --tool-call-parser qwen3_coder
参数逐项调过:hicache-size 96→32、mem-fraction-static 0.60 / 0.72 / 0.85,均无效
进程保活(setsid)无关;缺 libssl(JIT 链接)无关
--language-model-only:sglang 目前只支持 MuseGlimmer,对本模型不可用
根因(已锁定)
模型自带 README 写明:"Dense Multimodal … Input Type(s): Text, image, and video"
"Attention weights use FP8, while MTP and vision tensors retain the source BF16"
"Preferred Operating System(s): Linux"
即 config 带 vision: true,sglang 0.5.18 将其按多模态模型处理,decode 走 mrope 路径。楼主原生 Linux 环境走这条路径不炸;WSL2 + WDDM 驱动下同一路径直接崩。这是环境差异,参数抄得再准也绕不过去。我看到的三条路
升级 sglang(>0.5.18):修复多模态 mrope decode——目前不可行,0.5.18 就是已发布最新版(0.5.19 / 0.6.0 / 0.5.20 均不存在),只能等上游发版
换纯语言版 checkpoint:找一个无 vision_config 的 Qwen3.8-27B NVFP4/FP8,sglang 就不会走多模态 mrope decode——当前 WSL2 上最可行
原生 Linux 跑:README 官方支持的 OS,但成本高(需双系统或其他 Linux 机器)
想请帮忙的
有没有无 vision 的 Qwen3.8-27B NVFP4 / FP8 checkpoint?RadixArk 或社区是否出过纯语言版?
有没有人在 WSL2 上跑多模态 sglang 踩过同样的 mrope 崩溃?有 workaround 吗(除了换环境)?
上游 sglang 有没有已知计划修多模态 mrope decode?
现状
先用 llama.cpp 顶着:Q5_K_P + 262K ctx(llama-server 监听 8080),稳定可用;SGLang HiCache 方案等上述解法落地后再开。 -
@ran-z 这个崩点我查了 SGLang 的 issue 库,属于已知 bug 类别,不是配置问题——你的排查方向没错,别再抠参数了。
同类报告:
- sgl-project/sglang #13060:Qwen3-Omni 在 _compute_mrope_positions_decode 同点崩溃 = SGLang 解析 M-RoPE(3D 位置编码)配置的已知问题,纯文本也崩是正常的(跟视觉 token 无关)
- #30055:Qwen3.5 + HiCache 触发 CUDA illegal memory access——你开着 --hicache-size 32,正好踩这个组合
- #19383:Qwen3.5-397B-A17B-NVFP4 TopKTopPSampling 崩 = NVFP4 kernel 专属 bug 类别
按顺序二分定位(每次只动一个变量):
- 先关 HiCache(去掉 --enable-hierarchical-cache 或 --hicache-size 0)——#30055 就是 HiCache 路径触发的;关了不崩 = 锁定 HiCache 与 mrope 的交互,等 SGLang 修复,别硬刚
- 换 FP8 权重(RadixArk 有 FP8 版)——NVFP4 kernel 覆盖差(#19383 同族),FP8 稳得多,Qwen3.8 FP8 跑 SGLang 论坛里成功案例一堆
- 升级 SGLang 到 main 分支或最新 release——PyPI/tuna 的 0.5.18 是"发帖时最新",mrope/HiCache 修复基本都在 main 或 0.5.19+;用官方镜像 lmsysorg/sglang:latest 最省事
- 还崩就加 --disable-cuda-graph 试(WSL2 上 CUDA graph 捕获偶发 illegal access 是老坑)
最后提醒:楼主是在原生 Linux 跑通的,你在 WSL2——SGLang 这种服务端推理在 WSL2 上本身多一层兼容风险(共享内存、CUDA graph)。上面 4 步都不行,双系统/原生 Linux 跑同配置是终局验证:原生不崩 = 锁死 WSL2 环境问题,别在 WSL2 上继续耗。
-
【比着葫芦画葫芦失败】SGLang 0.5.18 + Qwen3.8-27B-NVFP4 在 WSL2 上 decode 崩溃(mrope CUDA illegal memory access),通过dsh由deepseek v4 flash处理,结果失败,请楼主指点
环境
项目 详情
硬件:i9 14900k 192G ddr5 RTX 5090
系统 Windows 11 + WSL2,NVIDIA 驱动 610.74(WDDM 模式)
框架 sglang 0.5.18(发帖时为最新版,PyPI / tuna 上无 0.5.19+)
模型 RadixArk Qwen3.8-27B-NVFP4
现象
decode 阶段 CUDA illegal memory access,崩在 _compute_mrope_positions_decode(vision token 的 3D 位置编码路径)。纯文本输入也会崩,可稳定复现。已排除项(逐项对照过楼主参数)
楼主(原生 Linux + systemd + RTX PRO 4500)的完整启动参数我已全套对齐复测,仍崩在同一位置:--hicache-size 32 --mem-fraction-static 0.85 --max-running-requests 1 --context-length 131072 --reasoning-parser qwen3 --tool-call-parser qwen3_coder
参数逐项调过:hicache-size 96→32、mem-fraction-static 0.60 / 0.72 / 0.85,均无效
进程保活(setsid)无关;缺 libssl(JIT 链接)无关
--language-model-only:sglang 目前只支持 MuseGlimmer,对本模型不可用
根因(已锁定)
模型自带 README 写明:"Dense Multimodal … Input Type(s): Text, image, and video"
"Attention weights use FP8, while MTP and vision tensors retain the source BF16"
"Preferred Operating System(s): Linux"
即 config 带 vision: true,sglang 0.5.18 将其按多模态模型处理,decode 走 mrope 路径。楼主原生 Linux 环境走这条路径不炸;WSL2 + WDDM 驱动下同一路径直接崩。这是环境差异,参数抄得再准也绕不过去。我看到的三条路
升级 sglang(>0.5.18):修复多模态 mrope decode——目前不可行,0.5.18 就是已发布最新版(0.5.19 / 0.6.0 / 0.5.20 均不存在),只能等上游发版
换纯语言版 checkpoint:找一个无 vision_config 的 Qwen3.8-27B NVFP4/FP8,sglang 就不会走多模态 mrope decode——当前 WSL2 上最可行
原生 Linux 跑:README 官方支持的 OS,但成本高(需双系统或其他 Linux 机器)
想请帮忙的
有没有无 vision 的 Qwen3.8-27B NVFP4 / FP8 checkpoint?RadixArk 或社区是否出过纯语言版?
有没有人在 WSL2 上跑多模态 sglang 踩过同样的 mrope 崩溃?有 workaround 吗(除了换环境)?
上游 sglang 有没有已知计划修多模态 mrope decode?
现状
先用 llama.cpp 顶着:Q5_K_P + 262K ctx(llama-server 监听 8080),稳定可用;SGLang HiCache 方案等上述解法落地后再开。 -
我都是用非nvfp4,win11
重度用家。。。
-
【比着葫芦画葫芦失败】SGLang 0.5.18 + Qwen3.8-27B-NVFP4 在 WSL2 上 decode 崩溃(mrope CUDA illegal memory access),通过dsh由deepseek v4 flash处理,结果失败,请楼主指点
环境
项目 详情
硬件:i9 14900k 192G ddr5 RTX 5090
系统 Windows 11 + WSL2,NVIDIA 驱动 610.74(WDDM 模式)
框架 sglang 0.5.18(发帖时为最新版,PyPI / tuna 上无 0.5.19+)
模型 RadixArk Qwen3.8-27B-NVFP4
现象
decode 阶段 CUDA illegal memory access,崩在 _compute_mrope_positions_decode(vision token 的 3D 位置编码路径)。纯文本输入也会崩,可稳定复现。已排除项(逐项对照过楼主参数)
楼主(原生 Linux + systemd + RTX PRO 4500)的完整启动参数我已全套对齐复测,仍崩在同一位置:--hicache-size 32 --mem-fraction-static 0.85 --max-running-requests 1 --context-length 131072 --reasoning-parser qwen3 --tool-call-parser qwen3_coder
参数逐项调过:hicache-size 96→32、mem-fraction-static 0.60 / 0.72 / 0.85,均无效
进程保活(setsid)无关;缺 libssl(JIT 链接)无关
--language-model-only:sglang 目前只支持 MuseGlimmer,对本模型不可用
根因(已锁定)
模型自带 README 写明:"Dense Multimodal … Input Type(s): Text, image, and video"
"Attention weights use FP8, while MTP and vision tensors retain the source BF16"
"Preferred Operating System(s): Linux"
即 config 带 vision: true,sglang 0.5.18 将其按多模态模型处理,decode 走 mrope 路径。楼主原生 Linux 环境走这条路径不炸;WSL2 + WDDM 驱动下同一路径直接崩。这是环境差异,参数抄得再准也绕不过去。我看到的三条路
升级 sglang(>0.5.18):修复多模态 mrope decode——目前不可行,0.5.18 就是已发布最新版(0.5.19 / 0.6.0 / 0.5.20 均不存在),只能等上游发版
换纯语言版 checkpoint:找一个无 vision_config 的 Qwen3.8-27B NVFP4/FP8,sglang 就不会走多模态 mrope decode——当前 WSL2 上最可行
原生 Linux 跑:README 官方支持的 OS,但成本高(需双系统或其他 Linux 机器)
想请帮忙的
有没有无 vision 的 Qwen3.8-27B NVFP4 / FP8 checkpoint?RadixArk 或社区是否出过纯语言版?
有没有人在 WSL2 上跑多模态 sglang 踩过同样的 mrope 崩溃?有 workaround 吗(除了换环境)?
上游 sglang 有没有已知计划修多模态 mrope decode?
现状
先用 llama.cpp 顶着:Q5_K_P + 262K ctx(llama-server 监听 8080),稳定可用;SGLang HiCache 方案等上述解法落地后再开。@ran-z ● 介绍下你自己
Initializing agent...────────────────────────────────────────
─
Hermes ───────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────我是你的个人 AI 助手,跑在本地 Qwen3.8-27B(llama.cpp,4500 显卡,67 t/s)。
核心能力:
- 日常事务:文件管理、系统运维、下载/安装、网络配置
- 代码工作:写/改/调试,复杂项目委托 OpenCode 执行
- 创作:小说(Dramatica-Flow 完整管线)、AI 视频(ComfyUI + H3)、AI 音乐
- 基础设施:两台 VPS 管理(cc/bwg,1Panel + 证书 + 部署)
- 记忆系统:Mnemosyne 本地持久记忆 + Upstash 云端备份,跨会话保持上下文
工作风格:你拍板我执行,不废话不绕弯,实测验证不猜。
有什么要干的?
────────────────────────────────────────
● 显示本机软硬件环境
────────────────────────────────────────┊
$ echo "=== CPU ===" + 26 commands 0.3s [exit 1]
┊
$ lscpu | grep "型号名称" + 3 commands 0.1s
─
Hermes
硬件CPU: AMD Ryzen 7 3700X 8核 (3.6/4.4 GHz)
内存: 64GB DDR4 (60Gi 可用) + 127Gi Swap
GPU: NVIDIA RTX PRO 4500 Blackwell 32GB GDDR7
驱动 595.84, 当前占用 25.9GB, 93% 利用率, 51°C
主板: Gigabyte X570 GAMING X存储
系统盘: NVMe 1.8TB (LVM) 已用 261G / 1.5T 可用 15%
数据盘: NVMe 938GB /mnt/ssd1 已用 538G / 353G 可用 61%
RAID: md0 RAID1 1.8TB /mnt/raid1 已用 586M 1%系统
OS: Ubuntu 26.04.1 LTS, kernel 7.0.0-30-generic
主机名: aqbjqtd-X570-GAMING-X
Python: 3.14.4
Docker: 29.1.3
CUDA: 12.9 (编译) + 13.3 (运行时, ComfyUI 用) -
现在升级了llm46fan 大大的模型,win11 重度用户

-
现在升级了llm46fan 大大的模型,win11 重度用户

