跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
ran zR

ran z

@ran z
取消关注 关注
关于
帖子
9
主题
0
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    ran zR ran z

    @Xiaote 手里有一张5090,两张4090,都是非公三风扇,有什么物美价廉的方案能都插上,或者插两张也行。

    AI硬件 7900xtx sg-lang 多卡部署

  • 魔改SGLANG支持7900XTX 双卡TP TTFT <1s 平均TG 80-100! 4并发TG200/sec
    ran zR ran z

    请教,x670e或者am4板子,能插两张三风扇的卡吗?先不说散热,就3.5槽的卡能插进去就行

    AI硬件 7900xtx sg-lang 多卡部署

  • SGLang HiCache 三层 KV 缓存实测:32GB Blackwell 单卡跑通 Qwen3.8-27B
    ran zR ran z

    懂了,得换系统才能跑,目前win11+wsl2的方案看来还是白费。
    感谢楼主!
    屏幕截图 2026-09-01 141900.png

    LLM讨论区 sg-lang qwen-27b

  • SGLang HiCache 三层 KV 缓存实测:32GB Blackwell 单卡跑通 Qwen3.8-27B
    ran zR ran z

    【比着葫芦画葫芦失败】SGLang 0.5.18 + Qwen3.8-27B-NVFP4 在 WSL2 上 decode 崩溃(mrope CUDA illegal memory access),通过dsh由deepseek v4 flash处理,结果失败,请楼主指点
    环境
    项目 详情
    硬件:i9 14900k 192G ddr5 RTX 5090
    系统 Windows 11 + WSL2,NVIDIA 驱动 610.74(WDDM 模式)
    框架 sglang 0.5.18(发帖时为最新版,PyPI / tuna 上无 0.5.19+)
    模型 RadixArk Qwen3.8-27B-NVFP4
    现象
    decode 阶段 CUDA illegal memory access,崩在 _compute_mrope_positions_decode(vision token 的 3D 位置编码路径)。纯文本输入也会崩,可稳定复现。

    已排除项(逐项对照过楼主参数)
    楼主(原生 Linux + systemd + RTX PRO 4500)的完整启动参数我已全套对齐复测,仍崩在同一位置:

    --hicache-size 32 --mem-fraction-static 0.85 --max-running-requests 1 --context-length 131072 --reasoning-parser qwen3 --tool-call-parser qwen3_coder
    参数逐项调过:hicache-size 96→32、mem-fraction-static 0.60 / 0.72 / 0.85,均无效
    进程保活(setsid)无关;缺 libssl(JIT 链接)无关
    --language-model-only:sglang 目前只支持 MuseGlimmer,对本模型不可用
    根因(已锁定)
    模型自带 README 写明:

    "Dense Multimodal … Input Type(s): Text, image, and video"
    "Attention weights use FP8, while MTP and vision tensors retain the source BF16"
    "Preferred Operating System(s): Linux"
    即 config 带 vision: true,sglang 0.5.18 将其按多模态模型处理,decode 走 mrope 路径。楼主原生 Linux 环境走这条路径不炸;WSL2 + WDDM 驱动下同一路径直接崩。这是环境差异,参数抄得再准也绕不过去。

    我看到的三条路
    升级 sglang(>0.5.18):修复多模态 mrope decode——目前不可行,0.5.18 就是已发布最新版(0.5.19 / 0.6.0 / 0.5.20 均不存在),只能等上游发版
    换纯语言版 checkpoint:找一个无 vision_config 的 Qwen3.8-27B NVFP4/FP8,sglang 就不会走多模态 mrope decode——当前 WSL2 上最可行
    原生 Linux 跑:README 官方支持的 OS,但成本高(需双系统或其他 Linux 机器)
    想请帮忙的
    有没有无 vision 的 Qwen3.8-27B NVFP4 / FP8 checkpoint?RadixArk 或社区是否出过纯语言版?
    有没有人在 WSL2 上跑多模态 sglang 踩过同样的 mrope 崩溃?有 workaround 吗(除了换环境)?
    上游 sglang 有没有已知计划修多模态 mrope decode?
    现状
    先用 llama.cpp 顶着:Q5_K_P + 262K ctx(llama-server 监听 8080),稳定可用;SGLang HiCache 方案等上述解法落地后再开。

    LLM讨论区 sg-lang qwen-27b

  • SGLang HiCache 三层 KV 缓存实测:32GB Blackwell 单卡跑通 Qwen3.8-27B
    ran zR ran z

    请教一下,20.14 GB(NVFP4)直接塞显存就行了,为啥还要搞HiCache呢?只是可用多会话吗?谢谢!

    LLM讨论区 sg-lang qwen-27b

  • 自研工作流,最新进展
    ran zR ran z

    说的实在,确实如此!

    Mark专区

  • 3090 24G 跑QWOPUS 3.6 27B mtp 131K上下文 KV(Q8_0) 55TOK/S 智能开关思考- 最终配置,再也不折腾了(6月14日更新)
    ran zR ran z

    5090移动版也是24g,能抄作业吗?

    LLM讨论区 rtx3090 mtp

  • llama.cpp+qwen3.6-27b 初步测试
    ran zR ran z

    @blackjack 说:

    @joker_chang 说:

    @rock-shi 那就对了,24G跑128K上下文+MTP资源不够

    我27 q4量化,kv均q8_0量化,上下文128k,MTP, 5090laptop 24GRAM,开thinking,50+tps,快的起飞啊

    厉害!一样的卡,大哥能给个作业抄吗?14900k,32g内存,llama.cpp,感谢!

    LLM讨论区 amd 7900xtx
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组