跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. SGLang运行Qwen3.6-27B-AWQ/FP8成功(双3080 20G)

SGLang运行Qwen3.6-27B-AWQ/FP8成功(双3080 20G)

已定时 已固定 已锁定 已移动 LLM讨论区
本地模型qwen-27bsg-lang量化
5 帖子 5 发布者 257 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • N 离线
    N 离线
    neo
    编写于 最后由 neo 编辑
    #1

    SGLang运行Qwen3.6-27B-AWQ/FP8成功(双3080 20G)

    目录

    • Qwen3.6-27B-FP8
    • Qwen3.6-27B-AWQ-INT4
    • Qwen3.6-27B-AWQ-MTP
    • 会话测试
    • 最后

    Qwen3.6-27B-FP8

    04575d3b-9658-40bb-b24b-aab697ea07ab-image.jpeg

    • 生成速度 38t/s,非常稳定
    • 总上下文长度纯文推理到170K左右,显存吃紧

    Qwen3.6-27B-AWQ-INT4

    7a2dffe2-ca9e-4100-9f4b-569e8400bc54-image.jpeg

    • 生成速度 ~53-54 token/s
    • 总上下文长度 380k 左右(应该还可优化),显存充裕

    Qwen3.6-27B-AWQ-MTP

    9490413a-5c66-417f-b44d-0909ffdc9efc-image.jpeg

    • 生成速度 65–83 token/s
    • 总上下文长度 260k 左右(应该还可优化),显存充裕

    对话测试

    84bec4bd-6176-4583-b7a1-109ddd2636d1-image.jpeg

    9539120f-b13f-4ad5-9479-5320e68fcb33-image.jpeg
    -3.
    cf311266-b0bd-45e5-9fbc-c3844b280e06-image.jpeg

    最后

    • SGLang版本0.5.16
    • 启动参数只需很基本的参数即可,无需太复杂
    • 之前没成功可能:1. SGLang版本问题 2. CUDA-tools版本与torch版本匹配问题
    • 随问随答的感觉很好,mama再也不用担心等太久花谢了
    1 条回复 最后回复
    3
    • 包磊包 离线
      包磊包 离线
      包磊
      编写于 最后由 编辑
      #2

      这两天在 GDX 上折腾 SGLang 配 27B。还是有点坑的。默认 Mamba 开很大,不匹配你的并发数。认不全统一内存的总量,kvcache 被 Mamba 挤压。手动设置Mamba size 要注意 和并发数不是 1 :1。最后我把--mem-fraction-static 1.4 才勉强把 kvcache 撑起来。

      1 条回复 最后回复
      0
      • linkdesuL 离线
        linkdesuL 离线
        linkdesu
        编写于 最后由 编辑
        #3

        50+ token/s 是真香,用过才知道 20+ 还是太苦了

        1 条回复 最后回复
        0
        • Y 离线
          Y 离线
          YDM
          编写于 最后由 YDM 编辑
          #4

          我雙5070ti 16gb llama.cpp用Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-Q5_K_M.gguf,跑hermes 問去洗車的問題。
          f9f083b6-ec0d-4546-a5b2-2401884e148b-image.jpeg
          45ef730c-1257-4e63-8122-0cd52b220d04-image.jpeg

          SGLang 學習中!!~

          @terry 好的,跑題了^^!!

          terryT 1 条回复 最后回复
          0
          • Y YDM

            我雙5070ti 16gb llama.cpp用Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-Q5_K_M.gguf,跑hermes 問去洗車的問題。
            f9f083b6-ec0d-4546-a5b2-2401884e148b-image.jpeg
            45ef730c-1257-4e63-8122-0cd52b220d04-image.jpeg

            SGLang 學習中!!~

            @terry 好的,跑題了^^!!

            terryT 离线
            terryT 离线
            terry
            超级版主
            编写于 最后由 编辑
            #5

            @YDM 这个和SG-lang无关,和模型有关,Qwen也不是每次都能答对。训练过的就100%能答对。

            油管:https://www.youtube.com/@抡锤者

            1 条回复 最后回复
            0

            你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

            厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

            有了你的建议,这篇帖子会更精彩哦 💗

            注册 登录
            回复
            • 在新帖中回复
            登录后回复
            • 从旧到新
            • 从新到旧
            • 最多赞同


            • 登录

            • 没有帐号? 注册

            • 登录或注册以进行搜索。
            • 第一个帖子
              最后一个帖子
            0
            • 版块
            • 最新
            • 标签
            • 热门
            • 用户
            • 群组