跳转至内容
  • 首页
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. 12G 及以下显存的朋友可以试试这个,号称Qwen3.6-35B-A3B专家模型 在4g 显存能跑19t/s

12G 及以下显存的朋友可以试试这个,号称Qwen3.6-35B-A3B专家模型 在4g 显存能跑19t/s

已定时 已固定 已锁定 已移动 LLM讨论区
4 帖子 3 发布者 135 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • C 离线
    C 离线
    coolstar
    编写于 最后由 coolstar 编辑
    #1

    我在12g 显存上实测 256k上下文 + mmproj 能到40t/s,干点普通活感觉可以用了。

    原帖:

    https://www.reddit.com/r/LocalLLM/comments/1unmzqc/surprisingly_fast_qwen3635ba3b_on_a_4_gb_vram/

    他的脚本参数:

    
    /opt/llama.cpp/build/bin/llama-server \
    -m /opt/llama.cpp/models/Qwen3.6-35B-A3B-UDT-Q4_K_XL_MTP.gguf \
    --host 0.0.0.0 \
    --port 8080 \
    -c 64000 \
    -ngl 999 \   
    --override-tensor "blk\..*\.ffn_(gate_up|gate|up|down)_exps\.weight=CPU"
    --flash-attn on \
    --cache-type-k q8_0 \
    --cache-type-v q8_0 \
    --mlock \
    -b 3072 \
    --ubatch-size 3072 \
    -ctxcp 128 \
    --reasoning off \
    --parallel 1 \
    -t 6 \
    -tb 12 \
    --cache-ram 16384 \
    --swa-full \
    --no-kv-unified \
    --spec-type none \
    --cache-reuse 256 \
    
    1 条回复 最后回复
    1
    • S 离线
      S 离线
      stxpnet
      技术大牛 劳动模范
      编写于 最后由 编辑
      #2

      我的P100 16G显卡上面主要跑QWEN 3.5 9B,Q4KM,效果还行。

      C 1 条回复 最后回复
      1
      • S stxpnet

        我的P100 16G显卡上面主要跑QWEN 3.5 9B,Q4KM,效果还行。

        C 离线
        C 离线
        coolstar
        编写于 最后由 编辑
        #3

        @stxpnet 说:

        我的P100 16G显卡上面主要跑QWEN 3.5 9B,Q4KM,效果还行。

        嗯,9B 也很不错了,我的能跑非常流畅,处理文档什么的秒回。

        就是参数少点,觉得有点虚,所以一直在折腾35B这个,满足一下虚虚荣心。

        话说也没用编程任务实测过,不知道到底智商能力上有多大差别。

        1 条回复 最后回复
        0
        • terryT 在线
          terryT 在线
          terry
          超级版主
          编写于 最后由 编辑
          #4

          如果是功能性任务,35b足够,它只是无法长期胜任全面Agent助手,幻觉严重。编程其实都不是事,因为大多数人写的小程序都不复杂。

          油管:https://www.youtube.com/@抡锤者

          1 条回复 最后回复
          0

          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

          有了你的建议,这篇帖子会更精彩哦 💗

          注册 登录
          回复
          • 在新帖中回复
          登录后回复
          • 从旧到新
          • 从新到旧
          • 最多赞同


          • 登录

          • 没有帐号? 注册

          • 登录或注册以进行搜索。
          • 第一个帖子
            最后一个帖子
          0
          • 首页
          • 版块
          • 最新
          • 标签
          • 热门
          • 用户
          • 群组