跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. LLM讨论区
  3. RTX 3090 24G 最佳 27B模型? 测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF

RTX 3090 24G 最佳 27B模型? 测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF

已定时 已固定 已锁定 已移动 LLM讨论区
rtx3090
6 帖子 5 发布者 418 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • S 在线
    S 在线
    stxpnet
    技术大牛 劳动模范
    编写于 最后由 stxpnet 编辑
    #1

    起因是在论坛看到有大神介绍 柠檬隐士的那个
    13.3GB的 Huihui-Qwen3.6-27B-abliterated-i1-IQ4_XS-FFN-IQ3.gguf,据说在3080 20G显卡上面速度起飞,同时还能保持长上下文,低分歧率。
    于是过去一探究竟,又看到 柠檬大神说,如果你需要长上下文,推荐下面这个模型。 模型卡上直接写明了不带MTP的适合 16G显存。
    78ae74d4-ea24-4aed-a394-f8722ca2f20b-image.jpeg
    于是我下载了带MTP的i1版本,这个体积也是挺小了。
    eb5de071-8400-4d65-b258-bde229286e8c-image.jpeg
    看来i1 这个标志对长上下文 分歧率应该有一定的稳定作用,
    考虑该模型在BPW在4.25-4.6之间,所以我用了以下的参数:
    上下文直接拉220K,

    /data/models/ikllama-616.cpp/build/bin/llama-server \
      --host 0.0.0.0 --port 8025 \
      --model  /data/model3/Qwen3.6-27B.i1-IQ4_KS-attn_qkv-IQ4_KS-i1_MTP-chunter-longcontext.gguf \
      --ctx-size 220000 -n 12000 \
      -ngl 99 \
      -ngld 99 \
      -b 2048 -ub 512 \
      -np 1 \
      -ctk q5_0 -ctv q5_0 \
      --cache-type-k-draft q4_1 --cache-type-v-draft q4_1 \
      -khad -vhad \
      --merge-qkv \
      -fa on \
      --jinja \
      --parallel-tool-calls \
      --spec-type mtp:n_max=2,p_min=0.0 \
      --recurrent-ckpt-mode auto \
        --chat-template-kwargs '{"preserve_thinking":true}' \
       --reasoning-format deepseek --reasoning-budget 768 \
         --chat-template-file /data/model2/qwen3.6-27b-gguf/chat_template-Qwen36-spiritbuun.jinja \
         --reasoning off  --temp 0.6 --top-k 20 --top-p 0.95 
    

    启动后占用显存在20G左右,这是ikllama的特色,有一部分“环形”层已加载到了CPU+内存里面。 首先来跑个 tooleval:
    262a4f9b-09e1-404f-ad53-8da870d72801-image.jpeg

    分数93分挺不错,只是token效率偏低(某些模型可以达到0.5 pts /1000 token)
    这时再跑一个简单的问答题,速率降到了53T/S
    43975540-3455-4a45-a005-6d8f7bbf6279-image.jpeg

    14:47开始俄罗斯方块:
    fc014d18-8b2e-4f71-944d-d2c1edec3c95-image.jpeg

    J 1 条回复 最后回复
    1
    • S 在线
      S 在线
      stxpnet
      技术大牛 劳动模范
      编写于 最后由 编辑
      #2

      我的提示词似乎还是有矛盾,我本来想让它分拆模块来实现更好的效果,
      它首先直接完成了一个1042行的HTML文件。
      14:51,已经在浏览器中弹出并开始playwright测试了。

      13355373-d2ac-45ed-9564-adda37abe13b-image.jpeg

      我试玩了,还是有消行消不干净的BUG。不知道是什么原因。 可能是参数不合适,或者提示词太乱了?

      terryT 1 条回复 最后回复
      3
      • S stxpnet

        我的提示词似乎还是有矛盾,我本来想让它分拆模块来实现更好的效果,
        它首先直接完成了一个1042行的HTML文件。
        14:51,已经在浏览器中弹出并开始playwright测试了。

        13355373-d2ac-45ed-9564-adda37abe13b-image.jpeg

        我试玩了,还是有消行消不干净的BUG。不知道是什么原因。 可能是参数不合适,或者提示词太乱了?

        terryT 离线
        terryT 离线
        terry
        超级版主
        编写于 最后由 terry 编辑
        #3

        @stxpnet 可以,没个帖子都很有技术含量,发帖简要干脆,没有废话,图文并茂,值得学习。

        油管:https://www.youtube.com/@抡锤者

        1 条回复 最后回复
        0
        • ,terryT terry 固定了此主题
        • ,系统 取消固定了此主题
        • S stxpnet

          起因是在论坛看到有大神介绍 柠檬隐士的那个
          13.3GB的 Huihui-Qwen3.6-27B-abliterated-i1-IQ4_XS-FFN-IQ3.gguf,据说在3080 20G显卡上面速度起飞,同时还能保持长上下文,低分歧率。
          于是过去一探究竟,又看到 柠檬大神说,如果你需要长上下文,推荐下面这个模型。 模型卡上直接写明了不带MTP的适合 16G显存。
          78ae74d4-ea24-4aed-a394-f8722ca2f20b-image.jpeg
          于是我下载了带MTP的i1版本,这个体积也是挺小了。
          eb5de071-8400-4d65-b258-bde229286e8c-image.jpeg
          看来i1 这个标志对长上下文 分歧率应该有一定的稳定作用,
          考虑该模型在BPW在4.25-4.6之间,所以我用了以下的参数:
          上下文直接拉220K,

          /data/models/ikllama-616.cpp/build/bin/llama-server \
            --host 0.0.0.0 --port 8025 \
            --model  /data/model3/Qwen3.6-27B.i1-IQ4_KS-attn_qkv-IQ4_KS-i1_MTP-chunter-longcontext.gguf \
            --ctx-size 220000 -n 12000 \
            -ngl 99 \
            -ngld 99 \
            -b 2048 -ub 512 \
            -np 1 \
            -ctk q5_0 -ctv q5_0 \
            --cache-type-k-draft q4_1 --cache-type-v-draft q4_1 \
            -khad -vhad \
            --merge-qkv \
            -fa on \
            --jinja \
            --parallel-tool-calls \
            --spec-type mtp:n_max=2,p_min=0.0 \
            --recurrent-ckpt-mode auto \
              --chat-template-kwargs '{"preserve_thinking":true}' \
             --reasoning-format deepseek --reasoning-budget 768 \
               --chat-template-file /data/model2/qwen3.6-27b-gguf/chat_template-Qwen36-spiritbuun.jinja \
               --reasoning off  --temp 0.6 --top-k 20 --top-p 0.95 
          

          启动后占用显存在20G左右,这是ikllama的特色,有一部分“环形”层已加载到了CPU+内存里面。 首先来跑个 tooleval:
          262a4f9b-09e1-404f-ad53-8da870d72801-image.jpeg

          分数93分挺不错,只是token效率偏低(某些模型可以达到0.5 pts /1000 token)
          这时再跑一个简单的问答题,速率降到了53T/S
          43975540-3455-4a45-a005-6d8f7bbf6279-image.jpeg

          14:47开始俄罗斯方块:
          fc014d18-8b2e-4f71-944d-d2c1edec3c95-image.jpeg

          J 离线
          J 离线
          joker_chang
          德高望重 劳动模范
          编写于 最后由 编辑
          #4

          @stxpnet 说:

          这时再跑一个简单的问答题,速率降到了53T/S

          我觉得这个速度在3090上是正常的。

          cfb0851a-4714-4153-8aed-5ae853d9628f-image.jpeg

          我用的模型和启动参数:

          unsloth\Qwen3.6-27B-MTP-GGUF\Qwen3.6-27B-unslothMTP-Q4_K_M.gguf

          --reasoning off ^
          --n-gpu-layers -1 ^
          --ctx-size 131072 ^
          --batch-size 4096^
          --ubatch-size 2048 ^
          --flash-attn on ^
          --cache-type-k q4_0 ^
          --cache-type-v q4_0 ^
          --spec-type draft-mtp ^
          --spec-draft-n-max 3 ^
          --spec-draft-n-min 1 ^
          --temp 0.7 ^
          --parallel 1 ^
          --kv-unified ^
          --mlock ^
          --jinja ^
          --threads 16 ^
          --threads-batch 16 ^
          --no-warmup
          

          华南金牌洋垃圾主板和CPU

          1 条回复 最后回复
          1
          • C 离线
            C 离线
            c0aster
            编写于 最后由 编辑
            #5

            对比其他衍生的27B,对比咋样

            1 条回复 最后回复
            0
            • wwcd2016W 离线
              wwcd2016W 离线
              wwcd2016
              编写于 最后由 编辑
              #6

              总之。3090 24g单卡 。hermes 能用的方案我都试验过了。基本不完美。

              1 条回复 最后回复
              0

              你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

              厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

              有了你的建议,这篇帖子会更精彩哦 💗

              注册 登录
              回复
              • 在新帖中回复
              登录后回复
              • 从旧到新
              • 从新到旧
              • 最多赞同


              • 登录

              • 没有帐号? 注册

              • 登录或注册以进行搜索。
              • 第一个帖子
                最后一个帖子
              0
              • 版块
              • 最新
              • 标签
              • 热门
              • 用户
              • 群组