跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. 大伙儿对最近Reddit LocalLLM社区中很火的Ternary Bonsai 27B怎么看?

大伙儿对最近Reddit LocalLLM社区中很火的Ternary Bonsai 27B怎么看?

已定时 已固定 已锁定 已移动 LLM讨论区
本地模型llama.cpp
16 帖子 8 发布者 804 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT 离线
    terryT 离线
    terry
    超级版主
    发表于 最后由 编辑
    #7

    27b更强,无论哪个领域,就是慢点

    油管:https://www.youtube.com/@抡锤者

    1 条回复 最后回复
    1
    • wwcd2016W 离线
      wwcd2016W 离线
      wwcd2016
      发表于 最后由 编辑
      #8

      qwen 3.6 27b 稳定性好。速度还行。
      跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
      但vison 模式 只有50k上下文,目前还没有解。

      fcmeF stxpnetS 3 条回复 最后回复
      0
      • wwcd2016W wwcd2016

        qwen 3.6 27b 稳定性好。速度还行。
        跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
        但vison 模式 只有50k上下文,目前还没有解。

        fcmeF 离线
        fcmeF 离线
        fcme
        技术大牛 劳动模范
        发表于 最后由 编辑
        #9

        @wwcd2016
        你可以试试 K V 量化开到 4,然后,如果开了 MTP 的话,MTP 头那一部分的计算量化也可以开到 Q8这样子就又可以省一下显存了。24G 显存的卡确实 27B 更强,但是如果你的卡显存更大的话,35B 用高粱话的版本其实是更好的选择,速度能快个三倍多。35B 这个 MOE 处理系统提示词之类的超级快,我自己折腾了好久,最后实测PP能到3800 tps,比硬磕 27B 舒服太多了

        1 条回复 最后回复
        0
        • wwcd2016W 离线
          wwcd2016W 离线
          wwcd2016
          发表于 最后由 编辑
          #10

          @fcme 求你的具体模型名,启动参数。麻烦你了。我是觉得35b速度快,但是编程全是乱的。我主要是用来做qmt量化。

          fcmeF 1 条回复 最后回复
          0
          • wwcd2016W wwcd2016

            @fcme 求你的具体模型名,启动参数。麻烦你了。我是觉得35b速度快,但是编程全是乱的。我主要是用来做qmt量化。

            fcmeF 离线
            fcmeF 离线
            fcme
            技术大牛 劳动模范
            发表于 最后由 编辑
            #11

            @wwcd2016

            核心的参数如下,我是成功开启WMMA以后速度才狂飙起来的(以前也就2200左右,R9700),PP跑分能到3800tps,tp57左右,好爽。实际用Agent调用大概在2800tps,tp单槽49,双槽并行总共大概60tps。
            记得要用对聊天模板,Agent场景这个非常重要。

            模型与模板:
            Bash
            
            
            --model /models/Ornith-1.0-35B-Q5_K_M.gguf
            --mmproj /models/mmproj-35B-A3B-Q8_0.gguf
            --alias Ornith-35B-WMMA
            --chat-template-file /app/chat_template_ornith.jinja

            服务端:
            copy
            
            
            --host 0.0.0.0
            --port 8080

            KV Cache:
            copy
            
            
            --cache-type-k q8_0
            --cache-type-v q8_0
            --ctx-size 524288 ← 512K

            批处理:
            copy
            
            
            --batch-size 1024
            --ubatch-size 1024
            --flash-attn on
            --n-gpu-layers 99

            并行槽位:
            copy
            
            
            --parallel 2
            --slot-prompt-similarity 0.50
            --cache-reuse 1

            采样参数:
            copy
            
            
            --temp 0.6
            --top-p 0.95
            --top-k 20
            --repeat-penalty 1.1
            --frequency-penalty 0.1
            --predict 8192

            视觉:
            copy
            
            
            --image-min-tokens 1536

            性能 Tuning:
            copy
            
            
            --poll 100
            --poll-batch 1
            --prio-batch 3

            BunseiB 1 条回复 最后回复
            0
            • fcmeF fcme

              @wwcd2016

              核心的参数如下,我是成功开启WMMA以后速度才狂飙起来的(以前也就2200左右,R9700),PP跑分能到3800tps,tp57左右,好爽。实际用Agent调用大概在2800tps,tp单槽49,双槽并行总共大概60tps。
              记得要用对聊天模板,Agent场景这个非常重要。

              模型与模板:
              Bash
              
              
              --model /models/Ornith-1.0-35B-Q5_K_M.gguf
              --mmproj /models/mmproj-35B-A3B-Q8_0.gguf
              --alias Ornith-35B-WMMA
              --chat-template-file /app/chat_template_ornith.jinja

              服务端:
              copy
              
              
              --host 0.0.0.0
              --port 8080

              KV Cache:
              copy
              
              
              --cache-type-k q8_0
              --cache-type-v q8_0
              --ctx-size 524288 ← 512K

              批处理:
              copy
              
              
              --batch-size 1024
              --ubatch-size 1024
              --flash-attn on
              --n-gpu-layers 99

              并行槽位:
              copy
              
              
              --parallel 2
              --slot-prompt-similarity 0.50
              --cache-reuse 1

              采样参数:
              copy
              
              
              --temp 0.6
              --top-p 0.95
              --top-k 20
              --repeat-penalty 1.1
              --frequency-penalty 0.1
              --predict 8192

              视觉:
              copy
              
              
              --image-min-tokens 1536

              性能 Tuning:
              copy
              
              
              --poll 100
              --poll-batch 1
              --prio-batch 3

              BunseiB 离线
              BunseiB 离线
              Bunsei
              发表于 最后由 编辑
              #12

              @fcme 我还在考虑要不要买第二块R9700呢,一块R9700长上下文prefill的速度太要命了。

              fcmeF 1 条回复 最后回复
              -1
              • BunseiB Bunsei

                @fcme 我还在考虑要不要买第二块R9700呢,一块R9700长上下文prefill的速度太要命了。

                fcmeF 离线
                fcmeF 离线
                fcme
                技术大牛 劳动模范
                发表于 最后由 fcme 编辑
                #13

                @Bunsei 除非时间不敏感或者需要质量(其实用v4 flash更好)的时候在开启27B就行。
                我发现这个35B的Ornith Q5好强,对于我的用途几乎都能替代flash了。跑分的PP3800/TP57,实际抓日志看Opencode和Zcode还有Hermes的调用大概在PP2900,TP单发50,双发合计60左右,这个体验就很爽了。

                本地的模型知识不够多和不够新(其实任何参数的模型都一样),所以这个时间配个好用的搜索引擎就哼重要了,付费的EXA或者Searngx(我本地配的质量能到exa的80%左右)。
                一套下来体验很好。

                aab76594-307d-4abe-b3c7-109f60d82d31-image.jpeg

                fcmeF 1 条回复 最后回复
                1
                • fcmeF fcme

                  @Bunsei 除非时间不敏感或者需要质量(其实用v4 flash更好)的时候在开启27B就行。
                  我发现这个35B的Ornith Q5好强,对于我的用途几乎都能替代flash了。跑分的PP3800/TP57,实际抓日志看Opencode和Zcode还有Hermes的调用大概在PP2900,TP单发50,双发合计60左右,这个体验就很爽了。

                  本地的模型知识不够多和不够新(其实任何参数的模型都一样),所以这个时间配个好用的搜索引擎就哼重要了,付费的EXA或者Searngx(我本地配的质量能到exa的80%左右)。
                  一套下来体验很好。

                  aab76594-307d-4abe-b3c7-109f60d82d31-image.jpeg

                  fcmeF 离线
                  fcmeF 离线
                  fcme
                  技术大牛 劳动模范
                  发表于 最后由 编辑
                  #14

                  对了,这是单R9700的数据,7900XTX的话测试速度应该可以在PP2700 TP85左右(因为7900XTX不支持WMMA但是带宽要高30%左右,分别限制预处理和解码)。
                  所以你要玩双卡的话应该是双7900XTX的组合更好,48G干啥都够了,只不过速度不能完全叠加能有个1.4-1.7倍就到头了,云的,没测试过。

                  1 条回复 最后回复
                  0
                  • wwcd2016W wwcd2016

                    qwen 3.6 27b 稳定性好。速度还行。
                    跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
                    但vison 模式 只有50k上下文,目前还没有解。

                    fcmeF 离线
                    fcmeF 离线
                    fcme
                    技术大牛 劳动模范
                    发表于 最后由 编辑
                    #15

                    @wwcd2016
                    27B的话可以考虑这个版本,实测和Q4几乎没区别,速度更快,上下文可以开的更大而且还可以开视觉。
                    IQ 量化非常强,我感觉只要你做的任务不是特别偏门IQ3XXS版本完全可以替代 Q4,但是注意,只有这个 XXS 版本比较好,我试过它的 XS 版本和 S 版本在某些时候下会输出会蹦还不如这个 XXS 的稳定。我这种魔改版的都是第 3 方的这些人。 每天都在那量化好多模型,他们不可能一个一个测试的,所以如果用模改版的模型的话,还是要自己多测试几个版本,找一个最适合的。

                    https://huggingface.co/mradermacher/Huihui-Qwen3.6-27B-abliterated-i1-GGUF?show_file_info=Huihui-Qwen3.6-27B-abliterated.i1-IQ3_XXS.gguf

                    1 条回复 最后回复
                    0
                    • ,5 566656661 引用了 此主题
                    • wwcd2016W wwcd2016

                      qwen 3.6 27b 稳定性好。速度还行。
                      跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
                      但vison 模式 只有50k上下文,目前还没有解。

                      stxpnetS 在线
                      stxpnetS 在线
                      stxpnet
                      超凡大师
                      编写于 最后由 编辑
                      #16

                      @wwcd2016 我也看了很多,只能加个3090,感觉别无他法,加一张,上VLLM一切就豁然开朗了。 外网有个人还单卡跑3090 VLLM 128K上下文。 写代码,但我无法复现他的操作,他没有公开配置细节,只公开了模型。

                      26-08-19
                      双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
                      8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

                      1 条回复 最后回复
                      0

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组