跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. 大伙儿对最近Reddit LocalLLM社区中很火的Ternary Bonsai 27B怎么看?

大伙儿对最近Reddit LocalLLM社区中很火的Ternary Bonsai 27B怎么看?

已定时 已固定 已锁定 已移动 LLM讨论区
本地模型llama.cpp
16 帖子 8 发布者 908 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • BunseiB 离线
    BunseiB 离线
    Bunsei
    德高望重 劳动模范
    发表于 最后由 编辑
    #1

    如题!
    问了一下AI,大概就是8G以下的大小,能达到Qwen3.6 27B Q4左右的效果?!

    模型链接:https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf

    1 条回复 最后回复
    0
    • kop wangK 在线
      kop wangK 在线
      kop wang
      超级版主
      发表于 最后由 kop wang 编辑
      #2

      看了下,作者自述的性能如下:

      2705356b-ba45-47c3-ba01-50b1389d0939-image.jpeg

      但他这个性能描述有很大的不合理之处。至少是benchmark的选型不合理。
      他自述Gemma-4-31B FP16的能力是Qwen3.6-27B FP16的 99.4%。但任何benchmark网站都不支持此结论。
      比如:https://artificialanalysis.ai/models/comparisons/qwen3-6-27b-vs-gemma-4-31b

      d5fb2e3f-5af0-4273-b50d-be50222a89f9-image.jpeg

      基于此,作者对于其27B模型是Qwen3.6-27B FP16的94.6%的结论至少是值得探讨的。

      虚心交流,一起进步

      BunseiB 1 条回复 最后回复
      2
      • kop wangK kop wang

        看了下,作者自述的性能如下:

        2705356b-ba45-47c3-ba01-50b1389d0939-image.jpeg

        但他这个性能描述有很大的不合理之处。至少是benchmark的选型不合理。
        他自述Gemma-4-31B FP16的能力是Qwen3.6-27B FP16的 99.4%。但任何benchmark网站都不支持此结论。
        比如:https://artificialanalysis.ai/models/comparisons/qwen3-6-27b-vs-gemma-4-31b

        d5fb2e3f-5af0-4273-b50d-be50222a89f9-image.jpeg

        基于此,作者对于其27B模型是Qwen3.6-27B FP16的94.6%的结论至少是值得探讨的。

        BunseiB 离线
        BunseiB 离线
        Bunsei
        德高望重 劳动模范
        发表于 最后由 编辑
        #3

        @kop-wang 也就是说实际效果可能更差,可能只有部分任务的情况下才能达到宣称的效果?可惜运行需要自己编译llama.cpp,再加上我的卡是R9700 ROCm,之前一阵折腾,才搞好。跑这个实际测试一遍对我来说还是有难度的。 🤕

        5 1 条回复 最后回复
        0
        • BunseiB Bunsei

          @kop-wang 也就是说实际效果可能更差,可能只有部分任务的情况下才能达到宣称的效果?可惜运行需要自己编译llama.cpp,再加上我的卡是R9700 ROCm,之前一阵折腾,才搞好。跑这个实际测试一遍对我来说还是有难度的。 🤕

          5 离线
          5 离线
          566656661
          超凡大师
          发表于 最后由 编辑
          #4

          @Bunsei

          雖然運用Hybrid Attention分別壓縮重要跟不重要的Layer到1 BPW是很厲害沒錯啦, 不過個人覺得有點喧嘩取眾

          模型的BPW對於輸出跟Tool Call是很重要的, 這也是為什麼BPW低的27B更容易陷入Thinking Loop跟Tool Call失敗

          根據這個評測, 單是Tool Call上多20%的失敗就足夠判死刑

          4e3ffbd3-1bbf-4d63-97d9-43e49ef5b48b-image.jpeg

          1 条回复 最后回复
          2
          • terryT 离线
            terryT 离线
            terry
            超级版主
            发表于 最后由 terry 编辑
            #5

            说实话,本地老老实实Qwen3.6 27b,跟着版本走就对了,未来很长一段时间,Qwen就是本地天花板代名词,小作坊是不可能干的过阿里这样的大企业的。在线就是Deepseek V4 Flash,高端的就上A O两家的模型,过分折腾耽误做事。

            油管:https://www.youtube.com/@抡锤者

            E 1 条回复 最后回复
            1
            • terryT terry

              说实话,本地老老实实Qwen3.6 27b,跟着版本走就对了,未来很长一段时间,Qwen就是本地天花板代名词,小作坊是不可能干的过阿里这样的大企业的。在线就是Deepseek V4 Flash,高端的就上A O两家的模型,过分折腾耽误做事。

              E 离线
              E 离线
              exe127
              发表于 最后由 编辑
              #6

              @terry 说:

              本地老老实实Qwen3.6 27b

              本地應該考慮 ,Qwen3.6 27b 還是 Qwen3.6-35B-A3B呢? 兩者都是24GB VRAM能吞下的。 多模態來說, 是密集裹是專家模型更強? 問了AI, 它也說不準

              1 条回复 最后回复
              0
              • terryT 离线
                terryT 离线
                terry
                超级版主
                发表于 最后由 编辑
                #7

                27b更强,无论哪个领域,就是慢点

                油管:https://www.youtube.com/@抡锤者

                1 条回复 最后回复
                1
                • wwcd2016W 离线
                  wwcd2016W 离线
                  wwcd2016
                  发表于 最后由 编辑
                  #8

                  qwen 3.6 27b 稳定性好。速度还行。
                  跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
                  但vison 模式 只有50k上下文,目前还没有解。

                  fcmeF stxpnetS 3 条回复 最后回复
                  0
                  • wwcd2016W wwcd2016

                    qwen 3.6 27b 稳定性好。速度还行。
                    跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
                    但vison 模式 只有50k上下文,目前还没有解。

                    fcmeF 离线
                    fcmeF 离线
                    fcme
                    技术大牛 劳动模范
                    发表于 最后由 编辑
                    #9

                    @wwcd2016
                    你可以试试 K V 量化开到 4,然后,如果开了 MTP 的话,MTP 头那一部分的计算量化也可以开到 Q8这样子就又可以省一下显存了。24G 显存的卡确实 27B 更强,但是如果你的卡显存更大的话,35B 用高粱话的版本其实是更好的选择,速度能快个三倍多。35B 这个 MOE 处理系统提示词之类的超级快,我自己折腾了好久,最后实测PP能到3800 tps,比硬磕 27B 舒服太多了

                    1 条回复 最后回复
                    0
                    • wwcd2016W 离线
                      wwcd2016W 离线
                      wwcd2016
                      发表于 最后由 编辑
                      #10

                      @fcme 求你的具体模型名,启动参数。麻烦你了。我是觉得35b速度快,但是编程全是乱的。我主要是用来做qmt量化。

                      fcmeF 1 条回复 最后回复
                      0
                      • wwcd2016W wwcd2016

                        @fcme 求你的具体模型名,启动参数。麻烦你了。我是觉得35b速度快,但是编程全是乱的。我主要是用来做qmt量化。

                        fcmeF 离线
                        fcmeF 离线
                        fcme
                        技术大牛 劳动模范
                        发表于 最后由 编辑
                        #11

                        @wwcd2016

                        核心的参数如下,我是成功开启WMMA以后速度才狂飙起来的(以前也就2200左右,R9700),PP跑分能到3800tps,tp57左右,好爽。实际用Agent调用大概在2800tps,tp单槽49,双槽并行总共大概60tps。
                        记得要用对聊天模板,Agent场景这个非常重要。

                        模型与模板:
                        Bash
                        
                        
                        --model /models/Ornith-1.0-35B-Q5_K_M.gguf
                        --mmproj /models/mmproj-35B-A3B-Q8_0.gguf
                        --alias Ornith-35B-WMMA
                        --chat-template-file /app/chat_template_ornith.jinja

                        服务端:
                        copy
                        
                        
                        --host 0.0.0.0
                        --port 8080

                        KV Cache:
                        copy
                        
                        
                        --cache-type-k q8_0
                        --cache-type-v q8_0
                        --ctx-size 524288 ← 512K

                        批处理:
                        copy
                        
                        
                        --batch-size 1024
                        --ubatch-size 1024
                        --flash-attn on
                        --n-gpu-layers 99

                        并行槽位:
                        copy
                        
                        
                        --parallel 2
                        --slot-prompt-similarity 0.50
                        --cache-reuse 1

                        采样参数:
                        copy
                        
                        
                        --temp 0.6
                        --top-p 0.95
                        --top-k 20
                        --repeat-penalty 1.1
                        --frequency-penalty 0.1
                        --predict 8192

                        视觉:
                        copy
                        
                        
                        --image-min-tokens 1536

                        性能 Tuning:
                        copy
                        
                        
                        --poll 100
                        --poll-batch 1
                        --prio-batch 3

                        BunseiB 1 条回复 最后回复
                        0
                        • fcmeF fcme

                          @wwcd2016

                          核心的参数如下,我是成功开启WMMA以后速度才狂飙起来的(以前也就2200左右,R9700),PP跑分能到3800tps,tp57左右,好爽。实际用Agent调用大概在2800tps,tp单槽49,双槽并行总共大概60tps。
                          记得要用对聊天模板,Agent场景这个非常重要。

                          模型与模板:
                          Bash
                          
                          
                          --model /models/Ornith-1.0-35B-Q5_K_M.gguf
                          --mmproj /models/mmproj-35B-A3B-Q8_0.gguf
                          --alias Ornith-35B-WMMA
                          --chat-template-file /app/chat_template_ornith.jinja

                          服务端:
                          copy
                          
                          
                          --host 0.0.0.0
                          --port 8080

                          KV Cache:
                          copy
                          
                          
                          --cache-type-k q8_0
                          --cache-type-v q8_0
                          --ctx-size 524288 ← 512K

                          批处理:
                          copy
                          
                          
                          --batch-size 1024
                          --ubatch-size 1024
                          --flash-attn on
                          --n-gpu-layers 99

                          并行槽位:
                          copy
                          
                          
                          --parallel 2
                          --slot-prompt-similarity 0.50
                          --cache-reuse 1

                          采样参数:
                          copy
                          
                          
                          --temp 0.6
                          --top-p 0.95
                          --top-k 20
                          --repeat-penalty 1.1
                          --frequency-penalty 0.1
                          --predict 8192

                          视觉:
                          copy
                          
                          
                          --image-min-tokens 1536

                          性能 Tuning:
                          copy
                          
                          
                          --poll 100
                          --poll-batch 1
                          --prio-batch 3

                          BunseiB 离线
                          BunseiB 离线
                          Bunsei
                          德高望重 劳动模范
                          发表于 最后由 编辑
                          #12

                          @fcme 我还在考虑要不要买第二块R9700呢,一块R9700长上下文prefill的速度太要命了。

                          fcmeF 1 条回复 最后回复
                          -1
                          • BunseiB Bunsei

                            @fcme 我还在考虑要不要买第二块R9700呢,一块R9700长上下文prefill的速度太要命了。

                            fcmeF 离线
                            fcmeF 离线
                            fcme
                            技术大牛 劳动模范
                            发表于 最后由 fcme 编辑
                            #13

                            @Bunsei 除非时间不敏感或者需要质量(其实用v4 flash更好)的时候在开启27B就行。
                            我发现这个35B的Ornith Q5好强,对于我的用途几乎都能替代flash了。跑分的PP3800/TP57,实际抓日志看Opencode和Zcode还有Hermes的调用大概在PP2900,TP单发50,双发合计60左右,这个体验就很爽了。

                            本地的模型知识不够多和不够新(其实任何参数的模型都一样),所以这个时间配个好用的搜索引擎就哼重要了,付费的EXA或者Searngx(我本地配的质量能到exa的80%左右)。
                            一套下来体验很好。

                            aab76594-307d-4abe-b3c7-109f60d82d31-image.jpeg

                            fcmeF 1 条回复 最后回复
                            1
                            • fcmeF fcme

                              @Bunsei 除非时间不敏感或者需要质量(其实用v4 flash更好)的时候在开启27B就行。
                              我发现这个35B的Ornith Q5好强,对于我的用途几乎都能替代flash了。跑分的PP3800/TP57,实际抓日志看Opencode和Zcode还有Hermes的调用大概在PP2900,TP单发50,双发合计60左右,这个体验就很爽了。

                              本地的模型知识不够多和不够新(其实任何参数的模型都一样),所以这个时间配个好用的搜索引擎就哼重要了,付费的EXA或者Searngx(我本地配的质量能到exa的80%左右)。
                              一套下来体验很好。

                              aab76594-307d-4abe-b3c7-109f60d82d31-image.jpeg

                              fcmeF 离线
                              fcmeF 离线
                              fcme
                              技术大牛 劳动模范
                              发表于 最后由 编辑
                              #14

                              对了,这是单R9700的数据,7900XTX的话测试速度应该可以在PP2700 TP85左右(因为7900XTX不支持WMMA但是带宽要高30%左右,分别限制预处理和解码)。
                              所以你要玩双卡的话应该是双7900XTX的组合更好,48G干啥都够了,只不过速度不能完全叠加能有个1.4-1.7倍就到头了,云的,没测试过。

                              1 条回复 最后回复
                              0
                              • wwcd2016W wwcd2016

                                qwen 3.6 27b 稳定性好。速度还行。
                                跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
                                但vison 模式 只有50k上下文,目前还没有解。

                                fcmeF 离线
                                fcmeF 离线
                                fcme
                                技术大牛 劳动模范
                                发表于 最后由 编辑
                                #15

                                @wwcd2016
                                27B的话可以考虑这个版本,实测和Q4几乎没区别,速度更快,上下文可以开的更大而且还可以开视觉。
                                IQ 量化非常强,我感觉只要你做的任务不是特别偏门IQ3XXS版本完全可以替代 Q4,但是注意,只有这个 XXS 版本比较好,我试过它的 XS 版本和 S 版本在某些时候下会输出会蹦还不如这个 XXS 的稳定。我这种魔改版的都是第 3 方的这些人。 每天都在那量化好多模型,他们不可能一个一个测试的,所以如果用模改版的模型的话,还是要自己多测试几个版本,找一个最适合的。

                                https://huggingface.co/mradermacher/Huihui-Qwen3.6-27B-abliterated-i1-GGUF?show_file_info=Huihui-Qwen3.6-27B-abliterated.i1-IQ3_XXS.gguf

                                1 条回复 最后回复
                                0
                                • 5 566656661 于 引用了 此主题
                                • wwcd2016W wwcd2016

                                  qwen 3.6 27b 稳定性好。速度还行。
                                  跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
                                  但vison 模式 只有50k上下文,目前还没有解。

                                  stxpnetS 离线
                                  stxpnetS 离线
                                  stxpnet
                                  超凡大师
                                  发表于 最后由 编辑
                                  #16

                                  @wwcd2016 我也看了很多,只能加个3090,感觉别无他法,加一张,上VLLM一切就豁然开朗了。 外网有个人还单卡跑3090 VLLM 128K上下文。 写代码,但我无法复现他的操作,他没有公开配置细节,只公开了模型。

                                  26-08-19
                                  双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
                                  8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

                                  1 条回复 最后回复
                                  0

                                  你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                  厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                  有了你的建议,这篇帖子会更精彩哦 💗

                                  注册 登录
                                  回复
                                  • 在新帖中回复
                                  登录后回复
                                  • 从旧到新
                                  • 从新到旧
                                  • 最多赞同


                                  • 登录

                                  • 登录或注册以进行搜索。
                                  • 第一个帖子
                                    最后一个帖子
                                  0
                                  • 版块
                                  • 最新
                                  • 标签
                                  • 热门
                                  • 用户
                                  • 群组