跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. LLM讨论区
  3. 大伙儿对最近Reddit LocalLLM社区中很火的Ternary Bonsai 27B怎么看?

大伙儿对最近Reddit LocalLLM社区中很火的Ternary Bonsai 27B怎么看?

已定时 已固定 已锁定 已移动 LLM讨论区
15 帖子 7 发布者 316 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • BunseiB 离线
    BunseiB 离线
    Bunsei
    编写于 最后由 编辑
    #1

    如题!
    问了一下AI,大概就是8G以下的大小,能达到Qwen3.6 27B Q4左右的效果?!

    模型链接:https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf

    1 条回复 最后回复
    0
    • kop wangK 离线
      kop wangK 离线
      kop wang
      超级版主
      编写于 最后由 kop wang 编辑
      #2

      看了下,作者自述的性能如下:

      2705356b-ba45-47c3-ba01-50b1389d0939-image.jpeg

      但他这个性能描述有很大的不合理之处。至少是benchmark的选型不合理。
      他自述Gemma-4-31B FP16的能力是Qwen3.6-27B FP16的 99.4%。但任何benchmark网站都不支持此结论。
      比如:https://artificialanalysis.ai/models/comparisons/qwen3-6-27b-vs-gemma-4-31b

      d5fb2e3f-5af0-4273-b50d-be50222a89f9-image.jpeg

      基于此,作者对于其27B模型是Qwen3.6-27B FP16的94.6%的结论至少是值得探讨的。

      虚心交流,一起进步

      BunseiB 1 条回复 最后回复
      2
      • kop wangK kop wang

        看了下,作者自述的性能如下:

        2705356b-ba45-47c3-ba01-50b1389d0939-image.jpeg

        但他这个性能描述有很大的不合理之处。至少是benchmark的选型不合理。
        他自述Gemma-4-31B FP16的能力是Qwen3.6-27B FP16的 99.4%。但任何benchmark网站都不支持此结论。
        比如:https://artificialanalysis.ai/models/comparisons/qwen3-6-27b-vs-gemma-4-31b

        d5fb2e3f-5af0-4273-b50d-be50222a89f9-image.jpeg

        基于此,作者对于其27B模型是Qwen3.6-27B FP16的94.6%的结论至少是值得探讨的。

        BunseiB 离线
        BunseiB 离线
        Bunsei
        编写于 最后由 编辑
        #3

        @kop-wang 也就是说实际效果可能更差,可能只有部分任务的情况下才能达到宣称的效果?可惜运行需要自己编译llama.cpp,再加上我的卡是R9700 ROCm,之前一阵折腾,才搞好。跑这个实际测试一遍对我来说还是有难度的。 🤕

        5 1 条回复 最后回复
        0
        • BunseiB Bunsei

          @kop-wang 也就是说实际效果可能更差,可能只有部分任务的情况下才能达到宣称的效果?可惜运行需要自己编译llama.cpp,再加上我的卡是R9700 ROCm,之前一阵折腾,才搞好。跑这个实际测试一遍对我来说还是有难度的。 🤕

          5 离线
          5 离线
          566656661
          超凡大师
          编写于 最后由 编辑
          #4

          @Bunsei

          雖然運用Hybrid Attention分別壓縮重要跟不重要的Layer到1 BPW是很厲害沒錯啦, 不過個人覺得有點喧嘩取眾

          模型的BPW對於輸出跟Tool Call是很重要的, 這也是為什麼BPW低的27B更容易陷入Thinking Loop跟Tool Call失敗

          根據這個評測, 單是Tool Call上多20%的失敗就足夠判死刑

          4e3ffbd3-1bbf-4d63-97d9-43e49ef5b48b-image.jpeg

          1 条回复 最后回复
          2
          • terryT 在线
            terryT 在线
            terry
            超级版主
            编写于 最后由 terry 编辑
            #5

            说实话,本地老老实实Qwen3.6 27b,跟着版本走就对了,未来很长一段时间,Qwen就是本地天花板代名词,小作坊是不可能干的过阿里这样的大企业的。在线就是Deepseek V4 Flash,高端的就上A O两家的模型,过分折腾耽误做事。

            油管:https://www.youtube.com/@抡锤者

            E 1 条回复 最后回复
            1
            • terryT terry

              说实话,本地老老实实Qwen3.6 27b,跟着版本走就对了,未来很长一段时间,Qwen就是本地天花板代名词,小作坊是不可能干的过阿里这样的大企业的。在线就是Deepseek V4 Flash,高端的就上A O两家的模型,过分折腾耽误做事。

              E 离线
              E 离线
              exe127
              编写于 最后由 编辑
              #6

              @terry 说:

              本地老老实实Qwen3.6 27b

              本地應該考慮 ,Qwen3.6 27b 還是 Qwen3.6-35B-A3B呢? 兩者都是24GB VRAM能吞下的。 多模態來說, 是密集裹是專家模型更強? 問了AI, 它也說不準

              1 条回复 最后回复
              0
              • terryT 在线
                terryT 在线
                terry
                超级版主
                编写于 最后由 编辑
                #7

                27b更强,无论哪个领域,就是慢点

                油管:https://www.youtube.com/@抡锤者

                1 条回复 最后回复
                1
                • wwcd2016W 离线
                  wwcd2016W 离线
                  wwcd2016
                  编写于 最后由 编辑
                  #8

                  qwen 3.6 27b 稳定性好。速度还行。
                  跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
                  但vison 模式 只有50k上下文,目前还没有解。

                  fcmeF 2 条回复 最后回复
                  0
                  • wwcd2016W wwcd2016

                    qwen 3.6 27b 稳定性好。速度还行。
                    跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
                    但vison 模式 只有50k上下文,目前还没有解。

                    fcmeF 离线
                    fcmeF 离线
                    fcme
                    技术大牛 劳动模范
                    编写于 最后由 编辑
                    #9

                    @wwcd2016
                    你可以试试 K V 量化开到 4,然后,如果开了 MTP 的话,MTP 头那一部分的计算量化也可以开到 Q8这样子就又可以省一下显存了。24G 显存的卡确实 27B 更强,但是如果你的卡显存更大的话,35B 用高粱话的版本其实是更好的选择,速度能快个三倍多。35B 这个 MOE 处理系统提示词之类的超级快,我自己折腾了好久,最后实测PP能到3800 tps,比硬磕 27B 舒服太多了

                    1 条回复 最后回复
                    0
                    • wwcd2016W 离线
                      wwcd2016W 离线
                      wwcd2016
                      编写于 最后由 编辑
                      #10

                      @fcme 求你的具体模型名,启动参数。麻烦你了。我是觉得35b速度快,但是编程全是乱的。我主要是用来做qmt量化。

                      fcmeF 1 条回复 最后回复
                      0
                      • wwcd2016W wwcd2016

                        @fcme 求你的具体模型名,启动参数。麻烦你了。我是觉得35b速度快,但是编程全是乱的。我主要是用来做qmt量化。

                        fcmeF 离线
                        fcmeF 离线
                        fcme
                        技术大牛 劳动模范
                        编写于 最后由 编辑
                        #11

                        @wwcd2016

                        核心的参数如下,我是成功开启WMMA以后速度才狂飙起来的(以前也就2200左右,R9700),PP跑分能到3800tps,tp57左右,好爽。实际用Agent调用大概在2800tps,tp单槽49,双槽并行总共大概60tps。
                        记得要用对聊天模板,Agent场景这个非常重要。

                        模型与模板:
                        Bash
                        
                        
                        --model /models/Ornith-1.0-35B-Q5_K_M.gguf
                        --mmproj /models/mmproj-35B-A3B-Q8_0.gguf
                        --alias Ornith-35B-WMMA
                        --chat-template-file /app/chat_template_ornith.jinja

                        服务端:
                        copy
                        
                        
                        --host 0.0.0.0
                        --port 8080

                        KV Cache:
                        copy
                        
                        
                        --cache-type-k q8_0
                        --cache-type-v q8_0
                        --ctx-size 524288 ← 512K

                        批处理:
                        copy
                        
                        
                        --batch-size 1024
                        --ubatch-size 1024
                        --flash-attn on
                        --n-gpu-layers 99

                        并行槽位:
                        copy
                        
                        
                        --parallel 2
                        --slot-prompt-similarity 0.50
                        --cache-reuse 1

                        采样参数:
                        copy
                        
                        
                        --temp 0.6
                        --top-p 0.95
                        --top-k 20
                        --repeat-penalty 1.1
                        --frequency-penalty 0.1
                        --predict 8192

                        视觉:
                        copy
                        
                        
                        --image-min-tokens 1536

                        性能 Tuning:
                        copy
                        
                        
                        --poll 100
                        --poll-batch 1
                        --prio-batch 3

                        BunseiB 1 条回复 最后回复
                        0
                        • fcmeF fcme

                          @wwcd2016

                          核心的参数如下,我是成功开启WMMA以后速度才狂飙起来的(以前也就2200左右,R9700),PP跑分能到3800tps,tp57左右,好爽。实际用Agent调用大概在2800tps,tp单槽49,双槽并行总共大概60tps。
                          记得要用对聊天模板,Agent场景这个非常重要。

                          模型与模板:
                          Bash
                          
                          
                          --model /models/Ornith-1.0-35B-Q5_K_M.gguf
                          --mmproj /models/mmproj-35B-A3B-Q8_0.gguf
                          --alias Ornith-35B-WMMA
                          --chat-template-file /app/chat_template_ornith.jinja

                          服务端:
                          copy
                          
                          
                          --host 0.0.0.0
                          --port 8080

                          KV Cache:
                          copy
                          
                          
                          --cache-type-k q8_0
                          --cache-type-v q8_0
                          --ctx-size 524288 ← 512K

                          批处理:
                          copy
                          
                          
                          --batch-size 1024
                          --ubatch-size 1024
                          --flash-attn on
                          --n-gpu-layers 99

                          并行槽位:
                          copy
                          
                          
                          --parallel 2
                          --slot-prompt-similarity 0.50
                          --cache-reuse 1

                          采样参数:
                          copy
                          
                          
                          --temp 0.6
                          --top-p 0.95
                          --top-k 20
                          --repeat-penalty 1.1
                          --frequency-penalty 0.1
                          --predict 8192

                          视觉:
                          copy
                          
                          
                          --image-min-tokens 1536

                          性能 Tuning:
                          copy
                          
                          
                          --poll 100
                          --poll-batch 1
                          --prio-batch 3

                          BunseiB 离线
                          BunseiB 离线
                          Bunsei
                          编写于 最后由 编辑
                          #12

                          @fcme 我还在考虑要不要买第二块R9700呢,一块R9700长上下文prefill的速度太要命了。

                          fcmeF 1 条回复 最后回复
                          -1
                          • BunseiB Bunsei

                            @fcme 我还在考虑要不要买第二块R9700呢,一块R9700长上下文prefill的速度太要命了。

                            fcmeF 离线
                            fcmeF 离线
                            fcme
                            技术大牛 劳动模范
                            编写于 最后由 fcme 编辑
                            #13

                            @Bunsei 除非时间不敏感或者需要质量(其实用v4 flash更好)的时候在开启27B就行。
                            我发现这个35B的Ornith Q5好强,对于我的用途几乎都能替代flash了。跑分的PP3800/TP57,实际抓日志看Opencode和Zcode还有Hermes的调用大概在PP2900,TP单发50,双发合计60左右,这个体验就很爽了。

                            本地的模型知识不够多和不够新(其实任何参数的模型都一样),所以这个时间配个好用的搜索引擎就哼重要了,付费的EXA或者Searngx(我本地配的质量能到exa的80%左右)。
                            一套下来体验很好。

                            aab76594-307d-4abe-b3c7-109f60d82d31-image.jpeg

                            fcmeF 1 条回复 最后回复
                            1
                            • fcmeF fcme

                              @Bunsei 除非时间不敏感或者需要质量(其实用v4 flash更好)的时候在开启27B就行。
                              我发现这个35B的Ornith Q5好强,对于我的用途几乎都能替代flash了。跑分的PP3800/TP57,实际抓日志看Opencode和Zcode还有Hermes的调用大概在PP2900,TP单发50,双发合计60左右,这个体验就很爽了。

                              本地的模型知识不够多和不够新(其实任何参数的模型都一样),所以这个时间配个好用的搜索引擎就哼重要了,付费的EXA或者Searngx(我本地配的质量能到exa的80%左右)。
                              一套下来体验很好。

                              aab76594-307d-4abe-b3c7-109f60d82d31-image.jpeg

                              fcmeF 离线
                              fcmeF 离线
                              fcme
                              技术大牛 劳动模范
                              编写于 最后由 编辑
                              #14

                              对了,这是单R9700的数据,7900XTX的话测试速度应该可以在PP2700 TP85左右(因为7900XTX不支持WMMA但是带宽要高30%左右,分别限制预处理和解码)。
                              所以你要玩双卡的话应该是双7900XTX的组合更好,48G干啥都够了,只不过速度不能完全叠加能有个1.4-1.7倍就到头了,云的,没测试过。

                              1 条回复 最后回复
                              0
                              • wwcd2016W wwcd2016

                                qwen 3.6 27b 稳定性好。速度还行。
                                跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
                                但vison 模式 只有50k上下文,目前还没有解。

                                fcmeF 离线
                                fcmeF 离线
                                fcme
                                技术大牛 劳动模范
                                编写于 最后由 编辑
                                #15

                                @wwcd2016
                                27B的话可以考虑这个版本,实测和Q4几乎没区别,速度更快,上下文可以开的更大而且还可以开视觉。
                                IQ 量化非常强,我感觉只要你做的任务不是特别偏门IQ3XXS版本完全可以替代 Q4,但是注意,只有这个 XXS 版本比较好,我试过它的 XS 版本和 S 版本在某些时候下会输出会蹦还不如这个 XXS 的稳定。我这种魔改版的都是第 3 方的这些人。 每天都在那量化好多模型,他们不可能一个一个测试的,所以如果用模改版的模型的话,还是要自己多测试几个版本,找一个最适合的。

                                https://huggingface.co/mradermacher/Huihui-Qwen3.6-27B-abliterated-i1-GGUF?show_file_info=Huihui-Qwen3.6-27B-abliterated.i1-IQ3_XXS.gguf

                                1 条回复 最后回复
                                0

                                你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                有了你的建议,这篇帖子会更精彩哦 💗

                                注册 登录
                                回复
                                • 在新帖中回复
                                登录后回复
                                • 从旧到新
                                • 从新到旧
                                • 最多赞同


                                • 登录

                                • 没有帐号? 注册

                                • 登录或注册以进行搜索。
                                • 第一个帖子
                                  最后一个帖子
                                0
                                • 版块
                                • 最新
                                • 标签
                                • 热门
                                • 用户
                                • 群组