跳转至内容
  • 首页
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. 【实测】7900xtx使用Qwen3.6-35B-A3B速度稳定在80+t/s

【实测】7900xtx使用Qwen3.6-35B-A3B速度稳定在80+t/s

已定时 已固定 已锁定 已移动 LLM讨论区
7900xtxamdllama.cpp
12 帖子 7 发布者 516 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • K 离线
    K 离线
    koala
    德高望重 劳动模范
    编写于 最后由 koala 编辑
    #1

    2c1c0705-5d39-45da-880c-8b396146864c-image.jpeg

    这个模型支持多模态,所以日常被我拿来用于工作,速度挺快的,也能持续干活,
    Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ4_NL.gguf
    启动参数

    ./llama-cli -m /path/to/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ4_NL.gguf \
      --mmproj /path/to/mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \
      -ngl 99 \
      -c 131072 \
      -fa \
      --batch-size 512 \
      -t 8 \
      --temp 0.7 \
      --repeat-penalty 1.1
    
    1 条回复 最后回复
    2
    • terryT 在线
      terryT 在线
      terry
      超级版主
      编写于 最后由 terry 编辑
      #2

      你用它来干什么呢?多模态是它的最大优势,也正好踩在本地显卡的算力负担甜点上。长上下文怕是显存不太够。

      油管:https://www.youtube.com/@抡锤者

      K 1 条回复 最后回复
      0
      • terryT terry

        你用它来干什么呢?多模态是它的最大优势,也正好踩在本地显卡的算力负担甜点上。长上下文怕是显存不太够。

        K 离线
        K 离线
        koala
        德高望重 劳动模范
        编写于 最后由 koala 编辑
        #3

        @terry 做总项目调度,调试软件、工作流,等等。

        1 条回复 最后回复
        2
        • ,K koala 引用了 此主题
        • D 离线
          D 离线
          densha
          编写于 最后由 编辑
          #4

          大佬的ctx開 132072這麼大@@,我的顯卡跟您一樣,照抄參數,跑起來很喘20t/s左右,而且系統內存32G也被佔滿了...

          K 1 条回复 最后回复
          0
          • S 离线
            S 离线
            stormaround
            编写于 最后由 编辑
            #5

            这个模型跑的很快,用m5max 6bit 能跑将近100toks,但是用hermes调用时候经常会死循环,一直重复几句话,干不了大活

            K fcmeF RexR 3 条回复 最后回复
            1
            • D densha

              大佬的ctx開 132072這麼大@@,我的顯卡跟您一樣,照抄參數,跑起來很喘20t/s左右,而且系統內存32G也被佔滿了...

              K 离线
              K 离线
              koala
              德高望重 劳动模范
              编写于 最后由 编辑
              #6

              @densha 在claude里面跑起来效果不错,有时候27B出错的时候我就切换他来跑,

              1 条回复 最后回复
              0
              • S stormaround

                这个模型跑的很快,用m5max 6bit 能跑将近100toks,但是用hermes调用时候经常会死循环,一直重复几句话,干不了大活

                K 离线
                K 离线
                koala
                德高望重 劳动模范
                编写于 最后由 编辑
                #7

                @stormaround 开个新的对话就可以了,上下文太长了就得开,claude对于新对话支持的比较好

                1 条回复 最后回复
                0
                • S stormaround

                  这个模型跑的很快,用m5max 6bit 能跑将近100toks,但是用hermes调用时候经常会死循环,一直重复几句话,干不了大活

                  fcmeF 离线
                  fcmeF 离线
                  fcme
                  技术大牛 劳动模范
                  编写于 最后由 编辑
                  #8

                  @stormaround
                  我也发现这个问题了,试了不下10个这个基座模型的变种,有的量化精度低一些的在Hermes调用几步以后就开始陷入死循环,良化进度高一点的(新入了r9700)会好一些,但是他的思维会陷入一个死循环,就是不断的尝试,但是每一轮尝试下来都是一样的结果,根本解决不了问题。
                  后来我把跟他的交互记录让deepseek Pro看了一下,Deepseek 2分钟就发现了问题,根本的原因是Hermes斯的对话管理机制,因为它的定位是做一个轻量的助手,所以他的对话几乎都不能持久,然后你过一会不用的话,那个对话就给你关掉了,你在聊天的时候又是一个新的对话,所以说它不是靠对话来管理上下文的,它实际上是靠搜索它的那个对话的数据库来搞的,这样的话,尤其像这种本地小模型智商没那么高的情况下,他有可能抓到的内容是碎片化不相关的。所以导致使用体验非常糟糕,然后我就把同样的咖啡UI的自动化视频流程让他总结了一遍,迁移到了opencode里面。中间有一个断点在opencode里面调用一个魔改版的这个35b一次跑通!因为open code的一个对话就是一个项目,这种开发类的agent框架的上下文比较干净。
                  工具和模型同样重要,多么痛的领悟,我已经卡了三四天了了。

                  1 条回复 最后回复
                  3
                  • S 在线
                    S 在线
                    stxpnet
                    技术大牛 劳动模范
                    编写于 最后由 stxpnet 编辑
                    #9

                    轻度聊天非常舒服的,我的单卡3090速度有80-100token/s,用完就关了,比在线的省点token,比本地qwen 3.6 27b ttft快4-5倍。 楼主这个参数没指定,似乎就F16的K V CACHE,有点牛,多轮可能会爆显存

                    1 条回复 最后回复
                    1
                    • S stormaround

                      这个模型跑的很快,用m5max 6bit 能跑将近100toks,但是用hermes调用时候经常会死循环,一直重复几句话,干不了大活

                      RexR 离线
                      RexR 离线
                      Rex
                      编写于 最后由 编辑
                      #10

                      @stormaround 同感,我用35B-A3A写一个代码项目,他干了5个小时,修了上百行代码。 claude code评价:5个小时干的活没有正向做功,因为没有找到根本问题,在现象层面修了东边,坏了西边,反过来修西边,又坏了东边。直到手动停止它

                      terryT 1 条回复 最后回复
                      0
                      • RexR Rex

                        @stormaround 同感,我用35B-A3A写一个代码项目,他干了5个小时,修了上百行代码。 claude code评价:5个小时干的活没有正向做功,因为没有找到根本问题,在现象层面修了东边,坏了西边,反过来修西边,又坏了东边。直到手动停止它

                        terryT 在线
                        terryT 在线
                        terry
                        超级版主
                        编写于 最后由 编辑
                        #11

                        @Rex 强调了很多次,35B A3B 干不了什么正儿八经的活,小玩玩可以。但大家似乎都不太相信,不知道原因是什么。

                        油管:https://www.youtube.com/@抡锤者

                        1 条回复 最后回复
                        0
                        • S 在线
                          S 在线
                          stxpnet
                          技术大牛 劳动模范
                          编写于 最后由 stxpnet 编辑
                          #12

                          不信的只有自己实践了才能信,35B,A3B,大概就是6B的速度,质量嘛,大概15B。 其实有个简单的判断方法,你给它配好harnness工具,然后让它写一些复杂点的小游戏。然后观察nvtop曲线。 就算你调好参数,让它能满载跑,它写程序也是写100行,过一会儿删80行, 电力和时间就这样被浪费了。 它只适合做一些简单的任务编排,但是这样的任务,deepseek flash就能做了,也便宜。

                          50e83ee5-0d5b-4cb2-887e-4769b475a92d-image.jpeg
                          这个模型唯一优点的就是刚开始像打了鸡血一样快。140T/S,中后期会掉到80,比较难受。 (我一直用0.6温度, 不然后期智力下降厉害) 。

                          1 条回复 最后回复
                          0

                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                          有了你的建议,这篇帖子会更精彩哦 💗

                          注册 登录
                          回复
                          • 在新帖中回复
                          登录后回复
                          • 从旧到新
                          • 从新到旧
                          • 最多赞同


                          • 登录

                          • 没有帐号? 注册

                          • 登录或注册以进行搜索。
                          • 第一个帖子
                            最后一个帖子
                          0
                          • 首页
                          • 版块
                          • 最新
                          • 标签
                          • 热门
                          • 用户
                          • 群组