跳转至内容
  • 首页
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. 【实测】7900xtx使用Qwen3.6-35B-A3B速度稳定在80+t/s

【实测】7900xtx使用Qwen3.6-35B-A3B速度稳定在80+t/s

已定时 已固定 已锁定 已移动 LLM讨论区
7900xtxamdllama.cpp
12 帖子 7 发布者 516 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT 在线
    terryT 在线
    terry
    超级版主
    编写于 最后由 terry 编辑
    #2

    你用它来干什么呢?多模态是它的最大优势,也正好踩在本地显卡的算力负担甜点上。长上下文怕是显存不太够。

    油管:https://www.youtube.com/@抡锤者

    K 1 条回复 最后回复
    0
    • terryT terry

      你用它来干什么呢?多模态是它的最大优势,也正好踩在本地显卡的算力负担甜点上。长上下文怕是显存不太够。

      K 离线
      K 离线
      koala
      德高望重 劳动模范
      编写于 最后由 koala 编辑
      #3

      @terry 做总项目调度,调试软件、工作流,等等。

      1 条回复 最后回复
      2
      • ,K koala 引用了 此主题
      • D 离线
        D 离线
        densha
        编写于 最后由 编辑
        #4

        大佬的ctx開 132072這麼大@@,我的顯卡跟您一樣,照抄參數,跑起來很喘20t/s左右,而且系統內存32G也被佔滿了...

        K 1 条回复 最后回复
        0
        • S 离线
          S 离线
          stormaround
          编写于 最后由 编辑
          #5

          这个模型跑的很快,用m5max 6bit 能跑将近100toks,但是用hermes调用时候经常会死循环,一直重复几句话,干不了大活

          K fcmeF RexR 3 条回复 最后回复
          1
          • D densha

            大佬的ctx開 132072這麼大@@,我的顯卡跟您一樣,照抄參數,跑起來很喘20t/s左右,而且系統內存32G也被佔滿了...

            K 离线
            K 离线
            koala
            德高望重 劳动模范
            编写于 最后由 编辑
            #6

            @densha 在claude里面跑起来效果不错,有时候27B出错的时候我就切换他来跑,

            1 条回复 最后回复
            0
            • S stormaround

              这个模型跑的很快,用m5max 6bit 能跑将近100toks,但是用hermes调用时候经常会死循环,一直重复几句话,干不了大活

              K 离线
              K 离线
              koala
              德高望重 劳动模范
              编写于 最后由 编辑
              #7

              @stormaround 开个新的对话就可以了,上下文太长了就得开,claude对于新对话支持的比较好

              1 条回复 最后回复
              0
              • S stormaround

                这个模型跑的很快,用m5max 6bit 能跑将近100toks,但是用hermes调用时候经常会死循环,一直重复几句话,干不了大活

                fcmeF 离线
                fcmeF 离线
                fcme
                技术大牛 劳动模范
                编写于 最后由 编辑
                #8

                @stormaround
                我也发现这个问题了,试了不下10个这个基座模型的变种,有的量化精度低一些的在Hermes调用几步以后就开始陷入死循环,良化进度高一点的(新入了r9700)会好一些,但是他的思维会陷入一个死循环,就是不断的尝试,但是每一轮尝试下来都是一样的结果,根本解决不了问题。
                后来我把跟他的交互记录让deepseek Pro看了一下,Deepseek 2分钟就发现了问题,根本的原因是Hermes斯的对话管理机制,因为它的定位是做一个轻量的助手,所以他的对话几乎都不能持久,然后你过一会不用的话,那个对话就给你关掉了,你在聊天的时候又是一个新的对话,所以说它不是靠对话来管理上下文的,它实际上是靠搜索它的那个对话的数据库来搞的,这样的话,尤其像这种本地小模型智商没那么高的情况下,他有可能抓到的内容是碎片化不相关的。所以导致使用体验非常糟糕,然后我就把同样的咖啡UI的自动化视频流程让他总结了一遍,迁移到了opencode里面。中间有一个断点在opencode里面调用一个魔改版的这个35b一次跑通!因为open code的一个对话就是一个项目,这种开发类的agent框架的上下文比较干净。
                工具和模型同样重要,多么痛的领悟,我已经卡了三四天了了。

                1 条回复 最后回复
                3
                • S 在线
                  S 在线
                  stxpnet
                  技术大牛 劳动模范
                  编写于 最后由 stxpnet 编辑
                  #9

                  轻度聊天非常舒服的,我的单卡3090速度有80-100token/s,用完就关了,比在线的省点token,比本地qwen 3.6 27b ttft快4-5倍。 楼主这个参数没指定,似乎就F16的K V CACHE,有点牛,多轮可能会爆显存

                  1 条回复 最后回复
                  1
                  • S stormaround

                    这个模型跑的很快,用m5max 6bit 能跑将近100toks,但是用hermes调用时候经常会死循环,一直重复几句话,干不了大活

                    RexR 离线
                    RexR 离线
                    Rex
                    编写于 最后由 编辑
                    #10

                    @stormaround 同感,我用35B-A3A写一个代码项目,他干了5个小时,修了上百行代码。 claude code评价:5个小时干的活没有正向做功,因为没有找到根本问题,在现象层面修了东边,坏了西边,反过来修西边,又坏了东边。直到手动停止它

                    terryT 1 条回复 最后回复
                    0
                    • RexR Rex

                      @stormaround 同感,我用35B-A3A写一个代码项目,他干了5个小时,修了上百行代码。 claude code评价:5个小时干的活没有正向做功,因为没有找到根本问题,在现象层面修了东边,坏了西边,反过来修西边,又坏了东边。直到手动停止它

                      terryT 在线
                      terryT 在线
                      terry
                      超级版主
                      编写于 最后由 编辑
                      #11

                      @Rex 强调了很多次,35B A3B 干不了什么正儿八经的活,小玩玩可以。但大家似乎都不太相信,不知道原因是什么。

                      油管:https://www.youtube.com/@抡锤者

                      1 条回复 最后回复
                      0
                      • S 在线
                        S 在线
                        stxpnet
                        技术大牛 劳动模范
                        编写于 最后由 stxpnet 编辑
                        #12

                        不信的只有自己实践了才能信,35B,A3B,大概就是6B的速度,质量嘛,大概15B。 其实有个简单的判断方法,你给它配好harnness工具,然后让它写一些复杂点的小游戏。然后观察nvtop曲线。 就算你调好参数,让它能满载跑,它写程序也是写100行,过一会儿删80行, 电力和时间就这样被浪费了。 它只适合做一些简单的任务编排,但是这样的任务,deepseek flash就能做了,也便宜。

                        50e83ee5-0d5b-4cb2-887e-4769b475a92d-image.jpeg
                        这个模型唯一优点的就是刚开始像打了鸡血一样快。140T/S,中后期会掉到80,比较难受。 (我一直用0.6温度, 不然后期智力下降厉害) 。

                        1 条回复 最后回复
                        0

                        你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                        厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                        有了你的建议,这篇帖子会更精彩哦 💗

                        注册 登录
                        回复
                        • 在新帖中回复
                        登录后回复
                        • 从旧到新
                        • 从新到旧
                        • 最多赞同


                        • 登录

                        • 没有帐号? 注册

                        • 登录或注册以进行搜索。
                        • 第一个帖子
                          最后一个帖子
                        0
                        • 首页
                        • 版块
                        • 最新
                        • 标签
                        • 热门
                        • 用户
                        • 群组