跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s

Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s

已定时 已固定 已锁定 已移动 LLM讨论区
qwen-27b7900xtxdsharness
36 帖子 14 发布者 1.1k 浏览 4 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • E 离线
    E 离线
    exllm
    德高望重
    编写于 最后由 编辑
    #2

    所有测试都是基于unsloth/Qwen3.8-27B-GGUF

    相同参数跑 Q6_K效果:

    3.24.516.851 I slot print_timing: id  1 | task 0 | prompt eval time =    2188.90 ms /   263 tokens (    8.32 ms per token,   120.15 tokens per second)       
    3.24.516.854 I slot print_timing: id  1 | task 0 |        eval time =  162164.36 ms /  4584 tokens (   35.38 ms per token,    **28.27 tokens** per second)       
    3.24.516.854 I slot print_timing: id  1 | task 0 |       total time =  164353.27 ms /  4847 tokens                                                  
    3.24.516.859 I slot print_timing: id  1 | task 0 |    graphs reused =       1263                                                                    
    3.24.516.862 I slot print_timing: id  1 | task 0 | draft acceptance = **0.86016** ( 3303 accepted /  3840 generated), mean acceptance length =  3.58, acceptance 
    rate per position = (0.934, 0.869, 0.778)
    
    

    UD_Q6_K_XL:

    3.24.218.990 I slot print_timing: id  1 | task 0 |        eval time =  146468.18 ms /  3978 tokens (   36.82 ms per token,    27.16 tokens per second)
    3.24.218.991 I slot print_timing: id  1 | task 0 |       total time =  148616.68 ms /  4240 tokens
    3.24.218.996 I slot print_timing: id  1 | task 0 |    graphs reused =       1109
    3.24.218.999 I slot print_timing: id  1 | task 0 | draft acceptance = 0.84698 ( 2856 accepted /  3372 generated), mean acceptance length =  3.54, acceptance rate per position = (0.924, 0.849, 0.768)
    
    1 条回复 最后回复
    3
    • terryT 在线
      terryT 在线
      terry
      超级版主
      编写于 最后由 编辑
      #3

      可以,有空我抄下作业,DSH缓存命中98%?那挺高啊,平常聊天能玩吗,体验如何?消息发出去要等多久

      油管:https://www.youtube.com/@抡锤者

      E 1 条回复 最后回复
      0
      • W 在线
        W 在线
        weidong
        编写于 最后由 编辑
        #4

        Q5和Q4差别大吗

        E 1 条回复 最后回复
        1
        • W weidong

          Q5和Q4差别大吗

          E 离线
          E 离线
          exllm
          德高望重
          编写于 最后由 编辑
          #5

          @weidong
          输出质量 3.8 Q5 > 3.6 Q4 > 3.8 Q4
          输出速度 3.8 Q4 > 3.6 Q 4

          1 条回复 最后回复
          0
          • terryT terry

            可以,有空我抄下作业,DSH缓存命中98%?那挺高啊,平常聊天能玩吗,体验如何?消息发出去要等多久

            E 离线
            E 离线
            exllm
            德高望重
            编写于 最后由 编辑
            #6

            @terry

            Harness 提示词: 介绍一下“八卦”的来由

            • 冷启动

              • 极简模式:

                Total duration: 16.2 s
                TTFT: 5.20 s
                Generation: 11.0 s
                Throughput: 74.8 tok/s

              • 标准模式:

                Total duration: 20.1 s
                TTFT: 12.3 s
                Generation: 7.78 s
                Throughput: 83.8 tok/s

            • 缓存填满新开会话

              • 极简模式:

                Total duration: 17.1 s
                TTFT: 2.65 s
                Generation: 14.4 s
                Throughput: 65.1 tok/s

              • 标准模式:

                Total duration: 28.1 s
                TTFT: 12.3 s
                Generation: 15.8 s
                Throughput: 61.0 tok/s

            1 条回复 最后回复
            1
            • terryT 在线
              terryT 在线
              terry
              超级版主
              编写于 最后由 编辑
              #7

              xtx能到这个水平实属不易,你上下文能做到多少?如果上下文也够,看你参数里开到128k,能驱动dsh,那就有实用价值了。说真的 ,xtx这种显卡就是安静的很,做工不错,功耗可控。能玩上deepseek harness这一条就能值回票价。

              油管:https://www.youtube.com/@抡锤者

              E 1 条回复 最后回复
              0
              • terryT terry

                xtx能到这个水平实属不易,你上下文能做到多少?如果上下文也够,看你参数里开到128k,能驱动dsh,那就有实用价值了。说真的 ,xtx这种显卡就是安静的很,做工不错,功耗可控。能玩上deepseek harness这一条就能值回票价。

                E 离线
                E 离线
                exllm
                德高望重
                编写于 最后由 编辑
                #8

                @terry

                是的,我上下文128k, 如我在一楼写的,修改现有的c++项目(大约 355595行代码),效果很好。 同样的任务比Deepseek flash慢 一半, 结合Harness一次性完成,效果一样。

                在opencode中, DSF 一次完美完成, 本地Qwen需要多次修改。

                terryT 1 条回复 最后回复
                1
                • E exllm

                  @terry

                  是的,我上下文128k, 如我在一楼写的,修改现有的c++项目(大约 355595行代码),效果很好。 同样的任务比Deepseek flash慢 一半, 结合Harness一次性完成,效果一样。

                  在opencode中, DSF 一次完美完成, 本地Qwen需要多次修改。

                  terryT 在线
                  terryT 在线
                  terry
                  超级版主
                  编写于 最后由 编辑
                  #9

                  @exllm 你让我有了折腾本地部署的想法,我有空抄下作业,7900都能玩,4090+SG-Lang。我先把xtx搞下,让它发挥剩余价值。如果这个链条是通的,dsh这么强大,那么它完全值得做一个视频。

                  油管:https://www.youtube.com/@抡锤者

                  1 条回复 最后回复
                  0
                  • ,terryT terry 固定了此主题
                  • ,terryT terry 引用了 此主题
                  • terryT 在线
                    terryT 在线
                    terry
                    超级版主
                    编写于 最后由 编辑
                    #10

                    此贴经过版主亲自验证,可以放心抄作业。

                    油管:https://www.youtube.com/@抡锤者

                    1 条回复 最后回复
                    0
                    • A 离线
                      A 离线
                      Adam
                      编写于 最后由 编辑
                      #11

                      跟着老特的视频找过来了,我windows下,跑楼主的参数,只有7t/s,看是内存用到共享内存到了1.2g,自然就慢了。调小了上下文长度到96k,并行2,hermes正常解决几个问题就oom了。速度也是能在50t/s的样子。现在调成了80k,并行2,再看看情况吧。

                      1 条回复 最后回复
                      0
                      • X 离线
                        X 离线
                        xl
                        编写于 最后由 编辑
                        #12

                        作业质量非常高!9700x、64G ddr5、R9700 跑QWen3.8-27b-Q4_K_M。没抄作业之前,接入Codex干活吐字只有3.1 t/s,还经常崩掉,完全不能忍。抄作业以后,接入Codex干活吐字能到50t/s,提升十多倍,感觉顺畅了。万分感谢!

                        E 1 条回复 最后回复
                        0
                        • X xl

                          作业质量非常高!9700x、64G ddr5、R9700 跑QWen3.8-27b-Q4_K_M。没抄作业之前,接入Codex干活吐字只有3.1 t/s,还经常崩掉,完全不能忍。抄作业以后,接入Codex干活吐字能到50t/s,提升十多倍,感觉顺畅了。万分感谢!

                          E 离线
                          E 离线
                          exllm
                          德高望重
                          编写于 最后由 编辑
                          #13

                          @xl 并行设置为1, 估计能到70t/s

                          X 1 条回复 最后回复
                          0
                          • williamlouisW 在线
                            williamlouisW 在线
                            williamlouis
                            超级版主
                            编写于 最后由 编辑
                            #14

                            看视频了。抄作业,已关注。请继续更新。

                            个人主页:xlkj.org Telegram https://t.me/xlkjorg

                            1 条回复 最后回复
                            0
                            • K 离线
                              K 离线
                              kuntask
                              编写于 最后由 编辑
                              #15

                              抄了作业,跑楼主参数,只有20tokens/s,比较尴尬,经过deepseek了一下,应该是我的CPU有点弱,我将--override-tensor blk.\d+.ffn_.*_exps.=CPU \注释掉了,并将--parallel改成了1,其他参数未动,现在能到60t/s了

                              terryT 1 条回复 最后回复
                              1
                              • Wang WeiW 离线
                                Wang WeiW 离线
                                Wang Wei
                                编写于 最后由 编辑
                                #16

                                抄了作业 只有20-30 t/s 不过我是在win下的 wsl2挂着跑 显存有溢出 换原生Ubuntu太折腾了

                                Wang WeiW 1 条回复 最后回复
                                0
                                • E exllm

                                  @xl 并行设置为1, 估计能到70t/s

                                  X 离线
                                  X 离线
                                  xl
                                  编写于 最后由 编辑
                                  #17

                                  @exllm 并行改为1后,预填充性能有接近5~10倍的提升(不同的任务变化很大),但生成token的性能提升不到10%。我也将“--override-tensor blk.\d+.ffn_.*_exps.=CPU \”注释掉进行过测试,性能反而有略微下降,可能跟我的硬件和跑的任务也有一定关系。

                                  terryT 1 条回复 最后回复
                                  1
                                  • K kuntask

                                    抄了作业,跑楼主参数,只有20tokens/s,比较尴尬,经过deepseek了一下,应该是我的CPU有点弱,我将--override-tensor blk.\d+.ffn_.*_exps.=CPU \注释掉了,并将--parallel改成了1,其他参数未动,现在能到60t/s了

                                    terryT 在线
                                    terryT 在线
                                    terry
                                    超级版主
                                    编写于 最后由 编辑
                                    #18

                                    @kuntask 这个是要注释掉的,我也是注释了

                                    油管:https://www.youtube.com/@抡锤者

                                    1 条回复 最后回复
                                    0
                                    • X xl

                                      @exllm 并行改为1后,预填充性能有接近5~10倍的提升(不同的任务变化很大),但生成token的性能提升不到10%。我也将“--override-tensor blk.\d+.ffn_.*_exps.=CPU \”注释掉进行过测试,性能反而有略微下降,可能跟我的硬件和跑的任务也有一定关系。

                                      terryT 在线
                                      terryT 在线
                                      terry
                                      超级版主
                                      编写于 最后由 编辑
                                      #19

                                      @xl 不是巧合,就是应该注释掉

                                      油管:https://www.youtube.com/@抡锤者

                                      X 1 条回复 最后回复
                                      0
                                      • terryT terry

                                        @xl 不是巧合,就是应该注释掉

                                        X 离线
                                        X 离线
                                        xl
                                        编写于 最后由 编辑
                                        #20

                                        @terry 不是,在我的电脑上,注释掉后性能反而有略微下降(预填充变化不大,生成性能有略微降低)。只测一次的结果可能有偏差,等有空的时候再多测几次。

                                        terryT 1 条回复 最后回复
                                        0
                                        • X xl

                                          @terry 不是,在我的电脑上,注释掉后性能反而有略微下降(预填充变化不大,生成性能有略微降低)。只测一次的结果可能有偏差,等有空的时候再多测几次。

                                          terryT 在线
                                          terryT 在线
                                          terry
                                          超级版主
                                          编写于 最后由 terry 编辑
                                          #21

                                          @xl 总之参数大体是对的,我是复制链接给AI自己配置的。它把这一行直接干掉了,效率上和楼主的差不多。

                                          油管:https://www.youtube.com/@抡锤者

                                          1 条回复 最后回复
                                          0

                                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                          有了你的建议,这篇帖子会更精彩哦 💗

                                          注册 登录
                                          回复
                                          • 在新帖中回复
                                          登录后回复
                                          • 从旧到新
                                          • 从新到旧
                                          • 最多赞同


                                          • 登录

                                          • 登录或注册以进行搜索。
                                          • 第一个帖子
                                            最后一个帖子
                                          0
                                          • 版块
                                          • 最新
                                          • 标签
                                          • 热门
                                          • 用户
                                          • 群组