跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s

Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s

已定时 已固定 已锁定 已移动 LLM讨论区
qwen-27b7900xtxdsharness
36 帖子 14 发布者 1.1k 浏览 4 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT terry

    可以,有空我抄下作业,DSH缓存命中98%?那挺高啊,平常聊天能玩吗,体验如何?消息发出去要等多久

    E 离线
    E 离线
    exllm
    德高望重
    编写于 最后由 编辑
    #6

    @terry

    Harness 提示词: 介绍一下“八卦”的来由

    • 冷启动

      • 极简模式:

        Total duration: 16.2 s
        TTFT: 5.20 s
        Generation: 11.0 s
        Throughput: 74.8 tok/s

      • 标准模式:

        Total duration: 20.1 s
        TTFT: 12.3 s
        Generation: 7.78 s
        Throughput: 83.8 tok/s

    • 缓存填满新开会话

      • 极简模式:

        Total duration: 17.1 s
        TTFT: 2.65 s
        Generation: 14.4 s
        Throughput: 65.1 tok/s

      • 标准模式:

        Total duration: 28.1 s
        TTFT: 12.3 s
        Generation: 15.8 s
        Throughput: 61.0 tok/s

    1 条回复 最后回复
    1
    • terryT 离线
      terryT 离线
      terry
      超级版主
      编写于 最后由 编辑
      #7

      xtx能到这个水平实属不易,你上下文能做到多少?如果上下文也够,看你参数里开到128k,能驱动dsh,那就有实用价值了。说真的 ,xtx这种显卡就是安静的很,做工不错,功耗可控。能玩上deepseek harness这一条就能值回票价。

      油管:https://www.youtube.com/@抡锤者

      E 1 条回复 最后回复
      0
      • terryT terry

        xtx能到这个水平实属不易,你上下文能做到多少?如果上下文也够,看你参数里开到128k,能驱动dsh,那就有实用价值了。说真的 ,xtx这种显卡就是安静的很,做工不错,功耗可控。能玩上deepseek harness这一条就能值回票价。

        E 离线
        E 离线
        exllm
        德高望重
        编写于 最后由 编辑
        #8

        @terry

        是的,我上下文128k, 如我在一楼写的,修改现有的c++项目(大约 355595行代码),效果很好。 同样的任务比Deepseek flash慢 一半, 结合Harness一次性完成,效果一样。

        在opencode中, DSF 一次完美完成, 本地Qwen需要多次修改。

        terryT 1 条回复 最后回复
        1
        • E exllm

          @terry

          是的,我上下文128k, 如我在一楼写的,修改现有的c++项目(大约 355595行代码),效果很好。 同样的任务比Deepseek flash慢 一半, 结合Harness一次性完成,效果一样。

          在opencode中, DSF 一次完美完成, 本地Qwen需要多次修改。

          terryT 离线
          terryT 离线
          terry
          超级版主
          编写于 最后由 编辑
          #9

          @exllm 你让我有了折腾本地部署的想法,我有空抄下作业,7900都能玩,4090+SG-Lang。我先把xtx搞下,让它发挥剩余价值。如果这个链条是通的,dsh这么强大,那么它完全值得做一个视频。

          油管:https://www.youtube.com/@抡锤者

          1 条回复 最后回复
          0
          • ,terryT terry 固定了此主题
          • ,terryT terry 引用了 此主题
          • terryT 离线
            terryT 离线
            terry
            超级版主
            编写于 最后由 编辑
            #10

            此贴经过版主亲自验证,可以放心抄作业。

            油管:https://www.youtube.com/@抡锤者

            1 条回复 最后回复
            0
            • A 离线
              A 离线
              Adam
              编写于 最后由 编辑
              #11

              跟着老特的视频找过来了,我windows下,跑楼主的参数,只有7t/s,看是内存用到共享内存到了1.2g,自然就慢了。调小了上下文长度到96k,并行2,hermes正常解决几个问题就oom了。速度也是能在50t/s的样子。现在调成了80k,并行2,再看看情况吧。

              1 条回复 最后回复
              0
              • X 离线
                X 离线
                xl
                编写于 最后由 编辑
                #12

                作业质量非常高!9700x、64G ddr5、R9700 跑QWen3.8-27b-Q4_K_M。没抄作业之前,接入Codex干活吐字只有3.1 t/s,还经常崩掉,完全不能忍。抄作业以后,接入Codex干活吐字能到50t/s,提升十多倍,感觉顺畅了。万分感谢!

                E 1 条回复 最后回复
                0
                • X xl

                  作业质量非常高!9700x、64G ddr5、R9700 跑QWen3.8-27b-Q4_K_M。没抄作业之前,接入Codex干活吐字只有3.1 t/s,还经常崩掉,完全不能忍。抄作业以后,接入Codex干活吐字能到50t/s,提升十多倍,感觉顺畅了。万分感谢!

                  E 离线
                  E 离线
                  exllm
                  德高望重
                  编写于 最后由 编辑
                  #13

                  @xl 并行设置为1, 估计能到70t/s

                  X 1 条回复 最后回复
                  0
                  • williamlouisW 在线
                    williamlouisW 在线
                    williamlouis
                    超级版主
                    编写于 最后由 编辑
                    #14

                    看视频了。抄作业,已关注。请继续更新。

                    个人主页:xlkj.org Telegram https://t.me/xlkjorg

                    1 条回复 最后回复
                    0
                    • K 离线
                      K 离线
                      kuntask
                      编写于 最后由 编辑
                      #15

                      抄了作业,跑楼主参数,只有20tokens/s,比较尴尬,经过deepseek了一下,应该是我的CPU有点弱,我将--override-tensor blk.\d+.ffn_.*_exps.=CPU \注释掉了,并将--parallel改成了1,其他参数未动,现在能到60t/s了

                      terryT 1 条回复 最后回复
                      1
                      • Wang WeiW 离线
                        Wang WeiW 离线
                        Wang Wei
                        编写于 最后由 编辑
                        #16

                        抄了作业 只有20-30 t/s 不过我是在win下的 wsl2挂着跑 显存有溢出 换原生Ubuntu太折腾了

                        Wang WeiW 1 条回复 最后回复
                        0
                        • E exllm

                          @xl 并行设置为1, 估计能到70t/s

                          X 离线
                          X 离线
                          xl
                          编写于 最后由 编辑
                          #17

                          @exllm 并行改为1后,预填充性能有接近5~10倍的提升(不同的任务变化很大),但生成token的性能提升不到10%。我也将“--override-tensor blk.\d+.ffn_.*_exps.=CPU \”注释掉进行过测试,性能反而有略微下降,可能跟我的硬件和跑的任务也有一定关系。

                          terryT 1 条回复 最后回复
                          1
                          • K kuntask

                            抄了作业,跑楼主参数,只有20tokens/s,比较尴尬,经过deepseek了一下,应该是我的CPU有点弱,我将--override-tensor blk.\d+.ffn_.*_exps.=CPU \注释掉了,并将--parallel改成了1,其他参数未动,现在能到60t/s了

                            terryT 离线
                            terryT 离线
                            terry
                            超级版主
                            编写于 最后由 编辑
                            #18

                            @kuntask 这个是要注释掉的,我也是注释了

                            油管:https://www.youtube.com/@抡锤者

                            1 条回复 最后回复
                            0
                            • X xl

                              @exllm 并行改为1后,预填充性能有接近5~10倍的提升(不同的任务变化很大),但生成token的性能提升不到10%。我也将“--override-tensor blk.\d+.ffn_.*_exps.=CPU \”注释掉进行过测试,性能反而有略微下降,可能跟我的硬件和跑的任务也有一定关系。

                              terryT 离线
                              terryT 离线
                              terry
                              超级版主
                              编写于 最后由 编辑
                              #19

                              @xl 不是巧合,就是应该注释掉

                              油管:https://www.youtube.com/@抡锤者

                              X 1 条回复 最后回复
                              0
                              • terryT terry

                                @xl 不是巧合,就是应该注释掉

                                X 离线
                                X 离线
                                xl
                                编写于 最后由 编辑
                                #20

                                @terry 不是,在我的电脑上,注释掉后性能反而有略微下降(预填充变化不大,生成性能有略微降低)。只测一次的结果可能有偏差,等有空的时候再多测几次。

                                terryT 1 条回复 最后回复
                                0
                                • X xl

                                  @terry 不是,在我的电脑上,注释掉后性能反而有略微下降(预填充变化不大,生成性能有略微降低)。只测一次的结果可能有偏差,等有空的时候再多测几次。

                                  terryT 离线
                                  terryT 离线
                                  terry
                                  超级版主
                                  编写于 最后由 terry 编辑
                                  #21

                                  @xl 总之参数大体是对的,我是复制链接给AI自己配置的。它把这一行直接干掉了,效率上和楼主的差不多。

                                  油管:https://www.youtube.com/@抡锤者

                                  1 条回复 最后回复
                                  0
                                  • Wang WeiW Wang Wei

                                    抄了作业 只有20-30 t/s 不过我是在win下的 wsl2挂着跑 显存有溢出 换原生Ubuntu太折腾了

                                    Wang WeiW 离线
                                    Wang WeiW 离线
                                    Wang Wei
                                    编写于 最后由 编辑
                                    #22

                                    Wang-Wei 说:

                                    抄了作业 只有20-30 t/s 不过我是在win下的 wsl2挂着跑 显存有溢出 换原生Ubuntu太折腾了

                                    我把np从2改到1就可以了,显存不溢出,q5 128k上下文 55t/s 换成q4可以到70 一个slot够我用了

                                    1 条回复 最后回复
                                    0
                                    • E exllm

                                      软硬件配置:

                                      cpu: AMD Ryzen 5 5600
                                      RAM: 32GB 3200
                                      GPU: 7900xtx
                                      OS: Ubuntu 26.04
                                      软件 : llama.cpp + vulkan
                                      版本:

                                         version: 9737 (67e9fd3b7)
                                         built with GNU 15.2.0 for Linux x86_64
                                      

                                      测试:

                                      1. llama.cpp 自带webui 创建打飞机游戏
                                        提示词:
                                      "Create a complete, fully functional 2D space shooter arcade game inside a single HTML file using HTML5 Canvas, CSS, and vanilla JavaScript.        
                                      **Requirements:**        
                                              
                                      1.  **Canvas & Layout:** Set up a centered 800x600 black canvas with a retro arcade UI showing the current score and remaining lives at the top.        
                                                  
                                      2.  **Player Ship:** Draw a distinct player ship at the bottom center. Allow smooth movement left and right using the Arrow Keys or A/D keys, constrained within the canvas bounds.        
                                                  
                                      3.  **Shooting Mechanics:** Pressing the Spacebar should fire a laser projectile upward from the player's position. Implement a brief cooldown between shots.        
                                                  
                                      4.  **Enemies:** Spawn alien ships or asteroids at random X coordinates along the top, moving downward at varying speeds.        
                                                  
                                      5.  **Collision Detection:** Write precise collision logic for bullets hitting enemies (destroying both and adding points) and enemies hitting the player or bottom screen (losing a life).        
                                                  
                                      6.  **Game Loop & States:** Include smooth requestAnimationFrame logic, a 'Game Over' screen, and a 'Restart' button functionality. Clean, well-commented code only."
                                      

                                      日志

                                      1.47.020.662 I slot print_timing: id  1 | task 0 | n_decoded =   5409, tg =  89.47 t/s, tg_3s =  71.71 t/s
                                      1.47.476.673 I slot print_timing: id  1 | task 0 | prompt eval time =     519.21 ms /   262 tokens (    1.98 ms per token,   504.61 tokens per second)
                                      1.47.476.677 I slot print_timing: id  1 | task 0 |        eval time =   60909.77 ms /  5440 tokens (   11.20 ms per token,    89.31 tokens per second)
                                      1.47.476.677 I slot print_timing: id  1 | task 0 |       total time =   61428.98 ms /  5702 tokens
                                      1.47.476.681 I slot print_timing: id  1 | task 0 |    graphs reused =       1480
                                      1.47.476.684 I slot print_timing: id  1 | task 0 | draft acceptance = 0.87497 ( 3940 accepted /  4503 generated), mean acceptance length =  3.62, acceptance rate per position = (0.943, 0.875, 0.806)
                                      
                                      
                                      1. 配合 Deepseek Harness 修改QT + C++ 项目 SimulIDE, 使其能在apple silicon上运行,并修改Qt 文本框输入bug

                                      llama.cpp 日志中的一段

                                      32.32.489.805 I slot print_timing: id  1 | task 10430 | prompt eval time =   17284.15 ms /  4098 tokens (    4.22 ms per token,   237.10 tokens per second)
                                      32.32.489.807 I slot print_timing: id  1 | task 10430 |        eval time =    5461.48 ms /   277 tokens (   19.72 ms per token,    50.72 tokens per second)
                                      32.32.489.808 I slot print_timing: id  1 | task 10430 |       total time =   22745.63 ms /  4375 tokens
                                      32.32.489.808 I slot print_timing: id  1 | task 10430 |    graphs reused =       9929
                                      32.32.489.811 I slot print_timing: id  1 | task 10430 | draft acceptance = 0.89333 (  201 accepted /   225 generated), mean acceptance length =  3.68, acceptance rate per position = (0.960, 0.893, 0.827)
                                      
                                      

                                      DSH 摘要:

                                       63歩ILLM 13m13S・工具週用 2m2s|首token 平均3.8s・52 tok/s|緩存命中98%1輸入 4.4M tok・輸出 29.2K tok
                                      

                                      llama.cpp运行参数:

                                      -t 10 
                                      -b 512 
                                      -ub 256 
                                      --spec-draft-n-max 3 
                                      --fit off 
                                      --no-context-shift 
                                      --metrics 
                                      --kv-unified 
                                      --jinja 
                                      --cache-type-k q8_0 
                                      --cache-type-v q8_0 
                                      -fa on 
                                      --spec-type draft-mtp 
                                      --ctx-size 131072 
                                      --parallel 2 
                                      -ngl -1 
                                      --host 0.0.0.0 
                                      --port 8080 
                                      --chat-template-kwargs {"enable_thinking": true, "preserve_think": false, "reasoning_effort": "medium"} 
                                      --no-mmap 
                                      --temp 0.6 
                                      --top-p 0.5 
                                      --top-k 15 
                                      --repeat-penalty 1.0 
                                      --override-tensor blk\.\d+\.ffn_.*_exps\.=CPU 
                                      --alias qwen3.8-27b-q5 
                                      
                                      懒人烘培懒 离线
                                      懒人烘培懒 离线
                                      懒人烘培
                                      编写于 最后由 编辑
                                      #23

                                      @exllm @terry
                                      根据楼主的测试了一下
                                      cpu: AMD Ryzen 5 7500F
                                      RAM:DDR5 32GB 6000
                                      GPU: 7900XTX
                                      OS: Ubuntu 24.04
                                      软件 : llama.cpp + vulkan

                                      先说结果:
                                      d9100061-f4ce-41c6-a642-6c786631721d-image.jpeg
                                      llama.cpp运行参数,spec-draft-n-max 3 速度最好:

                                      ~/llama_vulkan/bin/llama-server \
                                      -m ~/models/Qwen3.8-27B-Q5_K_M.gguf \
                                      -t 10 \
                                      -b 512 \
                                      -ub 256 \
                                      --spec-draft-n-max 3 \
                                      --fit off \
                                      --no-context-shift \
                                      --metrics \
                                      --kv-unified \
                                      --jinja \
                                      --cache-type-k q8_0 \
                                      --cache-type-v q8_0 \
                                      -fa on \
                                      --spec-type draft-mtp \
                                      --ctx-size 131072 \
                                      --parallel 1 \
                                      -ngl -1 \
                                      --host 0.0.0.0 \
                                      --port 8080 \
                                      --chat-template-kwargs '{"enable_thinking":true,"preserve_think":false,"reasoning_effort":"medium"}' \
                                      --no-mmap \
                                      --temp 0.6 \
                                      --top-p 0.5 \
                                      --top-k 15 \
                                      --repeat-penalty 1.0 \
                                      --alias qwen3.8-27b-q5
                                      

                                      llama.cpp运行参数,spec-draft-n-max 2 :
                                      a0024f56-4593-4dff-b3e1-f28a779fa278-image.jpeg

                                      llama.cpp运行参数,spec-draft-n-max 4 :
                                      990f1775-f067-4cb1-a475-497ac29df862-image.jpeg

                                      总结:

                                      参数 Prompt速度 生成速度 平均延迟 MTP命中率
                                      n=2 288.73 t/s 68.14 t/s 17.436 s 87.62%
                                      n=3 286.60 t/s 71.74 t/s 16.772 s 82.50%
                                      n=4 249.53 t/s 47.96 t/s 24.911 s 74.99%

                                      这台电脑n=3最好。
                                      注:修改这个参数是MTP speculative decoding(推测解码)一次最多提前“猜”多少个 token。

                                      1 条回复 最后回复
                                      1
                                      • 6 离线
                                        6 离线
                                        6cccccc
                                        编写于 最后由 编辑
                                        #24

                                        为啥我的启动参数是这样:
                                        -m "$SELECTED_MODEL" -t 10 -b 512 -ub 256
                                        --spec-draft-n-max 3 --fit off --no-context-shift
                                        --metrics --kv-unified --jinja
                                        --cache-type-k q8_0 --cache-type-v q8_0
                                        -fa on --spec-type draft-mtp
                                        --ctx-size 131072 --parallel 1 -ngl -1
                                        --host 0.0.0.0 --port $LLAMA_PORT
                                        --chat-template-kwargs {"enable_thinking": true, "preserve_think": false, "reasoning_effort": "medium"}
                                        --no-mmap --temp 0.6 --top-p 0.5 --top-k 15 --repeat-penalty 1.0
                                        --alias qwen3.8-27b-q5
                                        仍然速度很低,只有12左右
                                        配置如下
                                        cpu: AMD Ryzen 7 2700 Eight-Core Processor (8核16线程, 3.2GHz)
                                        RAM: 64GB DDR4
                                        GPU: AMD Radeon RX 7900 XTX 24GB (RADV NAVI31)
                                        OS: Ubuntu 26.04 LTS (内核 7.0.0-29-generic)
                                        软件 : llama.cpp Vulkan b10486

                                        懒人烘培懒 E 3 条回复 最后回复
                                        0
                                        • 6 6cccccc

                                          为啥我的启动参数是这样:
                                          -m "$SELECTED_MODEL" -t 10 -b 512 -ub 256
                                          --spec-draft-n-max 3 --fit off --no-context-shift
                                          --metrics --kv-unified --jinja
                                          --cache-type-k q8_0 --cache-type-v q8_0
                                          -fa on --spec-type draft-mtp
                                          --ctx-size 131072 --parallel 1 -ngl -1
                                          --host 0.0.0.0 --port $LLAMA_PORT
                                          --chat-template-kwargs {"enable_thinking": true, "preserve_think": false, "reasoning_effort": "medium"}
                                          --no-mmap --temp 0.6 --top-p 0.5 --top-k 15 --repeat-penalty 1.0
                                          --alias qwen3.8-27b-q5
                                          仍然速度很低,只有12左右
                                          配置如下
                                          cpu: AMD Ryzen 7 2700 Eight-Core Processor (8核16线程, 3.2GHz)
                                          RAM: 64GB DDR4
                                          GPU: AMD Radeon RX 7900 XTX 24GB (RADV NAVI31)
                                          OS: Ubuntu 26.04 LTS (内核 7.0.0-29-generic)
                                          软件 : llama.cpp Vulkan b10486

                                          懒人烘培懒 离线
                                          懒人烘培懒 离线
                                          懒人烘培
                                          编写于 最后由 编辑
                                          #25

                                          @6cccccc
                                          试试我那参数呢,不应该只有12

                                          1 条回复 最后回复
                                          0

                                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                          有了你的建议,这篇帖子会更精彩哦 💗

                                          注册 登录
                                          回复
                                          • 在新帖中回复
                                          登录后回复
                                          • 从旧到新
                                          • 从新到旧
                                          • 最多赞同


                                          • 登录

                                          • 登录或注册以进行搜索。
                                          • 第一个帖子
                                            最后一个帖子
                                          0
                                          • 版块
                                          • 最新
                                          • 标签
                                          • 热门
                                          • 用户
                                          • 群组