跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. Qwen3.8-27B DFlash2:RDNA4 双显卡 PP 与 128K 长上下文实测报告

Qwen3.8-27B DFlash2:RDNA4 双显卡 PP 与 128K 长上下文实测报告

已定时 已固定 已锁定 已移动 LLM讨论区
qwen-27bdflashamd
12 帖子 6 发布者 606 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • BunseiB 离线
    BunseiB 离线
    Bunsei
    德高望重 劳动模范
    编写于 最后由 Bunsei 编辑
    #2
    此主題已被删除!
    1 条回复 最后回复
    0
    • BunseiB 离线
      BunseiB 离线
      Bunsei
      德高望重 劳动模范
      编写于 最后由 编辑
      #3
      此主題已被删除!
      1 条回复 最后回复
      0
      • stxpnetS 离线
        stxpnetS 离线
        stxpnet
        超凡大师
        编写于 最后由 编辑
        #4

        666,要是有KLD测试就更好了。

        26-08-19
        双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
        8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

        1 条回复 最后回复
        0
        • terryT 离线
          terryT 离线
          terry
          超级版主
          编写于 最后由 编辑
          #5

          挺好,prefill呢,有负面影响吗

          油管:https://www.youtube.com/@抡锤者

          BunseiB 1 条回复 最后回复
          0
          • terryT terry

            挺好,prefill呢,有负面影响吗

            BunseiB 离线
            BunseiB 离线
            Bunsei
            德高望重 劳动模范
            编写于 最后由 编辑
            #6

            @terry 说:

            挺好,prefill呢,有负面影响吗

            目前来看没有任何负面效果,当然我只测试了128kb上下文。

            1 条回复 最后回复
            0
            • BunseiB 离线
              BunseiB 离线
              Bunsei
              德高望重 劳动模范
              编写于 最后由 编辑
              #7

              这部分数据有误,经过详细比对发现,PP+DFlash2仅比PP+MTP高了5%左右的性能。 我需要进一步测试单卡下DFlash2与MTP的效果。

              1 条回复 最后回复
              0
              • starryskyknightS 离线
                starryskyknightS 离线
                starryskyknight
                德高望重
                编写于 最后由 编辑
                #8

                剛好也在等 想把 MTP 改 DFlash2 試試看 期待

                1 条回复 最后回复
                0
                • xiaopbroX 离线
                  xiaopbroX 离线
                  xiaopbro
                  编写于 最后由 编辑
                  #9

                  留个脚印,等待最终测试结果

                  1 条回复 最后回复
                  0
                  • BunseiB 离线
                    BunseiB 离线
                    Bunsei
                    德高望重 劳动模范
                    编写于 最后由 编辑
                    #10

                    @xiaopbro @starryskyknight

                    R9700 单卡Q8 KV、无 mmproj 的 DFlash2 测试

                    GPU: R9700 单卡,210W PPT 上限
                    主模型: HauhauCS-Aggressive Q6_K_P
                    配置上下文: 163840
                    主 KV: Q8_0 / Q8_0
                    草稿 KV: Q8_0 / Q8_0
                    草稿: DFlash2 Q4_K_M,n-max=4
                    mmproj: 不加载
                    parallel: 1
                    Flash Attention: on
                    
                    配置 R9700 VRAM GTT CPU offload
                    Q6_K_P + Q8 KV,无投机 28.6GB 约 8MB 无
                    Q6_K_P + Q8 KV + DFlash2 Q4 30.7GB 约 8MB 无

                    512-token A/B

                    相同 96-token 代码 Agent 提示、temperature 0、seed 123、强制生成 512 token:

                    指标 无投机 DFlash2 Q4 差异
                    Prefill 335.81 t/s 272.85 t/s 仅 96 token,绝对差 66ms
                    Decode 21.01 t/s 42.01 t/s +99.93%
                    Decode time 24.321 s 12.165 s -49.98%
                    总墙钟 24.613 s 12.523 s -49.12%
                    Draft accepted/generated — 357/615 58.05%
                    平均接受长度 — 3.32 —

                    在短输入、持续生成的工况中,DFlash2 几乎把 R9700 单卡速度翻倍,属于明确收益。

                    129K 输入后的深上下文 A/B

                    相同 129,481-token Agent 工具历史、256 输出 token、temperature 0、seed 123:

                    指标 无投机 DFlash2 Q4 差异
                    Full prefill 277.266 t/s 275.524 t/s -0.63%
                    Prefill time 466.992 s 469.944 s +2.951 s
                    Deep decode 13.814 t/s 20.538 t/s +48.68%
                    Decode time / 256 18.460 s 12.416 s -6.044 s
                    总墙钟 485.536 s 482.445 s -3.091 s / -0.64%
                    Draft accepted/generated — 176/312 56.41%
                    平均接受长度 — 3.26 —

                    单卡 MTP 与 DFlash2 Q4

                    为补齐投机算法之间的直接比较,又以完全相同的 R9700 单卡、210W、Q6_K_P、Q8 主/草稿 KV、163840 上下文、不加载 mmproj、parallel=1、temperature 0、seed 123 条件补测了模型内置 MTP(n-max=3)。每个端点前均重新启动服务,129K 工况为 cache_n=0 的完整冷输入。DFlash2 使用前述同条件 Q4_K_M、n-max=4 数据。

                    工况 MTP DFlash2 Q4 端到端结果
                    96 输入 + 512 输出,Prefill 267.432 t/s 272.850 t/s DFlash2 高 2.03%
                    96 输入 + 512 输出,Decode 38.210 t/s 42.010 t/s DFlash2 高 9.95%
                    96 输入 + 512 输出,总墙钟 13.869 s 12.523 s DFlash2 缩短 9.71%
                    129K 输入 + 256 输出,Prefill 266.561 t/s 275.524 t/s DFlash2 高 3.36%
                    129K 长度 Decode 20.962 t/s 20.538 t/s MTP 高 2.06%
                    129K 输入 + 256 输出,总墙钟 497.994 s 482.445 s DFlash2 缩短 3.12%
                    工况 路线 接受率 平均接受长度
                    96 输入 + 512 输出 MTP 59.24%(327/552) 2.78
                    96 输入 + 512 输出 DFlash2 Q4 58.05%(357/615) 3.32
                    129K 输入 + 256 输出 MTP 60.52%(164/271) 2.80
                    129K 输入 + 256 输出 DFlash2 Q4 56.41%(176/312) 3.26

                    MTP 的 token 接受率略高,但连续接受长度更短,不能只凭接受率判断端到端速度。短生成由 DFlash2 明显胜出。129K 深度 decode 则由 MTP 小胜约 2%,但 DFlash2 更快的冷 prefill 仍令整项任务缩短约 3.1%。两者的进程 VRAM 都约 30.6~30.7GB,MTP 在 129K 满载时 AMD-SMI 总显存达到约 32.26/32.62GB,只剩约 0.36GB 设备级余量。

                    1 条回复 最后回复
                    0
                    • BunseiB 离线
                      BunseiB 离线
                      Bunsei
                      德高望重 劳动模范
                      编写于 最后由 编辑
                      #11

                      双卡只支持PP,PP+DFlash2 比 PP+MTP快了5%。

                      1 条回复 最后回复
                      0
                      • E 离线
                        E 离线
                        exllm
                        德高望重
                        编写于 最后由 编辑
                        #12

                        我试了dflash, 比普通mtp更慢了

                        1 条回复 最后回复
                        0

                        你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                        厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                        有了你的建议,这篇帖子会更精彩哦 💗

                        注册 登录
                        回复
                        • 在新帖中回复
                        登录后回复
                        • 从旧到新
                        • 从新到旧
                        • 最多赞同


                        • 登录

                        • 登录或注册以进行搜索。
                        • 第一个帖子
                          最后一个帖子
                        0
                        • 版块
                        • 最新
                        • 标签
                        • 热门
                        • 用户
                        • 群组