跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. Qwen3.8-27B DFlash2:RDNA4 双显卡 PP 与 128K 长上下文实测报告

Qwen3.8-27B DFlash2:RDNA4 双显卡 PP 与 128K 长上下文实测报告

已定时 已固定 已锁定 已移动 LLM讨论区
qwen-27bdflashamd
12 帖子 6 发布者 606 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • BunseiB 离线
    BunseiB 离线
    Bunsei
    德高望重 劳动模范
    编写于 最后由 编辑
    #3
    此主題已被删除!
    1 条回复 最后回复
    0
    • stxpnetS 离线
      stxpnetS 离线
      stxpnet
      超凡大师
      编写于 最后由 编辑
      #4

      666,要是有KLD测试就更好了。

      26-08-19
      双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
      8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

      1 条回复 最后回复
      0
      • terryT 离线
        terryT 离线
        terry
        超级版主
        编写于 最后由 编辑
        #5

        挺好,prefill呢,有负面影响吗

        油管:https://www.youtube.com/@抡锤者

        BunseiB 1 条回复 最后回复
        0
        • terryT terry

          挺好,prefill呢,有负面影响吗

          BunseiB 离线
          BunseiB 离线
          Bunsei
          德高望重 劳动模范
          编写于 最后由 编辑
          #6

          @terry 说:

          挺好,prefill呢,有负面影响吗

          目前来看没有任何负面效果,当然我只测试了128kb上下文。

          1 条回复 最后回复
          0
          • BunseiB 离线
            BunseiB 离线
            Bunsei
            德高望重 劳动模范
            编写于 最后由 编辑
            #7

            这部分数据有误,经过详细比对发现,PP+DFlash2仅比PP+MTP高了5%左右的性能。 我需要进一步测试单卡下DFlash2与MTP的效果。

            1 条回复 最后回复
            0
            • starryskyknightS 离线
              starryskyknightS 离线
              starryskyknight
              德高望重
              编写于 最后由 编辑
              #8

              剛好也在等 想把 MTP 改 DFlash2 試試看 期待

              1 条回复 最后回复
              0
              • xiaopbroX 离线
                xiaopbroX 离线
                xiaopbro
                编写于 最后由 编辑
                #9

                留个脚印,等待最终测试结果

                1 条回复 最后回复
                0
                • BunseiB 离线
                  BunseiB 离线
                  Bunsei
                  德高望重 劳动模范
                  编写于 最后由 编辑
                  #10

                  @xiaopbro @starryskyknight

                  R9700 单卡Q8 KV、无 mmproj 的 DFlash2 测试

                  GPU: R9700 单卡,210W PPT 上限
                  主模型: HauhauCS-Aggressive Q6_K_P
                  配置上下文: 163840
                  主 KV: Q8_0 / Q8_0
                  草稿 KV: Q8_0 / Q8_0
                  草稿: DFlash2 Q4_K_M,n-max=4
                  mmproj: 不加载
                  parallel: 1
                  Flash Attention: on
                  
                  配置 R9700 VRAM GTT CPU offload
                  Q6_K_P + Q8 KV,无投机 28.6GB 约 8MB 无
                  Q6_K_P + Q8 KV + DFlash2 Q4 30.7GB 约 8MB 无

                  512-token A/B

                  相同 96-token 代码 Agent 提示、temperature 0、seed 123、强制生成 512 token:

                  指标 无投机 DFlash2 Q4 差异
                  Prefill 335.81 t/s 272.85 t/s 仅 96 token,绝对差 66ms
                  Decode 21.01 t/s 42.01 t/s +99.93%
                  Decode time 24.321 s 12.165 s -49.98%
                  总墙钟 24.613 s 12.523 s -49.12%
                  Draft accepted/generated — 357/615 58.05%
                  平均接受长度 — 3.32 —

                  在短输入、持续生成的工况中,DFlash2 几乎把 R9700 单卡速度翻倍,属于明确收益。

                  129K 输入后的深上下文 A/B

                  相同 129,481-token Agent 工具历史、256 输出 token、temperature 0、seed 123:

                  指标 无投机 DFlash2 Q4 差异
                  Full prefill 277.266 t/s 275.524 t/s -0.63%
                  Prefill time 466.992 s 469.944 s +2.951 s
                  Deep decode 13.814 t/s 20.538 t/s +48.68%
                  Decode time / 256 18.460 s 12.416 s -6.044 s
                  总墙钟 485.536 s 482.445 s -3.091 s / -0.64%
                  Draft accepted/generated — 176/312 56.41%
                  平均接受长度 — 3.26 —

                  单卡 MTP 与 DFlash2 Q4

                  为补齐投机算法之间的直接比较,又以完全相同的 R9700 单卡、210W、Q6_K_P、Q8 主/草稿 KV、163840 上下文、不加载 mmproj、parallel=1、temperature 0、seed 123 条件补测了模型内置 MTP(n-max=3)。每个端点前均重新启动服务,129K 工况为 cache_n=0 的完整冷输入。DFlash2 使用前述同条件 Q4_K_M、n-max=4 数据。

                  工况 MTP DFlash2 Q4 端到端结果
                  96 输入 + 512 输出,Prefill 267.432 t/s 272.850 t/s DFlash2 高 2.03%
                  96 输入 + 512 输出,Decode 38.210 t/s 42.010 t/s DFlash2 高 9.95%
                  96 输入 + 512 输出,总墙钟 13.869 s 12.523 s DFlash2 缩短 9.71%
                  129K 输入 + 256 输出,Prefill 266.561 t/s 275.524 t/s DFlash2 高 3.36%
                  129K 长度 Decode 20.962 t/s 20.538 t/s MTP 高 2.06%
                  129K 输入 + 256 输出,总墙钟 497.994 s 482.445 s DFlash2 缩短 3.12%
                  工况 路线 接受率 平均接受长度
                  96 输入 + 512 输出 MTP 59.24%(327/552) 2.78
                  96 输入 + 512 输出 DFlash2 Q4 58.05%(357/615) 3.32
                  129K 输入 + 256 输出 MTP 60.52%(164/271) 2.80
                  129K 输入 + 256 输出 DFlash2 Q4 56.41%(176/312) 3.26

                  MTP 的 token 接受率略高,但连续接受长度更短,不能只凭接受率判断端到端速度。短生成由 DFlash2 明显胜出。129K 深度 decode 则由 MTP 小胜约 2%,但 DFlash2 更快的冷 prefill 仍令整项任务缩短约 3.1%。两者的进程 VRAM 都约 30.6~30.7GB,MTP 在 129K 满载时 AMD-SMI 总显存达到约 32.26/32.62GB,只剩约 0.36GB 设备级余量。

                  1 条回复 最后回复
                  0
                  • BunseiB 离线
                    BunseiB 离线
                    Bunsei
                    德高望重 劳动模范
                    编写于 最后由 编辑
                    #11

                    双卡只支持PP,PP+DFlash2 比 PP+MTP快了5%。

                    1 条回复 最后回复
                    0
                    • E 离线
                      E 离线
                      exllm
                      德高望重
                      编写于 最后由 编辑
                      #12

                      我试了dflash, 比普通mtp更慢了

                      1 条回复 最后回复
                      0

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组