Qwen3.8-27B DFlash2:RDNA4 双显卡 PP 与 128K 长上下文实测报告
-
剛好也在等 想把 MTP 改 DFlash2 試試看 期待
-
R9700 单卡Q8 KV、无 mmproj 的 DFlash2 测试
GPU: R9700 单卡,210W PPT 上限 主模型: HauhauCS-Aggressive Q6_K_P 配置上下文: 163840 主 KV: Q8_0 / Q8_0 草稿 KV: Q8_0 / Q8_0 草稿: DFlash2 Q4_K_M,n-max=4 mmproj: 不加载 parallel: 1 Flash Attention: on配置 R9700 VRAM GTT CPU offload Q6_K_P + Q8 KV,无投机 28.6GB 约 8MB 无 Q6_K_P + Q8 KV + DFlash2 Q4 30.7GB 约 8MB 无 512-token A/B
相同 96-token 代码 Agent 提示、temperature 0、seed 123、强制生成 512 token:
指标 无投机 DFlash2 Q4 差异 Prefill 335.81 t/s 272.85 t/s 仅 96 token,绝对差 66ms Decode 21.01 t/s 42.01 t/s +99.93% Decode time 24.321 s 12.165 s -49.98% 总墙钟 24.613 s 12.523 s -49.12% Draft accepted/generated — 357/615 58.05% 平均接受长度 — 3.32 — 在短输入、持续生成的工况中,DFlash2 几乎把 R9700 单卡速度翻倍,属于明确收益。
129K 输入后的深上下文 A/B
相同 129,481-token Agent 工具历史、256 输出 token、temperature 0、seed 123:
指标 无投机 DFlash2 Q4 差异 Full prefill 277.266 t/s 275.524 t/s -0.63% Prefill time 466.992 s 469.944 s +2.951 s Deep decode 13.814 t/s 20.538 t/s +48.68% Decode time / 256 18.460 s 12.416 s -6.044 s 总墙钟 485.536 s 482.445 s -3.091 s / -0.64% Draft accepted/generated — 176/312 56.41% 平均接受长度 — 3.26 — 单卡 MTP 与 DFlash2 Q4
为补齐投机算法之间的直接比较,又以完全相同的 R9700 单卡、210W、Q6_K_P、Q8 主/草稿 KV、163840 上下文、不加载 mmproj、
parallel=1、temperature 0、seed 123 条件补测了模型内置 MTP(n-max=3)。每个端点前均重新启动服务,129K 工况为cache_n=0的完整冷输入。DFlash2 使用前述同条件 Q4_K_M、n-max=4数据。工况 MTP DFlash2 Q4 端到端结果 96 输入 + 512 输出,Prefill 267.432 t/s 272.850 t/s DFlash2 高 2.03% 96 输入 + 512 输出,Decode 38.210 t/s 42.010 t/s DFlash2 高 9.95% 96 输入 + 512 输出,总墙钟 13.869 s 12.523 s DFlash2 缩短 9.71% 129K 输入 + 256 输出,Prefill 266.561 t/s 275.524 t/s DFlash2 高 3.36% 129K 长度 Decode 20.962 t/s 20.538 t/s MTP 高 2.06% 129K 输入 + 256 输出,总墙钟 497.994 s 482.445 s DFlash2 缩短 3.12% 工况 路线 接受率 平均接受长度 96 输入 + 512 输出 MTP 59.24%(327/552) 2.78 96 输入 + 512 输出 DFlash2 Q4 58.05%(357/615) 3.32 129K 输入 + 256 输出 MTP 60.52%(164/271) 2.80 129K 输入 + 256 输出 DFlash2 Q4 56.41%(176/312) 3.26 MTP 的 token 接受率略高,但连续接受长度更短,不能只凭接受率判断端到端速度。短生成由 DFlash2 明显胜出。129K 深度 decode 则由 MTP 小胜约 2%,但 DFlash2 更快的冷 prefill 仍令整项任务缩短约 3.1%。两者的进程 VRAM 都约 30.6~30.7GB,MTP 在 129K 满载时 AMD-SMI 总显存达到约 32.26/32.62GB,只剩约 0.36GB 设备级余量。