补充:R9700 单卡Q8 KV、无 mmproj 的 DFlash2 验证
刚准备睡觉发现还落了单卡的性能测试,这里补上。
GPU: R9700 单卡,210W PPT 上限
主模型: HauhauCS-Aggressive Q6_K_P
配置上下文: 163840
主 KV: Q8_0 / Q8_0
草稿 KV: Q8_0 / Q8_0
草稿: DFlash2 Q4_K_M,n-max=4
mmproj: 不加载
parallel: 1
Flash Attention: on
| 配置 | R9700 VRAM | GTT | CPU offload |
|---|---|---|---|
| Q6_K_P + Q8 KV,无投机 | 28.6GB | 约 8MB | 无 |
| Q6_K_P + Q8 KV + DFlash2 Q4 | 30.7GB | 约 8MB | 无 |
512-token A/B
相同 96-token 代码 Agent 提示、temperature 0、seed 123、强制生成 512 token:
| 指标 | 无投机 | DFlash2 Q4 | 差异 |
|---|---|---|---|
| Prefill | 335.81 t/s | 272.85 t/s | 仅 96 token,绝对差 66ms |
| Decode | 21.01 t/s | 42.01 t/s | +99.93% |
| Decode time | 24.321 s | 12.165 s | -49.98% |
| 总墙钟 | 24.613 s | 12.523 s | -49.12% |
| Draft accepted/generated | — | 357/615 | 58.05% |
| 平均接受长度 | — | 3.32 | — |
在短输入、持续生成的工况中,DFlash2 几乎把 R9700 单卡速度翻倍,属于明确收益。
129K 输入后的深上下文 A/B
相同 129,481-token Agent 工具历史、256 输出 token、temperature 0、seed 123:
| 指标 | 无投机 | DFlash2 Q4 | 差异 |
|---|---|---|---|
| Full prefill | 277.266 t/s | 275.524 t/s | -0.63% |
| Prefill time | 466.992 s | 469.944 s | +2.951 s |
| Deep decode | 13.814 t/s | 20.538 t/s | +48.68% |
| Decode time / 256 | 18.460 s | 12.416 s | -6.044 s |
| 总墙钟 | 485.536 s | 482.445 s | -3.091 s / -0.64% |
| Draft accepted/generated | — | 176/312 | 56.41% |
| 平均接受长度 | — | 3.26 | — |
单卡 MTP 与 DFlash2 Q4
为补齐投机算法之间的直接比较,又以完全相同的 R9700 单卡、210W、Q6_K_P、Q8 主/草稿 KV、163840 上下文、不加载 mmproj、parallel=1、temperature 0、seed 123 条件补测了模型内置 MTP(n-max=3)。每个端点前均重新启动服务,129K 工况为 cache_n=0 的完整冷输入。DFlash2 使用前述同条件 Q4_K_M、n-max=4 数据。
| 工况 | MTP | DFlash2 Q4 | 端到端结果 |
|---|---|---|---|
| 96 输入 + 512 输出,Prefill | 267.432 t/s | 272.850 t/s | DFlash2 高 2.03% |
| 96 输入 + 512 输出,Decode | 38.210 t/s | 42.010 t/s | DFlash2 高 9.95% |
| 96 输入 + 512 输出,总墙钟 | 13.869 s | 12.523 s | DFlash2 缩短 9.71% |
| 129K 输入 + 256 输出,Prefill | 266.561 t/s | 275.524 t/s | DFlash2 高 3.36% |
| 129K 长度 Decode | 20.962 t/s | 20.538 t/s | MTP 高 2.06% |
| 129K 输入 + 256 输出,总墙钟 | 497.994 s | 482.445 s | DFlash2 缩短 3.12% |
| 工况 | 路线 | 接受率 | 平均接受长度 |
|---|---|---|---|
| 96 输入 + 512 输出 | MTP | 59.24%(327/552) | 2.78 |
| 96 输入 + 512 输出 | DFlash2 Q4 | 58.05%(357/615) | 3.32 |
| 129K 输入 + 256 输出 | MTP | 60.52%(164/271) | 2.80 |
| 129K 输入 + 256 输出 | DFlash2 Q4 | 56.41%(176/312) | 3.26 |
MTP 的 token 接受率略高,但连续接受长度更短,不能只凭接受率判断端到端速度。短生成由 DFlash2 明显胜出。129K 深度 decode 则由 MTP 小胜约 2%,但 DFlash2 更快的冷 prefill 仍令整项任务缩短约 3.1%。两者的进程 VRAM 都约 30.6~30.7GB,MTP 在 129K 满载时 AMD-SMI 总显存达到约 32.26/32.62GB,只剩约 0.36GB 设备级余量。
最后再配合QWEN4B 模型1~4FPS采样当前摄像头中人物的神情、状态,配合音频情感分析,然后融合处理,再让9B左右的模型充当脊柱的作用进行快速决断、延续大模型的处理路线控制频率等,最后汇总的信息反馈给大模型做处理、合成播放TTS。 这也是小模型存在的意义~