5700X + Radeon AI PRO R9700 32GB 简单测试,求优化建议 (换了3090)
-
5700X + B550 + Corsair RM850x
因为工作需要(主要是法律/咨询类文本分析),希望逐步把工作流本地 AI 化,所以最近开始折腾本地 LLM。
前几天也发帖请教过各位大神,未来如果升级双显卡,到底继续消费级平台还是走工作站平台。结合预算和自己的需求,最后决定还是先走 AM4/X570 路线,暂时放弃工作站平台。
最近把 RTX 3090 换成了 Radeon AI PRO R9700 Creator 32GB。
我人在海外,这边二手 3090 和全新的 R9700 价差大概只有 2000 RMB 左右(3090 二手、R9700 全新),考虑到新卡保修、32GB 显存以及长期使用,所以最后没有选择魔改卡。
当前配置
CPU:Ryzen 7 5700X
主板:B550(已买了X570为将来如需要升级铺路)
GPU:Radeon AI PRO R9700 Creator 32GB
电源:Corsair RM850x
系统:Windows 11
Backend:llama.cpp
模型:Qwen/Qwen3.6-27B 的 Q4_K_M GGUF 量化版
MTP:关闭
Context:64K目前主要就是法律、合同、咨询类文本工作,不玩游戏,也不跑图片生成。
为了方便比较,3090 与 R9700 都限制在约 225W TBP(HWiNFO 监控)下测试。
测试结果
相同模型、相同参数、相近功耗限制下:
RTX 3090:约 24 tok/s
Radeon AI PRO R9700:约 27.6 tok/sllama.cpp 输出:
Prompt Processing(16K Prompt):约 780 tok/s
Decode(Generation):约 27.6 tok/s(附 llama.cpp 输出、HWiNFO、GPU 使用率截图)
目前这个结果比我预期好,至少对于我的使用场景来说,R9700 的表现让我很满意。
目前很多东西还在摸索阶段,基本原则就是先把工作流跑通,再一点一点优化。
AMD YES!

想请教各位大神几个问题
R9700 跑 Qwen3.6-27B Q4_K_M(MTP 关闭,64K Context),27.6 tok/s 大概属于什么水平?还有多少优化空间?
目前还有哪些地方值得继续优化?
llama.cpp 参数
Flash Attention
HIP/ROCm
还有哪些容易忽略的优化项?
目前工作必须使用 Windows。未来半年到一年,如果本地 AI 工作流越来越成熟,我有考虑单独组一台 Linux AI 主机。
不知道在 llama.cpp + R9700 这个组合下,Linux 相比 Windows 是否还有比较明显的提升?
欢迎大家拍砖,也欢迎分享自己的 R9700 / 3090 测试数据,谢谢!



-
@Haiyun-LIU 测试数据很详细!R9700 在这个场景下确实比 3090 更有性价比,我来回答你的几个问题:
-
27.6 tok/s 对于 Qwen3.6-27B Q4_K_M 在 R9700 上是什么水平?
相当不错的成绩。作为参考,3090 同样功耗下实测 24 tok/s(你也验证了),R9700 领先约 15%。考虑到 R9700 是全新卡+3年保修,这个能效比很划算。27.6 tok/s 对于法律文本分析(阅读速度约 5-10 tok/s)已经非常充裕。 -
还有哪些优化空间?
- llama.cpp 的 --no-mmap 在 Windows 上有时能提升首次加载速度
- 尝试 --flash-attn(你已经在用了),确认版本是最新的 ROCm 版 llama.cpp
- 设置 --batch-size 2048 试一下,对 prompt processing 有帮助
- 如果模型支持,开启 MTP(预测下一个 token 的辅助头)可以提升 10-20%
-
Linux vs Windows 差异
对于 llama.cpp + ROCm,Linux 的主要优势是 ROCm 驱动更稳定、内核编译更简单。但性能差距不大(约 3-5%),Windows 上 27.6 tok/s 已经很好了。如果未来要组 Linux AI 主机,建议用 Ubuntu 24.04 + ROCm 6.3+。 -
ROCm 额外优化
确认你用的是 ROCm 6.3 或更高版本,对 RDNA4 (gfx1200/gfx1201) 有完整支持。llama.cpp 编译时加上 -DLLAMA_HIP=ON -DAMDGPU_TARGETS=gfx1201。
另外提醒一点:如果未来要跑 RAG(法律文档检索对上下文长度要求很高),64K context 下 KV Cache 会占用约 8-10GB 显存,加上模型本体(约18GB),32GB 显存刚好够用,建议在 llama.cpp 中开启 --cache-type-k q8_0 来降低 KV Cache 的显存占用。
-
-
