5700X + B550 + Corsair RM850x
因为工作需要(主要是法律/咨询类文本分析),希望逐步把工作流本地 AI 化,所以最近开始折腾本地 LLM。
前几天也发帖请教过各位大神,未来如果升级双显卡,到底继续消费级平台还是走工作站平台。结合预算和自己的需求,最后决定还是先走 AM4/X570 路线,暂时放弃工作站平台。
最近把 RTX 3090 换成了 Radeon AI PRO R9700 Creator 32GB。
我人在海外,这边二手 3090 和全新的 R9700 价差大概只有 2000 RMB 左右(3090 二手、R9700 全新),考虑到新卡保修、32GB 显存以及长期使用,所以最后没有选择魔改卡。
当前配置
CPU:Ryzen 7 5700X
主板:B550(已买了X570为将来如需要升级铺路)
GPU:Radeon AI PRO R9700 Creator 32GB
电源:Corsair RM850x
系统:Windows 11
Backend:llama.cpp
模型:Qwen/Qwen3.6-27B 的 Q4_K_M GGUF 量化版
MTP:关闭
Context:64K
目前主要就是法律、合同、咨询类文本工作,不玩游戏,也不跑图片生成。
为了方便比较,3090 与 R9700 都限制在约 225W TBP(HWiNFO 监控)下测试。
测试结果
相同模型、相同参数、相近功耗限制下:
RTX 3090:约 24 tok/s
Radeon AI PRO R9700:约 27.6 tok/s
llama.cpp 输出:
Prompt Processing(16K Prompt):约 780 tok/s
Decode(Generation):约 27.6 tok/s
(附 llama.cpp 输出、HWiNFO、GPU 使用率截图)
目前这个结果比我预期好,至少对于我的使用场景来说,R9700 的表现让我很满意。
目前很多东西还在摸索阶段,基本原则就是先把工作流跑通,再一点一点优化。
AMD YES!
想请教各位大神几个问题
R9700 跑 Qwen3.6-27B Q4_K_M(MTP 关闭,64K Context),27.6 tok/s 大概属于什么水平?还有多少优化空间?
目前还有哪些地方值得继续优化?
llama.cpp 参数
Flash Attention
HIP/ROCm
还有哪些容易忽略的优化项?
目前工作必须使用 Windows。
未来半年到一年,如果本地 AI 工作流越来越成熟,我有考虑单独组一台 Linux AI 主机。
不知道在 llama.cpp + R9700 这个组合下,Linux 相比 Windows 是否还有比较明显的提升?
欢迎大家拍砖,也欢迎分享自己的 R9700 / 3090 测试数据,谢谢!


