<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[5700X + Radeon AI PRO R9700 32GB 简单测试，求优化建议 (换了3090)]]></title><description><![CDATA[<p dir="auto">5700X + B550 + Corsair RM850x</p>
<p dir="auto">因为工作需要（主要是法律/咨询类文本分析），希望逐步把工作流本地 AI 化，所以最近开始折腾本地 LLM。</p>
<p dir="auto">前几天也发帖请教过各位大神，未来如果升级双显卡，到底继续消费级平台还是走工作站平台。结合预算和自己的需求，最后决定还是先走 AM4/X570 路线，暂时放弃工作站平台。</p>
<p dir="auto">最近把 RTX 3090 换成了 Radeon AI PRO R9700 Creator 32GB。</p>
<p dir="auto">我人在海外，这边二手 3090 和全新的 R9700 价差大概只有 2000 RMB 左右（3090 二手、R9700 全新），考虑到新卡保修、32GB 显存以及长期使用，所以最后没有选择魔改卡。</p>
<p dir="auto">当前配置<br />
CPU：Ryzen 7 5700X<br />
主板：B550（已买了X570为将来如需要升级铺路）<br />
GPU：Radeon AI PRO R9700 Creator 32GB<br />
电源：Corsair RM850x<br />
系统：Windows 11<br />
Backend：llama.cpp<br />
模型：Qwen/Qwen3.6-27B 的 Q4_K_M GGUF 量化版<br />
MTP：关闭<br />
Context：64K</p>
<p dir="auto">目前主要就是法律、合同、咨询类文本工作，不玩游戏，也不跑图片生成。</p>
<p dir="auto">为了方便比较，3090 与 R9700 都限制在约 225W TBP（HWiNFO 监控）下测试。</p>
<p dir="auto">测试结果</p>
<p dir="auto">相同模型、相同参数、相近功耗限制下：</p>
<p dir="auto">RTX 3090：约 24 tok/s<br />
Radeon AI PRO R9700：约 27.6 tok/s</p>
<p dir="auto">llama.cpp 输出：</p>
<p dir="auto">Prompt Processing（16K Prompt）：约 780 tok/s<br />
Decode（Generation）：约 27.6 tok/s</p>
<p dir="auto">（附 llama.cpp 输出、HWiNFO、GPU 使用率截图）</p>
<p dir="auto">目前这个结果比我预期好，至少对于我的使用场景来说，R9700 的表现让我很满意。</p>
<p dir="auto">目前很多东西还在摸索阶段，基本原则就是先把工作流跑通，再一点一点优化。</p>
<p dir="auto">AMD YES！<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f604.png?v=1376b21da6c" class="not-responsive emoji emoji-android emoji--smile" style="height:23px;width:auto;vertical-align:middle" title="😄" alt="😄" /></p>
<p dir="auto">想请教各位大神几个问题<br />
R9700 跑 Qwen3.6-27B Q4_K_M（MTP 关闭，64K Context），27.6 tok/s 大概属于什么水平？还有多少优化空间？<br />
目前还有哪些地方值得继续优化？<br />
llama.cpp 参数<br />
Flash Attention<br />
HIP/ROCm<br />
还有哪些容易忽略的优化项？<br />
目前工作必须使用 Windows。</p>
<p dir="auto">未来半年到一年，如果本地 AI 工作流越来越成熟，我有考虑单独组一台 Linux AI 主机。</p>
<p dir="auto">不知道在 llama.cpp + R9700 这个组合下，Linux 相比 Windows 是否还有比较明显的提升？</p>
<p dir="auto">欢迎大家拍砖，也欢迎分享自己的 R9700 / 3090 测试数据，谢谢！<br />
<img src="https://upload.lcz.me/uploads/8ac594c7-4fdb-4182-baae-58a4c3124196.jpeg" alt="ddb4837b-d36c-46fe-bf32-a9dc8a5ddbe3-image.jpeg" class=" img-fluid img-markdown" /><br />
<img src="https://upload.lcz.me/uploads/7c1d82f8-1f4e-4097-988a-05bcaccc8616.jpeg" alt="8bf64744-a30c-4b67-b028-39ae2ae20435-image.jpeg" class=" img-fluid img-markdown" /><br />
<img src="https://upload.lcz.me/uploads/398e493d-c501-4143-8148-2c3f477d5938.jpeg" alt="11e5dc9c-12a9-405d-b1f8-46c8127e449a-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/820/5700x-radeon-ai-pro-r9700-32gb-简单测试-求优化建议-换了3090</link><generator>RSS for Node</generator><lastBuildDate>Sun, 26 Jul 2026 22:16:57 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/820.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 10 Jul 2026 09:36:08 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 5700X + Radeon AI PRO R9700 32GB 简单测试，求优化建议 (换了3090) on Fri, 10 Jul 2026 23:53:10 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/haiyun-liu" aria-label="Profile: Haiyun-LIU">@<bdi>Haiyun-LIU</bdi></a> 7900xtx会更快一点，但是AI视频R9700的大显存要重要得多。显存不够跑不动没啥用。</p>
]]></description><link>https://lcz.me/post/9678</link><guid isPermaLink="true">https://lcz.me/post/9678</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Fri, 10 Jul 2026 23:53:10 GMT</pubDate></item><item><title><![CDATA[Reply to 5700X + Radeon AI PRO R9700 32GB 简单测试，求优化建议 (换了3090) on Fri, 10 Jul 2026 21:56:00 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/jatwu" aria-label="Profile: jatwu">@<bdi>jatwu</bdi></a> <a href="/post/9657">说</a>:</p>
<p dir="auto">我用的是 R9700，跑分说实在，没 RX7900XTX 好，就是有大显存，跑 comfyui 有点拉跨，可能我没配置好<br />
<img src="https://upload.lcz.me/uploads/ab75ee2e-971d-41f3-9209-5dba5b5d0eff.png" alt="R9700_7900XTX.png" class=" img-fluid img-markdown" /></p>
</blockquote>
<p dir="auto">我爬了硬件板块帖子是有说7900XTX，目前我主要是长上下文需求大显存，我再折腾折腾看看<br />
我可能还没有碰到速度瓶颈，因为只是先要跑通场景，还在摸索阶段，性价比优先下的大显存尝试</p>
]]></description><link>https://lcz.me/post/9676</link><guid isPermaLink="true">https://lcz.me/post/9676</guid><dc:creator><![CDATA[Haiyun LIU]]></dc:creator><pubDate>Fri, 10 Jul 2026 21:56:00 GMT</pubDate></item><item><title><![CDATA[Reply to 5700X + Radeon AI PRO R9700 32GB 简单测试，求优化建议 (换了3090) on Fri, 10 Jul 2026 15:04:26 GMT]]></title><description><![CDATA[<p dir="auto">我用的是 R9700，跑分说实在，没 RX7900XTX 好，就是有大显存，跑 comfyui 有点拉跨，可能我没配置好<br />
<img src="https://upload.lcz.me/uploads/ab75ee2e-971d-41f3-9209-5dba5b5d0eff.png" alt="R9700_7900XTX.png" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/9657</link><guid isPermaLink="true">https://lcz.me/post/9657</guid><dc:creator><![CDATA[jatwu]]></dc:creator><pubDate>Fri, 10 Jul 2026 15:04:26 GMT</pubDate></item><item><title><![CDATA[Reply to 5700X + Radeon AI PRO R9700 32GB 简单测试，求优化建议 (换了3090) on Fri, 10 Jul 2026 10:16:25 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/haiyun-liu" aria-label="Profile: Haiyun-LIU">@<bdi>Haiyun-LIU</bdi></a> 测试数据很详细！R9700 在这个场景下确实比 3090 更有性价比，我来回答你的几个问题：</p>
<ol>
<li>
<p dir="auto">27.6 tok/s 对于 Qwen3.6-27B Q4_K_M 在 R9700 上是什么水平？<br />
相当不错的成绩。作为参考，3090 同样功耗下实测 24 tok/s（你也验证了），R9700 领先约 15%。考虑到 R9700 是全新卡+3年保修，这个能效比很划算。27.6 tok/s 对于法律文本分析（阅读速度约 5-10 tok/s）已经非常充裕。</p>
</li>
<li>
<p dir="auto">还有哪些优化空间？</p>
</li>
</ol>
<ul>
<li>llama.cpp 的 --no-mmap 在 Windows 上有时能提升首次加载速度</li>
<li>尝试 --flash-attn（你已经在用了），确认版本是最新的 ROCm 版 llama.cpp</li>
<li>设置 --batch-size 2048 试一下，对 prompt processing 有帮助</li>
<li>如果模型支持，开启 MTP（预测下一个 token 的辅助头）可以提升 10-20%</li>
</ul>
<ol start="3">
<li>
<p dir="auto">Linux vs Windows 差异<br />
对于 llama.cpp + ROCm，Linux 的主要优势是 ROCm 驱动更稳定、内核编译更简单。但性能差距不大（约 3-5%），Windows 上 27.6 tok/s 已经很好了。如果未来要组 Linux AI 主机，建议用 Ubuntu 24.04 + ROCm 6.3+。</p>
</li>
<li>
<p dir="auto">ROCm 额外优化<br />
确认你用的是 ROCm 6.3 或更高版本，对 RDNA4 (gfx1200/gfx1201) 有完整支持。llama.cpp 编译时加上 -DLLAMA_HIP=ON -DAMDGPU_TARGETS=gfx1201。</p>
</li>
</ol>
<p dir="auto">另外提醒一点：如果未来要跑 RAG（法律文档检索对上下文长度要求很高），64K context 下 KV Cache 会占用约 8-10GB 显存，加上模型本体（约18GB），32GB 显存刚好够用，建议在 llama.cpp 中开启 --cache-type-k q8_0 来降低 KV Cache 的显存占用。</p>
]]></description><link>https://lcz.me/post/9635</link><guid isPermaLink="true">https://lcz.me/post/9635</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Fri, 10 Jul 2026 10:16:25 GMT</pubDate></item></channel></rss>