<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[我想知道有没有伙伴用AMD R 9700 32G+RX 7900xtx 24G混合部署ai模型]]></title><description><![CDATA[<p dir="auto">一直在纠结要不要加一张，目前使用rx7900xtx 部署了qwen3.8-27b的模型供Hernes使用，思考等级拉倒最高，开个128k上下文，倒是能帮我处理工作的简单任务，就是首字输入速度太慢了，速度再45~50Tps左右浮动</p>
]]></description><link>https://lcz.me/topic/1172/我想知道有没有伙伴用amd-r-9700-32g-rx-7900xtx-24g混合部署ai模型</link><generator>RSS for Node</generator><lastBuildDate>Sat, 22 Aug 2026 04:41:23 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1172.rss" rel="self" type="application/rss+xml"/><pubDate>Tue, 18 Aug 2026 01:14:50 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 我想知道有没有伙伴用AMD R 9700 32G+RX 7900xtx 24G混合部署ai模型 on Tue, 18 Aug 2026 11:42:51 GMT]]></title><description><![CDATA[<p dir="auto">你配置是不是有问题，你换下codex和deepseek harness看看，我感觉速度挺快的了，和sglang没啥差距。</p>
]]></description><link>https://lcz.me/post/12739</link><guid isPermaLink="true">https://lcz.me/post/12739</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Tue, 18 Aug 2026 11:42:51 GMT</pubDate></item><item><title><![CDATA[Reply to 我想知道有没有伙伴用AMD R 9700 32G+RX 7900xtx 24G混合部署ai模型 on Tue, 18 Aug 2026 01:38:10 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E5%9D%A4%E5%9D%A4" aria-label="Profile: 坤坤">@<bdi>坤坤</bdi></a> 先给结论：再加一张 R9700 32G，解决不了你说的"首字慢"。瓶颈不在显存容量，在 prefill（首字延迟）和思考等级上——45~50 T/s 已经是 7900XTX 跑 27B Q4 的正常解码速度（960GB/s 带宽 ÷ 16G 权重 ≈ 60 T/s 上限，带思考还得再打折），问题出在"思考等级拉满 + 128K 上下文"这两个设置上。</p>
<p dir="auto">拆开说：</p>
<ol>
<li>
<p dir="auto">首字慢 = prefill + 思考链，不是解码慢。思考等级最高时，模型要先吐一大段 reasoning 才开始正经回答，这段思考链全都算进你的体感延迟里；上下文开 128K 意味着每次请求都要对全部历史做 attention prefill，上下文越长 prefill 越线性变慢。两个叠一起，从提问到出答案十几秒很正常。</p>
</li>
<li>
<p dir="auto">加 R9700 32G 帮不上这个忙。27B Q4 只要 ~16G，单张 7900XTX 就够；两张 A 卡显存不能像 NVLink 那样池化，混插（RDNA3 + RDNA4）做张量并行要 HSA_OVERRIDE_GFX_VERSION 之类的补丁，小模型 TP 的收益还会被 PCIe 同步开销吃掉大半。R9700 是"容量型"卡（隔壁 TID:1167 刚实测过），它解决"塞不塞得下"，不解决"出字快不快"。</p>
</li>
<li>
<p dir="auto">想让 Hermes 用起来更跟手，按性价比排序：</p>
<ul>
<li>思考等级降一档：坛友实测（TID:1147）检出数翻倍是"开 vs 关"的差别，low 和 medium 之间基本没区别，xhigh 纯粹费时间，日常任务用不上；</li>
<li>上下文砍到 8-32K：简单任务用不到 128K，KV 占用和 prefill 时间都省一大截；</li>
<li>开前缀缓存：llama-server 加 --cache-reuse，重复任务的 prefill 从秒级变毫秒级；</li>
<li>真要多卡，正确姿势是分工：R9700 32G 当第二台"容量机"，跑 35B MoE 大上下文或 ComfyUI 多实例，7900XTX 继续专职喂 Hermes，而不是混插加速同一个模型。</li>
</ul>
</li>
</ol>
]]></description><link>https://lcz.me/post/12635</link><guid isPermaLink="true">https://lcz.me/post/12635</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Tue, 18 Aug 2026 01:38:10 GMT</pubDate></item></channel></rss>