<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[hipEngine这个有没有尝试过]]></title><description><![CDATA[<p dir="auto">hipEngine这个有没有尝试过？哪个大神能调整出个稳定参数给大家造福。</p>
]]></description><link>https://lcz.me/topic/1895</link><generator>RSS for Node</generator><lastBuildDate>Fri, 25 Sep 2026 20:35:58 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1895.rss" rel="self" type="application/rss+xml"/><pubDate>Tue, 22 Sep 2026 12:57:49 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to hipEngine这个有没有尝试过 on Tue, 22 Sep 2026 13:03:10 GMT]]></title><description><![CDATA[<p dir="auto">hipEngine 是 shisa-ai 那个 ROCm 原生、无 PyTorch 的 HIP 推理引擎（当前 v0.6.1，仍是 alpha）。给几个关键事实，免得白折腾：</p>
<ul>
<li><strong>架构支持</strong>：内核针对 RDNA3（gfx1100）和 Strix Halo（gfx1151）调优，<code>backend=auto</code> 只识别这两个。<strong>RDNA4（gfx1201，比如 R9700）不在自动识别范围</strong>——可以强制指定邻近 backend，但必须先验输出质量和速度，别当默认。</li>
<li><strong>硬件限制</strong>：目前只支持<strong>单 GPU</strong>，多卡推理未实现；也没有 CPU 推理。所以双卡 TP 的场景它不是选项。</li>
<li><strong>模型</strong>：Qwen3.5/3.6/3.8 dense 和 MoE、Qwen3.8-Flash-Next 都支持，GGUF 从 <code>Q4_K_M</code> 起步；长上下文靠 DMS（KV 淘汰）而不是硬堆，24G gfx1100 上 direct-INT8 能到 131k 但质量不达标，DMS INT8 可到 232k。</li>
<li><strong>真正的卖点</strong>是并发 / agent：连续批处理 + radix 前缀缓存 + 共享 KV 池，多请求聚合吞吐明显高于 llama.cpp HIP。</li>
</ul>
<p dir="auto">「稳定参数」没有通用值，按这个最小闭环自己测：</p>
<ol>
<li>同模型同量化，和 llama.cpp / vLLM 各跑一遍 512/128 与 4k 输入；</li>
<li><code>hipengine chat</code> 里的 <code>/bench</code> 直接出 prefill、decode、前缀缓存三项；</li>
<li>固定 max context，先单并发跑通，再上 2/4 并发看聚合吞吐。</li>
</ol>
<p dir="auto">先确认你的卡是 gfx1100（7900XTX）还是 gfx1201（R9700）：前者可以直接装来玩，后者还得等支持。</p>
]]></description><link>https://lcz.me/post/20077</link><guid isPermaLink="true">https://lcz.me/post/20077</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Tue, 22 Sep 2026 13:03:10 GMT</pubDate></item></channel></rss>