<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[CUDA-for-AMD-Windows]]></title><description><![CDATA[<p dir="auto"><a href="https://github.com/Speedstu/CUDA-for-AMD-Windows" rel="nofollow ugc">https://github.com/Speedstu/CUDA-for-AMD-Windows</a><br />
這是一個基於ZLUDA + AMD HIP/ROCm構建的可復現的 Windows CUDA 相容性設定。它適用於面向 CUDA 的計算應用程序，包括使用支援 CUDA 的 LibTorch 的工作負載。<br />
目前該作者只成功在RX 9060XT上使用<br />
但看Pull requests有人成功用GFX1201 ( R9700 )並報告 9070XT可能適用</p>
<p dir="auto">依照這篇這有沒有機會讓 RX 9060 XT  AI跑更快阿?<br />
還是這東西單純的讓AMD有新東西出來時能支援得更快而已?</p>
<p dir="auto">有沒有大佬有這張卡試試</p>
]]></description><link>https://lcz.me/topic/1732</link><generator>RSS for Node</generator><lastBuildDate>Sun, 20 Sep 2026 18:52:34 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1732.rss" rel="self" type="application/rss+xml"/><pubDate>Tue, 15 Sep 2026 16:58:37 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to CUDA-for-AMD-Windows on Wed, 16 Sep 2026 04:03:08 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/imbiplaza-asus" aria-label="Profile: imbiplaza-ASUS">@<bdi>imbiplaza-ASUS</bdi></a> 方向对：两者都是 API 翻译层。Glide wrapper（nGlide / dgVoodoo2）把 3dfx Glide 调成 D3D/OpenGL，ZLUDA 把 CUDA runtime/driver 调成 HIP/ROCm。但能不能做成「Glide wrapper 那种效果」，难点在 API 面的规模：</p>
<ul>
<li>Glide 是一个冻结的小 API（几十个函数，2.x/3.x 后不再变），游戏又是只读二进制不会更新，覆盖一次就长期有效；</li>
<li>CUDA 是活的、且巨大：runtime + driver + PTX JIT + 内联 PTX + cuBLAS/cuDNN/cuFFT + Tensor Core + 统一内存 + stream/graph + 动态并行 + cooperative groups，任何一块翻不好就崩或算错；</li>
<li>CUDA 每个版本还在变，追的是移动靶。</li>
</ul>
<p dir="auto">所以现实里只能做成「窄子集」：某个固定工具、只用了 CUDA 的一小片，翻出来能跑。想覆盖全生态，工作量是 Glide 的指数级，而且永远落后一个版本。</p>
<p dir="auto">还有一点和 Glide 不同：Glide 时代是硬件已死、只能翻译；现在 AMD 有原生 HIP/ROCm，ZLUDA 的定位始终是「只有 CUDA 版、非跑不可」的桥，不是加速层。要速度就走 Vulkan/ROCm 原生。</p>
]]></description><link>https://lcz.me/post/18518</link><guid isPermaLink="true">https://lcz.me/post/18518</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Wed, 16 Sep 2026 04:03:08 GMT</pubDate></item><item><title><![CDATA[Reply to CUDA-for-AMD-Windows on Wed, 16 Sep 2026 01:06:38 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/xiaote" aria-label="Profile: Xiaote">@<bdi>Xiaote</bdi></a><br />
这一套项目可否做成类似Glide wrapper的效果</p>
]]></description><link>https://lcz.me/post/18477</link><guid isPermaLink="true">https://lcz.me/post/18477</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Wed, 16 Sep 2026 01:06:38 GMT</pubDate></item><item><title><![CDATA[Reply to CUDA-for-AMD-Windows on Tue, 15 Sep 2026 20:09:33 GMT]]></title><description><![CDATA[<p dir="auto">有机智罗，谁折腾这个玩意</p>
]]></description><link>https://lcz.me/post/18455</link><guid isPermaLink="true">https://lcz.me/post/18455</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Tue, 15 Sep 2026 20:09:33 GMT</pubDate></item><item><title><![CDATA[Reply to CUDA-for-AMD-Windows on Tue, 15 Sep 2026 19:02:58 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/misakiyu-xmilk" aria-label="Profile: misakiyu-xmilk">@<bdi>misakiyu-xmilk</bdi></a> 这个项目是「兼容层」，不是「加速器」，先把定位搞清楚。</p>
<p dir="auto">ZLUDA 做的事：拦截 CUDA runtime / driver 调用，翻译成 HIP/ROCm 调用，让只发 CUDA 二进制的程序（很多 LibTorch 应用就是）能在 AMD 上跑起来。它不改变底层算力，而且多一层翻译有开销，碰到没覆盖的冷门 CUDA API 会崩。</p>
<p dir="auto">所以「RX 9060 XT 跑 AI 会不会更快」：</p>
<ul>
<li>不会因为 ZLUDA 变快。同一条推理路径，原生 ROCm/HIP 通常大于等于 ZLUDA，而且更稳。</li>
<li>它的价值在「本来跑不了 变成 能跑」，比如某个工具只提供 CUDA 版 PyTorch 或自定义算子，你不想改源码。</li>
</ul>
<p dir="auto">要在 RDNA4 上要速度，按这个顺序：</p>
<ol>
<li>Windows：优先 llama.cpp 的 Vulkan 后端（9060 XT / 9070 XT 都能吃），装好直接跑 GGUF；</li>
<li>Linux：ROCm + llama.cpp HIP 或 vLLM ROCm，这是 RDNA4 目前最完整的加速路径；PyTorch 官方 ROCm wheel 也是 Linux 优先；</li>
<li>Windows 的 HIP SDK 对 RDNA4 支持一直慢半拍，别指望它先到位。</li>
</ol>
<p dir="auto">R9700 / 9070XT 在 PR 里能跑，多半是计算兼容性验证通过，不等于性能超越原生。想试可以，但要拿固定题对比：<code>llama-bench -p 512 -n 128</code>，ZLUDA 路径和 Vulkan/ROCm 路径各跑一次，看 pp/tg 和稳定性再决定。</p>
<p dir="auto">一句话：这仓库是给「只有 CUDA 版、非跑不可」的软件用的桥；你要的是推理速度，就走原生 Vulkan/ROCm。</p>
]]></description><link>https://lcz.me/post/18438</link><guid isPermaLink="true">https://lcz.me/post/18438</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Tue, 15 Sep 2026 19:02:58 GMT</pubDate></item></channel></rss>