<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[对于AMD MI210的疑问]]></title><description><![CDATA[<p dir="auto">最近AMD的生态完善了不少，AMD MI210 有64G专业显存，跑大模型，精度和上下文都可以提升很多，或者跑ComfyUI应该也可以胜任，7900XTX能做的，它也能呀。为什么大伙没人提这个卡呢？目前18000人民币一张卡，感觉性价比还是可以的。与4090 48G相比，它是原装货，出问题的概率低，显存是HBM2带ECC校验，比4090 48G便宜7000人民币。这两张卡，如果做选择的话，哪一个合适？</p>
]]></description><link>https://lcz.me/topic/864/对于amd-mi210的疑问</link><generator>RSS for Node</generator><lastBuildDate>Sun, 26 Jul 2026 21:10:54 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/864.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 17 Jul 2026 11:54:33 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 对于AMD MI210的疑问 on Fri, 17 Jul 2026 14:25:35 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E7%BF%BB%E8%AF%91%E5%B8%AE%E5%B8%AE" aria-label="Profile: 翻译帮帮">@<bdi>翻译帮帮</bdi></a></p>
<p dir="auto">AMD的話還是慢慢等UDNA出吧, 目前基本上所有普通人會用到的都針對CUDA / RDNA 2+</p>
<p dir="auto">Wavefront 64架構支援太偏科了 (簡稱為WAVE)</p>
<p dir="auto">VEGA / GCN / CDNA 基本上都跑在WAVE64, 因爲是專門針對寬向量所以只面向高精度的科學計算進行優化 (流體力學和分子動力之類的), 專精都是FP32甚至FP64</p>
<p dir="auto">對於市面上大多東西都不能完全發揮實力, 向量運算也都沒有優化, 畢竟市面最多都是跑到FP16</p>
<p dir="auto">支援度比較好的RDNA 2 (RX 6000系列), RDNA 3 (RX 7000系列), RDNA 4 (RX 9000系列)都是跑在WAVE 32</p>
]]></description><link>https://lcz.me/post/10037</link><guid isPermaLink="true">https://lcz.me/post/10037</guid><dc:creator><![CDATA[566656661]]></dc:creator><pubDate>Fri, 17 Jul 2026 14:25:35 GMT</pubDate></item><item><title><![CDATA[Reply to 对于AMD MI210的疑问 on Fri, 17 Jul 2026 13:28:13 GMT]]></title><description><![CDATA[<p dir="auto">看来还是我浅了，没有掌握CDNA在ComfyUI大家庭中未作适配这个大坑。</p>
]]></description><link>https://lcz.me/post/10036</link><guid isPermaLink="true">https://lcz.me/post/10036</guid><dc:creator><![CDATA[翻译帮帮]]></dc:creator><pubDate>Fri, 17 Jul 2026 13:28:13 GMT</pubDate></item><item><title><![CDATA[Reply to 对于AMD MI210的疑问 on Fri, 17 Jul 2026 13:12:51 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E7%BF%BB%E8%AF%91%E5%B8%AE%E5%B8%AE" aria-label="Profile: 翻译帮帮">@<bdi>翻译帮帮</bdi></a> 我来补充一下 LLM 推理角度这两张卡的对比：</p>
<p dir="auto">先说结论：<strong>如果主要用途是 LLM 推理（跑大模型），MI210 64G 在 18K 价位确实比 4090D 48G 有竞争力。但如果兼顾 ComfyUI/图像生成，Terry 说得对，CDNA2 架构的限制很大。</strong></p>
<p dir="auto">从 LLM 推理角度具体看：</p>
<p dir="auto"><strong>MI210 的优势：</strong></p>
<ul>
<li>HBM2e 带宽 1.6 TB/s，比 4090D 的 GDDR6X（~1.0 TB/s）高 60%。这对大模型推理的生成速度是关键——同模型同参数下，MI210 的 prefill 和 decode 速度会明显更快。</li>
<li>64GB 显存能跑更大的模型或更长的上下文。比如 Qwen3.6-27B 开 256K 上下文毫无压力，甚至能跑量化后的 70B 级别模型。</li>
<li>ECC 显存校验，长时间推理任务更稳定，不会因为显存位翻转导致输出异常。</li>
<li>ROCm 6.2+ 对 gfx90a（MI210 的架构）支持已经很成熟，llama.cpp、vLLM、SGlang 都能直接用，不需要特殊魔改。</li>
</ul>
<p dir="auto"><strong>4090D 48G 的优势：</strong></p>
<ul>
<li>CUDA 生态无可替代。所有框架、自定义算子、第三方工具都是先为 CUDA 优化。</li>
<li>功耗和散热方面，4090D 是主动散热消费卡，MI210 是被动散热服务器卡，需要机箱风道或者暴力扇。</li>
<li>魔改卡虽然是非官方渠道，但 48G 这个容量对单卡跑 70B Q4 模型来说刚好够用。</li>
</ul>
<p dir="auto"><strong>我的建议：</strong><br />
如果预算 18K 且 <strong>纯做 LLM 推理服务</strong>（比如搭本地 API 给多个人用），MI210 + X99 平台（PCIe 4.0 x16）比 4090D 48G 更划算——便宜 7K，带宽更高，显存更大，稳定性更好。</p>
<p dir="auto">但如果需要 <strong>ComfyUI、视频生成、或者玩各种第三方插件</strong>，还是老老实实 4090D 48G。MI210 在图像/视频生成领域的算子优化确实像 Terry 说的那样，很多自定义节点跑不了。</p>
]]></description><link>https://lcz.me/post/10035</link><guid isPermaLink="true">https://lcz.me/post/10035</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Fri, 17 Jul 2026 13:12:51 GMT</pubDate></item><item><title><![CDATA[Reply to 对于AMD MI210的疑问 on Fri, 17 Jul 2026 13:03:36 GMT]]></title><description><![CDATA[<p dir="auto">ComfyUI、Stable Diffusion、Flux 这些民用图像模型，其底层算子的优化（比如 Xformers、Flash-Attention、Sage-Attention）完全是围绕游戏显卡（NVIDIA CUDA 或 AMD RDNA 系列）展开的。<br />
MI210 属于 CDNA 2 架构（gfx90a）。这就导致了一个很尴尬的局面：<br />
当你在 Linux 下通过 export HSA_OVERRIDE_GFX_VERSION=9.0.10（或者类似的伪装指令）强行启动 ComfyUI 时，基础的矩阵乘法确实能跑，64G 显存也确实能把超大的 Flux 甚至是视频生成模型完整塞进去。<br />
但是，一旦你引入稍微复杂一点的自定义节点（Custom Nodes），比如 ControlNet、IP-Adapter、或者各种最新的视频插帧、图生视频算子，这些第三方插件的底层代码几乎 100% 没对 CDNA2 做过编译适配。你会频繁遇到编译报错，或者直接回退到极其低效的 CPU 兼容模式去跑。</p>
<p dir="auto">LLM还不错。但它算力不如4090，跑LLM不需要64G，因为都是跑Qwen3.6 27b。老卡生态随时崩塌，没必要。市场是公平的，没有漏可捡，反而容易吃大亏。</p>
]]></description><link>https://lcz.me/post/10033</link><guid isPermaLink="true">https://lcz.me/post/10033</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Fri, 17 Jul 2026 13:03:36 GMT</pubDate></item></channel></rss>