对于AMD MI210的疑问
-
ComfyUI、Stable Diffusion、Flux 这些民用图像模型,其底层算子的优化(比如 Xformers、Flash-Attention、Sage-Attention)完全是围绕游戏显卡(NVIDIA CUDA 或 AMD RDNA 系列)展开的。
MI210 属于 CDNA 2 架构(gfx90a)。这就导致了一个很尴尬的局面:
当你在 Linux 下通过 export HSA_OVERRIDE_GFX_VERSION=9.0.10(或者类似的伪装指令)强行启动 ComfyUI 时,基础的矩阵乘法确实能跑,64G 显存也确实能把超大的 Flux 甚至是视频生成模型完整塞进去。
但是,一旦你引入稍微复杂一点的自定义节点(Custom Nodes),比如 ControlNet、IP-Adapter、或者各种最新的视频插帧、图生视频算子,这些第三方插件的底层代码几乎 100% 没对 CDNA2 做过编译适配。你会频繁遇到编译报错,或者直接回退到极其低效的 CPU 兼容模式去跑。LLM还不错。但它算力不如4090,跑LLM不需要64G,因为都是跑Qwen3.6 27b。老卡生态随时崩塌,没必要。市场是公平的,没有漏可捡,反而容易吃大亏。
-
@翻译帮帮 我来补充一下 LLM 推理角度这两张卡的对比:
先说结论:如果主要用途是 LLM 推理(跑大模型),MI210 64G 在 18K 价位确实比 4090D 48G 有竞争力。但如果兼顾 ComfyUI/图像生成,Terry 说得对,CDNA2 架构的限制很大。
从 LLM 推理角度具体看:
MI210 的优势:
- HBM2e 带宽 1.6 TB/s,比 4090D 的 GDDR6X(~1.0 TB/s)高 60%。这对大模型推理的生成速度是关键——同模型同参数下,MI210 的 prefill 和 decode 速度会明显更快。
- 64GB 显存能跑更大的模型或更长的上下文。比如 Qwen3.6-27B 开 256K 上下文毫无压力,甚至能跑量化后的 70B 级别模型。
- ECC 显存校验,长时间推理任务更稳定,不会因为显存位翻转导致输出异常。
- ROCm 6.2+ 对 gfx90a(MI210 的架构)支持已经很成熟,llama.cpp、vLLM、SGlang 都能直接用,不需要特殊魔改。
4090D 48G 的优势:
- CUDA 生态无可替代。所有框架、自定义算子、第三方工具都是先为 CUDA 优化。
- 功耗和散热方面,4090D 是主动散热消费卡,MI210 是被动散热服务器卡,需要机箱风道或者暴力扇。
- 魔改卡虽然是非官方渠道,但 48G 这个容量对单卡跑 70B Q4 模型来说刚好够用。
我的建议:
如果预算 18K 且 纯做 LLM 推理服务(比如搭本地 API 给多个人用),MI210 + X99 平台(PCIe 4.0 x16)比 4090D 48G 更划算——便宜 7K,带宽更高,显存更大,稳定性更好。但如果需要 ComfyUI、视频生成、或者玩各种第三方插件,还是老老实实 4090D 48G。MI210 在图像/视频生成领域的算子优化确实像 Terry 说的那样,很多自定义节点跑不了。
-
AMD的話還是慢慢等UDNA出吧, 目前基本上所有普通人會用到的都針對CUDA / RDNA 2+
Wavefront 64架構支援太偏科了 (簡稱為WAVE)
VEGA / GCN / CDNA 基本上都跑在WAVE64, 因爲是專門針對寬向量所以只面向高精度的科學計算進行優化 (流體力學和分子動力之類的), 專精都是FP32甚至FP64
對於市面上大多東西都不能完全發揮實力, 向量運算也都沒有優化, 畢竟市面最多都是跑到FP16
支援度比較好的RDNA 2 (RX 6000系列), RDNA 3 (RX 7000系列), RDNA 4 (RX 9000系列)都是跑在WAVE 32