AMD R 9700 32G到货了。一顿操作。整成无头算力卡了。经实测这卡更适合工作在X99主板。家用老机器升级慎重考虑。
-
先上配置
部件 型号/规格
CPU Intel i7-4790K(LGA1150,4核8线程)
主板 技嘉 Z97-HD3(Z97芯片组,PCIe 3.0)
内存 32GB DDR3
显卡 AMD R9700 32G
硬盘 1TB 固态
电源 振华 1000W

兼容性问题。和我配置相近的就不要折腾了。不细讲。
故障原因:主板太老了。bios 和经过加工的 X99 系列差距太大。没有任何设置锁定 PCIe 3.0显卡接口的能力。官方说的 PCIe 5.0 向下兼容的要点是 1.锁定显卡接口频率。2.bios 识别大显存。3.vbios 能和主板显示接口握手。
简要方案描述:GitHub 找个老版本的 主板bios 编辑器。下载一个最新的bios文件(2015年的)。用编辑器读取bios. 扔给在线 AI。改几个地方。1.锁定显卡接口频率。2.bios 识别大显存。就这俩能改。Vbios需要购买工具。放弃。测试:能识别 9700了。只能作为算力卡使用。无法显示输出。

-
,
T terry 固定了此主题
-
这个卡也很吵
我还需要锻炼下自己。另一台还在吃灰。它更吵。
-
视频生产上浪不起来的。它的大显存并没有任何加成。就是多几秒的输出而已。
-
视频生产上浪不起来的。它的大显存并没有任何加成。就是多几秒的输出而已。
-
这卡不能上SGLang,极度麻烦不说还不稳定,不要问我怎么知道,说多了都是泪。vllm有现成docker镜像这个配置最简单但版本偏旧,也可以用VENV弄,这样vllm版本会新一点,已经可以上qwen3.8了,正在使用,但是感觉比3.6慢了好多,写写无审查代码找bug挺牛的,但不建议用来驱动hermes慢得吐血,hermes还是上deepseek v4flash吧
-
回一下 kos or 的问题,顺带把机制讲清楚:R9700 32G 视频生成"浪不起来"是对的,但原因不是卡烂,是视频生成压根不吃显存容量。
单条 720P 7 秒视频,扩散过程的中间张量加 KV cache 也就 10G 上下,24G 和 32G 跑同一条视频速度完全一样——每帧耗时由算力加带宽决定,显存只决定"塞不塞得下"。32G 的真实价值在三个地方:
- 多实例并行:32G 能同时开 2-3 个 ComfyUI 实例各跑各的(比如一个跑文生视频、一个跑图生视频),24G 只能开 1-2 个,吞吐直接翻倍;
- 大上下文 LLM:长文档、长对话这类 KV cache 大户,32G 能跑别人跑不了的上下文长度;
- 长视频/高分辨率:一条 1080P 30 秒的视频中间张量会明显变大,这时候 32G 才开始有存在感。
所以"中规中矩、普普但 VRAM 够用"这个评价基本准确——它是张"容量型"卡,不是"速度型"卡。买它赚的是多开和长上下文,不是单条视频的生成速度。
-
回一下 kos or 的问题,顺带把机制讲清楚:R9700 32G 视频生成"浪不起来"是对的,但原因不是卡烂,是视频生成压根不吃显存容量。
单条 720P 7 秒视频,扩散过程的中间张量加 KV cache 也就 10G 上下,24G 和 32G 跑同一条视频速度完全一样——每帧耗时由算力加带宽决定,显存只决定"塞不塞得下"。32G 的真实价值在三个地方:
- 多实例并行:32G 能同时开 2-3 个 ComfyUI 实例各跑各的(比如一个跑文生视频、一个跑图生视频),24G 只能开 1-2 个,吞吐直接翻倍;
- 大上下文 LLM:长文档、长对话这类 KV cache 大户,32G 能跑别人跑不了的上下文长度;
- 长视频/高分辨率:一条 1080P 30 秒的视频中间张量会明显变大,这时候 32G 才开始有存在感。
所以"中规中矩、普普但 VRAM 够用"这个评价基本准确——它是张"容量型"卡,不是"速度型"卡。买它赚的是多开和长上下文,不是单条视频的生成速度。
-
同时跑,而且本来就是这么设计的——每个 ComfyUI 实例是独立的 Python 进程,各自向驱动申请自己的显存,互不等待。
具体机制:
-
显存按"槽位"分配:32G 卡上,每个实例启动时吃掉模型 + 工作区所需的那部分显存(比如 LTX / 小模型 8-12G),剩下的空槽给第二个、第三个实例。只要各实例占用之和 ≤ 32G,就是真并发。
-
计算是分时的:GPU 算力被几个实例轮着用,单条视频的生成耗时不会变快(甚至略慢),但吞吐直接翻倍——2-3 个实例同时各跑各的,单位时间产出的视频数 ×2-3。这就是 32G 比 24G 多出来的真实价值(多实例并行)。
-
什么时候会变成"排队":某实例的模型太大、剩余显存装不下时,ComfyUI 不是排队,而是直接 OOM 报错。比如 H3 33B 一个实例就要 ~25G,32G 卡只能跑 1 个,这时候再开第二个必炸。
-
实操提示:实例间不共享显存副本,同一个模型每个实例各持一份(权重文件共用磁盘,显存不共用);ComfyUI 可以加 --disable-cuda-malloc 启动参数,让显存及时归还,多实例切换更稳。
简单记:显存够 → 同时跑;显存不够 → 不是排队,是 OOM。按模型大小分配实例数就行。
-
-
先上配置
部件 型号/规格
CPU Intel i7-4790K(LGA1150,4核8线程)
主板 技嘉 Z97-HD3(Z97芯片组,PCIe 3.0)
内存 32GB DDR3
显卡 AMD R9700 32G
硬盘 1TB 固态
电源 振华 1000W

兼容性问题。和我配置相近的就不要折腾了。不细讲。
故障原因:主板太老了。bios 和经过加工的 X99 系列差距太大。没有任何设置锁定 PCIe 3.0显卡接口的能力。官方说的 PCIe 5.0 向下兼容的要点是 1.锁定显卡接口频率。2.bios 识别大显存。3.vbios 能和主板显示接口握手。
简要方案描述:GitHub 找个老版本的 主板bios 编辑器。下载一个最新的bios文件(2015年的)。用编辑器读取bios. 扔给在线 AI。改几个地方。1.锁定显卡接口频率。2.bios 识别大显存。就这俩能改。Vbios需要购买工具。放弃。测试:能识别 9700了。只能作为算力卡使用。无法显示输出。

@williamlouis
请问华南金牌X99-CD4的板U洋垃圾与这张A卡兼容吗? -
@williamlouis
请问华南金牌X99-CD4的板U洋垃圾与这张A卡兼容吗?@joker_chang 你首先和客服沟通好。不支持可以退货就完事了。
理论上 X99 主板都有我需要手动编辑的这个两个选项 -
视频生产上浪不起来的。它的大显存并没有任何加成
R9700 32G 的視頻生產效率不佳嗎?
這卡是不是屬於中規中矩的卡 不多也不少的哪種 就都普普 但VRAM夠用 ?@kos-or 性能没有 7900XTX 强。唯一升级它就是 32G 显存。24G 受够了。我做的旧程序 扔 R9700 就都能直接开跑。
如果视频生成 还是7900XTX 在性能和价格上占优。并且它没什么噪音。
视频生成一样是模型加载到显存中开始工作。鉴于24G和32G之间模型的大小差距不大。其实出片画质差距不大。
但是7900XTX 加载速度更快。在流水线工作制度下。加载快的一方能出更多的片。
如果用过NV后。你就发现 AMD的生态还是欠缺很多。用了 pro 5000 就完全不想回 AMD 生态了。
反倒是其他项目 R9700 是个好的方向。它更适合 每日任务类的开发。
7900XTX 在自动重新加载的机制下依旧 OOM。测试浪费大量时间。它的显存24G限制了继续在我这服役的机会。 -
@kos-or 性能没有 7900XTX 强。唯一升级它就是 32G 显存。24G 受够了。我做的旧程序 扔 R9700 就都能直接开跑。
如果视频生成 还是7900XTX 在性能和价格上占优。并且它没什么噪音。
视频生成一样是模型加载到显存中开始工作。鉴于24G和32G之间模型的大小差距不大。其实出片画质差距不大。
但是7900XTX 加载速度更快。在流水线工作制度下。加载快的一方能出更多的片。
如果用过NV后。你就发现 AMD的生态还是欠缺很多。用了 pro 5000 就完全不想回 AMD 生态了。
反倒是其他项目 R9700 是个好的方向。它更适合 每日任务类的开发。
7900XTX 在自动重新加载的机制下依旧 OOM。测试浪费大量时间。它的显存24G限制了继续在我这服役的机会。

