R9700使用minimax-h3跑comfyui这个速度如何,请大家评价一下
-
从截图看:1344×768 @ 20 步,三段分别是 10.8 / 5.2 / 5.2 秒/段,总耗时 24 / 9 / 7.7 分钟。
评价:正常偏快。1344 宽度已经接近 2K 档,20 步下稳定 5.2 秒/段对 R9700 单卡来说是合理偏上的水平,画质档位也不低。第一段的 10.8 秒是冷启动——模型加载 + 首次 shader 编译,后面稳定在 5.2 才是常态,不用管第一段。
一个关键提醒:你这双卡没帮上忙。ComfyUI 的 H3 节点是单卡跑的,R9700 + 7900XTX 不会双卡合体加速,另一张卡基本在闲置。想提速别往"两张卡一起算"上想,论坛 TID:1306 实测有效的三板斧:
-
SageAttention 2.2.0:带宽瓶颈时收益明显,而且对图片生成同样有效(TID:1306 直接上到 1440p)。注意官方 PyPI 只有 1.0.6,2.2.0 在 GitHub 源码,Windows 用社区预编译轮子,需匹配 torch 版本。
-
Turbo LoRA 4-step:官方蒸馏 LoRA(fl2v_turbo_4step),采样器 euler + beta 调度 + shift 6/3,20 步能砍到 4~10 步,实测快 ~1.5 倍,画质和 10 步基线接近。
-
多任务分流:第二张卡别闲着,学 TID:1306 rock shi 的玩法——gpu0 跑 H3、gpu1 跑 zimage/图片任务,两个管线并行。
顺带一提:7900XTX 那张 24G 也能跑 H3,可以分别测一下哪张更快,但别期待双卡合并计算,H3 没有跨卡拆分路径。
-
-
从截图看:1344×768 @ 20 步,三段分别是 10.8 / 5.2 / 5.2 秒/段,总耗时 24 / 9 / 7.7 分钟。
评价:正常偏快。1344 宽度已经接近 2K 档,20 步下稳定 5.2 秒/段对 R9700 单卡来说是合理偏上的水平,画质档位也不低。第一段的 10.8 秒是冷启动——模型加载 + 首次 shader 编译,后面稳定在 5.2 才是常态,不用管第一段。
一个关键提醒:你这双卡没帮上忙。ComfyUI 的 H3 节点是单卡跑的,R9700 + 7900XTX 不会双卡合体加速,另一张卡基本在闲置。想提速别往"两张卡一起算"上想,论坛 TID:1306 实测有效的三板斧:
-
SageAttention 2.2.0:带宽瓶颈时收益明显,而且对图片生成同样有效(TID:1306 直接上到 1440p)。注意官方 PyPI 只有 1.0.6,2.2.0 在 GitHub 源码,Windows 用社区预编译轮子,需匹配 torch 版本。
-
Turbo LoRA 4-step:官方蒸馏 LoRA(fl2v_turbo_4step),采样器 euler + beta 调度 + shift 6/3,20 步能砍到 4~10 步,实测快 ~1.5 倍,画质和 10 步基线接近。
-
多任务分流:第二张卡别闲着,学 TID:1306 rock shi 的玩法——gpu0 跑 H3、gpu1 跑 zimage/图片任务,两个管线并行。
顺带一提:7900XTX 那张 24G 也能跑 H3,可以分别测一下哪张更快,但别期待双卡合并计算,H3 没有跨卡拆分路径。
-
-
这96g d5 现在得花多少钱了
-
这96g d5 现在得花多少钱了
@zhenyu-huang 3700+1000,之前买了48,最近咬牙买了48。后悔当初没买多点
-
@tmp-tmp 480p 15 秒 23 分钟——先下结论:跑 H3 的话这个速度"重但不算故障",但分两种情况,关键看你加载的是哪个权重文件:
情况一:文件对了(pruned fp8)。H3 官方 ComfyUI 推荐文件是 minimax_h3_fl2va_pruned_fp8_scaled(19.5GB),你 32G 的 R9700 基本能完整装进显存。这个前提下 480p 短片段不该到 23 分钟,偏慢,往下查步数和 CFG。
情况二:加载了大文件(更可能)。如果你下的是 int8 未剪枝(31.7G)或 bf16(61.7G),32G 装不下,ComfyUI 会把权重 offload 到系统内存。你的板子是 X99-CD3,DDR3 双通道只有 ~30GB/s,权重每步从内存倒腾,速度直接崩——23 分钟多半是这个。
自查三步:
- ComfyUI 控制台日志搜 "to RAM"/"offload",有就是权重在内存里跑;
- 模型加载节点里看文件路径和大小,确认是 pruned_fp8_scaled(19.5G)那个;
- 顺带报下步数——480p 没必要拉太高。
参照系:H3 本身是个很大的模型(比 Wan 14B 的 14.3G 重一档),站内 128G 内存机上跑官方模板高分辨率,10 步就要 20 多分钟——H3 慢是常态,别拿 Wan 的速度标准要求它。文件换对、确认没 offload 再测一次;还慢就把控制台日志截图发上来一起看。

