求助:RX7900XTX WIN11系统下想跑唱歌对口型
-
对口型报错先分清两类,再动手就顺了:
1. 节点错误(最常见)——工作流拖进去报红色 missing node:InfiniteTalk 的 ComfyUI 工作流依赖一批自定义节点,最核心是 Kijai 的 WanVideoWrapper(必须最新版,旧版没有 InfiniteTalk 的入口)。解法:装 ComfyUI-Manager,点 "Install Missing Custom Nodes" 把工作流引用的节点一键补齐,重启 ComfyUI 再试。
2. 模型错误——Load 节点报找不到模型/加载失败:InfiniteTalk 是"音频→对口型视频"管线,除了 Wan 2.1/2.2 的 S2V 主模型,还有它自己的对口型/表情权重和音频编码器,一份工作流里十几个模型引用,每个都必须按 Loader 里写的文件名精确放进 models/ 对应目录(checkpoints/unet/vae/audio)。哪个 Loader 报错就是缺哪个,文件名一个字符都不能差。
3. 显存够不够:24G 够跑。Wan 主模型用 fp8_e4m3fn 量化,约 56GB 压到 14GB,24G 卡能跑;batch size 先给 2(有余量再往上加),分辨率先 480p——720p 对显存和时长都很吃。
4. 最关键的一步——AMD 在 Windows 上的坑:官方 PyTorch ROCm 只有 Linux 版,Windows 下 7900XTX 跑 ComfyUI 视频工作流只有三条路:
- DirectML 版:最省事但慢,而且不少节点/算子不支持——你现在"一大堆模型和节点错误"大概率就是它,很多内核报错是后端不兼容,不是你的操作问题;
- ZLUDA:非官方、版本敏感,视频类工作流经常半路崩;
- WSL2 + ROCm(正路):WSL2 里装 Ubuntu + ROCm + ComfyUI,7900XTX 跑 Wan/H3 系是成熟路线,论坛 TID:1410 就是 7900XTX 跑同类 ComfyUI 视频工作流的完整记录,可以照着抄。
给新手的落地建议:先别自己拼工作流,B 站/CSDN 有 InfiniteTalk 一键整合包(带 WebUI,Q4/Q8 两档按显存选),能少踩一半坑——但注意整合包默认是 N 卡 CUDA 向,AMD 要先确认说明里明确写了支持;如果只是要"唱歌对口型"这个结果,同类的 EchoMimic V2(阿里系、支持唱歌、ComfyUI 生态更成熟)也值得一试。
最后:把 ComfyUI 控制台里第一条完整报错(红色那段)贴出来,可以帮你精准定位到底是缺节点还是缺模型。
-
成品的模型很多。你这是安装没装好。找个安装教程好好看看即可。