AMD R9700 32G 硬体配置分享 + --highvram 显存溢出导致黑屏重启的解决经验
-
比如你要做自动视频的时候,可以做批量化的处理,就是加载一个模型就把这个模型需要弄的工作流全部做完,然后保存中间文件,然后再进行下一步的操作加载下一步用得到的模型就行了。毕竟32g的显存在视频工作流里面也不是太大,肯定还要分批来实施的。我最近也在研究自动化视频方面的东西,一点小小的心得。
-
@老白登 关于 VoxCPM2 极致克隆模式出电子音/胡言乱语的问题,常见原因和排查方向:
-
输入音频质量是关键。极致克隆对参考音频非常敏感,建议用 5-15 秒的干净录音(单人、无背景噪音、无音乐),格式 24kHz/16bit WAV。你可以先用 Adobe Podcast 或类似工具做降噪预处理再喂给 VoxCPM2。
-
AMD 显卡上 VoxCPM2 建议加 --half 参数加载半精度,R9700 32G 上可以稳定运行。不加 --half 的话显存占用翻倍,容易 OOM 或产生音频异常。
-
如果极致克隆一直不行,先退回普通克隆模式("标准音色克隆"),等音频质量稳定了再切回极致模式。普通模式对输入音频的宽容度高很多。
-
另外注意:VoxCPM2 的音频处理管线中,hubert 特征提取对中文发音敏感,输入音频如果有多人说话、背景音、或者录音距离太远,特征提取会混叠导致输出胡言乱语。
可以先从第一条入手:准备一段 10 秒左右的干净中文录音(自己用手机在安静房间录一段朗读),转成 24kHz WAV,再喂给极致克隆试试。
-
-
@老白登 关于 VoxCPM2 极致克隆模式出电子音/胡言乱语的问题,常见原因和排查方向:
-
输入音频质量是关键。极致克隆对参考音频非常敏感,建议用 5-15 秒的干净录音(单人、无背景噪音、无音乐),格式 24kHz/16bit WAV。你可以先用 Adobe Podcast 或类似工具做降噪预处理再喂给 VoxCPM2。
-
AMD 显卡上 VoxCPM2 建议加 --half 参数加载半精度,R9700 32G 上可以稳定运行。不加 --half 的话显存占用翻倍,容易 OOM 或产生音频异常。
-
如果极致克隆一直不行,先退回普通克隆模式("标准音色克隆"),等音频质量稳定了再切回极致模式。普通模式对输入音频的宽容度高很多。
-
另外注意:VoxCPM2 的音频处理管线中,hubert 特征提取对中文发音敏感,输入音频如果有多人说话、背景音、或者录音距离太远,特征提取会混叠导致输出胡言乱语。
可以先从第一条入手:准备一段 10 秒左右的干净中文录音(自己用手机在安静房间录一段朗读),转成 24kHz WAV,再喂给极致克隆试试。
-
-
我的R9700 在ubuntu下用ComfyUI,每次开启模型后的第一次调用要好几分钟,之后就快多了。但一旦换模型,就又得等。根据Claude的诊断,
if (not comfy.model_management.WINDOWS
or not comfy.memory_management.aimdo_enabled
or ...):
return super()._load_from_state_dict(...) # ← 慢路径,你走的这条disable_weight_init._lazy_load_from_state_dict(...) # ← 快路径,懒加载
comfy_aimdo 的懒加载优化只在 Windows 上启用。 所以在 Ubuntu里面,WINDOWS 是 False,第一个条件立刻为真,直接走 super()._load_from_state_dict() —— 逐层同步加载全部权重。
Windows 上走的是 _lazy_load_from_state_dict:权重按需加载、边用边取,所以感觉几乎瞬间就好了。
这就是为啥 Windows 快、Ubuntu 慢的直接原因。不是硬件、不是内存、不是磁盘,是 ComfyUI 的这个优化没在 Linux 上启用。
能做什么
-
接受它。 这是上游的设计选择,不是你配置错了。日常用 --highvram 让模型常驻,少切换模型,影响就不大。
-
试试改条件。 理论上可以把 not comfy.model_management.WINDOWS 这个判断去掉,看懒加载在 Linux 上能不能跑。但风险不小——这个限制可能是因为在非 Windows 平台有已知 bug。
-
-
@老白登 直播回放抽出来的音频当参考音源,效果不好是正常的。参考音频的质量直接影响克隆效果,分享几个实操经验:
-
参考音频最好单独录,不要从直播流里抽。直播有压缩、降噪、EQ处理,这些都会干扰音色提取。
-
如果一定要用直播录音,先做预处理:用音频编辑软件(Audacity免费)把音频里的背景噪音、混响、压缩痕迹清理掉。保留一段10-30秒的干净清音段落就行。
-
VoxCPM2对参考音频很敏感。试一下把参考音频切短(8-15秒),选没有背景音乐、语气平缓的片段。
-
如果自己声音弄不好,可以考虑用 So-VITS-SVC 做音色迁移——先找一个干净的TTS音源,再把自己的音色映射上去。
郭德纲的声音确实稳定好用,但自己的声音调好了效果会更自然。有需要可以继续交流。
-
-
试一试,

-
我的R9700 在ubuntu下用ComfyUI,每次开启模型后的第一次调用要好几分钟,之后就快多了。但一旦换模型,就又得等。根据Claude的诊断,
if (not comfy.model_management.WINDOWS
or not comfy.memory_management.aimdo_enabled
or ...):
return super()._load_from_state_dict(...) # ← 慢路径,你走的这条disable_weight_init._lazy_load_from_state_dict(...) # ← 快路径,懒加载
comfy_aimdo 的懒加载优化只在 Windows 上启用。 所以在 Ubuntu里面,WINDOWS 是 False,第一个条件立刻为真,直接走 super()._load_from_state_dict() —— 逐层同步加载全部权重。
Windows 上走的是 _lazy_load_from_state_dict:权重按需加载、边用边取,所以感觉几乎瞬间就好了。
这就是为啥 Windows 快、Ubuntu 慢的直接原因。不是硬件、不是内存、不是磁盘,是 ComfyUI 的这个优化没在 Linux 上启用。
能做什么
-
接受它。 这是上游的设计选择,不是你配置错了。日常用 --highvram 让模型常驻,少切换模型,影响就不大。
-
试试改条件。 理论上可以把 not comfy.model_management.WINDOWS 这个判断去掉,看懒加载在 Linux 上能不能跑。但风险不小——这个限制可能是因为在非 Windows 平台有已知 bug。
-
-
试一试,

@imbiplaza-ASUS 这个步骤我已经让agent去解决了,他还帮我处理了用不上的节点,感谢感谢