amd 音频生成问题,现在主流的音频整合包都是cuda生态。
-
@mei li 关于AMD显卡跑音频生成,我补充一下:
VoxCPM是支持AMD的(我就是用AMD + Linux跑的),它底层用的是PyTorch,只要ROCm环境配好就能跑。higgsttsv3也是PyTorch生态,理论上AMD也支持。
关键是操作系统:
- Linux + ROCm:voxcpm和大部分TTS都能跑,速度跟N卡差距不大
- Windows + RX 7xxx系列:AMD这边能跑但兼容性差很多(HIP SDK、DirectML都欠优化)
- 纯CPU推理:确实慢,不推荐
所以你不需要另外买N卡。如果现在用的是Windows,装个双系统Ubuntu(或WSL2带ROCm),在Linux下跑音频生成就行。我这边7900 XTX + ROCm 6.2跑voxcpm体验是OK的。
另外音频生成对显存要求不高(8-12G足够),关键是大模型+音频同时跑才需要24G+。你如果主要做音频,现有的A卡完全够用。
-
@mei-li
不豪拉,3080ti是我当年12000买的,挖了一年多矿,都回本有余了
现在卖又卖不了多少钱,也就3000块,不如拿来打打辅助,毕竟自己知根知底,比买一张3080/20g要好。
大部分都是双7900xtx满-然后闲置-3080ti满,目前还没用上三卡同时满载的场景
因为在我的原始规划中,3080ti就是打辅助的
不过日后可能会引入79xt生视频-3080ti同步进行插帧/升频 的操作,而非现在的流水管线
在我现在的工作流中引入了双79生图-3080ti审图-QA失败的打回给79重新生的管线
在这个阶段能近似跑满3卡(前提是要有这么多图要改)
不过对于目前我的管线来说,qa只是质检,防止NSFW,以及某些六指狂魔之类的工作。
然后就是跑跑
voxcpm进行tts生成 ACE-step进行BGM生成 插帧升频等辅助操作而已。主力还是2张79xtx -
@mei-li
不豪拉,3080ti是我当年12000买的,挖了一年多矿,都回本有余了
现在卖又卖不了多少钱,也就3000块,不如拿来打打辅助,毕竟自己知根知底,比买一张3080/20g要好。
大部分都是双7900xtx满-然后闲置-3080ti满,目前还没用上三卡同时满载的场景
因为在我的原始规划中,3080ti就是打辅助的
不过日后可能会引入79xt生视频-3080ti同步进行插帧/升频 的操作,而非现在的流水管线
在我现在的工作流中引入了双79生图-3080ti审图-QA失败的打回给79重新生的管线
在这个阶段能近似跑满3卡(前提是要有这么多图要改)
不过对于目前我的管线来说,qa只是质检,防止NSFW,以及某些六指狂魔之类的工作。
然后就是跑跑
voxcpm进行tts生成 ACE-step进行BGM生成 插帧升频等辅助操作而已。主力还是2张79xtx -
@mei-li
不豪拉,3080ti是我当年12000买的,挖了一年多矿,都回本有余了
现在卖又卖不了多少钱,也就3000块,不如拿来打打辅助,毕竟自己知根知底,比买一张3080/20g要好。
大部分都是双7900xtx满-然后闲置-3080ti满,目前还没用上三卡同时满载的场景
因为在我的原始规划中,3080ti就是打辅助的
不过日后可能会引入79xt生视频-3080ti同步进行插帧/升频 的操作,而非现在的流水管线
在我现在的工作流中引入了双79生图-3080ti审图-QA失败的打回给79重新生的管线
在这个阶段能近似跑满3卡(前提是要有这么多图要改)
不过对于目前我的管线来说,qa只是质检,防止NSFW,以及某些六指狂魔之类的工作。
然后就是跑跑
voxcpm进行tts生成 ACE-step进行BGM生成 插帧升频等辅助操作而已。主力还是2张79xtx -
@abaalei 请教一下,是怎么样利用3080进行QA的,之前我跟其他人讨论过这个东西,就是使用本地的一个识图模型对这个视频进行抓图。你们都实现了这个视频生产的自动化了吗。貌似就是老特这个他的数字人频道自动化的程度会高一点。如果说固定的背景,固定的人物,只是说说的内容不一样,就是语音不一样,然后对口型就可以了,这样的场景的话,其实自动化的程度就会高一点吧。
-
@mei-li

音频我是用之前论坛里面的大佬推荐的这个软件,玩起来感觉足够应付我的需求了,暂时也没想着去扩充其他插件了。能把管线跑起来,爬到开启盈利是我第一阶段的目标了

不过这个软件确实好像是CUDA专用的,当时也是想着玩玩,没想到现在在管线中也能派上用场

所以多折腾还是有好处的,折腾浪费的时间、金钱,都会成为你身上的技术力之一 -
@mei-li https://github.com/fspecii/ace-step-ui 好像是这个,你去看看能不能帮到你



