跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

Fery ChenF

Fery Chen

@Fery Chen
德高望重
取消关注 关注
关于
帖子
21
主题
3
分享
0
群组
1
粉丝
0
关注
2

帖子

最新 最佳 有争议的

  • DeepSeek V4涨价3倍后还值得用吗?实测V4 Pro长链开发、DeepSeek Harness、Hermes与Codex成本对比!
    Fery ChenF Fery Chen

    @terry 默认1080的码率,你的视频应该没有我测试那个4k视频高吧?我看4k是有点卡……但是1080p不至于……

    1b902daa-4b17-43f6-bf40-77fedb137726-image.jpeg

    62f5a4c9-9f05-4638-9354-87b9f615084c-image.jpeg

    28e659cf-9423-4d3b-bafd-039cbec98713-image.jpeg

    LLM讨论区 dsharness deepseek codex hermes

  • 7900xtx涨价了已经没性价比,双3080 20G怎么样?
    Fery ChenF Fery Chen

    @老周 如果只是学习,没想好干嘛,就性价比为主:5060 Ti 16G, 生态齐全,价格不算贵,该有的都有。B站很多工作流,甚至支持8G的,16G是常态。

    甚至看看有没有3090魔改……

    我自用就7900XTX, 用着还行,满足需求了。

    AI硬件 7900xtx rtx3080

  • [7900XTX] Minimax H3视频生成速度测试报告
    Fery ChenF Fery Chen

    1. 实测参数与时间

    我的工作流没有用任何的加速节点,直接选择10步采用就感觉很快了。用其他加速节点估计是没有匹配Linux或者ROCm的版本,采样后都是花屏。我的机器直出10s太勉强,用5s还是舒适一些。或者是低分辨率换其他方式超分放大。有兴趣的人可以进一步研究。

    对我来说目前是够用了。我主要用来做游戏的512x512 , 2s的角色动画,用来抽帧, 平均90s一个小视频,批量抽卡也很快。

    时长 分辨率 采样步数 耗时
    5s 288x576 10 138.93s
    10s 288x576 10 196.60s
    5s 1024x588 10 335.71s
    10s 1024x588 10 778.87s

    ** 我把我本机的配置环境,全量显示出来,如果有看不懂的,拿去喂AI就好了 =.= **

    2. 概览

    项目 内容
    主机名 ferychen7900XTX
    操作系统 CachyOS(Arch Linux 系)
    内核 Linux 7.1.8-1-cachyos(x86_64, PREEMPT_DYNAMIC)
    主板 ASUS TUF GAMING B760M-PLUS D4
    CPU Intel Core i5-13490F(13 代 Raptor Lake)
    内存 38 GiB(另有 51 GiB 交换分区)
    GPU AMD Radeon RX 7900 XTX(Navi 31 / gfx1100,24 GiB 显存)
    计算栈 ROCm 7.14 + PyTorch 2.11.0+rocm7.14.0
    Python 环境 Python 3.12.13

    3. 操作系统与内核

    • 发行版:CachyOS(ID=cachyos, ID_LIKE=arch),滚动更新
    • 内核:7.1.8-1-cachyos(CachyOS 定制内核,含性能调度优化)
    • 桌面 / 显示服务器:Hyprland(Wayland,UWSM 启动)
    • 登录管理器:greetd + noctalia-greeter

    4. 硬件配置

    4.1 CPU

    项目 规格
    型号 13th Gen Intel Core i5-13490F
    核心 / 线程 10 核 16 线程(6P + 4E)
    频率 基准 ~2.5 GHz,最大睿频 4.8 GHz
    缓存 L3 24 MiB,L2 9.5 MiB
    虚拟化 VT-x 支持

    4.2 内存

    项目 规格
    物理内存 38 GiB(DDR4)
    交换 51 GiB

    4.3 GPU(AI 推理主力)

    项目 规格
    型号 AMD Radeon RX 7900 XTX
    核心 Navi 31(gfx1100, RDNA 3)
    显存 24 GiB GDDR6(实际 25.7 GB,rocm-smi 读数)
    功耗上限 303 W

    5. GPU 计算栈(ROCm)

    • ROCm 版本:7.14(随 PyTorch wheel 绑定);rocm-smi-lib 7.8.0
    • 内核模块:amdgpu、amdkfd 已加载
    • 检测命令:rocm-smi(可查看温度、功耗、显存占用)
    • 常见坑位备注:pt-2.12(rocm7.14) 花屏 → 清 ~/.triton/cache + ~/.cache/comgr 即恢复

    6. Python 虚拟环境(pt-2.11-r714)

    • Python:3.12.13
    • 用途:ComfyUI 宿主环境,本地运行 MiniMax H3 视频生成工作流(含 Ref2VA 全参考视频模式)
    • 包总量:约 188 个

    6.1 核心包版本

    包 版本
    torch 2.11.0+rocm7.14.0
    torchvision 0.26.0+rocm7.14.0
    torchaudio 2.11.0+rocm7.14.0
    transformers 5.14.1
    diffusers 0.27.2
    safetensors 0.8.0
    numpy 2.4.4
    pillow 12.2.0
    sentencepiece 0.2.2
    modelscope 1.39.0
    huggingface_hub 1.27.0
    torchsde 0.2.6

    6.2 ComfyUI 相关

    • comfyui_frontend_package 1.48.7
    • comfyui-manager 4.2.2
    • comfyui_workflow_templates 0.11.41(及配套 media 模板包)

    6.3 PyTorch 运行时验证结果

    torch:      2.11.0+rocm7.14.0
    hip:        7.14.60850
    cuda avail: True(走 HIP 后端)
    device:     AMD Radeon RX 7900 XTX
    

    4e573c77-e6fe-421f-b044-27df4eaa0c5b-image.jpeg

    AI音视频画图 7900xtx minimax 视频生成

  • 求助,现在怎样提升啊
    Fery ChenF Fery Chen

    @186168 说:

    本地跑comfyui,minimaxH3,hermes本地部署

    你想好你要做啥没…?你这几个漫无目的的思路,不适合加大投资,建议还是看完老特的视频,想想自己到底要做啥

    AI硬件

  • 7900xtx涨价了已经没性价比,双3080 20G怎么样?
    Fery ChenF Fery Chen

    @老周 说这个没意义。解决问题才是关键。

    AI硬件 7900xtx rtx3080

  • DeepSeek V4涨价3倍后还值得用吗?实测V4 Pro长链开发、DeepSeek Harness、Hermes与Codex成本对比!
    Fery ChenF Fery Chen

    @Bunsei 复制,在这个编辑器粘贴。就可以了啊……

    LLM讨论区 dsharness deepseek codex hermes

  • 7900xtx涨价了已经没性价比,双3080 20G怎么样?
    Fery ChenF Fery Chen

    7900xtx是6100京东入手的。入手后就听到又涨起来了。
    @老周 AMD在Linux下的确很折腾,要各种调试。要省心,就换N卡吧。一个16g显存的N卡,在ComfyUI的内存调度下都可以出长视频,生态好,省心。A卡很容易动不动就ROCm调度异常,对Linux的内核/驱动/环境都要斟酌一下。

    还有就是,你还是要明确自己的卡用来搞什么……要完整生产力,无脑去N卡,最快变现。留在A卡就是看性价比+部分满足自己生产所需……

    AI硬件 7900xtx rtx3080

  • DeepSeek V4涨价3倍后还值得用吗?实测V4 Pro长链开发、DeepSeek Harness、Hermes与Codex成本对比!
    Fery ChenF Fery Chen

    老特,你最近几个视频的清晰度和偏色是不是压缩的时候损耗太大了?虽然可以只听声音不看画面,但这样的视频偏色,系统也会判断为“不清晰视频”的吧?你可以放大图片看看,有很明显的色条/色斑/噪点……就是观感真的不太好。

    9eb47506-e269-408e-bb5c-f2e07332bcec-image.jpeg

    15c05fe5-88c1-48ce-ad32-efeca2cee981-image.jpeg

    LLM讨论区 dsharness deepseek codex hermes

  • Deepseek这波涨得狠,还是之前太便宜?
    Fery ChenF Fery Chen

    @williamlouis 继续用flash, 偶尔切一下pro, 做Hermes基本是够用而且不贵的。

    因为对比Kimi K3……真的便宜太多了……我的199套餐,8月3日开,用work跑几个任务, 8月5日毙了……

    编程继续用GLM 5.2, 目前真的能打,后面5.3也快出来了,够支撑下半年的了。

    如果真没什么特殊需求,用API比本地好多了…………😊

    LLM讨论区 deepseek

  • Deepseek这波涨得狠,还是之前太便宜?
    Fery ChenF Fery Chen

    flash的价格空闲时是原来的2.5倍……大家17号之后可以测测看看效果如何 ……对不对的起这个价格。

    新价格将于北京时间 2026 年 8 月 17 日 00:00 开始生效,具体如下:

    e7d99b2e-d082-4699-be35-b0ea48e1d6aa-image.jpeg

    LLM讨论区 deepseek

  • DeepSeek V4 Flash爆火,调用量破纪录,但是梁文锋谈话泄露华为芯片短期内供货不足,V5训练还得仰仗英伟达算力集群,会被CUDA生态锁死吗?
    Fery ChenF Fery Chen

    @terry Deepseek算力紧张,今日预告要涨价了。不知道多少而已……

    随便聊聊 huawei deepseek nvidia

  • MiniMax H3 FP8版本 4090 48G实测,效果惊艳,语义理解远好于传统模型Wan LTX等,但是速度有点慢!
    Fery ChenF Fery Chen

    @magician6677 模型推荐优先找Modelscope(国内)的, 速度很快的。比hf-mirror.com都快。如果在国内就走他俩下。

    AI音视频画图 minimax rtx4090 视频生成

  • 【交作业】7900 XTX + ROCm + ComfyUI 调优小结
    Fery ChenF Fery Chen

    @exe127 有人在做int4模型,用这种应该可以好一些。现在也有不少人在开始做有损加速,但是还是再等等吧……我在等有64G内存的人测试一下……

    AI音视频画图 7900xtx rocm comfyui

  • 【交作业】7900 XTX + ROCm + ComfyUI 调优小结
    Fery ChenF Fery Chen

    @Miraco 在Windows或者虚拟机内,用机智罗的起动器,解压他的整合包。具体解压哪个你自己去看他的视频。解压后,有用的就几样内容:

    1. 工作流(JSON)
    2. custom_node(节点)
    3. 模型

    拷贝到Linux内,你让 Hermes等Agent, 帮你把节点迁移进去,模型放进去,它自己会搞。你让它迁移工作流的时候,跟它说,让它把windows的字符格式转linux的,例如Windows路径用"", Linux用"/", 它自己会搞。

    搞完你叫它跑一个测试流程就知道了。不难

    AI音视频画图 7900xtx rocm comfyui

  • 【交作业】7900 XTX + ROCm + ComfyUI 调优小结
    Fery ChenF Fery Chen

    @terry 惊艳,可以看看下面的对比:
    f4ba25d6-a8d6-4111-b7dd-8eaf936b1e6c-image.jpeg

    另外,我发现B站刘悦也有更新这个工作流了。都赶着来了

    AI音视频画图 7900xtx rocm comfyui

  • 【交作业】7900 XTX + ROCm + ComfyUI 调优小结
    Fery ChenF Fery Chen

    @terry 老特你有64G内存吧?你试试跑跑看。升级ComfyUI到最新版本,有官方的实例工作流。支持int8模型,可以跑试试。就是慢。我文生图跑通了,速度还可以。

    但是图生视频,我的内存不够,A卡调度老是出问题,容易爆。B站很多人都出视频介绍了。我关注萝卜的,他的工作流也挺有意思。

    AI音视频画图 7900xtx rocm comfyui

  • 【交作业】7900 XTX + ROCm + ComfyUI 调优小结
    Fery ChenF Fery Chen

    minimax-h3文生图.png

    A卡可以玩一下Minimax H3 的文生视频, 但是因为ROCm的动态内存调度不理想,所以很慢……

    minimax-h3-参考生图-失败.png

    我测试图生视频(参考生视频),因为我内存不够,ROCm的内存交换太渣,卡了好久,不想等下去了……

    希望有好的配置的人试试。

    感觉这玩意的效果还是挺好的。

    AI音视频画图 7900xtx rocm comfyui

  • 【交作业】7900 XTX + ROCm + ComfyUI 调优小结
    Fery ChenF Fery Chen

    @exe127 我找到了一条8g的ddr4..怼上去多了一丝丝的余量……其实还是最少48G比较好

    AI音视频画图 7900xtx rocm comfyui

  • 【交作业】7900 XTX + ROCm + ComfyUI 调优小结
    Fery ChenF Fery Chen

    RX 7900 XTX + ROCm 跑 LTX-2.3 视频折腾全记录(附能跑通的配置)

    折腾了差不多一周,从花屏、黑图、卡死、OOM 杀桌面一路趟过来,终于让 LTX-2.3 在 A 卡上稳定出片了。把踩的坑和最终配方写下来,希望帮同样在 ROCm 上挣扎的朋友少走点弯路。

    我的配置

    项 配置
    GPU AMD Radeon RX 7900 XTX(24GB,gfx1100/RDNA3)
    驱动/计算栈 ROCm 7.2.4
    PyTorch 2.11.0+rocm7.2(关键,下面说)
    系统 CachyOS(Arch 系),btrfs
    CPU/内存 i5-13490F / 32GB 内存
    ComfyUI v0.29.0 + 几个本地补丁
    工作流 LTX-2.3 22B AV(首尾帧视频、图生视频,GGUF Q4_K_M)

    一、先说结论(太长不看版)

    稳定组合 = LTS 内核 + PyTorch 2.11 + 下面那套启动参数。 记住这三样,剩下的都是细节。

    • 内核:用 LTS(别用最新的 7.x)。
    • PyTorch:用 2.11(别用 2.12)。
    • TunableOp:关掉(花屏元凶,暂时我这里是……)。
    • 注意力:用 --use-pytorch-cross-attention,别开 flash。
    • 第一次跑会崩,当暖机,再跑一次就稳。

    二、内核选择:一定要 LTS

    这是最先踩的坑。最新的 7.x 内核(CachyOS 滚的)在重 ROCm 负载下,amdgpu 驱动会触发:

    Memory access fault by GPU node-1 ... Reason: Page not present or supervisor privilege.
    Fatal Python error: Aborted
    

    直接 SIGABRT 退出。看内核日志就是一堆 [gfxhub] page fault。切到 LTS 内核(cachyos-lts)这个崩法就消失了。 所以开机 GRUB 永远选 LTS,别手贱升最新。

    怎么判断是不是这个坑:崩之前日志里如果有 Memory access fault ... Page not present,基本就是新内核 amdgpu 的锅,换 LTS。


    三、ComfyUI 升级 + 打补丁

    直接 git pull 升到 v0.29.0 就行。但有几个坑上游还没修,得自己打本地补丁(补丁我存在仓库的 scripts/ 下,提交进了 git,pull 后重新 git apply 即可)。

    补丁 1:pin_memory 预算修复(对应 GitHub #14525 / issue #13730)

    症状:加载大模型时卡死在 Requested to load LTXAV,一动不动。
    原因:AMD 上 pinned memory(锁页内存)会被无限注册直到把主机内存撑爆。上游 #14525 加了预算检查但至今没合并,#13730 那个 issue 还开着。
    修法:本地把 comfy/model_management.py 的 pin_memory() 改成先检查预算:

    # 改之前(裸调用,会卡死):
    ensure_pin_registerable(size)
    # 改之后(检查预算,失败就回退到普通内存):
    if not ensure_pin_budget(size) or not ensure_pin_registerable(size):
        return False
    

    补丁 2:SaveVideo 音频 NaN 修复(对应 #13192 / #14617)

    症状:视频采样完了,最后存盘时报 avcodec_send_frame() returned 22(EINVAL),视频存不出来。
    原因:音频波形里有 NaN/±Inf,ffmpeg 的 AAC 编码器直接拒绝。
    修法:在 video_types.py 存盘前 np.nan_to_num 清洗 + try/except 兜底(音频实在编不了就存无声视频)。

    这两个补丁上游都还没合,所以每次 git pull 升级 ComfyUI 都要重新打一遍,否则老问题又回来。


    四、启动参数调优(最核心的一段)

    这部分我反复调了好几天,直接给结论。下面这套是我实测能跑通的:

    # 环境变量
    export TORCH_BLAS_PREFER_HIPBLASLT=1
    export COMFYUI_ENABLE_MIOPEN=1
    export MIOPEN_FIND_MODE=FAST
    export PYTORCH_CUDA_ALLOC_CONF="expandable_segments:True,garbage_collection_threshold:0.7,max_split_size_mb:512"
    export HSA_ENABLE_SDMA=0
    # ⚠️ 切勿开启 PYTORCH_TUNABLEOP_ENABLED,会花屏!
    
    python main.py \
      --use-pytorch-cross-attention \
      --disable-async-offload \
      --disable-dynamic-vram \
      --cache-none \
      --reserve-vram 4.0 \
      --enable-cors-header --preview-method auto --port 8188
    

    每个 flag 为什么这么选

    参数 为什么
    --use-pytorch-cross-attention ROCm 原生 SDPA,稳定。flash 和 quad 都试过,不稳(见第五节)。
    --disable-dynamic-vram 必须留! 关掉它才走 lowvram 逐层流式,22B 模型才塞得进 24G 显存。去掉会卡死。
    --disable-async-offload 显存策略配套,留着。
    --reserve-vram 4.0 单卡带显示,给桌面留点显存,不然 VRAM 峰值一来直接杀桌面。(其实实测,只要RAM内存太小,还是会杀桌面,峰值来了,不稳定)
    --cache-none 排查期最干净,每次重算。
    不开 --disable-smart-memory 让 smart memory 开着,文本编码器(Gemma)用完会自动释放,腾内存给后面的大模型加载。(0.29更新后,似乎有用了)
    不开 --disable-pinned-memory 让 pinning 开着,CPU↔GPU 搬运快(配合上面的 #14525 补丁已经安全)。

    ⚠️ PYTORCH_TUNABLEOP_ENABLED 千万别开!它会自动挑"最快"的核但不校验正确性,在 gfx1100 上挑到错核 → 全局花屏/黑图(连最简单的 SD1.5 文生图都崩)。这是花屏的真正元凶,我追了半天。


    五、Flash Attention vs PyTorch Attention

    这俩我都测试过,但是效果没多大感觉和区别:

    • Flash Attention(--use-flash-attention):我编译装了 flash_attn 2.8.4(ROCm/Triton 后端),这个稳定性存疑,要多测试。
    • PyTorch Cross Attention(--use-pytorch-cross-attention):ROCm 原生 SDPA,稳,画质无损。就用这个。
    • SageAttention:这个版本太低了,不活跃,不如用原生的。

    一句话:A 卡上老老实实用 --use-pytorch-cross-attention,速度够,稳定性最好。


    六、显存内存峰值:24G, 内存32G,卡的天花板(这是最无奈的部分)

    我用监控实测过,LTX-2.3 的 AV(音视频)工作流在"采样后合成"那一瞬间,显存峰值能冲到 23.82G / 24G——只剩 ~180MB 余量。这就是一切不稳定的总根源:

    • 单卡同时干显示 + 计算,桌面合成器、鼠标、浏览器都要吃显存;
    • 那 180MB 够不够显示用 → 全凭运气:有时候够(出片成功),有时候差一点(OOM 杀桌面 / GPU fault / 花屏)。
    • --reserve-vram 4.0 在这个峰值点也没完全守住,ComfyUI 照样冲到 23.82G。

    ** 最佳还是用64GB内存,32GB内存要生成视频,一定要控制视频的块以及视频的分辨率,长度,不然卡在内存里面,就跟死了没两样 **

    怎么把成功率拉到最高(但拉不到 100%)

    1. 跑之前关掉所有吃显存的程序:GPU 加速的终端(Kitty/Alacritty 那种)、开了硬件加速的浏览器都关,换成软渲染终端 + 轻浏览器。腾出来的显存就是你的活路。
    2. 第一次跑当暖机:刚启动 ComfyUI 的第一次跑基本会崩(冷加载 ~45G 模型 + 核 JIT 编译 + 内存碎片,把峰值顶穿)。崩了别管,直接再跑一次——第 2 次起模型进了缓存(ComfyUI 缓存 + 系统页缓存),复用、稳定出片。这是我的标准操作了。
    3. 崩过之后重启电脑清干净状态,别在脏环境上硬重试。
    4. 有一点估计是我看不仔细,就是很多人的7900XTX, 不跑桌面任务,单纯用来跑视频的。所以也就是很多人用SSH到另一台机器跑的缘故,可以节约1GB的显存 ————》机智罗的工作环境,他本地内存64GB, 而且他是Windows内,用核显跑桌面,显卡是专用跑AI的!

    老实讲:一个峰值 23.82G 的工作流在 24G 单卡(还带显示)上,天生就是走钢丝。想 100% 稳,要么降峰值(分辨率/帧数/AI 模型),要么换更大显存的卡。在我这套硬件上,能跑通,但不是每次都通——这是物理上限,不是参数没调好。


    七、关于 swap / zram(顺手提一下)

    32G 内存跑 ~45G 模型,必然要 swap。我把 swap 调成了:

    • zram 16G(优先级 100):压缩内存,速度快,优先用;
    • 磁盘 swap 32G(优先级 10):兜底。

    注意 zram 别开太大(我一开始开 31G 反而吃光内存),16G(约内存的一半)是甜点。btrfs 上的 swap 文件要用 btrfs filesystem mkswapfile 建(普通 fallocate 会被 swapon 拒绝,EINVAL)。

    我推翻了我原来认为ZRAM的问题。因为说到底,是我没设置好。而且机器内存真的不够。

    还有就是:ComfyUI对Linux的Swap真的不会去调用的。Windows内可以开虚拟显存,在Linux内我还在找办法。


    八、PyTorch 版本:为什么是 2.11

    我测了 2.11 / 2.12 / 2.13 三个版本:

    版本 表现
    2.11 ✅ 稳,能完整跑通(就这个)
    2.12 ❌ 卡在 LTXAV 加载,过不去
    2.13 没充分验证,不敢用

    所以锁定 2.11。我的三个 venv 是 venv(2.13) / pt-2.12 / pt-2.11,启动器里永远选 pt-2.11。


    九、几个"吓人但不是坏事"的现象

    • 首次启动第一张图黑:ROCm 内核 JIT 冷启动,第二张就正常。无害。
    • 跑完任务后屏幕花屏闪烁:基本是崩过之后 amdgpu 的脏状态残留,重启就好。判别:重启后消失 = 没事;BIOS 界面也花 = 才需要担心硬件。我查过内核日志,那些 fault 都是 ComfyUI 进程的权限错误(软件问题),GPU reset 次数为 0,硬件没坏。
    • 换工作流报 VideoVAE has no attribute ...:大概率是 VAE 模型选错了(我就犯过),检查一下加载的 VAE 文件对不对。

    十、为什么 N 卡 8G 能跑,我这 24G A 卡这么费劲?

    不是 8G > 24G。是 ComfyUI 那套"显存不够就从内存流式喂"的机制,在 CUDA 上又快又顺,在 ROCm 上又慢又糙。N 卡的锁页内存和 CPU↔GPU 传输很快,GPU 一直被喂饱;A 卡这条传输路径慢一截,GPU 经常饿着(利用率掉到 3%、卡住)。再加上 ROCm 生态对 ComfyUI 这种动态搬权重的场景成熟度不如 CUDA,坑就多。

    但结局不差:24G 显存比 8G 大,配对了之后能常驻的权重更多,理论上比 8G N 卡还快——只是路更颠。A 卡性价比是实打实的,没买错。


    附:我的完整启动脚本片段

    #!/bin/bash
    # ROCm 环境变量
    export TORCH_BLAS_PREFER_HIPBLASLT=1
    export COMFYUI_ENABLE_MIOPEN=1
    export MIOPEN_FIND_MODE=FAST
    export MIOPEN_USER_DB_PATH="$HOME/.cache/miopen"
    export PYTORCH_CUDA_ALLOC_CONF="expandable_segments:True,garbage_collection_threshold:0.7,max_split_size_mb:512"
    export HSA_ENABLE_SDMA=0
    # PYTORCH_TUNABLEOP_ENABLED 不设(=关)
    
    python main.py \
      --use-pytorch-cross-attention \
      --disable-async-offload \
      --disable-dynamic-vram \
      --cache-none \
      --reserve-vram 4.0 \
      --disable-api-nodes \
      --enable-cors-header \
      --preview-method auto \
      --port 8188
    

    TL;DR

    1. LTS 内核 + PyTorch 2.11 是稳定基线,别用最新的。
    2. #14525 和 SaveVideo 两个补丁自己打,上游没合。
    3. TunableOp 关掉,用 pytorch-cross-attention,否则花屏。
    4. --disable-dynamic-vram 必须留(lowvram 流式),smart memory 留开(自动释放)。
    5. 峰值 23.82G 是天花板,第一次跑当暖机,关掉别的吃显存程序,崩了重启再来。
    6. A 卡跑 ComfyUI 路是颠,但能跑通,性价比还是香的。
    7. A 卡出一个大视频,低内存就别想了,还是老老实实做脚本,一段一段来吧。

    最后,未来在继续尝试折腾看看。过阵子看看内存,上64G试试咸淡……

    有问题欢迎在帖子里交流,我能帮的都答。祝大家的 7900 XTX 都能稳定出片 🎬


    附带B站黑鹤001的工作流,我用这个测试的:
    3d4c5dc4-4d54-47cf-b982-1c964dbf7e5f-image.jpeg
    ▶▶LTX23-首尾帧视频(双图).json

    ——————————————————————————
    以下是机智罗的Wan2.1工作流测试图生视频。但是不知道为啥一次比一次慢
    机智罗wan工作流冷.png
    机智罗wan-越来越慢.png

    ——————————————————
    以下是内存爆满卡死的情况:
    内存爆满崩坏.png

    AI音视频画图 7900xtx rocm comfyui

  • 记录一下机智罗107/108-LTX2.3初级进阶-图生视频-GGUF 工作流的标准时间,以供坛友们参考
    Fery ChenF Fery Chen

    @abaalei 你有测试过机智罗最新的数字人无限时长工作流吗?搞不懂他上面的gemma-3-12b-it-heretic-v2_fp8_e4m3fn.safetensors , 还有 ltx-2.3-22b-distilled-1.1_transformer_only_fp8_scaled.safetensors 是怎么加载进去的。我这边一跑就 OOM了……还在琢磨中……

    AI音视频画图 ltx 机智罗
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组