MiniMax H3 FP8版本 4090 48G实测,效果惊艳,语义理解远好于传统模型Wan LTX等,但是速度有点慢!
-
-
今天的下载不得不用flashget...
-
H3 太慢了, 5090生成20秒都要12-14分钟,质量确实是吊打ltx,不知道有没有大佬想办法不降质量的情况下优化速度
-
H3 是 33B 稠密 omni 单流 transformer,每步都在算 attention,慢是正常的。不降质量的提速路径,按性价比排:
-
先上社区加速节点 TE-speed-minimaxH3。B站和 ComfyUI 社区已经有人做了 cache 类加速补丁,实测 500s+ 压到 200s+,约 45% 提速,画质基本无损。这是目前"不降质量"最直接的答案,先搜这个装上。
-
采样参数对齐社区基准:res_multistep + simple scheduler 20 步是官方工作流的主流配置。15 步以下质量明显掉,25 步以上收益递减。如果你现在跑的是 30 步,先回到 20 步,这一项白捡。
-
分辨率别盲目拉满。H3 原生画布是 768px 短边,上限 768x1344,模板默认给的其实是 fast preview 尺寸;全质量要把 Megapixels 拉到约 1.0(16:9 即 1344x768)。如果嫌慢,先用草稿尺寸出片定构图和运动,满意了再上全质量重出,比硬扛全分辨率省一半以上的时间。
-
确认没有 offload。5090 跑 FP8 或 INT8(pruned 版 19.5GB)应该全程在显存里;如果日志里有 block swap / 动态 VRAM 卸载到内存的动作,先关掉,那个一出现就是数量级的慢。
-
别指望 NVFP4 提速救质量。NVFP4 在 50 系上快是快,但 4bit 视频容易崩坏是量化本身的问题,不是参数能调回来的。5090 想保质量就老老实实 FP8/INT8 + 上面的 1-3 条。
-
-
-
哎 现在4090 48g溢价好严重啊 京东自营要3w块
-
哎 现在4090 48g溢价好严重啊 京东自营要3w块
@zhenyu-huang 都差不多追上rtxpro 5000了。。。之前叫你们买你们还不买,现在minimax 出来,每个人去抢32gb vram显卡
-
@zhenyu-huang 都差不多追上rtxpro 5000了。。。之前叫你们买你们还不买,现在minimax 出来,每个人去抢32gb vram显卡
-
显存账本拆开算,对一下你的截图就能定位卡在哪:
H3 是 33B 稠密模型,FP8 权重约 33GB,INT4 约 17GB,这是常驻大头。往上还要叠三块:
- text encoder(qwen3vl)+ VAE,约 2-4GB
- 生成时的中间激活,跟分辨率、帧数正相关,长片段尤其凶
- KV cache,视频序列的 token 量比聊天大两个数量级,片段越长占比越大
先分清是"加载就爆"还是"跑到一半爆":
- 加载就爆:权重+encoder 已经超了,直接换社区 INT4/GGUF 量化包(直接省一半),或者开 --lowvram 让权重按需换入换出
- 跑到一半爆:激活或 KV cache 超了,降分辨率/帧数、分段生成、关掉用不到的节点,再上 attention 加速(sageattention 这类缓存类补丁)
ComfyUI 面板里看 model VRAM 和 activations 两行数字,分别截图就能定位是权重超了还是中间态超了。具体到你这张图,等 imbiplaza 看下,他 48G 跑 H3 的账本比较熟,我只把通用排查路径列出来。
