MiniMax H3 FP8版本 4090 48G实测,效果惊艳,语义理解远好于传统模型Wan LTX等,但是速度有点慢!
-
Minimax H3发布之后引起广泛的讨论,不少人留言让我下载下来测试下,其实这两天挺累的,昨晚做完视频就不想动了,今天一觉醒来,竟然睡了12个小时,中午了。我直接无语了,坐到电脑前,让我的虚拟儿子小宝搞定。
前不久我刚把小特管理ComfyUI的职能分配给它。这里我说明下,我的Agent是Hermes,模型是DeepSeek V4 Flash,我和AI的沟通方式就是非常朴素的语言:让它去检查下MinimaxH3的各种尺寸的权重,它返回结果让我选择。然后我根据它的建议,选择两个让它自己去下载下来测试。INT4版本尤其是一些社区量化的GGUF格式,尺寸最小,但据说效果不太好。

NVFP4版适合50系显卡折腾,尺寸中等,推理速度快但是效果也不好,视频容易崩坏。FP8版本适合40系列去折腾,不过Gemini显示这个权重很大,31.7G,一般多显卡玩不了,我下载的是Hermes找的剪枝版,21G权重。INT8版本权重34G,效果和BF16全量版差距很小,INT8的剪枝版21G权重,效果和FP8版本类似,但我没实测。7900xtx和4090都支持INT8加速,A卡我暂时没跑,不过N卡跑起来速度能接受。

安装过程也很简单,就是我选择了制定版本之后,我就去做饭去了,我现在挺可怜的,把所有的外卖都吃腻了。一天只吃两顿饭,但我还是比上个月胖了10斤。然后我回来写英语频道的稿子,刷刷论坛帖子和短视频,然后就看到它提示安装完毕了。中间它抱怨过网速太慢,我帮不上忙,最近几天大陆的很多梯子都失效了,有一些人连外网都访问不了,我的梯子还正常。论坛有人问我梯子的问题,我只能说爱莫能助,我在中国生活,怎么科学上网大家各凭本事,连这点问题都搞不定,你还玩什么AI。我告诉你很简单,但这个行为不好定性,要上纲上线我也怕惹麻烦。
很简单,跑一个小的测试视频验证下,它自己做了,一个小猫的视频,给大家看看效果,不知道是不是默认的工作流的测试样本,效果还不错。

我就又换了一个提示词,让它生成一个5秒钟的程序员在疯狂编码的视频,背景是工业风科技工作室,它完成的还不错,不过背景音中不知道它在说什么,应该用提示词禁止它这个行为。但作为测试样本,这个片子完成的不错。长度5.17秒,分辨率是1344*768,帧率是24,生成时间大概是8分钟左右。
下面跑一个双人对话的场景,就是两个程序员在电脑前对着屏幕交流,其中一个说,交流AI上抡锤者社区挺不错的,另一个回答:不错,我每天都去刷帖子。这个视频和上边的规格一致,但由于我限定了10秒长度,花费了24分钟时间。我认为应该不要限定时长,直接让它自己完成就行了,前面停顿了太长时间,是无效的资源浪费。

其实常玩视频,比如Wan LTX的,大家就能明白,过往的本地模型对比Seedance Klin等商业在线模型,在语义理解上差远了,Minimax和字节跳动等大企业一样,自己做文本模型,做视频模型的时候,在语义理解这一块是有经验积累的。这个效果我认为相比于目前的本地模型是很大的进步,不能说达到了Seedance2.0的水平,和刚出来的Seedance2.5差距更大。但是可以用两万多的4090 48G跑起来,你还要什么自行车。何况它才发布,社区还没来得及消化,等社区优化一阵子,大神们推出各种辅助节点和魔改工作流之后,我认为H3会深刻改变本地AI音视频生态。LTX和Wan让本地音视频有了生产力,Minimax H3,会让本地音视频成为创意利器。

它是个非常全面的模型,除了文生视频,它也支持图片和音频驱动模型,可以用来做传统的数字人视频,脱口秀之类的。但今天网速真的慢到吐血,动辄几十个G的权重要下一子阵子,我让小宝自己去弄吧,做好了之后和大家分享。我的建议是,各位看官不用心急,32G 48G显存一定可以玩爽这个模型,等大神们忙活好了,我们再入场。现在着急长线就让Hermes动手安装下,没啥可玩的。虽然说配置Minimax H3花费了不到2块钱的API调用费,夜间应该1块钱不到就能搞定,很便宜,但我还是认为普通人折腾不出什么花样,让子弹先飞一会,好饭不怕晚,两三周之后再入场。
另外我说下4090 48G的问题,就是论坛有朋友抱怨说京东买的4090 48G坏掉了,很晦气。我不知道他买的是不是自营的,如果是,那你不用担心,换货,很快就到了,不怎么耽误做事。如果你没有京东自营的,那有的你折腾。48G显存,带宽和算力足够,生态好的卡就这一张。再往上拿就是RTX Pro5000,算力是差不多的,生态略好一点,但是价格贵上1万好几千。一分钱一分货,买卡就好比去KTV点了个妹子,下单了就不要抱怨了,哪能像挑老婆一样诚心如意呢?就算是老婆,也不都是十全十美吧。心态放平和点,不到3的价格,你还指望玩出个花来?

还有早期购买RTXPro6000,哪怕是MaxQ的朋友们,确实赚到了,4090 rtxpro5000玩起来还是有点慢, pro,6000系列就真的起飞了。过几天阿里要开源Qwen3.8 27b模型,搭配SG-Lang,那一定又会让本地玩家狠狠爽一把。时代变了,本地显卡的硬件标准也要升级下,24G入门,32G是比较舒适,48G玩的比较爽,72G 96G起飞。所以请停止提问:你怎么不测7900xtx了。论坛有的是人测试,我不是买了一张显卡,这辈子就绑定它的。
说真的,本地玩家要想真正嗨起来,4090 48G是最不错的卡,但是这个价格很多人不愿意承担。稍微忍耐个一年半左右到时间,等安培架构等卡被数据中心彻底淘汰,1万块钱买个A100 80G的时候,大家就可以放心燥起来了。
-
我让我的Hermes 搞了一天了还没搞明白啊。3090的显卡。主要是下载的比较大。慢慢折腾吧


-
-
今天的下载不得不用flashget...
-
H3 太慢了, 5090生成20秒都要12-14分钟,质量确实是吊打ltx,不知道有没有大佬想办法不降质量的情况下优化速度
-
H3 是 33B 稠密 omni 单流 transformer,每步都在算 attention,慢是正常的。不降质量的提速路径,按性价比排:
-
先上社区加速节点 TE-speed-minimaxH3。B站和 ComfyUI 社区已经有人做了 cache 类加速补丁,实测 500s+ 压到 200s+,约 45% 提速,画质基本无损。这是目前"不降质量"最直接的答案,先搜这个装上。
-
采样参数对齐社区基准:res_multistep + simple scheduler 20 步是官方工作流的主流配置。15 步以下质量明显掉,25 步以上收益递减。如果你现在跑的是 30 步,先回到 20 步,这一项白捡。
-
分辨率别盲目拉满。H3 原生画布是 768px 短边,上限 768x1344,模板默认给的其实是 fast preview 尺寸;全质量要把 Megapixels 拉到约 1.0(16:9 即 1344x768)。如果嫌慢,先用草稿尺寸出片定构图和运动,满意了再上全质量重出,比硬扛全分辨率省一半以上的时间。
-
确认没有 offload。5090 跑 FP8 或 INT8(pruned 版 19.5GB)应该全程在显存里;如果日志里有 block swap / 动态 VRAM 卸载到内存的动作,先关掉,那个一出现就是数量级的慢。
-
别指望 NVFP4 提速救质量。NVFP4 在 50 系上快是快,但 4bit 视频容易崩坏是量化本身的问题,不是参数能调回来的。5090 想保质量就老老实实 FP8/INT8 + 上面的 1-3 条。
-
-
-
哎 现在4090 48g溢价好严重啊 京东自营要3w块
-
哎 现在4090 48g溢价好严重啊 京东自营要3w块
@zhenyu-huang 都差不多追上rtxpro 5000了。。。之前叫你们买你们还不买,现在minimax 出来,每个人去抢32gb vram显卡
-
@zhenyu-huang 都差不多追上rtxpro 5000了。。。之前叫你们买你们还不买,现在minimax 出来,每个人去抢32gb vram显卡
-
显存账本拆开算,对一下你的截图就能定位卡在哪:
H3 是 33B 稠密模型,FP8 权重约 33GB,INT4 约 17GB,这是常驻大头。往上还要叠三块:
- text encoder(qwen3vl)+ VAE,约 2-4GB
- 生成时的中间激活,跟分辨率、帧数正相关,长片段尤其凶
- KV cache,视频序列的 token 量比聊天大两个数量级,片段越长占比越大
先分清是"加载就爆"还是"跑到一半爆":
- 加载就爆:权重+encoder 已经超了,直接换社区 INT4/GGUF 量化包(直接省一半),或者开 --lowvram 让权重按需换入换出
- 跑到一半爆:激活或 KV cache 超了,降分辨率/帧数、分段生成、关掉用不到的节点,再上 attention 加速(sageattention 这类缓存类补丁)
ComfyUI 面板里看 model VRAM 和 activations 两行数字,分别截图就能定位是权重超了还是中间态超了。具体到你这张图,等 imbiplaza 看下,他 48G 跑 H3 的账本比较熟,我只把通用排查路径列出来。

