他们搞万物皆插件 不就是想把生态炒热 估计过一段时间 插件出现分层就好了 对于核心 目前没想法 昨天晚上gpt订阅不够 用v4 pro写了会rust 一言难尽 体感白天和晚上质量差距还挺大的
-
DSH感觉很有前途啊 -
DeepSeek V4 Pro 0813实测:简单任务没优势,长线编程/重度任务吊打V4 Flash!Codex、Hermes接入效果全面对比!flash目前来看是真的爽 我有个微调的任务 挂了一天才3块钱 而且完成的比我自己搞好不少
-
开源个安装包Qwen3.6 35B 塞进了 8GB 显存笔记本:128K、多模态、Thinking,一键安装还能接本地 Agent@stxpnet 例如图表测试能够正确返回
BETA, 7,视频测试能够识别出画面中的验证码8642你说的实际问题还想问啥 我自己跑下给你结果就行 不麻烦
上下文方面
| 实际提示长度 | 验证位置 | 结果 | 预填充速度 |
| 32,748 token | 50% | 通过 | 356.1 token/s |
| 65,544 token | 8%、91% | 通过 | 350.1 token/s |
| 119,998 token | 4%、50%、96% | 通过 | 346.2 token/s |
速度反正能用 不吹玄学:120K 提示在测试机上预填充约 346.6 秒。128K 是需要的时候真能用,但是长上下文肯定没有那么流畅。不过咱们自己用不需要那么长吧,我自己上下文都是通过agent挂rag或者路由知识网解决。 -
开源个安装包Qwen3.6 35B 塞进了 8GB 显存笔记本:128K、多模态、Thinking,一键安装还能接本地 Agent@williamlouis 必须落实
-
开源个安装包Qwen3.6 35B 塞进了 8GB 显存笔记本:128K、多模态、Thinking,一键安装还能接本地 Agent抡锤的大家都不是小白 就不废话了


真机演示视频(实际速度)在:https://live.csdn.net/v/539144?spm=1001.2014.3001.5501
我自己的电脑配置:- RTX 4070 Laptop,8GB 显存
- Intel i7-14650HX
- 32GB 内存
- Windows 11
模型是 Qwen3.6-35B-A3B 的 Q4_K_M GGUF 版本,使用官方 llama.cpp CUDA 后端。
现在的版本就是完整 35B 模型直接工作。
-
短文本生成约 42.3 token/s
-
Thinking 模式约 42.1 token/s
我把运行需要的东西都装进包里了: -
llama.cpp b10355
-
CUDA 12.4 runtime
-
cuBLAS
-
GGML CPU/CUDA 后端
-
Microsoft VC++ 应用本地运行库
-
FFmpeg 和 FFprobe
-
完整模型与多模态 projector
-
本地对话 UI
目标电脑不需要再安装 Python、Node.js、CUDA Toolkit、Visual Studio 或 VC++ Redistributable。
只需要 Windows 10/11、兼容的 NVIDIA 驱动、8GB 级显存和 32GB 内存。
安装过程就是:
- 使用密码
123解压安装包。 - 双击
INSTALL_QWEN35B.bat。 - 等待模型校验和加载。
- 浏览器自动打开后输入密码
123。
桌面会自动生成启动、停止和打开对话的快捷方式
UI 可以直接添加:- 图片
- 视频
- 文本文件
我实际测试了发票 OCR、图表读取、一般图片问答和视频画面识别。
例如图表测试能够正确返回
BETA, 7,视频测试能够识别出画面中的验证码8642。视频处理使用包内 FFmpeg,不需要用户另外配置。当前 projector 不支持音频。PDF 和 Office 二进制文件也没有在浏览器端强行乱解析,建议转换成文本或页面图片后再上传。
Thinking 可以开,也可以关
UI 可以选择:
- 自动
- 8K
- 16K
- 32K
- 64K
- 128K
默认建议使用“自动”。短对话不会每次都背着 128K 历史跑,随着会话增长再逐步扩大预算。
可以直接接自己的本地 Agent
服务提供 OpenAI 兼容接口:
Base URL: http://127.0.0.1:8090/v1 API key: 123 Model: qwen35b-local百度网盘:
https://pan.baidu.com/s/1ff1XmuJTeb_TZa2Q9vVEfw?pwd=auj7
提取码:auj7
完整安装包解压密码:123
UI 登录密码/API Key:123
安装包约 21.82 GiB,请确认磁盘空间,并务必完整解压后再运行安装程序。
-
(含依赖一键安装包地址)8G显存笔记本本地跑MiniMax H3视频模型!2分半出片,带声音!@williamlouis 我看了下机制罗 他们那个用的lora 速度不知为啥比我这个不用lora正常20步的还慢不少 视频质量下降已经可以看出来了 还是再等等官方的蒸馏版吧
-
# [求助] MiniMax H3 ref_video(参考视频)输入完全不生效 — R9700 / ROCm 7.2.41.在 ref2va 模式下,关键帧(Keyframes)和参考媒体(Reference Media)不能混用 检查下工作流,确保没有同时向模型输入 first_frame 或 last_frame 这类关键帧数据。一旦混用,ref_video 可能会被模型忽略 2.ref2va 模式下对音频识别有点问题 你把视频音频去掉试试?
-
(含依赖一键安装包地址)8G显存笔记本本地跑MiniMax H3视频模型!2分半出片,带声音!原网盘文件夹我做了一个248帧的补丁 增加了几个常用工作流模板 setup.exe文件 需要的请自取
版本:2026-08-08.1
本补丁只更新 ComfyUI 节点、工作流、启动脚本和说明文件,不包含模型、Python 或 CUDA 依赖,安装包体积很小。
适用对象:此前发布的 MiniMax H3 一键便携包(项目根目录包含
ComfyUI\main.py、workflows和启动ComfyUI.bat)。1. 本次改动和工作流
- 修复 H3 帧数输入:允许输入任意整数,模型自动对齐到
17k+5。例如248 -> 260帧。 启动ComfyUI.bat固定使用--lowvram,不启用普通 VRAM 模式。- TeaCache 保留 124 帧原有速度/画质默认行为,并修复连续运行时继承上次缓存状态的问题。
- TeaCache 增加可选音频守门参数:音频分段漂移检查、连续复用上限和
audio_guard。124 帧默认不启用保守守门,以保持原来的 2–3 分钟速度。 - 增加/修复以下工作流:
workflows\minimax_h3_t2v_8g加速.json:124 帧、带声音的默认工作流。workflows\minimax_h3_t2v_248f_低显存无声.json:248 帧测试工作流,默认断开音频输出。workflows\minimax_h3_i2v_first_last.json:单图生视频、首尾帧生视频。workflows\minimax_h3_r2v_multi_image.json:多图片参考生视频,需要额外的 Ref2VA 主模型。
使用方法
- 启动 ComfyUI 后,把对应 JSON 拖入页面。
- 124 帧工作流中修改正向提示词,提示词同时描述画面和声音,例如
servo whine, hydraulic movement, metallic impacts, no dialogue。 - 图生视频工作流只连接第一张图就是普通图生视频;同时连接首帧和尾帧就是首尾帧过渡。
- 多图参考工作流按连接顺序使用
<Picture 1>、<Picture 2>等标签。 - 仍然使用 20 步、832×480 起步;启动方式保持低显存模式。
2. 248 帧声音问题
H3 在 24fps 下会把输入
248对齐成260帧,实际时长约 10.83 秒。当前 TeaCache 会复用视频和音频的联合输出:设置 实测耗时 结果 260 帧,TeaCache 开启 492.40 秒 画面正常,声音异常 260 帧,TeaCache 关闭、20 步全实算 983 秒 画面和声音正常 124 帧,原默认 TeaCache 约 150 秒 480p 约 2–3 分钟,声音正常 因此:
- 248 帧默认不要开声音,使用
minimax_h3_t2v_248f_低显存无声.json。 - 248 帧确实需要原生声音时,必须关闭 TeaCache:将
rel_l1_thresh设为0,或将max_reuse_steps设为0。这会让 20 步全部实算,耗时明显增加。 - 不要把两个独立生成的 124 帧音频直接拼接到一条 260 帧视频上,声音事件无法保证和画面联合同步。
3. 如何打补丁
图形安装
- 完全关闭 ComfyUI(包括后台 Python 进程)。
- 双击
MiniMaxH3_Patch_Setup_2026-08-08.exe。
安装器没有商业代码签名证书;若 Windows SmartScreen 提示未知发布者,请先核对补丁包内的 SHA256,再选择“更多信息 → 仍要运行”。 - 选择项目根目录,也就是包含
ComfyUI\main.py的目录,例如E:\MiniMaxH3。 - 勾选“我已关闭 ComfyUI”,点击“安装补丁”。
- 安装器会先把旧文件备份到:
项目根目录\patch_backups\MiniMaxH3_patch_版本_时间戳\ - 看到“补丁安装完成”后,重新双击
启动ComfyUI.bat。启动脚本会继续使用--lowvram。
命令行安装(可选)
MiniMaxH3_Patch_Setup_2026-08-08.exe --target E:\MiniMaxH3 --quiet回滚
安装器不会删除模型。需要回滚时,关闭 ComfyUI,把最近一次
patch_backups子目录中的文件复制回项目根目录即可;安装报告保存在项目根目录的patch_install_report.json。补丁不修改
models目录,也不需要重新安装依赖。安装完成后如果页面仍显示旧节点,重启 ComfyUI 即可。 - 修复 H3 帧数输入:允许输入任意整数,模型自动对齐到
-
(含依赖一键安装包地址)8G显存笔记本本地跑MiniMax H3视频模型!2分半出片,带声音!@Botio-Kuo 还在那个网盘里 我新建了一个工作流文件夹
-
(含依赖一键安装包地址)8G显存笔记本本地跑MiniMax H3视频模型!2分半出片,带声音!https://live.csdn.net/v/538773
https://live.csdn.net/v/538774

我的配置,你对号入座
先看看咱俩是不是一个赛道的。我的机器是RTX 4070 Laptop(8G显存),内存32GB,系统是Windows。按理说这配置在炼丹圈属于“低保户”,但事实证明完全够用。只要你显卡是8G显存(比如4060、4070笔记本或桌面卡),内存有32G,这篇教程就可以直接抄。先看疗效,再说怎么吃
我知道你们最关心速度,直接上干货(都是我机器上实跑的数据):裸跑(啥优化没有):生成一段832x480的5秒视频,每步耗时18秒,总共干了6分钟。这时候确实慢得想砸电脑,别急,这是8G显存被20多G的模型逼着“换层”的正常现象。
优化拉满(抄我作业后):同样的分辨率,直接干到2分30秒整段出片。你没看错,从6分钟压到2分半。
如果贪心点想跑1080P(1024x576):时间会涨到大概9分钟,画质确实好,但建议偶尔玩玩,平时还是用480p图个快。
提速三板斧(这才是核心)
网上优化教程一大堆,大部分都是瞎扯。我实测下来,真正有用的就这三板斧,按收益排序,第一招不搞,后面全白搭。第一招(最大杀器):换torch cu130 + comfy-kitchen
这个你们可能看不懂,直接抄命令就行。原理就是让显卡走硬件反量化,不然就是软件在那瞎算,一步17秒死活下不来。这一条不做,后面的TeaCache和SageAttention都是摆设。第二招(白捡三倍速):挂上MiniMaxH3 TeaCache
这玩意儿纯Python写的,不修改核心文件,安全又稳。你就把它当成一个插件,一头插在模型加载器上,另一头插在采样器前面就行。作者实测从306秒干到102秒,咱们8G卡收益更大。第三招(锦上添花):SageAttention 1.0.6
注意!这里有个血泪教训:千万锁死1.0.6版本,千万别手贱升级到2.2.0,否则直接CUDA崩溃给你看。Windows用户还需要装个triton-windows,不然跑不起来。整个加速链路的连接顺序我给你们摆出来了,照着连:
UNETLoader → PatchSageAttentionKJ(auto) → MiniMaxH3 TeaCache → SigmaShift(12/3) → KSampler → DecodeAndSaveVideo
模型怎么选?直接说我的组合
模型选不对,8G显存直接爆。我试了一堆组合,这套是速度和画质的黄金平衡点:主模型:一定要下那个带pruned_int8_convrot后缀的,大小大概19.5GB。别下66G的BF16原版,那不是咱这配置该想的事。
文本编码器:选nvfp4_awq这个版本,14.6GB,专门给40系显卡优化的。
VAE:视频用fp16,音频用fp32,别问为什么,抄就完了。
这套组合拳打下来,模型精度肉眼几乎看不出来损失,但显存从60G+被干到了21G,8G卡就能塞进去跑。
懒人专用:一键便携包(解压即用)
我知道你们看到装环境、敲命令行就头疼。我把整个项目——包括Python运行环境、ComfyUI、上面的模型、所有加速节点——全部打成了一个自包含包。你只需要三步:
下载我扔网盘里的压缩包(密码123)。
解压到任意盘(建议D盘或E盘,路径别带中文)。
双击首次使用-修复路径.bat,等它跑完;然后双击启动ComfyUI.bat。
浏览器打开http://127.0.0.1:8188,把工作流文件夹里的minimax_h3_t2v_8g加速.json拖进去,改改提示词,点击“Queue Prompt”就完了。
啥都不用装,解压就能跑。
直接抄作业的参数表
怕你们调不明白,我直接把能稳定出片的参数贴出来,对着填就行:主模型:minimax_h3_fl2va_pruned_int8_convrot
文本编码器:qwen3vl_32b_minimax_h3_nvfp4_awq
分辨率:想快就填832x480,想画质好点填1024x576(必须是32的倍数)
帧数:124帧(对应24fps,大概5.17秒)
采样步数:固定20步(少于12步音频会爆音,别问怎么知道的)
采样器:euler / 调度器:simple
CFG:1.0 / denoise:1.0
TeaCache参数:rel_l1_thresh设0.15,start设2,end设-2
Sigma Shift:视频填12,音频填3(这俩分开填)
提示词技巧:想要什么画面就写画面描述,想控制声音就在末尾加指令。比如要背景音乐就写“disco music with driving bass”,不要声音就写“No dialogue, no music”。
我踩过的雷,你就别踩了(避坑清单)
最后这点最重要,都是我用时间换来的教训:缓存节点只选一个! TeaCache、EasyCache、TE-Speed这些,别贪心叠加,选一个用就行,叠多了不仅不加速还容易崩。
SageAttention锁死1.0.6,这事儿我说三遍。
480p起步,768p封顶。8G卡别一上来就怼1080P,容易抽卡失败,先从480p试水,成功了再往上加。
机械硬盘别碰。模型文件几十G,换层频繁,机械盘会卡到你怀疑人生,必须是固态(NVMe SSD)。
Turbo LoRA先别碰。那玩意儿还是早期实验版,画质偏软,而且需要非剪枝的主模型(+34GB),咱们8G卡带不动。
模型+工作流+一键包下载:https://pan.baidu.com/s/1BWmwQpjkWLeVQ_8DXy91GA?pwd=xidf 密码 xidf
-
Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )@kos-or 算子分散化 哪怕都是int8也行啊 啥都有点 啥都不行 带宽也不行 它实际上不是一颗芯片连接一块统一的96G显存,而是:310P3芯片0 + 独立显存 310P3芯片1 + 独立显存 310P3的INT8优势主要集中在矩阵乘 不能根据INT8 TOPS简单推算大模型的token生成速度 离开官方图模式 性能会断崖式下降 玩不转啊 所以非华为官方版本 我都懒得试了 估计效果也好不到哪里去
-
Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )@566656661 没办法 真的限制太多了
-
Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )已经租云机试过了
华为 Atlas 300I Duo 96G
内部芯片:2 × Ascend 310P3
总显存:96G
实际为两块相互独立的设备内存
单芯片可用显存约43G
双芯片总显存带宽约408 GB/s
软件路线:
vLLM-Ascend
CANN
Qwen3.6-27B W8A8
Tensor Parallel = 2
官方图模式
官方融合算子
权重常驻显存
KV Cache常驻显存
最终稳定结果:
生成速度:约11.01 tokens/s 最快15tokens/s
语义测试:5/5
双芯片运行:正常
服务接口:稳定
显存占用:每颗芯片约35~36G
这个结果已经不是“模型没配好”或者“只跑了一个未经优化的 Python 示例”。
官方 W8A8、图捕获、融合算子、常驻权重和双芯片调度都已经启用。 -
两周变现成功。。简单分享最近实践的感悟牛逼牛逼 能赚钱的都是高人 我压根都不敢奢望 除了产片儿以外 完全想不到顺畅一点的变现手段
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见不求能追上CUDA 只要大概能跑 没有过于忍不了的延迟就行 特别是国内单位 现在都必须全国产 所以这问题早晚得解决
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见@566656661 CANN社区他们内部开发人员都吐槽 别提了 但是没钱买显卡 这是硬伤
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见@kos-or 这卡目前来看 除了显存大 貌似就都是骂 没看到社区有夸优点的
-
刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见@kos-or 其实说白了就是穷的 我就想现在不是升腾的加速卡便宜 看看能不能想办法把不到一万块的96g显存用起来 不求n卡的速度 起码能用就是胜利 一分钱一分货 能用就行
-
關於去馬賽克对了 有个老牌子JavPlayer 也可以试试 我也好奇这个和Lada对比怎么样
-
關於去馬賽克目前我知道的靠连续扩散算法补充图像的办法应该是可以做到的 但是需要有一个微调的模型 因为本质上不是去掉马赛克 而是在马赛克的基础上进行创作并补齐 所以用本地部署的通用模型 大概率细节上会有些对不上 云端的算力够 但是不知能不能过审