跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
bingqin wangB

bingqin wang

@bingqin wang
德高望重
取消关注 关注
关于
帖子
24
主题
3
分享
0
群组
1
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • (含依赖一键安装包地址)8G显存笔记本本地跑MiniMax H3视频模型!2分半出片,带声音!
    bingqin wangB bingqin wang

    https://live.csdn.net/v/538773
    https://live.csdn.net/v/538774
    微信图片_20260807230933_1276_8.png
    我的配置,你对号入座
    先看看咱俩是不是一个赛道的。我的机器是RTX 4070 Laptop(8G显存),内存32GB,系统是Windows。按理说这配置在炼丹圈属于“低保户”,但事实证明完全够用。只要你显卡是8G显存(比如4060、4070笔记本或桌面卡),内存有32G,这篇教程就可以直接抄。

    先看疗效,再说怎么吃
    我知道你们最关心速度,直接上干货(都是我机器上实跑的数据):

    裸跑(啥优化没有):生成一段832x480的5秒视频,每步耗时18秒,总共干了6分钟。这时候确实慢得想砸电脑,别急,这是8G显存被20多G的模型逼着“换层”的正常现象。

    优化拉满(抄我作业后):同样的分辨率,直接干到2分30秒整段出片。你没看错,从6分钟压到2分半。

    如果贪心点想跑1080P(1024x576):时间会涨到大概9分钟,画质确实好,但建议偶尔玩玩,平时还是用480p图个快。

    提速三板斧(这才是核心)
    网上优化教程一大堆,大部分都是瞎扯。我实测下来,真正有用的就这三板斧,按收益排序,第一招不搞,后面全白搭。

    第一招(最大杀器):换torch cu130 + comfy-kitchen
    这个你们可能看不懂,直接抄命令就行。原理就是让显卡走硬件反量化,不然就是软件在那瞎算,一步17秒死活下不来。这一条不做,后面的TeaCache和SageAttention都是摆设。

    第二招(白捡三倍速):挂上MiniMaxH3 TeaCache
    这玩意儿纯Python写的,不修改核心文件,安全又稳。你就把它当成一个插件,一头插在模型加载器上,另一头插在采样器前面就行。作者实测从306秒干到102秒,咱们8G卡收益更大。

    第三招(锦上添花):SageAttention 1.0.6
    注意!这里有个血泪教训:千万锁死1.0.6版本,千万别手贱升级到2.2.0,否则直接CUDA崩溃给你看。Windows用户还需要装个triton-windows,不然跑不起来。

    整个加速链路的连接顺序我给你们摆出来了,照着连:

    UNETLoader → PatchSageAttentionKJ(auto) → MiniMaxH3 TeaCache → SigmaShift(12/3) → KSampler → DecodeAndSaveVideo

    模型怎么选?直接说我的组合
    模型选不对,8G显存直接爆。我试了一堆组合,这套是速度和画质的黄金平衡点:

    主模型:一定要下那个带pruned_int8_convrot后缀的,大小大概19.5GB。别下66G的BF16原版,那不是咱这配置该想的事。

    文本编码器:选nvfp4_awq这个版本,14.6GB,专门给40系显卡优化的。

    VAE:视频用fp16,音频用fp32,别问为什么,抄就完了。

    这套组合拳打下来,模型精度肉眼几乎看不出来损失,但显存从60G+被干到了21G,8G卡就能塞进去跑。

    懒人专用:一键便携包(解压即用)
    我知道你们看到装环境、敲命令行就头疼。我把整个项目——包括Python运行环境、ComfyUI、上面的模型、所有加速节点——全部打成了一个自包含包。

    你只需要三步:

    下载我扔网盘里的压缩包(密码123)。

    解压到任意盘(建议D盘或E盘,路径别带中文)。

    双击首次使用-修复路径.bat,等它跑完;然后双击启动ComfyUI.bat。

    浏览器打开http://127.0.0.1:8188,把工作流文件夹里的minimax_h3_t2v_8g加速.json拖进去,改改提示词,点击“Queue Prompt”就完了。

    啥都不用装,解压就能跑。

    直接抄作业的参数表
    怕你们调不明白,我直接把能稳定出片的参数贴出来,对着填就行:

    主模型:minimax_h3_fl2va_pruned_int8_convrot

    文本编码器:qwen3vl_32b_minimax_h3_nvfp4_awq

    分辨率:想快就填832x480,想画质好点填1024x576(必须是32的倍数)

    帧数:124帧(对应24fps,大概5.17秒)

    采样步数:固定20步(少于12步音频会爆音,别问怎么知道的)

    采样器:euler / 调度器:simple

    CFG:1.0 / denoise:1.0

    TeaCache参数:rel_l1_thresh设0.15,start设2,end设-2

    Sigma Shift:视频填12,音频填3(这俩分开填)

    提示词技巧:想要什么画面就写画面描述,想控制声音就在末尾加指令。比如要背景音乐就写“disco music with driving bass”,不要声音就写“No dialogue, no music”。

    我踩过的雷,你就别踩了(避坑清单)
    最后这点最重要,都是我用时间换来的教训:

    缓存节点只选一个! TeaCache、EasyCache、TE-Speed这些,别贪心叠加,选一个用就行,叠多了不仅不加速还容易崩。

    SageAttention锁死1.0.6,这事儿我说三遍。

    480p起步,768p封顶。8G卡别一上来就怼1080P,容易抽卡失败,先从480p试水,成功了再往上加。

    机械硬盘别碰。模型文件几十G,换层频繁,机械盘会卡到你怀疑人生,必须是固态(NVMe SSD)。

    Turbo LoRA先别碰。那玩意儿还是早期实验版,画质偏软,而且需要非剪枝的主模型(+34GB),咱们8G卡带不动。

    模型+工作流+一键包下载:https://pan.baidu.com/s/1BWmwQpjkWLeVQ_8DXy91GA?pwd=xidf 密码 xidf

    AI音视频画图 minimax 视频生成

  • 开源个安装包Qwen3.6 35B 塞进了 8GB 显存笔记本:128K、多模态、Thinking,一键安装还能接本地 Agent
    bingqin wangB bingqin wang

    抡锤的大家都不是小白 就不废话了
    a67eb58469e211990b8051e156a13f2c.png
    035deaab339dda47638ee187ab6c11d4.png
    真机演示视频(实际速度)在:https://live.csdn.net/v/539144?spm=1001.2014.3001.5501
    我自己的电脑配置:

    • RTX 4070 Laptop,8GB 显存
    • Intel i7-14650HX
    • 32GB 内存
    • Windows 11
      模型是 Qwen3.6-35B-A3B 的 Q4_K_M GGUF 版本,使用官方 llama.cpp CUDA 后端。

    现在的版本就是完整 35B 模型直接工作。

    • 短文本生成约 42.3 token/s

    • Thinking 模式约 42.1 token/s
      我把运行需要的东西都装进包里了:

    • llama.cpp b10355

    • CUDA 12.4 runtime

    • cuBLAS

    • GGML CPU/CUDA 后端

    • Microsoft VC++ 应用本地运行库

    • FFmpeg 和 FFprobe

    • 完整模型与多模态 projector

    • 本地对话 UI
      目标电脑不需要再安装 Python、Node.js、CUDA Toolkit、Visual Studio 或 VC++ Redistributable。

    只需要 Windows 10/11、兼容的 NVIDIA 驱动、8GB 级显存和 32GB 内存。

    安装过程就是:

    1. 使用密码 123 解压安装包。
    2. 双击 INSTALL_QWEN35B.bat。
    3. 等待模型校验和加载。
    4. 浏览器自动打开后输入密码 123。

    桌面会自动生成启动、停止和打开对话的快捷方式
    UI 可以直接添加:

    • 图片
    • 视频
    • 文本文件

    我实际测试了发票 OCR、图表读取、一般图片问答和视频画面识别。

    例如图表测试能够正确返回 BETA, 7,视频测试能够识别出画面中的验证码 8642。视频处理使用包内 FFmpeg,不需要用户另外配置。

    当前 projector 不支持音频。PDF 和 Office 二进制文件也没有在浏览器端强行乱解析,建议转换成文本或页面图片后再上传。

    Thinking 可以开,也可以关

    UI 可以选择:

    • 自动
    • 8K
    • 16K
    • 32K
    • 64K
    • 128K

    默认建议使用“自动”。短对话不会每次都背着 128K 历史跑,随着会话增长再逐步扩大预算。

    可以直接接自己的本地 Agent

    服务提供 OpenAI 兼容接口:

    Base URL: http://127.0.0.1:8090/v1
    API key: 123
    Model: qwen35b-local
    

    百度网盘:

    https://pan.baidu.com/s/1ff1XmuJTeb_TZa2Q9vVEfw?pwd=auj7

    提取码:auj7

    完整安装包解压密码:123

    UI 登录密码/API Key:123

    安装包约 21.82 GiB,请确认磁盘空间,并务必完整解压后再运行安装程序。

    LLM讨论区 qwen 本地模型

  • Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )
    bingqin wangB bingqin wang

    已经租云机试过了
    华为 Atlas 300I Duo 96G
    内部芯片:2 × Ascend 310P3
    总显存:96G
    实际为两块相互独立的设备内存
    单芯片可用显存约43G
    双芯片总显存带宽约408 GB/s
    软件路线:
    vLLM-Ascend
    CANN
    Qwen3.6-27B W8A8
    Tensor Parallel = 2
    官方图模式
    官方融合算子
    权重常驻显存
    KV Cache常驻显存
    最终稳定结果:
    生成速度:约11.01 tokens/s 最快15tokens/s
    语义测试:5/5
    双芯片运行:正常
    服务接口:稳定
    显存占用:每颗芯片约35~36G
    这个结果已经不是“模型没配好”或者“只跑了一个未经优化的 Python 示例”。
    官方 W8A8、图捕获、融合算子、常驻权重和双芯片调度都已经启用。

    AI硬件 本地模型

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @566656661 果然是专家 确实是非浮点运算 但是比您说的这种更极端 我从数学底层把所有乘除和微分计算都换成了有限加法表达的公式 也就是全面离散数学化 非线性计算用了一部分查表 我的目标是NPU 利用CANN算子做优化 这样有俩个好处1.可以最大避免带宽影响大力出奇迹 2.所有结果计算可审计 相同的seed得到的答案完全一致 比较适合高确定性场景

    LLM讨论区 本地模型

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @kos-or 其实说白了就是穷的 我就想现在不是升腾的加速卡便宜 看看能不能想办法把不到一万块的96g显存用起来 不求n卡的速度 起码能用就是胜利 一分钱一分货 能用就行

    LLM讨论区 本地模型

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @kos-or 这卡目前来看 除了显存大 貌似就都是骂 没看到社区有夸优点的

    LLM讨论区 本地模型

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    @566656661 CANN社区他们内部开发人员都吐槽 别提了 但是没钱买显卡 这是硬伤

    LLM讨论区 本地模型

  • 刚把推理引擎跑到15 token/s,新人发帖想听听大家的意见
    bingqin wangB bingqin wang

    不求能追上CUDA 只要大概能跑 没有过于忍不了的延迟就行 特别是国内单位 现在都必须全国产 所以这问题早晚得解决

    LLM讨论区 本地模型

  • # [求助] MiniMax H3 ref_video(参考视频)输入完全不生效 — R9700 / ROCm 7.2.4
    bingqin wangB bingqin wang

    1.在 ref2va 模式下,关键帧(Keyframes)和参考媒体(Reference Media)不能混用 检查下工作流,确保没有同时向模型输入 first_frame 或 last_frame 这类关键帧数据。一旦混用,ref_video 可能会被模型忽略 2.ref2va 模式下对音频识别有点问题 你把视频音频去掉试试?

    AI音视频画图 minimax r9700 rocm 视频生成

  • 两周变现成功。。简单分享最近实践的感悟
    bingqin wangB bingqin wang

    牛逼牛逼 能赚钱的都是高人 我压根都不敢奢望 除了产片儿以外 完全想不到顺畅一点的变现手段

    网络技术 网络 变现

  • (含依赖一键安装包地址)8G显存笔记本本地跑MiniMax H3视频模型!2分半出片,带声音!
    bingqin wangB bingqin wang

    @Botio-Kuo 还在那个网盘里 我新建了一个工作流文件夹

    AI音视频画图 minimax 视频生成

  • Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )
    bingqin wangB bingqin wang

    @kos-or 算子分散化 哪怕都是int8也行啊 啥都有点 啥都不行 带宽也不行 它实际上不是一颗芯片连接一块统一的96G显存,而是:310P3芯片0 + 独立显存 310P3芯片1 + 独立显存 310P3的INT8优势主要集中在矩阵乘 不能根据INT8 TOPS简单推算大模型的token生成速度 离开官方图模式 性能会断崖式下降 玩不转啊 所以非华为官方版本 我都懒得试了 估计效果也好不到哪里去

    AI硬件 本地模型

  • Atlas 300I Duo 推理卡 (LPDDR4X 96GB / 功耗150W / 带宽408GB/s )
    bingqin wangB bingqin wang

    @566656661 没办法 真的限制太多了

    AI硬件 本地模型
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组