跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
P

perter

@perter
取消关注 关注
关于
帖子
27
主题
5
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流
    P perter
    AI音视频画图 rtx5070 comfyui minimax

    适用人群:

    • 想跑 MiniMax H3 / Ref2VA / FL2VA
    • 想做长视频、动作戏、打斗、镜头衔接
    • 想在有限显存下追求画质最大化

    🟥 为什么 12GB 显存也能跑长视频?

    AI 视频推理显存需求动辄 24GB+,但通过 精度压缩、分段推理、显存碎片管理、软硬件分治,12GB 卡依然能做到:

    • 长视频分段生成(>60 秒)
    • 高动态动作戏稳定推理
    • 4K 超分放大(RTX VSR)
    • 画质不衰减的连续镜头

    下面是完整的工作流拆解。


    🟦 一、硬件与环境约束

    🖥️ 核心配置

    项目 配置
    GPU RTX 5070(12GB VRAM)
    CPU Ryzen 5700X
    RAM 64GB
    存储 SSD (48GB虚拟内存)

    🔒 稳定策略:功耗墙锁死 80%

    锁功耗墙的好处:

    • 避免瞬时电流尖峰导致黑屏
    • 显存颗粒温度更低
    • 长时间推理不掉帧
    • 显卡寿命更健康
    • 性能下降不足5%

    🟦 二、模型与推理工作流(ComfyUI)

    🧬 1. 混合权重(Hybrid)

    兼顾 Ref2VA 的可控性 与 FL2VA 的画质:

    minimax_h3_ref2va_hybrid_b20-49_pruned_w4a8_mixed.safetensors
    qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
    minimax_h3_video_vae_int8_convrot.safetensors
    minimax_h3_audio_vae_fp32.safetensors
    

    加速 LoRA:

    minimax_h3_turbo_v4_step600_ema.safetensors
    

    ⚙️ 2. 精度方案:W4A8(黄金分割点)

    精度 显存占用 画质 推荐度
    FP16 高 优秀 ❌ 12GB 不稳
    INT8 ConvRot 中 良好 ✔ 可用
    W4A8 低 良好 ⭐ 最佳平衡
    NVFP4 低 良好 ✔ 50系专用

    🚀 3. 加速引擎

    • MiniMax H3 Mem Eff Patch / Sage Attention Patch
    • Block Sparse Attention
    • TE-Speed-MiniMaxH3 (3.5+)

    三者组合可减少 35–50% 推理时间。


    🎬 4. 动态步数策略

    场景类型 步数 10 秒0.5M视频推理时间
    文戏 / 静态 6-step ~150s
    动作戏 / 打斗 8-step ~200s

    🔁 5. 分段生成 + 引导重绘策略(长视频关键)

    核心逻辑:

    • 使用“minmax h3 导演台”节点进行分段
    • 每段生成 10 秒 视频
    • 下一段以上一段的 尾帧 作为视频和声音引导
    • 重绘幅度设为 0.65
      建议:勾选每段生成后清理一次显存。

    效果:

    • 动作连续性提升一个档次
    • 长视频画质不衰减
    • 镜头衔接自然无跳帧

    🟦 三、画质放大与修复(The “4K Strategy”)

    目标: 在不进行离线 4K 推理的情况下,最终输出依然达到 4K 观感。


    🧩 第一阶段:视频质量修复(VOSR 2.0)

    输入:960×544
    输出:1080p

    VOSR 的优势:

    • 修复硬线条
    • 修复文字
    • 修复人物皮肤

    📈 第二阶段:视频超分放大(RTX VSR)

    RTX+Video+Super+Resolution视频放大
    输入:1080p
    输出:4K

    • 基于 TensorRT 引擎
    • 几乎不占显存
    • 画质提升显著
    • 适合长视频放大

    🟩 四、最终总结

    即使只有 12GB 显存:

    • 通过 W4A8 精度压缩
    • 加速LORA
    • 分段重绘策略
    • VOSR + RTX VSR 两段式增强

    依然可以实现:

    • 长视频生成
    • 动作戏稳定推理
    • 4K 观感输出
    • 画质不衰减的连续镜头

    如果你也在用 50 系列或 40 系列显卡跑 MiniMax H3,欢迎在评论区分享你的工作流参数。



  • 【最强 35B MoE 模型】Qwen3.8‑35B‑A3B‑Distill‑GGUF
    P perter
    LLM讨论区 qwen llama.cpp 量化

    🌟 模型简介

    首先申明Qwen3.8‑35B‑A3B‑Distill‑GGUF不是Qwen官方发布的模型, 是Empero将 Qwen3.8 前沿模型蒸馏到 Qwen3.6‑35B‑A3B 的 Mixture‑of‑Experts(MoE)架构版本,提供多种 GGUF 量化文件,可直接用于 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等推理框架。

    模型特点:

    • 35B 总参数
    • 每 token 仅激活约 3B 参数(MoE 稀疏)
    • 推理速度显著快于同体量稠密模型

    🧠 架构细节

    • 30 层 Gated DeltaNet
    • 10 层 全注意力层
    • 256 个专家,每 token 路由 8 个专家

    ⚠️ 使用前注意

    加载此模型需要 支持 Qwen3.6 / Gated DeltaNet MoE 的新版 llama.cpp。
    旧版本会直接加载失败。


    📦 GGUF 文件列表(量化方式与大小)

    文件名 量化 大小 说明
    IQ2_M 12.558 GB 最小可用,16GB 显卡可跑
    Q2_K 13.839 GB 2-bit K-quant,兼容性好
    IQ3_M 16.340 GB 3-bit,高性价比
    Q3_K_M 17.664 GB 常规 3-bit K-quant
    IQ4_XS 19.628 GB 接近 Q4_K_M,体积更小
    Q4_K_M(推荐) 21.713 GB 质量与体积最佳平衡
    Q5_K_M 25.348 GB 更高质量
    Q6_K 29.209 GB 接近无损
    Q8_0 37.802 GB 最高质量量化
    BF16 71.067 GB 全精度参考版
    Vision Projector 0.899 GB 图像输入需要搭配此文件

    💻 VRAM / RAM 需求指南

    量化 GPU VRAM CPU RAM
    IQ2_M / Q2_K 16GB 16GB
    IQ3_M / Q3_K_M 20–24GB 24GB
    IQ4_XS / Q4_K_M 24GB 32GB
    Q5_K_M / Q6_K 32GB 48GB
    Q8_0 48GB 64GB
    BF16 80GB+ 96GB

    MoE 架构让 CPU 推理比稠密模型更可行。


    🛠 推理示例(llama.cpp)

    文本推理

    llama-cli -m Qwen3.8-35B-A3B-Q4_K_M.gguf \
      --temp 0.6 --top-p 0.95 --top-k 20 \
      -n 16384 -cnv
    

    模型属于 推理模型(reasoning model),回答开头会带结构化块,需要在最终输出中清理掉。


    图像推理(Vision)

    llama-mtmd-cli \
      -m Qwen3.8-35B-A3B-Q4_K_M.gguf \
      --mmproj mmproj-Qwen3.8-35B-A3B-F16.gguf \
      --image photo.jpg \
      -p "Describe this image."
    

    视觉模型来自 Qwen3.6‑35B‑A3B,蒸馏过程未评估视觉能力。


    🧩 Ollama / LM Studio / Jan / KoboldCpp

    直接加载 GGUF 文件即可,聊天模板已内置。
    推荐采样参数:temperature=0.6, top_p=0.95, top_k=20


    🔐 校验下载

    下载地址:Qwen3.8-35B-A3B-Distill-GGUF

    sha256sum -c SHA256SUMS --ignore-missing
    

    📜 许可

    模型权重使用 Apache‑2.0 许可。



  • 抡友们Qwen Image 2.1 发布了
    P perter
    AI音视频画图 qwen 图片生成

    @kop-wang
    除了Minimax Music3 和 YuE2以外,还有小Suno魔改版之称的MolaCover
    https://github.com/klossm/comfyui_MuLaCover


  • 在飞牛NAS上部署Hermes agent非常简单。
    P perter
    AI Agent hermes 服务器

    首先通过应用中心安装,不过版本较低
    c9870c19-4587-4ed8-946f-5bdb954b3bb8-image.jpeg
    最新版本也可以自己下载fpk手动安装
    736c070c-9776-4147-964e-cd13b490d80f-image.jpeg
    目前最新版本0.19.0
    f01319f8-b39e-4e5c-a882-00782c41f9a0-image.jpeg
    然后手动设置本地模型,或者在线模型
    33b46151-8dea-4eda-8608-02ad9fec4156-image.jpeg
    最后启动Gateway
    03aa206c-cb48-4135-a6f3-648731eabeef-image.jpeg
    就可以愉快的聊天了
    910cf37f-1f01-4aa2-889b-311d7a37e8cc-image.jpeg


  • 【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流
    P perter
    AI音视频画图 rtx5070 comfyui minimax

    MiniMax+H3+导演台全能工作流_加速版工作流

    image.jpeg

    实测 10 秒0.5M视频8step推理时间163秒
    image.jpeg
    MiniMax+H3+导演台全能工作流_加速版.json


  • 【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流
    P perter
    AI音视频画图 rtx5070 comfyui minimax

    视频放大修复(VOSR 2.0)工作流
    image.jpeg

    视频修复放大【VOSR2】.json


  • 【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流
    P perter
    AI音视频画图 rtx5070 comfyui minimax

    视频超分放大(RTX VSR) 工作流
    image.jpeg
    视频超分放大(RTX VSR).json

  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组