跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
P

perter

@perter
取消关注 关注
关于
帖子
27
主题
5
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 【MinimaxH3】「練手作品」強奪天下——高燃打斗,一不小心做成遊戲了。。。
    P perter
    AI音视频画图 视频生成 7900xtx

    @JuWing 只要随便上传一张照片就可以生成。
    4fef4f63-bf9d-4076-8fb4-1c2cf3a7a602-image.jpeg


  • 新手求助 Qwen3.8 27b 卡tokens上限了 怎么破?
    P perter
    LLM讨论区 qwen-27b rtx3090

    @huan-chow
    想把上下文扩大到64K,可以在 llama-server.exe 的启动命令里追加参数 -c 65536 或者 --ctx-size 65536


  • 新手救助
    P perter
    AI硬件 dgxspark qwen 本地模型

    @Vincnet-Hu 如果只跑Qwen3.8-27B 1台Spark就够了,跑H3还是配一块5090输出速度才有一点的生产力。


  • JEV颠覆传统AI生态,GPT Claude降本增效数百倍?DSH/GPT简单测试,AI圈子里的重金求子项目!
    P perter
    LLM讨论区 dsharness gpt

    一个名为 Laya 的开源权重 System One 模型,在玩俄罗斯方块时以比基于云的 Jev 快 11 倍的速度做出决策,从而击败了它,并在 16GB MacBook Air 上本地运行!
    5d3a885b-2733-47d5-a02d-38367863997b-image.jpeg


  • 有人跑SONAI 27B模型吗?我的3080 12G还行
    P perter
    LLM讨论区 rtx3080 本地模型

    @九门奇人
    是这个Bonsai-2-27B-gguf模型吗?需要专门的llama.cpp fork 版本才能启动,实际跑起来速度还可以,但是太弱智了。还不如跑新出的大模型Qwen3.8-35B-A3B-Distill。


  • 【最强 35B MoE 模型】Qwen3.8‑35B‑A3B‑Distill‑GGUF
    P perter
    LLM讨论区 qwen llama.cpp 量化

    @marsempire 我的测试中和qwen3.8-27b相比代码水平互有胜负,qwen3.8-27b写的游戏往往第一次都会卡在启动画面,Qwen3.8‑35B写的游戏都是一次启动成功。肯定比Qwen3.6‑35B和Ornith-35B的代码水平强的多。无审查版我还是用Qwen3.6‑35B。


  • 抡友们Qwen Image 2.1 发布了
    P perter
    AI音视频画图 qwen 图片生成

    大家看看这个文字编辑能力,能取代gpt-image 2.5吗?

    image.jpeg


  • 抡友们Qwen Image 2.1 发布了
    P perter
    AI音视频画图 qwen 图片生成

    @kop-wang
    除了Minimax Music3 和 YuE2以外,还有小Suno魔改版之称的MolaCover
    https://github.com/klossm/comfyui_MuLaCover


  • 抡友们Qwen Image 2.1 发布了
    P perter
    AI音视频画图 qwen 图片生成

    qwen_image_2.1_int8_convrot.safetensors 权重只有7G,任何显卡都能跑。
    Qwen Image 2.1最强的应该是图像编辑功能。
    比如保持 <image1> 中的人物和姿势不变,让该人物穿上 <image2> 中的浅蓝色牛仔衬衫。
    image.jpeg


  • 【最强 35B MoE 模型】Qwen3.8‑35B‑A3B‑Distill‑GGUF
    P perter
    LLM讨论区 qwen llama.cpp 量化

    @koala 大约比Qwen3.8-27B快一倍,开MTP差不多70token/s


  • 【最强 35B MoE 模型】Qwen3.8‑35B‑A3B‑Distill‑GGUF
    P perter
    LLM讨论区 qwen llama.cpp 量化

    🌟 模型简介

    首先申明Qwen3.8‑35B‑A3B‑Distill‑GGUF不是Qwen官方发布的模型, 是Empero将 Qwen3.8 前沿模型蒸馏到 Qwen3.6‑35B‑A3B 的 Mixture‑of‑Experts(MoE)架构版本,提供多种 GGUF 量化文件,可直接用于 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等推理框架。

    模型特点:

    • 35B 总参数
    • 每 token 仅激活约 3B 参数(MoE 稀疏)
    • 推理速度显著快于同体量稠密模型

    🧠 架构细节

    • 30 层 Gated DeltaNet
    • 10 层 全注意力层
    • 256 个专家,每 token 路由 8 个专家

    ⚠️ 使用前注意

    加载此模型需要 支持 Qwen3.6 / Gated DeltaNet MoE 的新版 llama.cpp。
    旧版本会直接加载失败。


    📦 GGUF 文件列表(量化方式与大小)

    文件名 量化 大小 说明
    IQ2_M 12.558 GB 最小可用,16GB 显卡可跑
    Q2_K 13.839 GB 2-bit K-quant,兼容性好
    IQ3_M 16.340 GB 3-bit,高性价比
    Q3_K_M 17.664 GB 常规 3-bit K-quant
    IQ4_XS 19.628 GB 接近 Q4_K_M,体积更小
    Q4_K_M(推荐) 21.713 GB 质量与体积最佳平衡
    Q5_K_M 25.348 GB 更高质量
    Q6_K 29.209 GB 接近无损
    Q8_0 37.802 GB 最高质量量化
    BF16 71.067 GB 全精度参考版
    Vision Projector 0.899 GB 图像输入需要搭配此文件

    💻 VRAM / RAM 需求指南

    量化 GPU VRAM CPU RAM
    IQ2_M / Q2_K 16GB 16GB
    IQ3_M / Q3_K_M 20–24GB 24GB
    IQ4_XS / Q4_K_M 24GB 32GB
    Q5_K_M / Q6_K 32GB 48GB
    Q8_0 48GB 64GB
    BF16 80GB+ 96GB

    MoE 架构让 CPU 推理比稠密模型更可行。


    🛠 推理示例(llama.cpp)

    文本推理

    llama-cli -m Qwen3.8-35B-A3B-Q4_K_M.gguf \
      --temp 0.6 --top-p 0.95 --top-k 20 \
      -n 16384 -cnv
    

    模型属于 推理模型(reasoning model),回答开头会带结构化块,需要在最终输出中清理掉。


    图像推理(Vision)

    llama-mtmd-cli \
      -m Qwen3.8-35B-A3B-Q4_K_M.gguf \
      --mmproj mmproj-Qwen3.8-35B-A3B-F16.gguf \
      --image photo.jpg \
      -p "Describe this image."
    

    视觉模型来自 Qwen3.6‑35B‑A3B,蒸馏过程未评估视觉能力。


    🧩 Ollama / LM Studio / Jan / KoboldCpp

    直接加载 GGUF 文件即可,聊天模板已内置。
    推荐采样参数:temperature=0.6, top_p=0.95, top_k=20


    🔐 校验下载

    下载地址:Qwen3.8-35B-A3B-Distill-GGUF

    sha256sum -c SHA256SUMS --ignore-missing
    

    📜 许可

    模型权重使用 Apache‑2.0 许可。



  • 【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流
    P perter
    AI音视频画图 rtx5070 comfyui minimax

    @terry 已经分享全部工作流。


  • 【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流
    P perter
    AI音视频画图 rtx5070 comfyui minimax

    视频超分放大(RTX VSR) 工作流
    image.jpeg
    视频超分放大(RTX VSR).json


  • 【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流
    P perter
    AI音视频画图 rtx5070 comfyui minimax

    视频放大修复(VOSR 2.0)工作流
    image.jpeg

    视频修复放大【VOSR2】.json


  • 【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流
    P perter
    AI音视频画图 rtx5070 comfyui minimax

    MiniMax+H3+导演台全能工作流_加速版工作流

    image.jpeg

    实测 10 秒0.5M视频8step推理时间163秒
    image.jpeg
    MiniMax+H3+导演台全能工作流_加速版.json


  • 【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流
    P perter
    AI音视频画图 rtx5070 comfyui minimax

    适用人群:

    • 想跑 MiniMax H3 / Ref2VA / FL2VA
    • 想做长视频、动作戏、打斗、镜头衔接
    • 想在有限显存下追求画质最大化

    🟥 为什么 12GB 显存也能跑长视频?

    AI 视频推理显存需求动辄 24GB+,但通过 精度压缩、分段推理、显存碎片管理、软硬件分治,12GB 卡依然能做到:

    • 长视频分段生成(>60 秒)
    • 高动态动作戏稳定推理
    • 4K 超分放大(RTX VSR)
    • 画质不衰减的连续镜头

    下面是完整的工作流拆解。


    🟦 一、硬件与环境约束

    🖥️ 核心配置

    项目 配置
    GPU RTX 5070(12GB VRAM)
    CPU Ryzen 5700X
    RAM 64GB
    存储 SSD (48GB虚拟内存)

    🔒 稳定策略:功耗墙锁死 80%

    锁功耗墙的好处:

    • 避免瞬时电流尖峰导致黑屏
    • 显存颗粒温度更低
    • 长时间推理不掉帧
    • 显卡寿命更健康
    • 性能下降不足5%

    🟦 二、模型与推理工作流(ComfyUI)

    🧬 1. 混合权重(Hybrid)

    兼顾 Ref2VA 的可控性 与 FL2VA 的画质:

    minimax_h3_ref2va_hybrid_b20-49_pruned_w4a8_mixed.safetensors
    qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
    minimax_h3_video_vae_int8_convrot.safetensors
    minimax_h3_audio_vae_fp32.safetensors
    

    加速 LoRA:

    minimax_h3_turbo_v4_step600_ema.safetensors
    

    ⚙️ 2. 精度方案:W4A8(黄金分割点)

    精度 显存占用 画质 推荐度
    FP16 高 优秀 ❌ 12GB 不稳
    INT8 ConvRot 中 良好 ✔ 可用
    W4A8 低 良好 ⭐ 最佳平衡
    NVFP4 低 良好 ✔ 50系专用

    🚀 3. 加速引擎

    • MiniMax H3 Mem Eff Patch / Sage Attention Patch
    • Block Sparse Attention
    • TE-Speed-MiniMaxH3 (3.5+)

    三者组合可减少 35–50% 推理时间。


    🎬 4. 动态步数策略

    场景类型 步数 10 秒0.5M视频推理时间
    文戏 / 静态 6-step ~150s
    动作戏 / 打斗 8-step ~200s

    🔁 5. 分段生成 + 引导重绘策略(长视频关键)

    核心逻辑:

    • 使用“minmax h3 导演台”节点进行分段
    • 每段生成 10 秒 视频
    • 下一段以上一段的 尾帧 作为视频和声音引导
    • 重绘幅度设为 0.65
      建议:勾选每段生成后清理一次显存。

    效果:

    • 动作连续性提升一个档次
    • 长视频画质不衰减
    • 镜头衔接自然无跳帧

    🟦 三、画质放大与修复(The “4K Strategy”)

    目标: 在不进行离线 4K 推理的情况下,最终输出依然达到 4K 观感。


    🧩 第一阶段:视频质量修复(VOSR 2.0)

    输入:960×544
    输出:1080p

    VOSR 的优势:

    • 修复硬线条
    • 修复文字
    • 修复人物皮肤

    📈 第二阶段:视频超分放大(RTX VSR)

    RTX+Video+Super+Resolution视频放大
    输入:1080p
    输出:4K

    • 基于 TensorRT 引擎
    • 几乎不占显存
    • 画质提升显著
    • 适合长视频放大

    🟩 四、最终总结

    即使只有 12GB 显存:

    • 通过 W4A8 精度压缩
    • 加速LORA
    • 分段重绘策略
    • VOSR + RTX VSR 两段式增强

    依然可以实现:

    • 长视频生成
    • 动作戏稳定推理
    • 4K 观感输出
    • 画质不衰减的连续镜头

    如果你也在用 50 系列或 40 系列显卡跑 MiniMax H3,欢迎在评论区分享你的工作流参数。



  • 神秘开源模型Ox Alpha身份揭晓
    P perter
    LLM讨论区 glm deepseek

    近期的热点 “牛来” 大模型(在 OpenRouter 上匿名上线时名为 Ox Alpha)已被官方证实就是智谱 AI 发布的 GLM-5.3-Flash。

    GLM‑5.3‑Flash vs DeepSeek‑V4‑Flash vs DeepSeek‑V4‑Pro

    🧮 1. 规格总览(参数、架构、上下文)

    模型 总参数 激活参数 架构 上下文窗口 多模态
    GLM‑5.3‑Flash 320B MoE 18B 混合专家 1M 图文多模态
    DeepSeek‑V4‑Flash 284B MoE 13B MoE 1M 文本
    DeepSeek‑V4‑Pro 1.6T MoE 49B MoE 1M 文本

    💰 2. API 价格(输入 / 输出 / 缓存)

    官方公开价格(每百万 token)

    GLM‑5.3‑Flash

    • 输入:$0.15 / 1M
    • 输出:$0.50 / 1M

    限时优惠价格(5折)

    • 输入:$0.075 / 1M
    • 输出:$0.25/ 1M

    DeepSeek‑V4‑Flash

    • 输入:$0.14 / 1M
    • 输出:$0.28 / 1M
    • 缓存读:$0.028 / 1M

    DeepSeek‑V4‑Pro

    • 输入:价格上调(更贵)
    • 输出:显著更贵

    ⚡ 3. 性能(速度、吞吐、延迟)

    模型 输出速度(tok/s) 首 token 延迟
    GLM‑5.3‑Flash ~50 tok/s 0.67s(旗舰)
    DeepSeek‑V4‑Flash 119.4 tok/s(最快) 0.82s
    DeepSeek‑V4‑Pro ~70 tok/s(DGX Spark) 0.9s(AA)

    🧠 4. 智能水平(基准分)

    Artificial Analysis(可比数据)

    指标 GLM‑5.3‑Flash DeepSeek‑V4‑Flash DeepSeek‑V4‑Pro
    Intelligence Index 57 52 更高(旗舰)
    Coding Index 44.2(GLM‑5) 38.7 61.4
    GPQA 0.820(GLM‑5) 0.894(更强科学推理) 更强(旗舰)

    🛠 5. Agent / RAG / 工具调用表现

    GLM‑5.3‑Flash

    • MCP / Tool 调用稳定
    • 长任务链不容易断
    • 多模态可直接看截图修 bug

    DeepSeek‑V4‑Flash

    • JSON 输出干净
    • 适合轻量 Agent、高并发
    • 长任务链容易断,需要 Harness

    DeepSeek‑V4‑Pro

    • 复杂推理强
    • 但长工程上下文追踪弱于 GLM

    📦 6. 私有化部署

    GLM‑5.3‑Flash

    • 已开源(MIT)
    • 支持国产卡
    • 本地部署友好

    DeepSeek‑V4‑Flash / Pro

    • 权重 MIT 开源
    • 生态成熟
    维度 GLM‑5.3‑Flash DeepSeek‑V4‑Flash DeepSeek‑V4‑Pro
    总参数 320B MoE 284B MoE 1.6T MoE
    激活参数 18B 13B 49B
    上下文窗口 1M 1M 1M
    多模态 图文 文本 文本
    输入价格 $0.15/M $0.14/M 更贵
    输出价格 $0.50/M $0.28/M 更贵
    输出速度 ~50 tok/s 119 tok/s ~70 tok/s
    智能指数 57 52 更高
    代码能力 强 中等 最强(算法)
    Agent 稳定性 最稳 中等 中等
    私有化 MIT 开源 MIT 开源 MIT 开源

    GLM‑5.3‑Flash实际挑战SVG生成的中国传统太极八卦

    taiji.png


  • 神秘大模型Ox Alpha 、性能很强、还完全免费的 AI 模型。
    P perter
    LLM讨论区 glm 本地模型

    @人物时光机 刚才看了一下记录一共调用了1 8次工具还自动把修BUG的经验总结成skill。难怪花了3分钟。总结目前模型工作完全正常。


  • 神秘大模型Ox Alpha 、性能很强、还完全免费的 AI 模型。
    P perter
    LLM讨论区 glm 本地模型

    @人物时光机 大夏时间11:00 -13:00修BUG的。目前刚刚1 4:00最新帮你测了一下,回答有点慢大概花了3分钟,但是还是可以用的。


  • 神秘大模型Ox Alpha 、性能很强、还完全免费的 AI 模型。
    P perter
    LLM讨论区 glm 本地模型

    @人物时光机 至少今天上午我还用hermess调用它来修代码,完全没问题。

  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组