@JuWing 只要随便上传一张照片就可以生成。

perter
-
【MinimaxH3】「練手作品」強奪天下——高燃打斗,一不小心做成遊戲了。。。 -
新手求助 Qwen3.8 27b 卡tokens上限了 怎么破?@huan-chow
想把上下文扩大到64K,可以在 llama-server.exe 的启动命令里追加参数 -c 65536 或者 --ctx-size 65536 -
新手救助@Vincnet-Hu 如果只跑Qwen3.8-27B 1台Spark就够了,跑H3还是配一块5090输出速度才有一点的生产力。
-
JEV颠覆传统AI生态,GPT Claude降本增效数百倍?DSH/GPT简单测试,AI圈子里的重金求子项目!一个名为 Laya 的开源权重 System One 模型,在玩俄罗斯方块时以比基于云的 Jev 快 11 倍的速度做出决策,从而击败了它,并在 16GB MacBook Air 上本地运行!

-
有人跑SONAI 27B模型吗?我的3080 12G还行 -
【最强 35B MoE 模型】Qwen3.8‑35B‑A3B‑Distill‑GGUF@marsempire 我的测试中和qwen3.8-27b相比代码水平互有胜负,qwen3.8-27b写的游戏往往第一次都会卡在启动画面,Qwen3.8‑35B写的游戏都是一次启动成功。肯定比Qwen3.6‑35B和Ornith-35B的代码水平强的多。无审查版我还是用Qwen3.6‑35B。
-
抡友们Qwen Image 2.1 发布了大家看看这个文字编辑能力,能取代gpt-image 2.5吗?

-
抡友们Qwen Image 2.1 发布了@kop-wang
除了Minimax Music3 和 YuE2以外,还有小Suno魔改版之称的MolaCover
https://github.com/klossm/comfyui_MuLaCover -
抡友们Qwen Image 2.1 发布了qwen_image_2.1_int8_convrot.safetensors 权重只有7G,任何显卡都能跑。
Qwen Image 2.1最强的应该是图像编辑功能。
比如保持 <image1> 中的人物和姿势不变,让该人物穿上 <image2> 中的浅蓝色牛仔衬衫。

-
【最强 35B MoE 模型】Qwen3.8‑35B‑A3B‑Distill‑GGUF -
【最强 35B MoE 模型】Qwen3.8‑35B‑A3B‑Distill‑GGUF
模型简介首先申明Qwen3.8‑35B‑A3B‑Distill‑GGUF不是Qwen官方发布的模型, 是Empero将 Qwen3.8 前沿模型蒸馏到 Qwen3.6‑35B‑A3B 的 Mixture‑of‑Experts(MoE)架构版本,提供多种 GGUF 量化文件,可直接用于 llama.cpp、Ollama、LM Studio、Jan、KoboldCpp 等推理框架。
模型特点:
- 35B 总参数
- 每 token 仅激活约 3B 参数(MoE 稀疏)
- 推理速度显著快于同体量稠密模型
🧠 架构细节
- 30 层 Gated DeltaNet
- 10 层 全注意力层
- 256 个专家,每 token 路由 8 个专家
️ 使用前注意加载此模型需要 支持 Qwen3.6 / Gated DeltaNet MoE 的新版 llama.cpp。
旧版本会直接加载失败。
GGUF 文件列表(量化方式与大小)文件名 量化 大小 说明 IQ2_M 12.558 GB 最小可用,16GB 显卡可跑 Q2_K 13.839 GB 2-bit K-quant,兼容性好 IQ3_M 16.340 GB 3-bit,高性价比 Q3_K_M 17.664 GB 常规 3-bit K-quant IQ4_XS 19.628 GB 接近 Q4_K_M,体积更小 Q4_K_M(推荐) 21.713 GB 质量与体积最佳平衡 Q5_K_M 25.348 GB 更高质量 Q6_K 29.209 GB 接近无损 Q8_0 37.802 GB 最高质量量化 BF16 71.067 GB 全精度参考版 Vision Projector 0.899 GB 图像输入需要搭配此文件
VRAM / RAM 需求指南量化 GPU VRAM CPU RAM IQ2_M / Q2_K 16GB 16GB IQ3_M / Q3_K_M 20–24GB 24GB IQ4_XS / Q4_K_M 24GB 32GB Q5_K_M / Q6_K 32GB 48GB Q8_0 48GB 64GB BF16 80GB+ 96GB MoE 架构让 CPU 推理比稠密模型更可行。
推理示例(llama.cpp)文本推理
llama-cli -m Qwen3.8-35B-A3B-Q4_K_M.gguf \ --temp 0.6 --top-p 0.95 --top-k 20 \ -n 16384 -cnv模型属于 推理模型(reasoning model),回答开头会带结构化块,需要在最终输出中清理掉。
图像推理(Vision)
llama-mtmd-cli \ -m Qwen3.8-35B-A3B-Q4_K_M.gguf \ --mmproj mmproj-Qwen3.8-35B-A3B-F16.gguf \ --image photo.jpg \ -p "Describe this image."视觉模型来自 Qwen3.6‑35B‑A3B,蒸馏过程未评估视觉能力。
🧩 Ollama / LM Studio / Jan / KoboldCpp
直接加载 GGUF 文件即可,聊天模板已内置。
推荐采样参数:temperature=0.6, top_p=0.95, top_k=20
校验下载下载地址:Qwen3.8-35B-A3B-Distill-GGUF
sha256sum -c SHA256SUMS --ignore-missing
许可模型权重使用 Apache‑2.0 许可。
-
【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流 -
【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流视频超分放大(RTX VSR) 工作流

视频超分放大(RTX VSR).json -
【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流视频放大修复(VOSR 2.0)工作流

-
【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流 -
【硬核实测】12GB 显存的极限救赎:我的 MiniMax H3 本地生成与 4K 超分工作流适用人群:
- 想跑 MiniMax H3 / Ref2VA / FL2VA
- 想做长视频、动作戏、打斗、镜头衔接
- 想在有限显存下追求画质最大化
🟥 为什么 12GB 显存也能跑长视频?
AI 视频推理显存需求动辄 24GB+,但通过 精度压缩、分段推理、显存碎片管理、软硬件分治,12GB 卡依然能做到:
- 长视频分段生成(>60 秒)
- 高动态动作戏稳定推理
- 4K 超分放大(RTX VSR)
- 画质不衰减的连续镜头
下面是完整的工作流拆解。
🟦 一、硬件与环境约束
️ 核心配置项目 配置 GPU RTX 5070(12GB VRAM) CPU Ryzen 5700X RAM 64GB 存储 SSD (48GB虚拟内存)
稳定策略:功耗墙锁死 80%锁功耗墙的好处:
- 避免瞬时电流尖峰导致黑屏
- 显存颗粒温度更低
- 长时间推理不掉帧
- 显卡寿命更健康
- 性能下降不足5%
🟦 二、模型与推理工作流(ComfyUI)
🧬 1. 混合权重(Hybrid)
兼顾 Ref2VA 的可控性 与 FL2VA 的画质:
minimax_h3_ref2va_hybrid_b20-49_pruned_w4a8_mixed.safetensors qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors minimax_h3_video_vae_int8_convrot.safetensors minimax_h3_audio_vae_fp32.safetensors加速 LoRA:
minimax_h3_turbo_v4_step600_ema.safetensors
️ 2. 精度方案:W4A8(黄金分割点)精度 显存占用 画质 推荐度 FP16 高 优秀
12GB 不稳INT8 ConvRot 中 良好
可用W4A8 低 良好
最佳平衡NVFP4 低 良好
50系专用
3. 加速引擎- MiniMax H3 Mem Eff Patch / Sage Attention Patch
- Block Sparse Attention
- TE-Speed-MiniMaxH3 (3.5+)
三者组合可减少 35–50% 推理时间。
4. 动态步数策略场景类型 步数 10 秒0.5M视频推理时间 文戏 / 静态 6-step ~150s 动作戏 / 打斗 8-step ~200s
5. 分段生成 + 引导重绘策略(长视频关键)核心逻辑:
- 使用“minmax h3 导演台”节点进行分段
- 每段生成 10 秒 视频
- 下一段以上一段的 尾帧 作为视频和声音引导
- 重绘幅度设为 0.65
建议:勾选每段生成后清理一次显存。
效果:
- 动作连续性提升一个档次
- 长视频画质不衰减
- 镜头衔接自然无跳帧
🟦 三、画质放大与修复(The “4K Strategy”)
目标: 在不进行离线 4K 推理的情况下,最终输出依然达到 4K 观感。
🧩 第一阶段:视频质量修复(VOSR 2.0)
输入:960×544
输出:1080pVOSR 的优势:
- 修复硬线条
- 修复文字
- 修复人物皮肤
第二阶段:视频超分放大(RTX VSR)RTX+Video+Super+Resolution视频放大
输入:1080p
输出:4K- 基于 TensorRT 引擎
- 几乎不占显存
- 画质提升显著
- 适合长视频放大
🟩 四、最终总结
即使只有 12GB 显存:
- 通过 W4A8 精度压缩
- 加速LORA
- 分段重绘策略
- VOSR + RTX VSR 两段式增强
依然可以实现:
- 长视频生成
- 动作戏稳定推理
- 4K 观感输出
- 画质不衰减的连续镜头
如果你也在用 50 系列或 40 系列显卡跑 MiniMax H3,欢迎在评论区分享你的工作流参数。
-
神秘开源模型Ox Alpha身份揭晓近期的热点 “牛来” 大模型(在 OpenRouter 上匿名上线时名为 Ox Alpha)已被官方证实就是智谱 AI 发布的 GLM-5.3-Flash。
GLM‑5.3‑Flash vs DeepSeek‑V4‑Flash vs DeepSeek‑V4‑Pro
🧮 1. 规格总览(参数、架构、上下文)
模型 总参数 激活参数 架构 上下文窗口 多模态 GLM‑5.3‑Flash 320B MoE 18B 混合专家 1M 图文多模态 DeepSeek‑V4‑Flash 284B MoE 13B MoE 1M 文本 DeepSeek‑V4‑Pro 1.6T MoE 49B MoE 1M 文本
2. API 价格(输入 / 输出 / 缓存)官方公开价格(每百万 token)
GLM‑5.3‑Flash
- 输入:$0.15 / 1M
- 输出:$0.50 / 1M
限时优惠价格(5折)
- 输入:$0.075 / 1M
- 输出:$0.25/ 1M
DeepSeek‑V4‑Flash
- 输入:$0.14 / 1M
- 输出:$0.28 / 1M
- 缓存读:$0.028 / 1M
DeepSeek‑V4‑Pro
- 输入:价格上调(更贵)
- 输出:显著更贵
3. 性能(速度、吞吐、延迟)模型 输出速度(tok/s) 首 token 延迟 GLM‑5.3‑Flash ~50 tok/s 0.67s(旗舰) DeepSeek‑V4‑Flash 119.4 tok/s(最快) 0.82s DeepSeek‑V4‑Pro ~70 tok/s(DGX Spark) 0.9s(AA)
🧠 4. 智能水平(基准分)
Artificial Analysis(可比数据)
指标 GLM‑5.3‑Flash DeepSeek‑V4‑Flash DeepSeek‑V4‑Pro Intelligence Index 57 52 更高(旗舰) Coding Index 44.2(GLM‑5) 38.7 61.4 GPQA 0.820(GLM‑5) 0.894(更强科学推理) 更强(旗舰)
5. Agent / RAG / 工具调用表现GLM‑5.3‑Flash
- MCP / Tool 调用稳定
- 长任务链不容易断
- 多模态可直接看截图修 bug
DeepSeek‑V4‑Flash
- JSON 输出干净
- 适合轻量 Agent、高并发
- 长任务链容易断,需要 Harness
DeepSeek‑V4‑Pro
- 复杂推理强
- 但长工程上下文追踪弱于 GLM
6. 私有化部署GLM‑5.3‑Flash
- 已开源(MIT)
- 支持国产卡
- 本地部署友好
DeepSeek‑V4‑Flash / Pro
- 权重 MIT 开源
- 生态成熟
维度 GLM‑5.3‑Flash DeepSeek‑V4‑Flash DeepSeek‑V4‑Pro 总参数 320B MoE 284B MoE 1.6T MoE 激活参数 18B 13B 49B 上下文窗口 1M 1M 1M 多模态 图文 文本 文本 输入价格 $0.15/M $0.14/M 更贵 输出价格 $0.50/M $0.28/M 更贵 输出速度 ~50 tok/s 119 tok/s ~70 tok/s 智能指数 57 52 更高 代码能力 强 中等 最强(算法) Agent 稳定性 最稳 中等 中等 私有化 MIT 开源 MIT 开源 MIT 开源 GLM‑5.3‑Flash实际挑战SVG生成的中国传统太极八卦

-
神秘大模型Ox Alpha 、性能很强、还完全免费的 AI 模型。 -
神秘大模型Ox Alpha 、性能很强、还完全免费的 AI 模型。 -
神秘大模型Ox Alpha 、性能很强、还完全免费的 AI 模型。

