跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
罗冰寒罗

罗冰寒

@罗冰寒
取消关注 关注
关于
帖子
11
主题
2
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 分享下双卡AMD R9700跑一下qwen3.8 27B效果
    罗冰寒罗 罗冰寒

    之前玩AI入的N卡看涨价厉害卖了。。。但实在又想玩AI本地部署(文本和视频都想玩),又入了两张r9700,今天刚点亮,跑个qwen3.8 27b给大家分享下

    硬件配置:

    操作系统:Ubuntu 24.04,内核 7.0.0-30-generic

    CPU:Intel Core Ultra 7 270K Plus(Arrow Lake)

    • 24 核,最高频率 5.5 GHz

    内存:64GB(系统识别 62GiB,当前空闲约 29GB)

    显卡:2× AMD Radeon AI PRO R9700(工作站版,RDNA4/gfx1201)

    • 单卡 32GB GDDR6,可用显存各 31.9 GiB
    • PCI ID 1002:7551
    • 双卡拓扑:PCIe 5.0 板内拆分 x8 + x8(主板 BIOS 启用)
      • card1 = 04:00.0(本地直连,承担显示输出)
      • card2 = 07:00.0(经 RPC 挂载,纯计算)
    • 驱动:Mesa RADV 25.2.8(Vulkan),内核 amdgpu
    • 未安装 ROCm(因此 llama.cpp 走 Vulkan 后端)

    主板:铭瑄 iCraft Z890 Pacific(Intel Z890 芯片组)

    工具

    【一、当前工具/部署栈】 │
    │ - llama.cpp b10568(Vulkan 预编译版)+ ggml-rpc-server(RPC 双卡桥) │
    │ - 模型:Qwen3.8-27B unsloth UD-Q6_K_L(6-bit 动态量化,22.5GB) │
    │ - 草稿模型:mtp-Qwen3.8-27B-Q4_0(1.37GB,MTP 投机解码用) │
    │ - GPU:Mesa RADV 25.2.8 驱动(RDNA4 gfx1201 原生支持) │
    │ - 服务器参数:128K 上下文、-cram 40000、-fa on、-np 1、--agent、--jinja │
    │ │
    │ 【二、已生效的加速机制】 │
    │ 1. MTP 投机解码:--spec-type draft-mtp + Q4 草稿模型(--spec-draft-n-max 3)。效果最显著:生成从 21 → 36-49 tok/s(约 1.6-2.3x),接受率实测 0.41-0.88 │
    │ 2. 双卡并行:layer split 流水线 + RPC,权重和 128K KV cache 按显存比例分摊(card1 1/3、card2 2/3),两卡实测负载 30%/69% │
    │ 3. Flash Attention:-fa on(注意:日志显示 fused Gated Delta Net 被禁用,flash-attn 正常) │
    │ 4. UD 动态量化:unsloth 的 Q6_K_L 质量接近 Q8、体积只有 24GB,带宽友好 │
    │ 5. KV cache 双卡分摊:128K 上下文 KV 全在显存(无 RAM 回退),这是 128K 下仍保持 36 tok/s 的关键 │
    │ 6. Prompt caching(自动):日志 graphs reused / LCP similarity 显示上下文复用已在工作,重复 prompt 命中缓存 │
    │ 7. 单槽位(-np 1):避免多槽 KV 碎片 │
    │ 8. 模型 mmap 加载:启动 17 秒,内存映射零拷贝 │
    │ │

    效果

    │ - 生成(tg):36 tok/s 稳定,短对话峰值 49 tok/s
    │ - prompt 处理(pp):短 prompt 497 t/s,长 prompt(375 tokens)280 t/s
    │ - 这是 27B 稠密模型 Q6 在双 R9700 上的成绩

    0f6eeff9-95c2-4642-a1f5-4d6f72e8e214-image.jpeg
    2d8d0d83-5c06-4266-af6c-f3c9607d4875-image.jpeg
    cd110124-58b6-4eb0-9255-6e4a49a015f9-image.jpeg

    AI硬件 r9700 qwen-27b 多卡部署

  • 分享下双卡AMD R9700跑一下qwen3.8 27B效果
    罗冰寒罗 罗冰寒

    查了一下 llama.cpp双卡调度可能不如vllm,晚上跑了一下单卡 27BQ4量化 +64k上下文+mtp+kvq4量化 速度50+t/s 明天再试试vllm跑双卡的;一个人用无并发 主要还是考虑输出质量

    AI硬件 r9700 qwen-27b 多卡部署

  • 双R9700跑minimaxH3效果分享
    罗冰寒罗 罗冰寒

    《重构人生》H3 视频 —— 跑通环境配置 & 时间基准

    日期:2026-08-31 凌晨(最终跑通版)
    结论:Ref2VA 测试片(含中文台词 + 字幕)已跑通,此文档记录可复现的环境配置与实测耗时。


    一、硬件

    • CPU:Intel Ultra 7 270K Plus(24 核 / 62GB 内存)
    • GPU:2× AMD Radeon AI PRO R9700 32GB(gfx1201 / RDNA4,PCIe 5.0 x8+x8,无 P2P)
    • 系统:Ubuntu 24.04

    二、软件栈(关键版本)

    组件 版本
    torch 2.11.0+rocm7.2(勿用 2.10+rocm7.0=挂死黑屏,勿用 2.12+rocm7.14=DynamicVRAM 卡死)
    torchvision / torchaudio 0.26.0+rocm7.2 / 2.11.0+rocm7.2
    ComfyUI 0.33.0
    comfy-kitchen 0.2.31(HIP 后端)
    comfy-aimdo 0.4.13(DynamicVRAM 未启用,健康态)
    Python 3.11.16(venv: ~/comfy-h3/venv)

    关键软链(comfy-kitchen HIP 原生内核):

    ln -sf libamdhip64.so libamdhip64.so.7   # 在 venv/.../torch/lib/ 下
    

    三、启动参数(ComfyUI)

    export HSA_XNACK=0
    python main.py --listen 127.0.0.1 --port 8188 --reserve-vram 1.0
    
    • 不带 --gpu-only(DiT 20GB 会因显存碎片 OOM)
    • HSA_XNACK=0 抑制 SVM 页迁移开销
    • 启动脚本:~/comfy-h3/start-comfy-rocm7.sh

    四、模型文件

    角色 文件 大小
    DiT 主模型 minimax_h3_fl2va_pruned_int8_convrot.safetensors 20G
    文本编码器 TE qwen3vl_32b_minimax_h3_int8_convrot.safetensors(INT8,必用,勿用 nvfp4) 26G
    视频 VAE minimax_h3_video_vae_fp16.safetensors 4.9G
    音频 VAE minimax_h3_audio_vae_fp32.safetensors 578M
    8步 turbo LoRA minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors 1.9G

    五、双卡摆放(ComfyUI-MultiGPU)

    组件 设备 节点
    DiT cuda:0 UNETLoaderMultiGPU(device=cuda:0)
    文本编码器 TE cuda:1 CLIPLoaderMultiGPU(device=cuda:1)
    视频 VAE cuda:1 VAELoaderMultiGPU(device=cuda:1)
    音频 VAE cuda:1 VAELoaderMultiGPU(device=cuda:1)

    六、工作流参数(8步 turbo)

    • 采样器 res_multistep + scheduler simple + steps=8 + denoise=1.0 + LoRA strength 1.0
    • 提交:~/comfy-h3/gen_h3.sh(T2V)/ ~/comfy-h3/gen_h3_ref2va.py(Ref2VA)
    • 帧网格 17k+5:5s=124帧、10s=243帧

    Ref2VA 测试片参数:768×1344 竖屏 / 243帧(10s) / 8步 / ref-size=match / 3 参考图(林远/赵天成/会议室)


    七、实测时间基准

    任务 分辨率/时长 采样速度 全程耗时
    H3 T2V 冒烟 864×480 / 5s(124帧) 11.6s/it 176s(约 3 分钟)
    Krea-2 生图 768×1344 1.35s/it 30s
    Ref2VA 测试片 768×1344 / 10s(243帧) 190s/it 27分03秒
    • 竖屏 768×1344 像素 ≈ 864×480 的 2.5 倍,加上 Ref2VA 参考图参与每个采样步,故 190s/it(T2V 横屏的 16 倍/步)。
    • 加载阶段(TE 26GB + DiT 20GB + 参考图)约 1.5 分钟;采样 8 步约 25 分钟;VAE 解码约 2 分钟。
    • dmesg SVM 计数全程 0(无卡死、无页迁移死循环)。

    八、跑通验证

    1. TE 加载:loaded completely; 30714.80 MB usable, 25883.83 MB loaded, full load: True(健康态,非 DynamicVRAM 分阶段)
    2. 身份三锚定:林远(侧分短发/细框眼镜/深灰T恤)、赵天成(中分油头/金丝眼镜/圆脸/藏青西装)、会议室(玻璃桌/红色 SYSTEM FAILURE 屏/冷白光)全部照图生成,零漂移、无第三人。
    3. 中文台词:<d>[Chinese] 林远,数据库是你动的吧?</d> + <d>[Chinese] 我没碰过生产数据。</d>,人声时段音量 +3~4dB 确认念出。
    4. 字幕:ASS(Noto Sans CJK SC,白字黑边)时间轴对齐台词。

    九、一句话可复现

    torch 2.11.0+rocm7.2 + ComfyUI 0.33 + INT8 TE + HSA_XNACK=0 + 8步 turbo + 双卡 MultiGPU,Ref2VA 竖屏 10s 约 27 分钟出片。

    AI音视频画图 r9700 minimax 视频生成
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组