跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
B

Brian

@Brian
德高望重
取消关注 关注
关于
帖子
17
主题
3
分享
0
群组
1
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功
    B Brian

    Hermes+Deepseek整理,不保证全对。

    硬件环境

    组件 详情
    CPU Intel Xeon E5-2686 v4
    主板 X99(无 GPU P2P 直连)
    GPU 2× AMD Radeon AI PRO R9700 (RDNA4 / gfx1201)
    显存 每卡 32 GB GDDR6
    系统内存 62 GB
    OS Ubuntu 24.04
    ROCm 7.2.4
    Python 3.12 (conda: sglang-triton36)

    模型信息

    参数 数值
    模型 Qwen3.6-27B-FP8(HuggingFace 本地缓存)
    架构 Qwen3.5 (GDN + 混合注意力),64 层
    量化 Native FP8 (e4m3, dynamic activation scheme)
    模型大小 29 GB(磁盘)
    隐藏维度 5120
    注意力头 24 (Q) / 4 (KV),head_dim=256
    词表 248,320
    最大上下文 262,144 (256K)

    当前配置 (2026-06-15)

    启动命令

    # 激活环境
    export PATH="/home/xxx/miniforge3/bin:/home/XXX/.cargo/bin:$PATH"
    source /home/XXX/miniforge3/etc/profile.d/conda.sh
    conda activate sglang-triton36
    
    # 启动服务
    python -m sglang.launch_server \
      --model-path /home/XXX/models-hf/Qwen3.6-27B-FP8 \
      --tp-size 2 \
      --mem-fraction-static 0.75 \
      --context-length 262144 \
      --attention-backend triton \
      --fp8-gemm-backend triton \
      --trust-remote-code \
      --port 23334 \
      --host 0.0.0.0 \
      --disable-custom-all-reduce \
      --cuda-graph-max-bs 1 \
      --cuda-graph-bs 1 \
      --max-running-requests 1 \
      --num-continuous-decode-steps 8 \
      --max-mamba-cache-size 8 \
      --chunked-prefill-size 8192 \
      --disable-overlap-schedule \
      --tool-call-parser qwen3_coder \
      --chat-template /home/XXX/models-hf/Qwen3.6-27B-FP8/chat_template_nothink.jinja \
      --speculative-algorithm NEXTN \
      --speculative-num-steps 5 \
      --speculative-num-draft-tokens 2 \
      --speculative-eagle-topk 1 \
      --allow-auto-truncate \
      --log-requests
    

    关键参数说明

    参数 值 原因
    --tp-size 2 双卡 TP 256K 单卡装不下 KV cache
    --mem-fraction-static 0.75 75% 显存 MTP draft graph 额外占用,0.80 会 OOM
    --context-length 262144 256K 上下文 模型最大上下文
    --fp8-gemm-backend triton Triton GEMM RDNA4 最优 FP8 矩阵乘后端
    --disable-custom-all-reduce 禁用 X99 无 GPU P2P,必须禁用
    --cuda-graph-max-bs 1 单 batch graph CUDA graph 解码提速
    --disable-overlap-schedule 禁用 overlap Mamba no_buffer 不兼容
    --tool-call-parser qwen3_coder Qwen3 工具调用 Hermes Agent function calling
    --chat-template nothink.jinja 自定义模板 关闭 thinking(无 reasoning_parser,模板去掉了 <think> 标签)
    --speculative-algorithm NEXTN MTP (EAGLE) 内建 MTP 加速解码
    --speculative-num-steps 5 5 步 draft 最优值:4.38 accept_len,68% accept_rate
    --speculative-num-draft-tokens 2 每步 2 token 配合 steps=5
    --speculative-eagle-topk 1 单分支 topk=2 无额外收益且占更多显存
    --allow-auto-truncate 自动截断 超过 KV cache (147K tokens) 自动截断而非 400 报错
    --max-running-requests 1 单请求 单用户优化
    --log-requests 请求日志 生产调试

    显存分配 (256K 上下文 + MTP)

    GPU 模型权重 KV Pool Draft Graph CUDA Graph + 驱动 余量
    GPU0 ~17 GB ~8 GB ~0.3 GB ~5 GB ~5.6 GB
    GPU1 ~17 GB ~8 GB ~0.3 GB ~5 GB ~5.6 GB

    max_total_num_tokens=146964,allow_auto_truncate=True 超过自动截断。

    思考模式

    • reasoning_parser=None — 无 reasoning parser
    • chat_template_nothink.jinja — 自定义模板,add_generation_prompt 中不输出 <think> 标签
    • enable_thinking 变量处理已完全移除
    • 模型训练行为残留的 <think> 标签(output_ids 以 248068=`

    <||DSML||tool_calls>
    <||DSML||invoke name="write_file">
    <||DSML||parameter name="content" string="true"> 开头)属于模型输出内容,不影响 reasoning_tokens(始终为 0)

    • NOTE: 编辑 chat_template_nothink.jinja 后禁止还原 <think> 标签。如 SGLang 版本升级后模板行为变化,参考本文件的"思考模式"说明进行调试。

    性能基准

    Decode 速度 (MTP steps=5)

    场景 速度 (MTP) 速度 (无 MTP) 提升
    短上下文 (<1K) ~34 tok/s ~18 tok/s +89%
    中等上下文 (4K–32K) ~30 tok/s ~18 tok/s +67%

    MTP 参数对比测试结果

    steps draft_tokens topk 速度 accept_len accept_rate
    无 MTP - - ~18 tok/s - -
    1 2 1 ~24 tok/s 1.88 88%
    3 2 1 ~29 tok/s 3.08 69%
    4 2 1 ~30 tok/s 3.38 56%
    5 2 1 ~34 tok/s 4.38 68%
    6 2 1 ~33 tok/s 4.62 60%
    5 4 2 ~28 tok/s 3.23 72%

    最优:steps=5, draft_tokens=2, topk=1。Steps=2 以上会在 CUDA graph 捕获阶段增加 draft graph(约 0.3GB 显存开销)。

    Prefill 速度 (chunk_size=8K)

    上下文 速度
    16K ~473 tok/s
    64K ~450 tok/s
    108K ~407 tok/s

    环境搭建步骤

    1. 安装 Miniforge3

    curl -L -o /tmp/miniforge.sh "https://github.com/conda-forge/miniforge/releases/latest/download/Miniforge3-Linux-x86_64.sh"
    bash /tmp/miniforge.sh -b -p /home/gaopy/miniforge3
    

    2. 安装 Rust (SGLang 编译需要)

    curl --proto '=https' --tlsv1.2 -sSf https://sh.rustup.rs | sh -s -- -y
    

    3. 克隆并运行 SGLang RDNA4 setup

    git clone https://github.com/mattbucci/2x-R9700-RDNA4-GFX1201-sglang-inference.git sglang-rdna4
    cd sglang-rdna4
    export PATH="/home/gaopy/miniforge3/bin:/home/gaopy/.cargo/bin:$PATH"
    bash scripts/setup.sh
    

    4. 修复依赖冲突

    conda activate sglang-triton36
    cp components/sglang/sgl-kernel/python/sgl_kernel/*.py $CONDA_PREFIX/lib/python3.12/site-packages/sgl_kernel/
    pip install kernels==0.14.1
    pip install --force-reinstall --no-deps transformers==5.8.0
    bash scripts/build_awq_gemv.sh --env sglang-triton36
    cd components/sglang
    git checkout v0.5.12
    for p in ../../patches/0*.patch; do git apply --3way "$p" 2>/dev/null; done
    pip install -e "python[all]" --no-build-isolation --no-deps
    

    5. 下载模型(FP8)

    huggingface-cli download Qwen/Qwen3.6-27B-FP8 \
      --local-dir /home/gaopy/models-hf/Qwen3.6-27B-FP8 \
      --max-workers 4
    

    服务接口

    # 健康检查
    curl http://localhost:23334/health
    
    # 模型列表
    curl http://localhost:23334/v1/models
    
    # 推理 (OpenAI 兼容)
    curl http://localhost:23334/v1/chat/completions \
      -H "Content-Type: application/json" \
      -d '{
        "model": "/home/XXX/models-hf/Qwen3.6-27B-FP8",
        "messages": [{"role": "user", "content": "Hello"}],
        "max_tokens": 100,
        "temperature": 0.7
      }'
    

    已知问题

    1. thinking 残留 — 模型训练行为,</think> 标签以 248068/248069 token 形式出现在输出开头,不影响内容质量
    2. X99 无 GPU P2P — 多卡必须用 --disable-custom-all-reduce
    3. 首次启动慢 — 模型加载 + KV cache 分配 + CUDA graph + draft graph 捕获约 90 秒
    4. FP8 GEMM 警告 — 启动时提示 Using default W8A8 Block FP8 kernel config,性能可能未达最优,等待社区提交 R9700 调优配置
    5. Triton deprecation warning — tl.where with non-boolean condition,当前不影响运行

    版本历史

    日期 变更
    2026-06-15 MTP 加速 (+89%, ~34 tok/s);思考关闭 (no-think v2 模板);添加 --allow-auto-truncate;上下文 256K
    2026-06-14 从 AWQ 切换到 Native FP8;添加 no-think 模板绕过 reasoning_parser 自动检测
    2026-06-13 初始部署:AWQ + 256K,后因 OOM 切换 FP8
    LLM讨论区 r9700 ai-pro-r9700 sg-lang

  • 双 R9700 部署 — GPU1 跑 SGLang 256K 大模型,GPU0 跑 ComfyUI MiniMax H3 视频,工具已经免费,专注内容
    B Brian

    两张AI Pro R9700,一张sglang 部署qwen3.8-27b awq,一张comfyui,完整配置,hermes操控视频生成。

    sglang速度可接受,长上下文decode不衰减,llamacpp需要用到内存,影响comfyui,所以不能用了comfyui,内存条太贵,64g刚够用。

    comfyui 质量0.4,10步,15s用时20-25min左右。无人值守生成视频(试了才知道,做视频是个辛苦活,写脚本不容易)

    如下供参考

    双 R9700 (RDNA4 / gfx1201) 单宿主部署 — GPU1 跑 SGLang 256K 大模型,GPU0 跑 ComfyUI MiniMax H3 视频

    一台机器、两张 R9700 (RDNA4 / gfx1201, 32G),各挂一个 systemd 服务并行跑:GPU1 跑 SGLang 256K 上下文大模型,GPU0 跑 ComfyUI 生成 MiniMax H3 视频。配置全部从实际运行进程逐参数核实,含每个参数的作用、AMD 特定点、显存分配逻辑,以及 50K→250K 的 prefill/decode 实测数据和 H3 视频尺寸/质量结论。直接可抄。


    1. 硬件与环境

    项 值
    GPU 2× AMD Radeon PRO R9700(RDNA4,gfx1201),各 32GB VRAM
    分工 GPU1 = SGLang 大模型(HIP_VISIBLE_DEVICES=1);GPU0 = ComfyUI 视频生成(HIP_VISIBLE_DEVICES=0)
    内存 宿主 64G RAM(ComfyUI 单元限 60~62G,OOMScoreAdjust=-500 保命)
    软件栈 ROCm(/opt/rocm)
    SGLang stock 0.5.16 + sglang-rdna4 社区 fork(通过 PYTHONPATH 覆盖,关键!)
    Python 3.12.13(miniforge env sglang-triton36)
    模型 mattbucci Qwen3.8-27B-AWQ(AWQ int4 量化,含多模态)
    架构 Qwen3_5ForConditionalGeneration(model_type qwen3_5)

    要点:gfx1201 (RDNA4) 不在 ROCm 官方支持列表,stock sglang 跑不起来。需要 (a) HSA_OVERRIDE_GFX_VERSION=12.0.1 把 target 映射到已识别的 gfx 版本,(b) 用适配 RDNA4 的 sglang fork。单卡 32G 靠 AWQ int4 权重 + fp8 KV cache 才塞下 256K。

    双卡隔离:两个服务用 HIP_VISIBLE_DEVICES 分别钉到 GPU1 / GPU0,互不抢卡、并行跑。SGLang 占满 GPU1,ComfyUI 独占 GPU0 跑 H3 视频生成,互不干扰。


    2. 启动命令

    python -m sglang.launch_server \
      --model-path /path/to/Qwen3.8-27B-AWQ \
      --quantization awq \
      --served-model-name qwen3.8-27b \
      --enable-multimodal \
      --dtype bfloat16 \
      --kv-cache-dtype fp8_e4m3 \
      --context-length 262144 \
      --mem-fraction-static 0.85 \
      --max-running-requests 1 \
      --num-continuous-decode-steps 16 \
      --chunked-prefill-size 8192 \
      --max-prefill-tokens 16384 \
      --cuda-graph-backend-decode full \
      --attention-backend triton \
      --max-mamba-cache-size 8 \
      --mamba-ssm-dtype bfloat16 \
      --reasoning-parser qwen3 \
      --tool-call-parser qwen3_coder \
      --trust-remote-code \
      --watchdog-timeout 1200 \
      --host 0.0.0.0 --port 23334
    

    参数逐项说明

    参数 值 为什么
    --quantization awq awq 权重 AWQ int4,省显存
    --dtype bfloat16 bfloat16 激活/中间张量精度(权重仍按 int4 加载)
    --kv-cache-dtype fp8_e4m3 核心省显存项:KV 用 fp8 比 bf16 省一半,是 256K 能跑起来的关键
    --context-length 262144 256K 上下文
    --mem-fraction-static 0.85 预留给权重+KV 的显存比例。0.85 在 32G 单卡上稳妥,太高会 OOM
    --max-running-requests 1 单请求批次,长上下文场景下 decode 最稳最可预测(牺牲并发)
    --chunked-prefill-size 8192 prefill 按 8K 分块,平衡峰值显存和首 token 延迟
    --max-prefill-tokens 16384 单批 prefill token 上限
    --num-continuous-decode-steps 16 连续解码步数,配 cuda graph 降 kernel launch 开销
    --cuda-graph-backend-decode full decode 用完整 graph,AMD 上映射到 HIP graph
    --attention-backend triton AMD 必须:NVIDIA 的 FA 在 AMD 不可用,走 Triton 版 FlashAttention
    --max-mamba-cache-size 8 该架构含 mamba/SSM 层,限制其缓存规模
    --mamba-ssm-dtype bfloat16 SSM 层精度
    --enable-multimodal - 开启视觉(配 mmproj)
    --reasoning-parser qwen3 解析 think 推理块
    --tool-call-parser qwen3_coder tool call 解析
    --watchdog-timeout 1200 关键:20 分钟。256K 长 prefill 单次可达 15min+,默认值会被 watchdog 误杀
    --trust-remote-code - 加载模型自定义 code

    3. 环境变量(AMD 关键项,放 systemd Environment= 或脚本)

    # 让 ROCm 把不支持的 gfx1201 映射到已知 target
    HSA_OVERRIDE_GFX_VERSION=12.0.1
    # 指定用哪张卡(0 或 1)
    HIP_VISIBLE_DEVICES=1
    HIP_PATH=/opt/rocm
    ROCM_PATH=/opt/rocm
    
    # AMD 版 FlashAttention 走 Triton
    FLASH_ATTENTION_TRITON_AMD_ENABLE=TRUE
    # 关掉 AITER(AMD kernel 库)及其 all-reduce —— RDNA4 上稳定性问题
    SGLANG_USE_AITER=0
    SGLANG_USE_AITER_AR=0
    # 关 SDMA 拷贝引擎(稳定性)
    HSA_ENABLE_SDMA=0
    HSA_FORCE_FINE_GRAIN_PCIE=1
    GPU_MAX_HW_QUEUES=8
    HIP_FORCE_DEV_KERNARG=1
    # 禁 torch tunableop(AMD 上不稳)
    PYTORCH_TUNABLEOP_ENABLED=0
    PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
    TOKENIZERS_PARALLELISM=false
    
    # ⚠️ 指向 RDNA4 适配的 sglang fork(本配置能跑起来的另一半关键)
    PYTHONPATH=/path/to/sglang-rdna4/components/sglang/python
    

    4. systemd 服务(完整 unit,可直接抄改)

    [Unit]
    Description=SGLang Qwen3.8-27B AWQ int4 single GPU 256K multimodal
    After=network.target
    
    [Service]
    Type=simple
    WorkingDirectory=/home/YOU
    Environment="PATH=/path/to/venv/bin:/usr/bin:/bin"
    Environment="PYTHONPATH=/path/to/sglang-rdna4/components/sglang/python"
    Environment="ROCM_PATH=/opt/rocm"
    Environment="HIP_PATH=/opt/rocm"
    Environment="HSA_OVERRIDE_GFX_VERSION=12.0.1"
    Environment="GPU_MAX_HW_QUEUES=8"
    Environment="HIP_FORCE_DEV_KERNARG=1"
    Environment="HSA_FORCE_FINE_GRAIN_PCIE=1"
    Environment="FLASH_ATTENTION_TRITON_AMD_ENABLE=TRUE"
    Environment="PYTORCH_TUNABLEOP_ENABLED=0"
    Environment="SGLANG_USE_AITER=0"
    Environment="SGLANG_USE_AITER_AR=0"
    Environment="HSA_ENABLE_SDMA=0"
    Environment="HIP_VISIBLE_DEVICES=1"
    Environment="TOKENIZERS_PARALLELISM=false"
    Environment="PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True"
    ExecStart=/path/to/venv/bin/python -m sglang.launch_server \
        --model-path /path/to/Qwen3.8-27B-AWQ \
        --enable-multimodal --quantization awq \
        --served-model-name qwen3.8-27b \
        --dtype bfloat16 --kv-cache-dtype fp8_e4m3 \
        --context-length 262144 --mem-fraction-static 0.85 \
        --num-continuous-decode-steps 16 --max-running-requests 1 \
        --chunked-prefill-size 8192 --max-prefill-tokens 16384 \
        --cuda-graph-backend-decode full --attention-backend triton \
        --max-mamba-cache-size 8 --mamba-ssm-dtype bfloat16 \
        --reasoning-parser qwen3 --tool-call-parser qwen3_coder \
        --trust-remote-code --watchdog-timeout 1200 \
        --host 0.0.0.0 --port 23334
    Restart=on-failure
    RestartSec=10
    TimeoutStopSec=120
    
    [Install]
    WantedBy=default.target
    

    用户级服务用 systemctl --user,记得 loginctl enable-linger YOURUSER 才能在重启后自动拉起。


    5. 实测性能(单卡 32G,冷 prefill / 每请求强制冷缓存)

    上下文 prompt_tokens 首 token (TTFT) Prefill Decode
    50K 50,005 59.6s 838 tok/s 24.7 tok/s
    100K 100,003 170.0s 588 tok/s 23.2 tok/s
    150K 150,000 392.2s 382 tok/s 21.7 tok/s
    200K 200,078 606.2s 330 tok/s 20.5 tok/s
    250K 250,075 921.2s 272 tok/s 19.3 tok/s

    结论

    • Prefill 随上下文陡降:50K→250K 从 838 掉到 272 tok/s(约 3× 降)。250K prefill 一次 ~15 分钟,长上下文冷启动要有耐心 / 配合 warm cache。
    • Decode 基本稳:24.7 → 19.3 tok/s,仅降 ~22%(单 token 出,KV 长度增长影响有限)。
    • 想要更快首 token:开 radix cache / 复用前缀,或把 --chunked-prefill-size 调大。

    6. ComfyUI (GPU0) — MiniMax H3 视频生成

    GPU0 上跑 ComfyUI 生成 MiniMax H3 视频。模型合计 ~51G(diffusion 20G + text_encoder 26G + 视频 VAE 4.9G + 音频 VAE 0.6G),单张 32G 卡装不下,靠 --lowvram 把权重经系统内存轮流换入显存(以速度换显存)。

    启动命令 / systemd

    # comfyui-gpu0.service
    [Service]
    Type=simple
    WorkingDirectory=/path/to/ComfyUI
    Environment="HIP_VISIBLE_DEVICES=0"
    Environment="HSA_OVERRIDE_GFX_VERSION=12.0.1"
    Environment="GPU_MAX_HW_QUEUES=8"
    Environment="PYTORCH_TUNABLEOP_ENABLED=0"
    Environment="TOKENIZERS_PARALLELISM=false"
    ExecStart=/path/to/ComfyUI/.venv/bin/python3 /path/to/ComfyUI/main.py \
        --listen 0.0.0.0 \
        --port 8189 \
        --lowvram \
        --database-url sqlite:////tmp/comfyui_gpu0.db
    Restart=on-failure
    RestartSec=10
    # 降低 OOM killer 优先级 - 让 ComfyUI 不容易被杀
    OOMScoreAdjust=-500
    # 允许使用 swap 缓解瞬时内存峰值(--lowvram 依赖大内存换入换出)
    MemoryHigh=60G
    MemoryMax=62G
    
    [Install]
    WantedBy=default.target
    

    关键项:

    • --lowvram:H3 全模型 >51G,单卡 32G 装不下,必须开启——权重放系统内存,用时按层换入 GPU。代价是生成变慢,但能跑起来。
    • HIP_VISIBLE_DEVICES=0:钉死 GPU0,和 GPU1 的 SGLang 物理隔离。
    • OOMScoreAdjust=-500 + MemoryHigh/Max=60~62G:--lowvram 会吃大量系统 RAM,给 ComfyUI 大内存配额并降低被 OOM killer 优先杀的概率。
    • --database-url sqlite:////tmp/...:用独立 SQLite,避免和别的实例抢库。

    MiniMax H3 工作流(本地已有,可直接用)

    • 文生视频 T2V:ComfyUI/user/default/workflows/MiniMax_H3_T2V_AMD.json
    • 图生视频 I2V:ComfyUI/user/default/workflows/MiniMax_H3_I2V_AMD.json

    H3 是 MiniMax 的 omni-modal 生成模型,原生立体声(人声/音效/音乐一次前向联合生成,不是后期贴上去)。输出最高 2K / 24fps / ~15s。

    节点 作用
    4c314f31-...(H3 Generate 节点) prompt + width/height + duration + 4 个模型文件 → VIDEO
    ResolutionSelector 设宽高,按 megapixel 档位 + 32 的倍数对齐
    SaveVideo 输出 mp4
    LoadImage + ImageScaleToTotalPixels(I2V) 首帧/参考图,缩到目标总像素

    模型文件(下载到对应目录):

    ComfyUI/models/
    ├── diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors   (20G)
    ├── text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors       (26G)
    ├── vae/minimax_h3_video_vae_fp16.safetensors                            (4.9G)
    └── vae/minimax_h3_audio_vae_fp32.safetensors                            (0.6G)
    

    全部来自 Comfy-Org/MiniMax-H3。依赖新版 ComfyUI(含 ComfyUI#15224 的 H3 节点),老版本没有这些节点。

    视频尺寸 / 质量 — 建议 0.4MP

    实测结论:分辨率不要开太高,稳定档位是 0.4。

    H3 原生画布 768px 短边,上限 768×1344,按 32 的倍数对齐。ResolutionSelector 的 megapixel 档位对应输出(16:9):

    megapixels 16:9 输出 说明
    0.2 608×352 很小
    0.4 864×480 ✅ 本机稳定档位
    0.5 960×544 开始吃紧
    0.6 1056×608 更吃紧
    1.0 1376×768 接近上限,32G + lowvram 吃力
    2.0 1920×1088 2K,单卡基本跑不动/很慢

    本机实际跑通的视频(ffprobe 实测):

    • 16:9 文生视频 → 864×480 @24fps, 15s, H.264 + AAC 立体声
    • 1:1 图生视频 → 640×640 @24fps, 15s, H.264 + AAC 立体声

    这些都落在 0.4MP 档。在 32G 单卡 + --lowvram 下,0.4 是质量和速度的平衡点;往 0.6/1.0 以上开,要么 OOM 要么慢到不可用。建议默认 0.4。

    维度 建议
    分辨率 0.4MP(16:9 → 864×480;1:1 → 640×640)
    时长 15s(H3 上限约 15s;帧数按 17k+5 网格在 24fps 下对齐)
    帧率 24fps(固定)
    音频 原生立体声 AAC(无需另配)

    7. 踩坑清单(AMD 党必看)

    1. stock sglang 跑不了 RDNA4 → 必须 sglang-rdna4 fork(PYTHONPATH 覆盖)+ HSA_OVERRIDE_GFX_VERSION=12.0.1。
    2. --watchdog-timeout 必须调大:256K 单次 prefill >15min,默认 30min 内还好,但并发/重试场景会被误杀,建议 ≥1200s。
    3. --kv-cache-dtype fp8_e4m3 是省显存主力:bf16 KV 在 256K 会爆显存,fp8 直接减半。
    4. --attention-backend triton:别用默认,AMD 上默认 FA 路径不可用。
    5. 关 AITER / SDMA / tunableop:RDNA4 上这几个是稳定性和 crash 的主要来源。
    6. --max-running-requests 1:单卡长上下文先跑通单请求,并发后续再加。
    7. 显存紧张先降 --mem-fraction-static(0.85→0.8)或缩短 --context-length。
    8. 双卡务必用 HIP_VISIBLE_DEVICES 物理隔离:SGLang 钉 =1、ComfyUI 钉 =0,否则两边抢同一张卡互相 OOM。改错卡号 = 服务起不来或抢占崩溃。
    9. H3 模型 >51G,必须 --lowvram:单张 32G 卡装不下,关 lowvram 直接 OOM。代价是生成慢(权重经系统内存换入换出)。
    10. ComfyUI 给足系统内存配额:--lowvram 吃 RAM,单元里设 MemoryHigh/Max=60~62G + OOMScoreAdjust=-500,否则系统 RAM 不够时 ComfyUI 容易被 OOM killer 先杀掉。
    11. H3 分辨率锁 0.4MP:开 0.6/1.0/2K 在 32G+lowvram 下要么 OOM 要么慢到不可用。0.4(16:9→864×480、1:1→640×640)是稳定且可用的档。
    12. ComfyUI 要新版:H3 节点来自 ComfyUI#15224,老版本没有这些节点,会报"missing node type"。
    AI音视频画图 r9700 sg-lang comfyui

  • 比较流畅的跑Qwen 3.6 27B 模型本地部署,使用AI PRO R9700,主机怎么配置
    B Brian

    我刚配好,拼多多2800元, 2686v4*2,x99,1T,64g,不带显卡,显卡京东1.1万,电源700w,我自己换了1200w,长城750元。预装win10,本来想玩玩游戏再搞模型,win弹窗弹的难受,赶紧装了ubuntu,还在摸索,洋垃圾太强了

    AI硬件 r9700 ai-pro-r9700

  • 比较流畅的跑Qwen 3.6 27B 模型本地部署,使用AI PRO R9700,主机怎么配置
    B Brian

    安装了hermes,配了ds V4 pro,太省事了,不用怎么折腾

    AI硬件 r9700 ai-pro-r9700

  • 双AI Pro R9700 32g,Qwen 3.6 27b q4 KM q8 KV Ubuntu24 Hermes agent
    B Brian

    先说下感受,256k上下文,速度是真的慢,但是做研究真是很细。

    同时偶然发现在线API虽快,但是比较粗糙,需要驾驭很好才行。

    但是本地Qwen3.6,推理能力极强,工具调用,加上联网检索,最终效果挺好。

    即使是模型和hermes都设置256k上下文,herems还会触发压缩,最终效果还是很够用的。

    折腾了很多,Vllm和sglang搞不定,用了deepseek claude codex都搞不定,不是工具的问题,是我一点都不懂。只会说看看社区有什么成功的方案去尝试(我TM社区是啥都不知道)。

    以下是llama cpp参数。问了AI 256k上下文,就是这个速度,不知道有没有好的优化方法。

    硬件: 双 AMD Radeon AI Pro R9700(各 32GB VRAM)+ Intel Xeon E5-2686 v4

    参数 值 说明
    -m Qwen3.6-27B-Q4_K_M.gguf 标准版模型
    -ngl 99 全部层卸载到 GPU
    -c 262144 262K 上下文(医疗文档长文本需要)
    -np 1 单并行槽(避免 OOM)
    --split-mode layer 双卡按层切分(tensor 模式在 PCIe 瓶颈下更慢)
    --cache-type-k/v q8_0 KV cache 精度,保持质量
    --cache-ram 0 禁用跨请求 prompt cache(规避 crash)
    --no-cache-prompt — 禁用 prompt cache
    --mlock — 锁内存防 swap
    --defrag-thold 0.1 KV cache 碎片整理阈值
    --reasoning off — 关闭 thinking 模式
    -fa on — Flash Attention

    性能基准

    指标 数值
    llama.cpp 版本 b9586
    Decode 速度 ~24 tok/s(MTP版);~24 tok/s(标准版)
    Prefill 速度 ~562 tok/s(MTP版);~21 tok/s(标准版,短 prompt)
    tensor split 测试 19.4 tok/s(PCIe 瓶颈,不如 layer)
    LLM讨论区 r9700 ai-pro-r9700 hermes

  • 双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功
    B Brian

    IMG_1985.png
    最后MTP 3比较稳定。

    IMG_1983.png
    之前MTP 5有长任务会卡

    LLM讨论区 r9700 ai-pro-r9700 sg-lang
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组