跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
paul houP

paul hou

@paul hou
取消关注 关注
关于
帖子
7
主题
1
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4
    paul houP paul hou

    之前本地佈署都是靠著網站上的大神們的分享
    這個假日測了整整二天VLLM,最終使用了這個方案,結果不錯分享一下。

    https://github.com/magiccodingman/vllm-radiance

    模型

    • 主模型:/models/amd/Qwen3.8-27B-Quark-AWQ-MXFP4(served name: qwen3.8-27b-mxfp4)
    • Draft 模型:/models/tcclaviger/Qwen3.8-27B-DFlash2-FP8
    • 量化:MXFP4(W4A8),RADIANCE_MXFP4=1 + 全套 radiance 優化旗標(WPERM、HOIST_QUANT、EPIFAST、SKINNY_GEMM、R4D attention 等)

    引擎參數

    • tensor-parallel-size: 1(單卡 R9700 / gfx1201)
    • gpu-memory-utilization: 0.98
    • kv-cache-dtype: fp8,--kv-cache-memory 7,783,339,733 bytes(~7.3GB 固定分配)
    • max-num-seqs: 8
    • max-model-len: 163,840
    • max-num-batched-tokens: 8,192
    • attention-backend: R4D(+ RADIANCE_USE_R4D_GDN / R4D_AR / R4D_AR_QUANT)
    • speculative decoding: dflash,num_speculative_tokens=7,TRITON_ATTN,disable_padded_drafter_batch
    • mamba-cache-mode: align
    • prefix caching: 啟用
    • no-async-scheduling
    • tool call: qwen3_xml parser;reasoning parser: qwen3
    • override generation config: temperature 0.7 / top_p 0.95 / top_k 20
    • chat template: qwen-fixed-v22.3.jinja(掛載為 /chat-template.jinja)
    • language-model-only、trust-remote-code、HF_HUB_OFFLINE

    實際運行狀態(/metrics)

    • KV cache:288 blocks,共 180,098 tokens 容量,fp8
    • prefix cache 命中率:1.85M / 2.44M ≈ 75.9%
    • dflash spec decode:48,588 draft tokens → 17,180 accepted,整體接受率約 35%;position 0 接受率 69%(4920/7108),逐位遞減到 position 6 約 15%
    • 目前 0 running / 0 waiting,KV 使用率 0%
    • AITER:只啟用 UNIFIED_ATTENTION,其餘(MHA/MOE/MLA/RMSNORM/FP4BMM/FP8BMM)全關

    Prefill(長 context 預填)速度:

    prompt 長度 實際 tokens TTFT prefill 速度
    8K 7,470 3.22s 2,319 tok/s
    32K 29,742 11.49s 2,589 tok/s
    64K 59,409 17.95s 3,311 tok/s
    128K 118,772 45.52s 2,609 tok/s

    Prefill 穩定在 2,300-3,300 tok/s,128K context 約 45 秒完成預填。

    併發測試(每路 max 256 tok):

    併發路數 wall time 總輸出 聚合速度 單路速度
    1(先前) - 298 tok 41.5 tok/s 41.5
    2 7.5s 459 tok 61.4 tok/s 29-34
    4 8.7s 982 tok 113.5 tok/s 25-42
    8 12.7s 1,941 tok 152.4 tok/s 27-42

    實際在DSH的使用,單路思考時是很穩定在40 t/s左右,編程時會到70~80 t/s
    ,比起llama.cpp + UD-Q4_K_XL 思考時25~40t/s,編程時50~75 t/s 效能好上不少。

    LLM讨论区 r9700 vllm qwen-27b

  • 單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4
    paul houP paul hou

    @kos-or 有測試內建的MTP,結果就是9xx的prefill,30左右的decode,看來真的跟dflash2有關了。

    LLM讨论区 r9700 vllm qwen-27b

  • 單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4
    paul houP paul hou

    我是純LLM SERVER的方式在用,所以可以壓榨所有的VRAM來使用,另外是放棄了多模態沒上載入。二併發的情況下還是滿好用的。
    這套99.9%都是HERMES+DSV4F安裝好的,那2G應該可以想辦法搞出來。
    DSH新會話大約是3秒就開始動作,所以PREFILL是破3000的,這是我用這個的重點。

    1225f3f2-cf51-4b23-9959-f10088fdb83b-image.jpeg

    LLM讨论区 r9700 vllm qwen-27b
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组