跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. LLM讨论区
  3. AMD AI Pro R9700 LLM调教

AMD AI Pro R9700 LLM调教

已定时 已固定 已锁定 已移动 LLM讨论区
r9700ai-pro-r9700amd
22 帖子 9 发布者 459 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • 用户名违规用 离线
    用户名违规用 离线
    用户名违规
    编写于 最后由 编辑
    #6

    这个是我调了一周的sglang配置。
    主要目的是单线程,没有MTP,速度30t/s,有500K上下文。
    上了MTP,速度有60t/s,有300k上下文。最主要的是QWEN3.6-27B-FP8也不聪明。。但是又觉得有时候比云API聪明。
    主要是我的soul。md 明确了,所有问题优先社区找到答案。。处理问题的能力提升了一些。

    #!/bin/bash
    # SGLang 0.5.15 — sglang serve (官方推荐方式)
    # Qwen3.6-27B-MTP | RTX 4090D 48G
    set -euo pipefail
    
    # 路径与环境
    readonly SGLANG_VENV="/mnt/dataM4/venv_sglang"
    readonly MODEL_PATH="/mnt/dataM4/models/Qwen3.6-27B-AEON-Ultimate-Uncensored-FP8-MTP"
    
    export HF_HOME="/root/.cache/huggingface"
    export TRITON_CACHE_DIR="/root/sglang_cache/triton/cache"
    export TORCHINDUCTOR_CACHE_DIR="/root/sglang_cache/torch_compile"
    export FLASH_ATTENTION_CUTE_CACHE_DIR="/root/sglang_cache/flash_attn_cute_cache"
    
    export CUDA_HOME=/usr/local/cuda-12.8
    export PATH="$CUDA_HOME/bin:$PATH"
    export LD_LIBRARY_PATH="$CUDA_HOME/lib64"
    export LD_LIBRARY_PATH="/mnt/dataM4/venv_sglang/lib/python3.11/site-packages/nvidia/cusparselt/lib:$LD_LIBRARY_PATH"
    export CUDAHOSTCXX=/usr/bin/gcc-12
    export CC=/usr/bin/gcc-12
    export CXX=/usr/bin/g++-12
    
    export PYTORCH_ALLOC_CONF="expandable_segments:True"
    export CUDA_DEVICE_ORDER="PCI_BUS_ID"
    export CUDA_VISIBLE_DEVICES="0"
    export FLASHINFER_DISABLE_VERSION_CHECK=1
    export FLASH_ATTENTION_CUTE_DSL_CACHE_ENABLED=1
    
    source "${SGLANG_VENV}/bin/activate"
    
    SGLANG_ARGS=(
      --model-path "${MODEL_PATH}"
      --host 0.0.0.0
      --port 30000
      --trust-remote-code
      --tp-size 1
      --attention-backend flashinfer
      --mamba-backend flashinfer
      --kv-cache-dtype fp8_e4m3
      --page-size 16
      --mem-fraction-static 0.93
      --max-running-requests 1
      --prefill-max-requests 1
      --schedule-policy lpm
      --schedule-conservativeness 1.0
      --mamba-radix-cache-strategy extra_buffer
      --mamba-ssm-dtype bfloat16
      --mamba-full-memory-ratio 0.08
      --speculative-algorithm nextn
      --speculative-num-steps 2
      --speculative-eagle-topk 1
      --speculative-num-draft-tokens 2
      --tool-call-parser qwen3_coder
      --reasoning-parser qwen3
      --preferred-sampling-params '{"temperature": 0.7, "repetition_penalty": 1.2, "frequency_penalty": 0.5, "presence_penalty": 0.3}'
      --enable-dynamic-chunking
      --chunked-prefill-size 16384
      --radix-eviction-policy lru
      --enable-metrics
      --enable-streaming-session
      --enable-request-time-stats-logging
      --log-requests
      --log-requests-level 0
      --decode-log-interval 60
    )
    
    # 启动
    readonly SGLOG="/dev/shm/sglang/sglang.log"
    mkdir -p "$(dirname "$SGLOG")"
    
    # 日志轮转
    if ! pgrep -f sglang_log_rotate > /dev/null 2>&1; then
        nohup bash /root/sglang_log_rotate.sh >/dev/null 2>&1 &
    fi
    
    exec sglang serve "${SGLANG_ARGS[@]}" >>"$SGLOG" 2>&1
    
    
    terryT fcmeF 2 条回复 最后回复
    2
    • fcmeF fcme

      在座的各位大神,有没有关于在R9700上运行千问 3.6 27B 的时候各种框架时候的速度对比?
      拿它配合 Hermes 和其他的 Agent 使用的时候,用llamacpp Vulkan版本,PP 的速度还是太惨了,卡到不太想用。有没有大神试验过 vLLM 和 SGlang,跑起来速度怎么样?我在论坛里面找了一圈,也没有找到相关的材料,谢了!

      5 离线
      5 离线
      566656661
      超凡大师
      编写于 最后由 编辑
      #7

      @fcme

      vLLM的ROCm我記得是有支持AITER加速 (AMD自家Tensor Core, 應該是透過分拆Kernel來增加Decode速度)

      可以找找看有沒有人特意出vLLM 基於AITER版本的Docker Image, aml731我記得也有出, 就是不知道有沒有更新

      fcmeF 1 条回复 最后回复
      1
      • 用户名违规用 用户名违规

        这个是我调了一周的sglang配置。
        主要目的是单线程,没有MTP,速度30t/s,有500K上下文。
        上了MTP,速度有60t/s,有300k上下文。最主要的是QWEN3.6-27B-FP8也不聪明。。但是又觉得有时候比云API聪明。
        主要是我的soul。md 明确了,所有问题优先社区找到答案。。处理问题的能力提升了一些。

        #!/bin/bash
        # SGLang 0.5.15 — sglang serve (官方推荐方式)
        # Qwen3.6-27B-MTP | RTX 4090D 48G
        set -euo pipefail
        
        # 路径与环境
        readonly SGLANG_VENV="/mnt/dataM4/venv_sglang"
        readonly MODEL_PATH="/mnt/dataM4/models/Qwen3.6-27B-AEON-Ultimate-Uncensored-FP8-MTP"
        
        export HF_HOME="/root/.cache/huggingface"
        export TRITON_CACHE_DIR="/root/sglang_cache/triton/cache"
        export TORCHINDUCTOR_CACHE_DIR="/root/sglang_cache/torch_compile"
        export FLASH_ATTENTION_CUTE_CACHE_DIR="/root/sglang_cache/flash_attn_cute_cache"
        
        export CUDA_HOME=/usr/local/cuda-12.8
        export PATH="$CUDA_HOME/bin:$PATH"
        export LD_LIBRARY_PATH="$CUDA_HOME/lib64"
        export LD_LIBRARY_PATH="/mnt/dataM4/venv_sglang/lib/python3.11/site-packages/nvidia/cusparselt/lib:$LD_LIBRARY_PATH"
        export CUDAHOSTCXX=/usr/bin/gcc-12
        export CC=/usr/bin/gcc-12
        export CXX=/usr/bin/g++-12
        
        export PYTORCH_ALLOC_CONF="expandable_segments:True"
        export CUDA_DEVICE_ORDER="PCI_BUS_ID"
        export CUDA_VISIBLE_DEVICES="0"
        export FLASHINFER_DISABLE_VERSION_CHECK=1
        export FLASH_ATTENTION_CUTE_DSL_CACHE_ENABLED=1
        
        source "${SGLANG_VENV}/bin/activate"
        
        SGLANG_ARGS=(
          --model-path "${MODEL_PATH}"
          --host 0.0.0.0
          --port 30000
          --trust-remote-code
          --tp-size 1
          --attention-backend flashinfer
          --mamba-backend flashinfer
          --kv-cache-dtype fp8_e4m3
          --page-size 16
          --mem-fraction-static 0.93
          --max-running-requests 1
          --prefill-max-requests 1
          --schedule-policy lpm
          --schedule-conservativeness 1.0
          --mamba-radix-cache-strategy extra_buffer
          --mamba-ssm-dtype bfloat16
          --mamba-full-memory-ratio 0.08
          --speculative-algorithm nextn
          --speculative-num-steps 2
          --speculative-eagle-topk 1
          --speculative-num-draft-tokens 2
          --tool-call-parser qwen3_coder
          --reasoning-parser qwen3
          --preferred-sampling-params '{"temperature": 0.7, "repetition_penalty": 1.2, "frequency_penalty": 0.5, "presence_penalty": 0.3}'
          --enable-dynamic-chunking
          --chunked-prefill-size 16384
          --radix-eviction-policy lru
          --enable-metrics
          --enable-streaming-session
          --enable-request-time-stats-logging
          --log-requests
          --log-requests-level 0
          --decode-log-interval 60
        )
        
        # 启动
        readonly SGLOG="/dev/shm/sglang/sglang.log"
        mkdir -p "$(dirname "$SGLOG")"
        
        # 日志轮转
        if ! pgrep -f sglang_log_rotate > /dev/null 2>&1; then
            nohup bash /root/sglang_log_rotate.sh >/dev/null 2>&1 &
        fi
        
        exec sglang serve "${SGLANG_ARGS[@]}" >>"$SGLOG" 2>&1
        
        
        terryT 在线
        terryT 在线
        terry
        超级版主
        编写于 最后由 编辑
        #8

        @倭寇国を滅ぼす SG-Lang是最终解决方案,主要是Prefill速度提升很多,说实话,只有这个框架有一些本地部署的意义。Qwen3.6和DeepSeek V4 Flash差距不大,各有优劣,它反正不蠢,文档写好了是完全够用的,工具属性也足,驱动Hermes挺不错的。

        油管:https://www.youtube.com/@抡锤者

        1 条回复 最后回复
        0
        • 5 566656661

          @fcme

          vLLM的ROCm我記得是有支持AITER加速 (AMD自家Tensor Core, 應該是透過分拆Kernel來增加Decode速度)

          可以找找看有沒有人特意出vLLM 基於AITER版本的Docker Image, aml731我記得也有出, 就是不知道有沒有更新

          fcmeF 离线
          fcmeF 离线
          fcme
          技术大牛 劳动模范
          编写于 最后由 编辑
          #9

          @566656661 我在GitHub上下载了一个类似的里面下载量最高的一个,最后实际测试下来v l l m在r9700上性能不如llamacpp vulkan版本。
          最后还是老老实实用vulkan吧,毕竟跑35b q5的模型,开三路,pp都能到2300,tp能到50~55。体验已经相当不错了,如果要是能把这个pp再提高到4000左右就比较爽了,agent应用太吃pp了。不过好像也就5090能做到这个水平,但是这破玩意儿现在是真的贵。

          1 条回复 最后回复
          2
          • 用户名违规用 用户名违规

            这个是我调了一周的sglang配置。
            主要目的是单线程,没有MTP,速度30t/s,有500K上下文。
            上了MTP,速度有60t/s,有300k上下文。最主要的是QWEN3.6-27B-FP8也不聪明。。但是又觉得有时候比云API聪明。
            主要是我的soul。md 明确了,所有问题优先社区找到答案。。处理问题的能力提升了一些。

            #!/bin/bash
            # SGLang 0.5.15 — sglang serve (官方推荐方式)
            # Qwen3.6-27B-MTP | RTX 4090D 48G
            set -euo pipefail
            
            # 路径与环境
            readonly SGLANG_VENV="/mnt/dataM4/venv_sglang"
            readonly MODEL_PATH="/mnt/dataM4/models/Qwen3.6-27B-AEON-Ultimate-Uncensored-FP8-MTP"
            
            export HF_HOME="/root/.cache/huggingface"
            export TRITON_CACHE_DIR="/root/sglang_cache/triton/cache"
            export TORCHINDUCTOR_CACHE_DIR="/root/sglang_cache/torch_compile"
            export FLASH_ATTENTION_CUTE_CACHE_DIR="/root/sglang_cache/flash_attn_cute_cache"
            
            export CUDA_HOME=/usr/local/cuda-12.8
            export PATH="$CUDA_HOME/bin:$PATH"
            export LD_LIBRARY_PATH="$CUDA_HOME/lib64"
            export LD_LIBRARY_PATH="/mnt/dataM4/venv_sglang/lib/python3.11/site-packages/nvidia/cusparselt/lib:$LD_LIBRARY_PATH"
            export CUDAHOSTCXX=/usr/bin/gcc-12
            export CC=/usr/bin/gcc-12
            export CXX=/usr/bin/g++-12
            
            export PYTORCH_ALLOC_CONF="expandable_segments:True"
            export CUDA_DEVICE_ORDER="PCI_BUS_ID"
            export CUDA_VISIBLE_DEVICES="0"
            export FLASHINFER_DISABLE_VERSION_CHECK=1
            export FLASH_ATTENTION_CUTE_DSL_CACHE_ENABLED=1
            
            source "${SGLANG_VENV}/bin/activate"
            
            SGLANG_ARGS=(
              --model-path "${MODEL_PATH}"
              --host 0.0.0.0
              --port 30000
              --trust-remote-code
              --tp-size 1
              --attention-backend flashinfer
              --mamba-backend flashinfer
              --kv-cache-dtype fp8_e4m3
              --page-size 16
              --mem-fraction-static 0.93
              --max-running-requests 1
              --prefill-max-requests 1
              --schedule-policy lpm
              --schedule-conservativeness 1.0
              --mamba-radix-cache-strategy extra_buffer
              --mamba-ssm-dtype bfloat16
              --mamba-full-memory-ratio 0.08
              --speculative-algorithm nextn
              --speculative-num-steps 2
              --speculative-eagle-topk 1
              --speculative-num-draft-tokens 2
              --tool-call-parser qwen3_coder
              --reasoning-parser qwen3
              --preferred-sampling-params '{"temperature": 0.7, "repetition_penalty": 1.2, "frequency_penalty": 0.5, "presence_penalty": 0.3}'
              --enable-dynamic-chunking
              --chunked-prefill-size 16384
              --radix-eviction-policy lru
              --enable-metrics
              --enable-streaming-session
              --enable-request-time-stats-logging
              --log-requests
              --log-requests-level 0
              --decode-log-interval 60
            )
            
            # 启动
            readonly SGLOG="/dev/shm/sglang/sglang.log"
            mkdir -p "$(dirname "$SGLOG")"
            
            # 日志轮转
            if ! pgrep -f sglang_log_rotate > /dev/null 2>&1; then
                nohup bash /root/sglang_log_rotate.sh >/dev/null 2>&1 &
            fi
            
            exec sglang serve "${SGLANG_ARGS[@]}" >>"$SGLOG" 2>&1
            
            
            fcmeF 离线
            fcmeF 离线
            fcme
            技术大牛 劳动模范
            编写于 最后由 编辑
            #10

            @倭寇国を滅ぼす
            你这个跑起来pp能到多少?就是尤其输入比较大的时候,比如说16K32k这种,这种比较接近agent使用时候的真实场景。 有点奇怪,我做研究的时候都说SGlang是三个主要框架里面速度最慢的,求个分享。

            用户名违规用 1 条回复 最后回复
            0
            • fcmeF fcme

              @倭寇国を滅ぼす
              你这个跑起来pp能到多少?就是尤其输入比较大的时候,比如说16K32k这种,这种比较接近agent使用时候的真实场景。 有点奇怪,我做研究的时候都说SGlang是三个主要框架里面速度最慢的,求个分享。

              用户名违规用 离线
              用户名违规用 离线
              用户名违规
              编写于 最后由 编辑
              #11

              @fcme PP不知道150K上下文速度能打50t/s,200k的上下文时候大概也是在50t/s,这个有mtp。如果不开MTP稳定100K内31t/s,超过150k 27t/s的样子。速度不能和云API对比

              fcmeF 1 条回复 最后回复
              1
              • 用户名违规用 用户名违规

                @fcme PP不知道150K上下文速度能打50t/s,200k的上下文时候大概也是在50t/s,这个有mtp。如果不开MTP稳定100K内31t/s,超过150k 27t/s的样子。速度不能和云API对比

                fcmeF 离线
                fcmeF 离线
                fcme
                技术大牛 劳动模范
                编写于 最后由 编辑
                #12

                @倭寇国を滅ぼす
                使用来讲的话,TP25 或者以上就挺不错的了。

                但是因为 Agent 里应用的那个系统提示词啊,和来回工具调用的那个上下文很长,所以 PP 才是最最关键的。那个如果 PP 慢了的话,等消息简直等到天荒地老。

                用户名违规用 1 条回复 最后回复
                0
                • I 离线
                  I 离线
                  iamvirus
                  编写于 最后由 编辑
                  #13

                  再买一张组tp=2 的vllm体验会很丝滑

                  fcmeF 1 条回复 最后回复
                  0
                  • fcmeF fcme

                    @倭寇国を滅ぼす
                    使用来讲的话,TP25 或者以上就挺不错的了。

                    但是因为 Agent 里应用的那个系统提示词啊,和来回工具调用的那个上下文很长,所以 PP 才是最最关键的。那个如果 PP 慢了的话,等消息简直等到天荒地老。

                    用户名违规用 离线
                    用户名违规用 离线
                    用户名违规
                    编写于 最后由 编辑
                    #14

                    @fcme PP怎么测试,sglang ,prefill每次16K或者8K,prefill beth在1000-1400t/s,说的是这个吗?

                    fcmeF 1 条回复 最后回复
                    0
                    • I iamvirus

                      再买一张组tp=2 的vllm体验会很丝滑

                      fcmeF 离线
                      fcmeF 离线
                      fcme
                      技术大牛 劳动模范
                      编写于 最后由 编辑
                      #15

                      @iamvirus
                      我的是R9700说是有个什么vllm不支持,就很恶心,速度比llamacpp vulkan都不如。开启wmma后用MoE直接起飞!

                      Luke MaoL 1 条回复 最后回复
                      0
                      • 用户名违规用 用户名违规

                        @fcme PP怎么测试,sglang ,prefill每次16K或者8K,prefill beth在1000-1400t/s,说的是这个吗?

                        fcmeF 离线
                        fcmeF 离线
                        fcme
                        技术大牛 劳动模范
                        编写于 最后由 编辑
                        #16

                        @倭寇国を滅ぼす
                        用agent啊,做个测试脚本,每次服务拉起来了跑一遍脚本就有了。

                        用户名违规用 1 条回复 最后回复
                        0
                        • fcmeF fcme

                          @倭寇国を滅ぼす
                          用agent啊,做个测试脚本,每次服务拉起来了跑一遍脚本就有了。

                          用户名违规用 离线
                          用户名违规用 离线
                          用户名违规
                          编写于 最后由 编辑
                          #17

                          @fcme 我意思是你指的PP具体是什么,是那个PP512 1024 2048吗?

                          fcmeF 1 条回复 最后回复
                          0
                          • 用户名违规用 用户名违规

                            @fcme 我意思是你指的PP具体是什么,是那个PP512 1024 2048吗?

                            fcmeF 离线
                            fcmeF 离线
                            fcme
                            技术大牛 劳动模范
                            编写于 最后由 编辑
                            #18

                            @倭寇国を滅ぼす
                            哦 不是,pp 是 prompt processing,就是那个prefill所谓输入的预处理。可以理解为是输入token处理速度。

                            1 条回复 最后回复
                            0
                            • L 离线
                              L 离线
                              linkdesu
                              编写于 最后由 编辑
                              #19

                              https://kyuz0.github.io/amd-r9700-ai-toolboxes/index.html 这里有个双 9700 在不同驱动下的 benchmark ,希望也能有帮助

                              fcmeF 1 条回复 最后回复
                              1
                              • fcmeF fcme

                                @iamvirus
                                我的是R9700说是有个什么vllm不支持,就很恶心,速度比llamacpp vulkan都不如。开启wmma后用MoE直接起飞!

                                Luke MaoL 离线
                                Luke MaoL 离线
                                Luke Mao
                                编写于 最后由 Luke Mao 编辑
                                #20

                                @fcme 能否详细讲讲这个wmma部署,谢谢!

                                fcmeF 1 条回复 最后回复
                                0
                                • L linkdesu

                                  https://kyuz0.github.io/amd-r9700-ai-toolboxes/index.html 这里有个双 9700 在不同驱动下的 benchmark ,希望也能有帮助

                                  fcmeF 离线
                                  fcmeF 离线
                                  fcme
                                  技术大牛 劳动模范
                                  编写于 最后由 编辑
                                  #21

                                  @linkdesu
                                  谢谢,我之前就是看的这个,受到的启发,现在已经基本上稳定了。

                                  1 条回复 最后回复
                                  0
                                  • Luke MaoL Luke Mao

                                    @fcme 能否详细讲讲这个wmma部署,谢谢!

                                    fcmeF 离线
                                    fcmeF 离线
                                    fcme
                                    技术大牛 劳动模范
                                    编写于 最后由 编辑
                                    #22

                                    @Luke-Mao
                                    其实也没什么,你就让Hermes帮你重新编译llamacpp就可以了。编译的过程当中开启WMMA,之后是用系统原生服务跑还是docker跑都可以。效果没差。

                                    1 条回复 最后回复
                                    0

                                    你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                    厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                    有了你的建议,这篇帖子会更精彩哦 💗

                                    注册 登录
                                    回复
                                    • 在新帖中回复
                                    登录后回复
                                    • 从旧到新
                                    • 从新到旧
                                    • 最多赞同


                                    • 登录

                                    • 没有帐号? 注册

                                    • 登录或注册以进行搜索。
                                    • 第一个帖子
                                      最后一个帖子
                                    0
                                    • 版块
                                    • 最新
                                    • 标签
                                    • 热门
                                    • 用户
                                    • 群组