跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. LLM讨论区
  3. AMD AI Pro R9700 LLM调教

AMD AI Pro R9700 LLM调教

已定时 已固定 已锁定 已移动 LLM讨论区
r9700ai-pro-r9700amd
22 帖子 9 发布者 457 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • fcmeF fcme

    @倭寇国を滅ぼす
    你这个跑起来pp能到多少?就是尤其输入比较大的时候,比如说16K32k这种,这种比较接近agent使用时候的真实场景。 有点奇怪,我做研究的时候都说SGlang是三个主要框架里面速度最慢的,求个分享。

    用户名违规用 离线
    用户名违规用 离线
    用户名违规
    编写于 最后由 编辑
    #11

    @fcme PP不知道150K上下文速度能打50t/s,200k的上下文时候大概也是在50t/s,这个有mtp。如果不开MTP稳定100K内31t/s,超过150k 27t/s的样子。速度不能和云API对比

    fcmeF 1 条回复 最后回复
    1
    • 用户名违规用 用户名违规

      @fcme PP不知道150K上下文速度能打50t/s,200k的上下文时候大概也是在50t/s,这个有mtp。如果不开MTP稳定100K内31t/s,超过150k 27t/s的样子。速度不能和云API对比

      fcmeF 离线
      fcmeF 离线
      fcme
      技术大牛 劳动模范
      编写于 最后由 编辑
      #12

      @倭寇国を滅ぼす
      使用来讲的话,TP25 或者以上就挺不错的了。

      但是因为 Agent 里应用的那个系统提示词啊,和来回工具调用的那个上下文很长,所以 PP 才是最最关键的。那个如果 PP 慢了的话,等消息简直等到天荒地老。

      用户名违规用 1 条回复 最后回复
      0
      • I 离线
        I 离线
        iamvirus
        编写于 最后由 编辑
        #13

        再买一张组tp=2 的vllm体验会很丝滑

        fcmeF 1 条回复 最后回复
        0
        • fcmeF fcme

          @倭寇国を滅ぼす
          使用来讲的话,TP25 或者以上就挺不错的了。

          但是因为 Agent 里应用的那个系统提示词啊,和来回工具调用的那个上下文很长,所以 PP 才是最最关键的。那个如果 PP 慢了的话,等消息简直等到天荒地老。

          用户名违规用 离线
          用户名违规用 离线
          用户名违规
          编写于 最后由 编辑
          #14

          @fcme PP怎么测试,sglang ,prefill每次16K或者8K,prefill beth在1000-1400t/s,说的是这个吗?

          fcmeF 1 条回复 最后回复
          0
          • I iamvirus

            再买一张组tp=2 的vllm体验会很丝滑

            fcmeF 离线
            fcmeF 离线
            fcme
            技术大牛 劳动模范
            编写于 最后由 编辑
            #15

            @iamvirus
            我的是R9700说是有个什么vllm不支持,就很恶心,速度比llamacpp vulkan都不如。开启wmma后用MoE直接起飞!

            Luke MaoL 1 条回复 最后回复
            0
            • 用户名违规用 用户名违规

              @fcme PP怎么测试,sglang ,prefill每次16K或者8K,prefill beth在1000-1400t/s,说的是这个吗?

              fcmeF 离线
              fcmeF 离线
              fcme
              技术大牛 劳动模范
              编写于 最后由 编辑
              #16

              @倭寇国を滅ぼす
              用agent啊,做个测试脚本,每次服务拉起来了跑一遍脚本就有了。

              用户名违规用 1 条回复 最后回复
              0
              • fcmeF fcme

                @倭寇国を滅ぼす
                用agent啊,做个测试脚本,每次服务拉起来了跑一遍脚本就有了。

                用户名违规用 离线
                用户名违规用 离线
                用户名违规
                编写于 最后由 编辑
                #17

                @fcme 我意思是你指的PP具体是什么,是那个PP512 1024 2048吗?

                fcmeF 1 条回复 最后回复
                0
                • 用户名违规用 用户名违规

                  @fcme 我意思是你指的PP具体是什么,是那个PP512 1024 2048吗?

                  fcmeF 离线
                  fcmeF 离线
                  fcme
                  技术大牛 劳动模范
                  编写于 最后由 编辑
                  #18

                  @倭寇国を滅ぼす
                  哦 不是,pp 是 prompt processing,就是那个prefill所谓输入的预处理。可以理解为是输入token处理速度。

                  1 条回复 最后回复
                  0
                  • L 离线
                    L 离线
                    linkdesu
                    编写于 最后由 编辑
                    #19

                    https://kyuz0.github.io/amd-r9700-ai-toolboxes/index.html 这里有个双 9700 在不同驱动下的 benchmark ,希望也能有帮助

                    fcmeF 1 条回复 最后回复
                    1
                    • fcmeF fcme

                      @iamvirus
                      我的是R9700说是有个什么vllm不支持,就很恶心,速度比llamacpp vulkan都不如。开启wmma后用MoE直接起飞!

                      Luke MaoL 离线
                      Luke MaoL 离线
                      Luke Mao
                      编写于 最后由 Luke Mao 编辑
                      #20

                      @fcme 能否详细讲讲这个wmma部署,谢谢!

                      fcmeF 1 条回复 最后回复
                      0
                      • L linkdesu

                        https://kyuz0.github.io/amd-r9700-ai-toolboxes/index.html 这里有个双 9700 在不同驱动下的 benchmark ,希望也能有帮助

                        fcmeF 离线
                        fcmeF 离线
                        fcme
                        技术大牛 劳动模范
                        编写于 最后由 编辑
                        #21

                        @linkdesu
                        谢谢,我之前就是看的这个,受到的启发,现在已经基本上稳定了。

                        1 条回复 最后回复
                        0
                        • Luke MaoL Luke Mao

                          @fcme 能否详细讲讲这个wmma部署,谢谢!

                          fcmeF 离线
                          fcmeF 离线
                          fcme
                          技术大牛 劳动模范
                          编写于 最后由 编辑
                          #22

                          @Luke-Mao
                          其实也没什么,你就让Hermes帮你重新编译llamacpp就可以了。编译的过程当中开启WMMA,之后是用系统原生服务跑还是docker跑都可以。效果没差。

                          1 条回复 最后回复
                          0

                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                          有了你的建议,这篇帖子会更精彩哦 💗

                          注册 登录
                          回复
                          • 在新帖中回复
                          登录后回复
                          • 从旧到新
                          • 从新到旧
                          • 最多赞同


                          • 登录

                          • 没有帐号? 注册

                          • 登录或注册以进行搜索。
                          • 第一个帖子
                            最后一个帖子
                          0
                          • 版块
                          • 最新
                          • 标签
                          • 热门
                          • 用户
                          • 群组