跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. RTX PRO 5000 72G SgLang 跑 Qwen3.8-27B FP8

RTX PRO 5000 72G SgLang 跑 Qwen3.8-27B FP8

已定时 已固定 已锁定 已移动 AI硬件
rtxpro5000sg-langqwen-27b
9 帖子 6 发布者 462 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • laihzang619L 离线
    laihzang619L 离线
    laihzang619
    编写于 最后由 编辑
    #1

    source ~/sglang_env/bin/activate
    SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server
    --model-path /home/jhhotel/models/models/Qwen--Qwen3.8-27B-FP8/snapshots/master
    --served-model-name Qwen3.8-27B-FP8
    --attention-backend flashinfer
    --kv-cache-dtype fp8_e4m3
    --chunked-prefill-size 2048
    --context-length 262144
    --mem-fraction-static 0.90
    --reasoning-parser qwen3
    --tool-call-parser qwen3_coder
    --speculative-algo NEXTN
    --speculative-num-steps 3
    --speculative-eagle-topk 1
    --speculative-num-draft-tokens 4
    --host 0.0.0.0
    --port 30000
    --enable-cache-report \

    Ubuntu24.04

    7da4ed66-6eda-43af-91f4-5696026f5dd5-image.jpeg
    202490b7-be8a-45c8-b2a3-427f2a042eba-image.jpeg
    7e7706c7-2fdf-48c4-88b8-bf95e88c6341-image.jpeg
    f3d983cd-5c8a-489d-952b-8a25181b90cf-image.jpeg
    3fb25b0c-df24-4284-bdd7-29b1fa11c4e6-image.jpeg
    bfcd9aaf-674e-4362-94ec-93dcca3983a3-image.jpeg
    24881020-5b45-4824-8180-aa85967d9218-image.jpeg

    生产速度在55-80t/s 预填充6000左右 延时0.336 这些数据都是在单会话情况下的测试

    1 条回复 最后回复
    3
    • williamlouisW 在线
      williamlouisW 在线
      williamlouis
      超级版主
      编写于 最后由 编辑
      #2

      不错。抄作业。66.5度 声音也起来了。汗。涡轮。

      个人主页:xlkj.org Telegram https://t.me/xlkjorg

      张光璞张 1 条回复 最后回复
      0
      • williamlouisW williamlouis

        不错。抄作业。66.5度 声音也起来了。汗。涡轮。

        张光璞张 离线
        张光璞张 离线
        张光璞
        劳动模范 德高望重
        编写于 最后由 编辑
        #3

        @williamlouis 说:

        不错。抄作业。66.5度 声音也起来了。汗。涡轮。

        72G 的抄不了😧

        1 条回复 最后回复
        0
        • benton yiB 离线
          benton yiB 离线
          benton yi
          技术大牛 劳动模范
          编写于 最后由 编辑
          #4

          调整一下风扇策略,84℃风扇56%不合理。300w的风冷卡控制温度不要上75℃

          1 条回复 最后回复
          1
          • ,terryT terry 固定了此主题
          • terryT 离线
            terryT 离线
            terry
            超级版主
            编写于 最后由 编辑
            #5

            SGLang是Pro5000 72G的黄金搭档,实际上48G玩起来没这么嗨,72G能吃到所有红利,多会话也不含糊。Prefill没那么重要,因为SGLang的Radix缓存是真的只算增量部分,多开也完全够用。72G是关键体验差距,这是它比48G版本最大的增值。

            油管:https://www.youtube.com/@抡锤者

            1 条回复 最后回复
            0
            • kop wangK 离线
              kop wangK 离线
              kop wang
              超级版主
              编写于 最后由 编辑
              #6

              72G的核心就是可以同时开3个session的全量上下文。配合上几乎不掉速的2线程并发,是真正的生产级别。

              48GB我用下来现在的掣肘就是kvcache不够用,只能单会话满上下文。
              这就导致无法发挥LLM框架的全部效率。

              虚心交流,一起进步

              terryT 1 条回复 最后回复
              0
              • kop wangK kop wang

                72G的核心就是可以同时开3个session的全量上下文。配合上几乎不掉速的2线程并发,是真正的生产级别。

                48GB我用下来现在的掣肘就是kvcache不够用,只能单会话满上下文。
                这就导致无法发挥LLM框架的全部效率。

                terryT 离线
                terryT 离线
                terry
                超级版主
                编写于 最后由 编辑
                #7

                @kop-wang 你要把4比特跑起来,FP8 KV。

                油管:https://www.youtube.com/@抡锤者

                kop wangK 1 条回复 最后回复
                0
                • terryT terry

                  @kop-wang 你要把4比特跑起来,FP8 KV。

                  kop wangK 离线
                  kop wangK 离线
                  kop wang
                  超级版主
                  编写于 最后由 编辑
                  #8

                  @terry 4bit量化我看能力下降还是比较明显,因为我是当deepseek波峰时的平替用,所以不敢用太傻的版本
                  7ae032fa-2485-43a8-bb91-e4025d396f52-image.jpeg

                  虚心交流,一起进步

                  terryT 1 条回复 最后回复
                  1
                  • kop wangK kop wang

                    @terry 4bit量化我看能力下降还是比较明显,因为我是当deepseek波峰时的平替用,所以不敢用太傻的版本
                    7ae032fa-2485-43a8-bb91-e4025d396f52-image.jpeg

                    terryT 离线
                    terryT 离线
                    terry
                    超级版主
                    编写于 最后由 编辑
                    #9

                    @kop-wang 测试下,没啥影响,测试好了我抄作业,赶紧去折腾。

                    油管:https://www.youtube.com/@抡锤者

                    1 条回复 最后回复
                    0
                    • ,系统 取消固定了此主题

                    你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                    厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                    有了你的建议,这篇帖子会更精彩哦 💗

                    注册 登录
                    回复
                    • 在新帖中回复
                    登录后回复
                    • 从旧到新
                    • 从新到旧
                    • 最多赞同


                    • 登录

                    • 登录或注册以进行搜索。
                    • 第一个帖子
                      最后一个帖子
                    0
                    • 版块
                    • 最新
                    • 标签
                    • 热门
                    • 用户
                    • 群组