跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. qwen 3.8 27b mtp vllm0.26测试,benchlocal得分79% 平均速度约50-60token/s 分享遇到的几个坑

qwen 3.8 27b mtp vllm0.26测试,benchlocal得分79% 平均速度约50-60token/s 分享遇到的几个坑

已定时 已固定 已锁定 已移动 LLM讨论区
qwen-27bmtpvllm
9 帖子 2 发布者 354 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • stxpnetS 离线
    stxpnetS 离线
    stxpnet
    超凡大师
    编写于 最后由 stxpnet 编辑
    #1

    3090 24G双卡,破解P2P驱动(实际没派上用场),功率都限制260W,关闭NCCL,张量并行
    (卡间数据走8X/8X PCH通道,应该每个token只有那一瞬间要用到PCIE传输数据,影响不大)
    选定的模型:https://huggingface.co/twolven/Qwen3.8-27B-abliterated-AWQ-MTP 考虑到这个模型比较新,抖音某博主说qwen 3.8使用0.27版本可能有问题,所以vllm选择0.26版本。
    4位权重,FP8 kv缓存,KV 缓存池大约在2倍于262K = 520K 容量。

    镜像模板和容器,都是DEEPSEEK V4 FLASH配置的,现在的FLASH感觉比以前的PRO还强。

    关掉思考,再用上v22的那个模板之后,快速15项测试涨了3分,时间快了11秒:
    43d05286-499a-4993-af2b-014b01635c47-image.jpeg
    换话题,TTFT就会2-3秒,卡得难受。 但是在Litellm里面测试速度又飞快。

    这里遇上第一个坑:这个模型文件目录下面有个generationconfig.json文件 temp 默认是1.0,难怪非常啰嗦(思维过于发散),一个小任务搞半小时!根本不适合做这种维护性质的工作,让HERMES自己改了模型配置之后,再试:
    dfd818b9-2ce7-417f-835d-fe7101915c78-image.jpeg

    同时把模型目录下面的值也改掉:
    aec218a6-bd4e-4f14-a0b2-54c944878ece-image.jpeg

    1c0179f6-501b-4553-bbbe-0dd1a7e660b7-image.jpeg

    第二个坑,vllm启动里面有个参数,如果不修改,在hermes里面工具调用 也会思考 速度爆慢,经过修改之后,工具调用也清爽了,hermes也不啰嗦了:

      --default-chat-template-kwargs '{"enable_thinking": false, "reasoning_effort": "medium", "auto_disable_thinking_with_tools": true, "preserve_thinking": true}' \
    

    第三个,qwen 3.8 27B,设置不同思考等级,模型的行为差别如下:
    6704da45-073e-432f-ab22-657a64a5c96b-image.jpeg
    手动根据当前任务难度选择不同的思考等级以获得最佳效果。

    在上下文超过115K时,查看后台日志,速度变化不大:
    14157bd3-1366-49ce-b7c7-fee538523256-image.jpeg

    双并发,其中一个WEBUI的简单文本测试,约60T/S
    7f7f54f1-a3d7-4321-bc69-73f2aae05a21-image.jpeg
    另一边HERMES比单流略慢一点。

    最后,benchlocal得分 79%
    3d528fc2-f128-488b-81d9-a52447f3c366-image.jpeg

    44f2a25a-2f86-4aa3-b56a-c58ac3a1b840-image.jpeg

    5fc38b70-cc40-4de6-bc43-61f896d7a82e-image.jpeg

    如果单独从比分来看,还不如以前 3.6 27B Q4 K xl 单卡跑145K上下文(无视觉)。 旧帖子链接

    摘录一些别人的其它模型测试结果:

    dfd53b22-a2f1-475e-8cea-89c5c43a81ec-image.jpeg 【这人的是3090两张,有nvlink】

    另外:单卡3090可考虑这个人的配置:
    https://github.com/syv-ai/qwen38-27b-rtx3090 按它说法,单卡150K上下文是可用的。最高极限190K。

    1 条回复 最后回复
    1
    • stxpnetS 离线
      stxpnetS 离线
      stxpnet
      超凡大师
      编写于 最后由 stxpnet 编辑
      #2

      终极测试,写一个三关的仿超级玛丽HTML5小游戏【15:40开始】:
      6879174f-b2d6-402e-a46b-be6d46783e7e-image.jpeg
      16点12分完成,显示代码6000多行,耗用token 28K:
      ee47a60f-5e13-4d40-8a22-8aa0f3ee776d-image.jpeg
      BUG一堆,又要让它修复,然后玩玩看QWEN 3.8的公主长啥样。

      由于代码实在太烂,没法玩到最后,让它写了一个无敌模式,我混到最后去看看:
      6fbf2606-fbea-4984-8646-3983d00e3727-image.jpeg

      d7abc554-6495-47ec-9903-0d846d57cca8-image.jpeg

      eb8cf6a1-f129-4fc8-8f00-0c7499963f0a-image.jpeg
      审美感觉不咋地啊,不过这个模型的记忆力还可以。不知道f16原版模型写出来的超级玛丽会是怎样的。

      02a13ff7-daa8-4eb9-bd61-de51ec1017b0-image.jpeg
      QWEN 3.8 27B这些黑话,应该是新版跟哪个模型蒸馏学来的吧? 以前似乎没有这种话风。

      fcf18636-c3cf-4870-b952-c4eb3f96e613-image.jpeg

      用了temp = 0.6还是啰嗦。
      dece0b4a-77f1-4824-be2a-5052c2611739-image.jpeg

      1 条回复 最后回复
      2
      • stxpnetS 离线
        stxpnetS 离线
        stxpnet
        超凡大师
        编写于 最后由 stxpnet 编辑
        #3

        c7c5bbd0-c996-4e5f-b388-aa7022674776-image.jpeg

        今天用了一段时间,比单卡跑27B体验舒服多了,也好过我之前草率测试的2-3个vllm模型。

        用trae调用 的时候,后台数据很漂亮,冲到120+ token/s ?
        1f5e2777-476b-4214-ae4f-02a9f99b72c4-image.jpeg

        1 条回复 最后回复
        0
        • ,terryT terry 固定了此主题
        • terryT 离线
          terryT 离线
          terry
          超级版主
          编写于 最后由 编辑
          #4

          VLLM驱动Agent体验如何,实话实话,我以前部署的时候觉得太慢,缓存和狗屎一样。

          油管:https://www.youtube.com/@抡锤者

          1 条回复 最后回复
          0
          • stxpnetS 离线
            stxpnetS 离线
            stxpnet
            超凡大师
            编写于 最后由 stxpnet 编辑
            #5

            俄罗斯方块是和3.6不一样的风格:
            51273263-5cfb-42f7-a483-c4c6636f1440-image.jpeg

            回答站长的问题:整体速度的感受:反正比我单卡时代要好些,没有35B A3B那种秒出的过瘾感觉,但是27B的智商给人很实在的感觉。

            脑筋急转弯,11个,思考真的久:
            https://fboom.me/file/6c27500d8eddc

            俄罗斯方块,hermes里关不掉思考也是很久:
            https://fboom.me/file/c78267afc43d8

            1 条回复 最后回复
            1
            • terryT 离线
              terryT 离线
              terry
              超级版主
              编写于 最后由 编辑
              #6

              挺好的,你现在温度如何,卡扛得住吗?噪音2张不是特么的反天了,是不是搞在专门的房间?

              油管:https://www.youtube.com/@抡锤者

              stxpnetS 2 条回复 最后回复
              0
              • terryT terry

                挺好的,你现在温度如何,卡扛得住吗?噪音2张不是特么的反天了,是不是搞在专门的房间?

                stxpnetS 离线
                stxpnetS 离线
                stxpnet
                超凡大师
                编写于 最后由 编辑
                #7
                此主題已被删除!
                1 条回复 最后回复
                0
                • terryT terry

                  挺好的,你现在温度如何,卡扛得住吗?噪音2张不是特么的反天了,是不是搞在专门的房间?

                  stxpnetS 离线
                  stxpnetS 离线
                  stxpnet
                  超凡大师
                  编写于 最后由 编辑
                  #8

                  @terry 我这两张都是游戏显卡,一张在主机内,另一张引到主机后面,基本没有噪音。除非一直满载超过5分钟会有点风扇声。

                  1 条回复 最后回复
                  1
                  • stxpnetS 离线
                    stxpnetS 离线
                    stxpnet
                    超凡大师
                    编写于 最后由 编辑
                    #9

                    e2cf7a84-8616-463e-83b4-64a71f92b411-image.jpeg
                    目前的任务,应急的时候用35B A3B,30秒就能跑起来。 然后有空的时候再让27B xhigh慢慢复核。

                    1 条回复 最后回复
                    0
                    • ,系统 取消固定了此主题

                    你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                    厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                    有了你的建议,这篇帖子会更精彩哦 💗

                    注册 登录
                    回复
                    • 在新帖中回复
                    登录后回复
                    • 从旧到新
                    • 从新到旧
                    • 最多赞同


                    • 登录

                    • 登录或注册以进行搜索。
                    • 第一个帖子
                      最后一个帖子
                    0
                    • 版块
                    • 最新
                    • 标签
                    • 热门
                    • 用户
                    • 群组