跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. 双 3090 NVLink + vLLM 半年实测:Qwen3.6-27B 解码 128 tok/s,并发 4 用户 258 tok/s

双 3090 NVLink + vLLM 半年实测:Qwen3.6-27B 解码 128 tok/s,并发 4 用户 258 tok/s

已定时 已固定 已锁定 已移动 AI硬件
rtx3090多卡部署qwen-27bvllm
17 帖子 7 发布者 844 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Don zhuD Don zhu

    @starryskyknight 问一下这位兄弟,你是把其中的一张卡给竖起来放置了吗?我现在也有类似的问题,我一张卡是 EVGA 的三风扇的卡,另外一张卡是 NVIDIA 的 FE。如果两张卡都并排放的话,根本就没有空间了。

    starryskyknightS 离线
    starryskyknightS 离线
    starryskyknight
    德高望重
    编写于 最后由 编辑
    #8

    @Don-zhu 我没放机壳内 我用延长线拉伸出来 另外用了架子撑着

    Don zhuD 1 条回复 最后回复
    0
    • terryT terry

      非常好的分享,尤其是踩坑点,VLLM吐字速度快,32k上下文prefill冷启动15.2秒,后续如何?VLLM最头疼的就是缓存机制比SG-Lang差太多。SG-Lang可以做到长上下文基本不掉速,吐字速度还是要慢于VLLM的。有空可以测试一下SG-Lang,毕竟Agent是刚需,稍微上点强度的编程也要求走长上下文,聊天走本地意义不大。

      starryskyknightS 离线
      starryskyknightS 离线
      starryskyknight
      德高望重
      编写于 最后由 编辑
      #9

      @terry 看了您的建议 我一直想用SG-Lang试试看 但跑起来都没有 VLLM好 不知道是不是老卡的关系 今天会发一篇千问3.8的版本 希望相同设备的伙伴能一起讨论 找到最佳化方案

      terryT 1 条回复 最后回复
      0
      • C Che

        看到大佬的帖子才知道 vLLM 吞吐量这么大,连夜把 llama.cpp 换成了 vLLM。奇怪的是 Prefix cache hit rate: 0.0%,仍在探索中。。

        starryskyknightS 离线
        starryskyknightS 离线
        starryskyknight
        德高望重
        编写于 最后由 编辑
        #10

        @Che 大佬不敢当 我也是自己乱摸 乱尝试 我今天会发一篇千问3.8的版本 欢迎一起研究讨论

        1 条回复 最后回复
        0
        • stxpnetS 离线
          stxpnetS 离线
          stxpnet
          超凡大师
          编写于 最后由 编辑
          #11

          sglang感觉就是长时间占 着CPU和显卡。发热太大了,不知道是不是我没配置好。

          26-08-19
          双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
          8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

          terryT C 2 条回复 最后回复
          0
          • stxpnetS stxpnet

            sglang感觉就是长时间占 着CPU和显卡。发热太大了,不知道是不是我没配置好。

            terryT 离线
            terryT 离线
            terry
            超级版主
            编写于 最后由 编辑
            #12

            @stxpnet 它就是运算的时候占着,你是不是启动的时候它响很久?那在配置cuda graph,搞完了就不占据了。

            油管:https://www.youtube.com/@抡锤者

            stxpnetS 1 条回复 最后回复
            0
            • starryskyknightS starryskyknight

              @terry 看了您的建议 我一直想用SG-Lang试试看 但跑起来都没有 VLLM好 不知道是不是老卡的关系 今天会发一篇千问3.8的版本 希望相同设备的伙伴能一起讨论 找到最佳化方案

              terryT 离线
              terryT 离线
              terry
              超级版主
              编写于 最后由 terry 编辑
              #13

              @starryskyknight
              1,不要用敬语。
              2,大概率就是老卡的问题。

              油管:https://www.youtube.com/@抡锤者

              1 条回复 最后回复
              0
              • stxpnetS stxpnet

                sglang感觉就是长时间占 着CPU和显卡。发热太大了,不知道是不是我没配置好。

                C 离线
                C 离线
                Che
                德高望重
                编写于 最后由 编辑
                #14

                @stxpnet 挺奇怪,只占显存不推理应该是没功耗的

                1 条回复 最后回复
                0
                • terryT terry

                  @stxpnet 它就是运算的时候占着,你是不是启动的时候它响很久?那在配置cuda graph,搞完了就不占据了。

                  stxpnetS 离线
                  stxpnetS 离线
                  stxpnet
                  超凡大师
                  编写于 最后由 stxpnet 编辑
                  #15

                  @terry
                  不知道,用了两天,显卡60度和CPU 睿频4.4GHZ,70多度 就跟火炉一样烧了两天,目前体感没有这个好,干脆弃用了。
                  再有更好了就要删除它了。 现在就等 noonghunna和Sandermage/sndr 那两个仓库出更好的方案了。 Sandermage那个是真的看好,启动后100多个专属的补丁在vllm里面打好。但是3.8一出来,一点都不香了。作者估计 都换设备了,还没更新。 再过10天不更新的话,我想自己让GLM5.3把他的仓库克隆过来改造那些vllm补丁给3.8用。

                  26-08-19
                  双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
                  8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

                  1 条回复 最后回复
                  1
                  • starryskyknightS starryskyknight

                    @Don-zhu 我没放机壳内 我用延长线拉伸出来 另外用了架子撑着

                    Don zhuD 离线
                    Don zhuD 离线
                    Don zhu
                    编写于 最后由 编辑
                    #16

                    @starryskyknight 感谢回复,我也是买了线放到外边,根本没法装一起。放外边反而散热好很多

                    starryskyknightS 1 条回复 最后回复
                    0
                    • Don zhuD Don zhu

                      @starryskyknight 感谢回复,我也是买了线放到外边,根本没法装一起。放外边反而散热好很多

                      starryskyknightS 离线
                      starryskyknightS 离线
                      starryskyknight
                      德高望重
                      编写于 最后由 编辑
                      #17

                      @Don-zhu 灰尘比较需要注意 其他都还好

                      1 条回复 最后回复
                      0

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组