跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. 随便聊聊
  4. 双卡 3090 qwen 3.8-27b dflash2 131k上下文 ,100+ t/s 有大神已经搞出来了?

双卡 3090 qwen 3.8-27b dflash2 131k上下文 ,100+ t/s 有大神已经搞出来了?

已定时 已固定 已锁定 已移动 随便聊聊
rtx3090qwen-27bdflash
5 帖子 3 发布者 84 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • stxpnetS 在线
    stxpnetS 在线
    stxpnet
    超凡大师
    编写于 最后由 stxpnet 编辑
    #1

    9013f100-a65b-43f7-81d8-4c8b8fc3f8ee-image.jpeg

    https://www.reddit.com/r/LocalLLaMA/comments/1vsccit/qwen3827b_on_2x_3090_vllm_dflash2_218_toks_single/

    d275f82b-5ab0-470a-8e96-ab666e752ffa-image.jpeg

    https://github.com/oceanplexian/vllm/pull/1

    感觉变革太快了。比起3.6时代还要疯狂啊!
    如果有256K或200K上下文,我都愿意换用它这个方案!

    我自己目前是用双卡 qwen 3.8 w4a16的 awq模型,只有66t/s +256K上下文 ,还没机会测试超过131K的上下文。
    其实我目前的感觉,没有nvlink的话,100K前还好,过了100K,nccl提供那点带宽就供给不上了,直接导致prefill 速度和生成速度都断崖式下降。

    26-08-19
    双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
    8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

    1 条回复 最后回复
    1
    • terryT 在线
      terryT 在线
      terry
      超级版主
      编写于 最后由 terry 编辑
      #2

      这些都是意义不大的特殊场景,实际用到的情况不多。来,回复下我,我来给你第100分,谢谢主人😂,地上有个🧼

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0
      • A 离线
        A 离线
        applejuice
        技术大牛 劳动模范
        编写于 最后由 applejuice 编辑
        #3

        我觉得2000prefill 60decode 才是最适合的agent 用. 过了1500prefill 50decode 这条线 我宁愿长上下文 跟 更高准确率

        一张卡 我昨天读我的本地文件 结果131k context 压缩了好多次
        一张卡prefill 好像最多1000 总共花了50分钟...

        stxpnetS 1 条回复 最后回复
        0
        • A applejuice

          我觉得2000prefill 60decode 才是最适合的agent 用. 过了1500prefill 50decode 这条线 我宁愿长上下文 跟 更高准确率

          一张卡 我昨天读我的本地文件 结果131k context 压缩了好多次
          一张卡prefill 好像最多1000 总共花了50分钟...

          stxpnetS 在线
          stxpnetS 在线
          stxpnet
          超凡大师
          编写于 最后由 编辑
          #4

          @applejuice 你现在那个卡还没修好吗? 单卡推理跑什么框架和模型?

          26-08-19
          双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
          8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

          A 1 条回复 最后回复
          0
          • stxpnetS stxpnet

            @applejuice 你现在那个卡还没修好吗? 单卡推理跑什么框架和模型?

            A 离线
            A 离线
            applejuice
            技术大牛 劳动模范
            编写于 最后由 编辑
            #5

            @stxpnet

            我在国外,邮寄需要一个星期多
            前两天搞到卖家手上,不知道他们几时才能给回复

            现在用着

            Item Value
            Model Qwen3.8-27B UD-Q4_K_M (16.46 GB, sha256-verified, nextn head present)
            Engine llama.cpp b10498-60addddf3, static CUDA sm_86
            Context 135,168
            KV q8_0 / q8_0
            Vision on (mmproj-F16)
            MTP draft-mtp, n-max 2
            1 条回复 最后回复
            1

            你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

            厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

            有了你的建议,这篇帖子会更精彩哦 💗

            注册 登录
            回复
            • 在新帖中回复
            登录后回复
            • 从旧到新
            • 从新到旧
            • 最多赞同


            • 登录

            • 登录或注册以进行搜索。
            • 第一个帖子
              最后一个帖子
            0
            • 版块
            • 最新
            • 标签
            • 热门
            • 用户
            • 群组