跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. 单台DGX 装qwen 3.8 next flash 500K token 长度,能用

单台DGX 装qwen 3.8 next flash 500K token 长度,能用

已定时 已固定 已锁定 已移动 LLM讨论区
dgxsparkqwen
13 帖子 4 发布者 193 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Kk HhK 离线
    Kk HhK 离线
    Kk Hh
    编写于 最后由 编辑
    #4

    再啰嗦一句云端服务ollama cloud 的MAX现在好像不让新用户买了,原则还是ollama cloud 最便宜,其次https://commandcode.ai 也能用就是贵点
    7ba35d4d-0c60-4e1e-8f38-af0824beaef0-image.jpeg
    8420bb50-061d-4505-954e-97e8d495eb86-image.jpeg

    1 条回复 最后回复
    0
    • terryT 离线
      terryT 离线
      terry
      超级版主
      编写于 最后由 编辑
      #5

      重要的不是别人说如何,是你自己感觉如何,你觉得好就行。

      油管:https://www.youtube.com/@抡锤者

      Kk HhK 1 条回复 最后回复
      0
      • terryT terry

        重要的不是别人说如何,是你自己感觉如何,你觉得好就行。

        Kk HhK 离线
        Kk HhK 离线
        Kk Hh
        编写于 最后由 Kk Hh 编辑
        #6

        @terry 说:

        重要的不是别人说如何,是你自己感觉如何,你觉得好就行。

        在我的工作环境下,实测这个版本的qwen 3.8 next flash 要好于我的qwen3.8 27b q8,就是速度对于dgx spark来说还是提不上来。所以呢着急我就用线上的glm 5.3 flash 和qwen 3.8 flash ,不着急的晚上挂机的,就让这个本地跑。https://commandcode.ai 这个站有个好处中外的模型都有了,特别复杂的就花钱用贵的模型。我这个本地机器就是平时做挂机基础执行环节的。

        J terryT 2 条回复 最后回复
        0
        • Kk HhK Kk Hh

          @terry 说:

          重要的不是别人说如何,是你自己感觉如何,你觉得好就行。

          在我的工作环境下,实测这个版本的qwen 3.8 next flash 要好于我的qwen3.8 27b q8,就是速度对于dgx spark来说还是提不上来。所以呢着急我就用线上的glm 5.3 flash 和qwen 3.8 flash ,不着急的晚上挂机的,就让这个本地跑。https://commandcode.ai 这个站有个好处中外的模型都有了,特别复杂的就花钱用贵的模型。我这个本地机器就是平时做挂机基础执行环节的。

          J 离线
          J 离线
          johnnybegood
          劳动模范 技术大牛
          编写于 最后由 编辑
          #7

          @Kk-Hh 今天刚测的,我在我的3090加3080上面跑,解码都快40t/s了, 不过prefill比较慢才两三百

          1 条回复 最后回复
          0
          • M 离线
            M 离线
            MSHAVL
            编写于 最后由 MSHAVL 编辑
            #8

            @kk-hh 目前掛在我ai max395上切VRAM/RAM 64/64gb下用IQ4xs搭配dsh也非常舒服,@41k上下文深度下pp200多/tg 20-30token/s開192k上下文,目前已經利用goal然後入睡前讓它大型專案開發,隔天早上起來收割。是確定可以做出前沿模型那種質量。但速度響應上就不苛求了。目前pp可能還有提升的空間應該會更好。
            替代文字

            Kk HhK 1 条回复 最后回复
            0
            • M MSHAVL

              @kk-hh 目前掛在我ai max395上切VRAM/RAM 64/64gb下用IQ4xs搭配dsh也非常舒服,@41k上下文深度下pp200多/tg 20-30token/s開192k上下文,目前已經利用goal然後入睡前讓它大型專案開發,隔天早上起來收割。是確定可以做出前沿模型那種質量。但速度響應上就不苛求了。目前pp可能還有提升的空間應該會更好。
              替代文字

              Kk HhK 离线
              Kk HhK 离线
              Kk Hh
              编写于 最后由 编辑
              #9

              @MSHAVL 说:

              @kk-hh 目前掛在我ai max395上切VRAM/RAM 64/64gb下用IQ4xs搭配dsh也非常舒服,@41k上下文深度下pp200多/tg 20-30token/s開192k上下文,目前已經利用goal然後入睡前讓它大型專案開發,隔天早上起來收割。是確定可以做出前沿模型那種質量。但速度響應上就不苛求了。目前pp可能還有提升的空間應該會更好。

              替代文字

              我这个这个其实在300K TOKEN长度的时候 开MTP-3 其实生成速度也是 20-30token/s,TOKEN 最大长度在单台DGX SPARK可以设置成 1M 但是基于对这些FLASH 模型在云端使用的经验他们前500K还行,后500K 质量太差,所以我在本机就只开了500K的TOKEN长度。

              1 条回复 最后回复
              0
              • Kk HhK 离线
                Kk HhK 离线
                Kk Hh
                编写于 最后由 Kk Hh 编辑
                #10

                说实话一个小机能跑成这样,你还要什么自行车啊。再买一台DGX SPARK 做双TP的QWEN 3.8 FLASH NEXT 或者 DPV4 FLASH 我觉得有点不太值,或者再买三台DGX SPARK 做4TP的 GLM 5.3 FLASH 更不值,我宁可多买点云端服务的额度。

                J 1 条回复 最后回复
                0
                • Kk HhK Kk Hh

                  说实话一个小机能跑成这样,你还要什么自行车啊。再买一台DGX SPARK 做双TP的QWEN 3.8 FLASH NEXT 或者 DPV4 FLASH 我觉得有点不太值,或者再买三台DGX SPARK 做4TP的 GLM 5.3 FLASH 更不值,我宁可多买点云端服务的额度。

                  J 离线
                  J 离线
                  johnnybegood
                  劳动模范 技术大牛
                  编写于 最后由 编辑
                  #11

                  @Kk-Hh 单台多少钱买的?

                  Kk HhK 1 条回复 最后回复
                  0
                  • J johnnybegood

                    @Kk-Hh 单台多少钱买的?

                    Kk HhK 离线
                    Kk HhK 离线
                    Kk Hh
                    编写于 最后由 编辑
                    #12

                    @johnnybegood 说:

                    @Kk-Hh 单台多少钱买的?

                    31000 人民币 JD买的,我是买的技嘉1T的版本,就以现在实际使用的情况来看,这机器也跑不了什么特别大的模型,买个1T版本就够了。

                    1 条回复 最后回复
                    0
                    • Kk HhK Kk Hh

                      @terry 说:

                      重要的不是别人说如何,是你自己感觉如何,你觉得好就行。

                      在我的工作环境下,实测这个版本的qwen 3.8 next flash 要好于我的qwen3.8 27b q8,就是速度对于dgx spark来说还是提不上来。所以呢着急我就用线上的glm 5.3 flash 和qwen 3.8 flash ,不着急的晚上挂机的,就让这个本地跑。https://commandcode.ai 这个站有个好处中外的模型都有了,特别复杂的就花钱用贵的模型。我这个本地机器就是平时做挂机基础执行环节的。

                      terryT 离线
                      terryT 离线
                      terry
                      超级版主
                      编写于 最后由 编辑
                      #13

                      @Kk-Hh 我感觉Qwen flash很慢,但是如果你实际部署了不错,那么它足够用了,推理开高点,不着急无所谓。

                      油管:https://www.youtube.com/@抡锤者

                      1 条回复 最后回复
                      0

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组