跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. Asus Ascent GX10到货,双gb10的DSV4-Flash集群全程hermes远程部署

Asus Ascent GX10到货,双gb10的DSV4-Flash集群全程hermes远程部署

已定时 已固定 已锁定 已移动 AI硬件
gb10deepseekhermes
28 帖子 15 发布者 759 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • kos orK kos or

    @kop-wang said:

    6~7万,就能部署一个头部能力的全尺寸模型。响应能力、kvcache容量都是可用级别。
    放在半年前都像做梦一样。

    請問半年前是什麼場景呢? 我是Qwen3.6 才開始研究Local LLM的

    terryT 在线
    terryT 在线
    terry
    超级版主
    编写于 最后由 terry 编辑
    #19

    @kos-or 半年前还没有Qwen3.5,我刚做这个频道的时候,能跑Agent的模型我感觉只有Claude opus 4.6,GPT都不够格。现在是Qwen3.8 27b比肩Opus 4.6的时代。

    油管:https://www.youtube.com/@抡锤者

    kos orK 1 条回复 最后回复
    0
    • 张光璞张 离线
      张光璞张 离线
      张光璞
      劳动模范
      编写于 最后由 编辑
      #20

      B站有个哥们,现在已经有6台DGX了,他自己实测发现,两台dxg 和 deepseek v4 flash 是绝配。

      相比下M3 ultra 脱离了聊天就直接拉了,算力不够,空有高带宽 。

      1 条回复 最后回复
      0
      • terryT terry

        @kos-or 半年前还没有Qwen3.5,我刚做这个频道的时候,能跑Agent的模型我感觉只有Claude opus 4.6,GPT都不够格。现在是Qwen3.8 27b比肩Opus 4.6的时代。

        kos orK 离线
        kos orK 离线
        kos or
        技术大牛 劳动模范
        编写于 最后由 kos or 编辑
        #21

        @terry said:

        半年前还没有Qwen3.5

        在Hermes 四月份出現之前, 我大概頂多只是看新聞, 看了兩個月的OpenClaw熱潮,
        逛帖子也頂多上一些Reddit 論壇 看大家聊AI未來10~20年的發展
        沒想到半年內就出了 Qwen3.5, Qwen3.6, Qwen3.8

        3094e184-de26-4937-bbdb-220a28070809-image.jpeg

        1 条回复 最后回复
        0
        • D 离线
          D 离线
          densha
          编写于 最后由 densha 编辑
          #22

          這是昨天請 hermes (gemini-3.7-flash-high) 在雙GX10跑的測試做出來的比較,沒有很嚴謹(因為題目是它幫我想的XD),大家看看就好~
          dual-gx10-three-kings-benchmark.png

          1 条回复 最后回复
          2
          • I 离线
            I 离线
            iamvirus
            德高望重
            编写于 最后由 编辑
            #23

            我早就说过两台GB10 跑DS V4是目前最好的本地方案了。几乎本地95%的工作不要在线了。

            1 条回复 最后回复
            0
            • ,系统 取消固定了此主题
            • benton yiB 离线
              benton yiB 离线
              benton yi
              技术大牛
              编写于 最后由 benton yi 编辑
              #24

              d46e9494-ceb9-4cb6-b22e-45f1ffa71376-image.jpeg

              以上截图是今天真实工作场景下的全量日志拿来分析的数据,PP的峰值数据不可信(因为SGLang推理框架的RadixAttention缓存真的优雅又高效),但均值数据确实比vLLM运行DSV4-Flash提高了能有接近4成。

              启动参数脚本如下,先在从机运行启动脚本:

              docker run -d --name sglang_glm53 --network host --gpus all --shm-size=32g \
                -v /home/bentonyi/LLM/LibertAIDAI/GLM-5.3-Flash-NVFP4:/models/glm53:ro \
                sglang-glm53:gb10 \
                python3 -m sglang.launch_server \
                  --model-path /models/glm53 \
                  --trust-remote-code \
                  --tp-size 2 --nnodes 2 --node-rank 1 \
                  --dist-init-addr 10.100.40.2:29500 \
                  --attention-backend dsa \
                  --dsa-prefill-backend tilelang --dsa-decode-backend tilelang \
                  --moe-runner-backend flashinfer_cutlass \
                  --kv-cache-dtype bfloat16 \
                  --disable-shared-experts-fusion \
                  --reasoning-parser glm45 --tool-call-parser glm47 \
                  --mem-fraction-static 0.90 \
                  --context-length 524288 \
                  --max-running-requests 2 \
                  --default-chat-template-kwargs '{"reasoning_effort": "low"}' \
                  --host 0.0.0.0 --port 8000
              

              主机等6秒运行脚本:

              docker rm -f sglang_glm53 2>/dev/null
              docker run -d --name sglang_glm53 --network host --gpus all --shm-size=32g \
                -v /home/bentonyi/LLM/LibertAIDAI/GLM-5.3-Flash-NVFP4:/models/glm53:ro \
                sglang-glm53:gb10 \
                python3 -m sglang.launch_server \
                  --model-path /models/glm53 \
                  --trust-remote-code \
                  --tp-size 2 --nnodes 2 --node-rank 0 \
                  --dist-init-addr 10.100.40.2:29500 \
                  --attention-backend dsa \
                  --dsa-prefill-backend tilelang --dsa-decode-backend tilelang \
                  --moe-runner-backend flashinfer_cutlass \
                  --kv-cache-dtype bfloat16 \
                  --disable-shared-experts-fusion \
                  --reasoning-parser glm45 --tool-call-parser glm47 \
                  --mem-fraction-static 0.90 \
                  --context-length 524288 \
                  --max-running-requests 2 \
                  --default-chat-template-kwargs '{"reasoning_effort": "low"}' \
                  --host 0.0.0.0 --port 8000
              

              这个参数设置得比较极限:通过计算得到内存红线设置在0.92可保证上下文512K的情况下最大并发为2(gb10集群仅作推理服务器不运行别的任何程序,连屏幕键鼠都不配的情况下)。
              GLM5.3-Flash这模型因为激活参数18B,推理确实很慢,再加上这货的默认设置导致过度思考的问题:
              c96873da-5267-4322-bfe5-4bb377b61c98-image.jpeg

              加入 --default-chat-template-kwargs '{"reasoning_effort": "low"}' \后勉强可用,但效果还是远不如DSV4-Flash。也就是不愿意为“降速高达70%但智力没有相应程度的提升”买单,工作了一天准备换回DSV4-Flash。下一步准备测试Qwen4架构的qwen3.8-flash-next。因为都是以实际工作场景的数据日志进行性能分析,所以更新可能没那么快,主打一个真实可信。

              fcfb0251-2776-4789-9aa1-a13eb51cb09d-image.jpeg

              最后引用一个社区排行榜的glm5.3-flash截图,tp2无论如何都还是捉襟见肘,要真想在gb10上爽玩还是得TP4集群。

              1 条回复 最后回复
              1
              • ,terryT terry 固定了此主题
              • ,系统 取消固定了此主题
              • Grayson RenG 离线
                Grayson RenG 离线
                Grayson Ren
                编写于 最后由 编辑
                #25

                Qwen4架构的qwen3.8-flash-next 测试结果有了么?

                1 条回复 最后回复
                0
                • benton yiB 离线
                  benton yiB 离线
                  benton yi
                  技术大牛
                  编写于 最后由 编辑
                  #26

                  a6885b23-ef0e-472e-9cb1-91720ad40a3f-image.jpeg
                  3efd99b2-bb79-4af6-9fe2-7d8da857c538-image.jpeg

                  terryT 1 条回复 最后回复
                  1
                  • benton yiB benton yi

                    a6885b23-ef0e-472e-9cb1-91720ad40a3f-image.jpeg
                    3efd99b2-bb79-4af6-9fe2-7d8da857c538-image.jpeg

                    terryT 在线
                    terryT 在线
                    terry
                    超级版主
                    编写于 最后由 编辑
                    #27

                    @benton-yi 我弟你多测试下,comfyui/glm/qwen flash/dsv4,多发点帖子😂

                    油管:https://www.youtube.com/@抡锤者

                    1 条回复 最后回复
                    0
                    • kop wangK 离线
                      kop wangK 离线
                      kop wang
                      超级版主
                      编写于 最后由 编辑
                      #28

                      为何总参数、激活参数更小的qwen3.8-flash会更慢,这个很难理解。

                      虚心交流,一起进步

                      1 条回复 最后回复
                      0

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组