跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. 一直没找到在DGX上能完全满意的一套模型配置

一直没找到在DGX上能完全满意的一套模型配置

已定时 已固定 已锁定 已移动 LLM讨论区
本地模型服务器
24 帖子 8 发布者 345 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • soop ladiosS 离线
    soop ladiosS 离线
    soop ladios
    德高望重
    编写于 最后由 soop ladios 编辑
    #12

    個人淺見, 如果是複雜冗長的任務, 可能還是用coding agent去跑會比較容易掌握, 可以讓hermes跟coding agent(codex cli/pi agent/claude code/kimi code..等等)協同作戰, 由hermes監控coding agent並由user手動或自動送命令過去.
    早期我沒解決會停下來的問題之前, 我是讓openclaw 定期去巡視工作中的tmux sessions, 有誰停下來了, 看起來又還沒完成工作的, 自動送出繼續+enter, 他就會繼續跑了. 也可以讓openclaw/hermes定期或手動讓他回報目前進度跟輸入指令.

    Deepseek單機我是沒跑過, 我是用雙機跑原版的. 原版權重160G, IQ2SS 應該也差不多80G. 我看論壇上心得是沒有太大損失, kv也足以支撐512K x 3 或 256K x 5. 不過他沒圖像, 剩餘的ram應該也不太夠去架多模態, 如果需要處理圖像可能就無法考慮了.

    體感上我覺得deepseek v4 flash比qwen 3.6 27B Q8強一點, 但是差距沒有到很大. qwen 3.6 27B我之所以跑Q8, 是因為這已經是我能接受的速度的極限了, 不然全精度還是放得下的. 後來有出了有含MTP頭的模型我就沒試過BF16了, 或許BF16的qwen 3.6 27B速度有所提升也不一定.

    不過, deepseek v4 flash正式版即將推出,或許一切都會讓人改觀.
    螢幕擷取畫面 2026-07-31 163018.png

    包磊包 1 条回复 最后回复
    0
    • 包磊包 离线
      包磊包 离线
      包磊
      编写于 最后由 编辑
      #13

      谢谢! soop ladios。你说的跨框架的方案我还完全没试过,有机会去尝试一下。MTP我实测过Gemma4 31b,提升巨大。但到5对短任务,单toolcall就有点反作用了。

      1 条回复 最后回复
      0
      • soop ladiosS soop ladios

        個人淺見, 如果是複雜冗長的任務, 可能還是用coding agent去跑會比較容易掌握, 可以讓hermes跟coding agent(codex cli/pi agent/claude code/kimi code..等等)協同作戰, 由hermes監控coding agent並由user手動或自動送命令過去.
        早期我沒解決會停下來的問題之前, 我是讓openclaw 定期去巡視工作中的tmux sessions, 有誰停下來了, 看起來又還沒完成工作的, 自動送出繼續+enter, 他就會繼續跑了. 也可以讓openclaw/hermes定期或手動讓他回報目前進度跟輸入指令.

        Deepseek單機我是沒跑過, 我是用雙機跑原版的. 原版權重160G, IQ2SS 應該也差不多80G. 我看論壇上心得是沒有太大損失, kv也足以支撐512K x 3 或 256K x 5. 不過他沒圖像, 剩餘的ram應該也不太夠去架多模態, 如果需要處理圖像可能就無法考慮了.

        體感上我覺得deepseek v4 flash比qwen 3.6 27B Q8強一點, 但是差距沒有到很大. qwen 3.6 27B我之所以跑Q8, 是因為這已經是我能接受的速度的極限了, 不然全精度還是放得下的. 後來有出了有含MTP頭的模型我就沒試過BF16了, 或許BF16的qwen 3.6 27B速度有所提升也不一定.

        不過, deepseek v4 flash正式版即將推出,或許一切都會讓人改觀.
        螢幕擷取畫面 2026-07-31 163018.png

        包磊包 离线
        包磊包 离线
        包磊
        编写于 最后由 编辑
        #14

        @soop-ladios 昨天装个 codex,然后和他讨论一番。决定在 codex 复制我在 Hermes 上的工作流。需求端保留在 Hermes。全文档交换系统。Hermes 用codex-run 方式启动。然后 简单cron扫描交换区进行双向通讯。阻塞性事件微信通知人肉处理。跑了一个自动抓雪球 文章的并整理评级的小项目效果很好。对多 agent看板工作流控制比我在 Hermes 手工攒起来强多了。后台用的 DeepSeek false 还没接 DGX,可能也是特别顺的原因之一。下次转到本地模型的再试

        soop ladiosS 1 条回复 最后回复
        0
        • 包磊包 包磊

          @soop-ladios 昨天装个 codex,然后和他讨论一番。决定在 codex 复制我在 Hermes 上的工作流。需求端保留在 Hermes。全文档交换系统。Hermes 用codex-run 方式启动。然后 简单cron扫描交换区进行双向通讯。阻塞性事件微信通知人肉处理。跑了一个自动抓雪球 文章的并整理评级的小项目效果很好。对多 agent看板工作流控制比我在 Hermes 手工攒起来强多了。后台用的 DeepSeek false 还没接 DGX,可能也是特别顺的原因之一。下次转到本地模型的再试

          soop ladiosS 离线
          soop ladiosS 离线
          soop ladios
          德高望重
          编写于 最后由 编辑
          #15

          @包磊 不錯喔,不過如果你之前沒試過,或許可以試試hermes直接接deepseek 看看,可能之前就是模型的問題而已
          這兩天DGX論壇上也把單台dgx spark裝deepseek flash 0731搞到看起來還不錯,可以試試. 若一台覺得精度不夠,可能要看用量決定是再買一台來張量並行,還是直接用線上的.
          兩台速度快很多,prefill 2000初 t/s, decode 40-60 tok/s, 精度也夠,看怎麼取捨了.

          linkdesuL 1 条回复 最后回复
          1
          • terryT 离线
            terryT 离线
            terry
            超级版主
            编写于 最后由 编辑
            #16

            Hermes直接接Deepseek就很好用.本地部署吃硬件,100G显存以内Qwen3.6 27b SGLang缺一不可,其他都是玩具。这些从几个月前就有大量测试佐证,没必要怀疑测试的人,自己一定要折腾其他方案。

            油管:https://www.youtube.com/@抡锤者

            1 条回复 最后回复
            0
            • 包磊包 离线
              包磊包 离线
              包磊
              编写于 最后由 编辑
              #17

              单纯解决问题Hermes 跑 DeepSeek 是最简单的。其实我大部分工作都是这么完成的。折腾的原因是因为现成有一台 DGX,不用起来觉得亏的慌。没上Qwen3.6:27b 的前面已经说了。空了去试试。现在用SGLang 跑 qwen3:coder-next-FP8感觉也还行。生命不息,折腾不止😄

              1 条回复 最后回复
              0
              • M 离线
                M 离线
                mark
                超凡大师
                编写于 最后由 编辑
                #18

                7c08e03d-9cf8-444b-8af4-2634b479101e-image.jpeg

                是这个laguna 2.1 吗? 好像他是 做的qwen 3.6 27b

                1 条回复 最后回复
                1
                • soop ladiosS 离线
                  soop ladiosS 离线
                  soop ladios
                  德高望重
                  编写于 最后由 编辑
                  #19

                  這個模型我有用一陣子, 蠻不錯的, 不過有一些過度思考跟loop輸出的問題, 而且他們好像還在tune, 可能再等一陣子吧.

                  1 条回复 最后回复
                  0
                  • 包磊包 离线
                    包磊包 离线
                    包磊
                    编写于 最后由 编辑
                    #20

                    GDX 部署好了 SGLang+27B 了。Mamba size 要自己显式设定等于你的并发数*5,否者 SGLang 会限制你的并发数。SGLang 在部署27B 的时候竟然认不全所有共享内存。我把--mem-fraction-static 1.4 才把看 kVcache撑起来。这个具体数值可能要自己根据情况看。 Hermes 出了 0.20.0 版,a2a和框架通讯都获益,不需要 cron,不需要 codex cli。Hermes 调用CC switch 配置27B的 codex 做点个人小项目泡一晚上都很稳。@soop-ladios

                    1 条回复 最后回复
                    0
                    • soop ladiosS soop ladios

                      @包磊 不錯喔,不過如果你之前沒試過,或許可以試試hermes直接接deepseek 看看,可能之前就是模型的問題而已
                      這兩天DGX論壇上也把單台dgx spark裝deepseek flash 0731搞到看起來還不錯,可以試試. 若一台覺得精度不夠,可能要看用量決定是再買一台來張量並行,還是直接用線上的.
                      兩台速度快很多,prefill 2000初 t/s, decode 40-60 tok/s, 精度也夠,看怎麼取捨了.

                      linkdesuL 离线
                      linkdesuL 离线
                      linkdesu
                      编写于 最后由 编辑
                      #21

                      @soop-ladios 更进一步 2 台 DGX Spark 可以实现 1+1 > 2 的效果,看到没人提就分享一下,成本很高大家量力而行吧。仓库链接: https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

                      soop ladiosS 1 条回复 最后回复
                      0
                      • 包磊包 离线
                        包磊包 离线
                        包磊
                        编写于 最后由 编辑
                        #22

                        我这里只有一台,deepseek 装上了,试了一下就停了,没法真的用。朋友那里有两台,在买线。过两天其他那里试试。

                        1 条回复 最后回复
                        0
                        • N 离线
                          N 离线
                          neo
                          编写于 最后由 编辑
                          #23

                          这两天试了下claude code+sglang+qwen3.6-27B,除了coding,干其他也还行。

                          1 条回复 最后回复
                          0
                          • linkdesuL linkdesu

                            @soop-ladios 更进一步 2 台 DGX Spark 可以实现 1+1 > 2 的效果,看到没人提就分享一下,成本很高大家量力而行吧。仓库链接: https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

                            soop ladiosS 离线
                            soop ladiosS 离线
                            soop ladios
                            德高望重
                            编写于 最后由 编辑
                            #24

                            @linkdesu 我已經用兩台跑很久了,0731出來也已經換上了,真心不錯,速度快,kv緩存也夠500K x 6.
                            不過coding上使用起來感覺還是差glm 5.2一點,純個人感覺,沒有甚麼根據.
                            單純論性價比,dsv4f用兩台,glm 5.2至少要四台,dsv4f還是比較高的

                            1 条回复 最后回复
                            1

                            你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                            厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                            有了你的建议,这篇帖子会更精彩哦 💗

                            注册 登录
                            回复
                            • 在新帖中回复
                            登录后回复
                            • 从旧到新
                            • 从新到旧
                            • 最多赞同


                            • 登录

                            • 没有帐号? 注册

                            • 登录或注册以进行搜索。
                            • 第一个帖子
                              最后一个帖子
                            0
                            • 版块
                            • 最新
                            • 标签
                            • 热门
                            • 用户
                            • 群组