跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. 一直没找到在DGX上能完全满意的一套模型配置

一直没找到在DGX上能完全满意的一套模型配置

已定时 已固定 已锁定 已移动 LLM讨论区
本地模型服务器
24 帖子 8 发布者 343 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • 包磊包 离线
    包磊包 离线
    包磊
    编写于 最后由 编辑
    #11

    谢谢! soop ladios你的分享,我会去你的那里学习取经。我一直在用Hermes agent,也碰到好多问题,这两天参考Pi项目也改进了hermes的hook

    1 条回复 最后回复
    0
    • soop ladiosS 离线
      soop ladiosS 离线
      soop ladios
      德高望重
      编写于 最后由 soop ladios 编辑
      #12

      個人淺見, 如果是複雜冗長的任務, 可能還是用coding agent去跑會比較容易掌握, 可以讓hermes跟coding agent(codex cli/pi agent/claude code/kimi code..等等)協同作戰, 由hermes監控coding agent並由user手動或自動送命令過去.
      早期我沒解決會停下來的問題之前, 我是讓openclaw 定期去巡視工作中的tmux sessions, 有誰停下來了, 看起來又還沒完成工作的, 自動送出繼續+enter, 他就會繼續跑了. 也可以讓openclaw/hermes定期或手動讓他回報目前進度跟輸入指令.

      Deepseek單機我是沒跑過, 我是用雙機跑原版的. 原版權重160G, IQ2SS 應該也差不多80G. 我看論壇上心得是沒有太大損失, kv也足以支撐512K x 3 或 256K x 5. 不過他沒圖像, 剩餘的ram應該也不太夠去架多模態, 如果需要處理圖像可能就無法考慮了.

      體感上我覺得deepseek v4 flash比qwen 3.6 27B Q8強一點, 但是差距沒有到很大. qwen 3.6 27B我之所以跑Q8, 是因為這已經是我能接受的速度的極限了, 不然全精度還是放得下的. 後來有出了有含MTP頭的模型我就沒試過BF16了, 或許BF16的qwen 3.6 27B速度有所提升也不一定.

      不過, deepseek v4 flash正式版即將推出,或許一切都會讓人改觀.
      螢幕擷取畫面 2026-07-31 163018.png

      包磊包 1 条回复 最后回复
      0
      • 包磊包 离线
        包磊包 离线
        包磊
        编写于 最后由 编辑
        #13

        谢谢! soop ladios。你说的跨框架的方案我还完全没试过,有机会去尝试一下。MTP我实测过Gemma4 31b,提升巨大。但到5对短任务,单toolcall就有点反作用了。

        1 条回复 最后回复
        0
        • soop ladiosS soop ladios

          個人淺見, 如果是複雜冗長的任務, 可能還是用coding agent去跑會比較容易掌握, 可以讓hermes跟coding agent(codex cli/pi agent/claude code/kimi code..等等)協同作戰, 由hermes監控coding agent並由user手動或自動送命令過去.
          早期我沒解決會停下來的問題之前, 我是讓openclaw 定期去巡視工作中的tmux sessions, 有誰停下來了, 看起來又還沒完成工作的, 自動送出繼續+enter, 他就會繼續跑了. 也可以讓openclaw/hermes定期或手動讓他回報目前進度跟輸入指令.

          Deepseek單機我是沒跑過, 我是用雙機跑原版的. 原版權重160G, IQ2SS 應該也差不多80G. 我看論壇上心得是沒有太大損失, kv也足以支撐512K x 3 或 256K x 5. 不過他沒圖像, 剩餘的ram應該也不太夠去架多模態, 如果需要處理圖像可能就無法考慮了.

          體感上我覺得deepseek v4 flash比qwen 3.6 27B Q8強一點, 但是差距沒有到很大. qwen 3.6 27B我之所以跑Q8, 是因為這已經是我能接受的速度的極限了, 不然全精度還是放得下的. 後來有出了有含MTP頭的模型我就沒試過BF16了, 或許BF16的qwen 3.6 27B速度有所提升也不一定.

          不過, deepseek v4 flash正式版即將推出,或許一切都會讓人改觀.
          螢幕擷取畫面 2026-07-31 163018.png

          包磊包 离线
          包磊包 离线
          包磊
          编写于 最后由 编辑
          #14

          @soop-ladios 昨天装个 codex,然后和他讨论一番。决定在 codex 复制我在 Hermes 上的工作流。需求端保留在 Hermes。全文档交换系统。Hermes 用codex-run 方式启动。然后 简单cron扫描交换区进行双向通讯。阻塞性事件微信通知人肉处理。跑了一个自动抓雪球 文章的并整理评级的小项目效果很好。对多 agent看板工作流控制比我在 Hermes 手工攒起来强多了。后台用的 DeepSeek false 还没接 DGX,可能也是特别顺的原因之一。下次转到本地模型的再试

          soop ladiosS 1 条回复 最后回复
          0
          • 包磊包 包磊

            @soop-ladios 昨天装个 codex,然后和他讨论一番。决定在 codex 复制我在 Hermes 上的工作流。需求端保留在 Hermes。全文档交换系统。Hermes 用codex-run 方式启动。然后 简单cron扫描交换区进行双向通讯。阻塞性事件微信通知人肉处理。跑了一个自动抓雪球 文章的并整理评级的小项目效果很好。对多 agent看板工作流控制比我在 Hermes 手工攒起来强多了。后台用的 DeepSeek false 还没接 DGX,可能也是特别顺的原因之一。下次转到本地模型的再试

            soop ladiosS 离线
            soop ladiosS 离线
            soop ladios
            德高望重
            编写于 最后由 编辑
            #15

            @包磊 不錯喔,不過如果你之前沒試過,或許可以試試hermes直接接deepseek 看看,可能之前就是模型的問題而已
            這兩天DGX論壇上也把單台dgx spark裝deepseek flash 0731搞到看起來還不錯,可以試試. 若一台覺得精度不夠,可能要看用量決定是再買一台來張量並行,還是直接用線上的.
            兩台速度快很多,prefill 2000初 t/s, decode 40-60 tok/s, 精度也夠,看怎麼取捨了.

            linkdesuL 1 条回复 最后回复
            1
            • terryT 在线
              terryT 在线
              terry
              超级版主
              编写于 最后由 编辑
              #16

              Hermes直接接Deepseek就很好用.本地部署吃硬件,100G显存以内Qwen3.6 27b SGLang缺一不可,其他都是玩具。这些从几个月前就有大量测试佐证,没必要怀疑测试的人,自己一定要折腾其他方案。

              油管:https://www.youtube.com/@抡锤者

              1 条回复 最后回复
              0
              • 包磊包 离线
                包磊包 离线
                包磊
                编写于 最后由 编辑
                #17

                单纯解决问题Hermes 跑 DeepSeek 是最简单的。其实我大部分工作都是这么完成的。折腾的原因是因为现成有一台 DGX,不用起来觉得亏的慌。没上Qwen3.6:27b 的前面已经说了。空了去试试。现在用SGLang 跑 qwen3:coder-next-FP8感觉也还行。生命不息,折腾不止😄

                1 条回复 最后回复
                0
                • M 离线
                  M 离线
                  mark
                  超凡大师
                  编写于 最后由 编辑
                  #18

                  7c08e03d-9cf8-444b-8af4-2634b479101e-image.jpeg

                  是这个laguna 2.1 吗? 好像他是 做的qwen 3.6 27b

                  1 条回复 最后回复
                  1
                  • soop ladiosS 离线
                    soop ladiosS 离线
                    soop ladios
                    德高望重
                    编写于 最后由 编辑
                    #19

                    這個模型我有用一陣子, 蠻不錯的, 不過有一些過度思考跟loop輸出的問題, 而且他們好像還在tune, 可能再等一陣子吧.

                    1 条回复 最后回复
                    0
                    • 包磊包 离线
                      包磊包 离线
                      包磊
                      编写于 最后由 编辑
                      #20

                      GDX 部署好了 SGLang+27B 了。Mamba size 要自己显式设定等于你的并发数*5,否者 SGLang 会限制你的并发数。SGLang 在部署27B 的时候竟然认不全所有共享内存。我把--mem-fraction-static 1.4 才把看 kVcache撑起来。这个具体数值可能要自己根据情况看。 Hermes 出了 0.20.0 版,a2a和框架通讯都获益,不需要 cron,不需要 codex cli。Hermes 调用CC switch 配置27B的 codex 做点个人小项目泡一晚上都很稳。@soop-ladios

                      1 条回复 最后回复
                      0
                      • soop ladiosS soop ladios

                        @包磊 不錯喔,不過如果你之前沒試過,或許可以試試hermes直接接deepseek 看看,可能之前就是模型的問題而已
                        這兩天DGX論壇上也把單台dgx spark裝deepseek flash 0731搞到看起來還不錯,可以試試. 若一台覺得精度不夠,可能要看用量決定是再買一台來張量並行,還是直接用線上的.
                        兩台速度快很多,prefill 2000初 t/s, decode 40-60 tok/s, 精度也夠,看怎麼取捨了.

                        linkdesuL 离线
                        linkdesuL 离线
                        linkdesu
                        编写于 最后由 编辑
                        #21

                        @soop-ladios 更进一步 2 台 DGX Spark 可以实现 1+1 > 2 的效果,看到没人提就分享一下,成本很高大家量力而行吧。仓库链接: https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

                        soop ladiosS 1 条回复 最后回复
                        0
                        • 包磊包 离线
                          包磊包 离线
                          包磊
                          编写于 最后由 编辑
                          #22

                          我这里只有一台,deepseek 装上了,试了一下就停了,没法真的用。朋友那里有两台,在买线。过两天其他那里试试。

                          1 条回复 最后回复
                          0
                          • N 离线
                            N 离线
                            neo
                            编写于 最后由 编辑
                            #23

                            这两天试了下claude code+sglang+qwen3.6-27B,除了coding,干其他也还行。

                            1 条回复 最后回复
                            0
                            • linkdesuL linkdesu

                              @soop-ladios 更进一步 2 台 DGX Spark 可以实现 1+1 > 2 的效果,看到没人提就分享一下,成本很高大家量力而行吧。仓库链接: https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

                              soop ladiosS 离线
                              soop ladiosS 离线
                              soop ladios
                              德高望重
                              编写于 最后由 编辑
                              #24

                              @linkdesu 我已經用兩台跑很久了,0731出來也已經換上了,真心不錯,速度快,kv緩存也夠500K x 6.
                              不過coding上使用起來感覺還是差glm 5.2一點,純個人感覺,沒有甚麼根據.
                              單純論性價比,dsv4f用兩台,glm 5.2至少要四台,dsv4f還是比較高的

                              1 条回复 最后回复
                              1

                              你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                              厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                              有了你的建议,这篇帖子会更精彩哦 💗

                              注册 登录
                              回复
                              • 在新帖中回复
                              登录后回复
                              • 从旧到新
                              • 从新到旧
                              • 最多赞同


                              • 登录

                              • 没有帐号? 注册

                              • 登录或注册以进行搜索。
                              • 第一个帖子
                                最后一个帖子
                              0
                              • 版块
                              • 最新
                              • 标签
                              • 热门
                              • 用户
                              • 群组