跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. 一直没找到在DGX上能完全满意的一套模型配置

一直没找到在DGX上能完全满意的一套模型配置

已定时 已固定 已锁定 已移动 LLM讨论区
本地模型服务器
24 帖子 8 发布者 343 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • 包磊包 包磊

    @soop-ladios 昨天装个 codex,然后和他讨论一番。决定在 codex 复制我在 Hermes 上的工作流。需求端保留在 Hermes。全文档交换系统。Hermes 用codex-run 方式启动。然后 简单cron扫描交换区进行双向通讯。阻塞性事件微信通知人肉处理。跑了一个自动抓雪球 文章的并整理评级的小项目效果很好。对多 agent看板工作流控制比我在 Hermes 手工攒起来强多了。后台用的 DeepSeek false 还没接 DGX,可能也是特别顺的原因之一。下次转到本地模型的再试

    soop ladiosS 离线
    soop ladiosS 离线
    soop ladios
    德高望重
    编写于 最后由 编辑
    #15

    @包磊 不錯喔,不過如果你之前沒試過,或許可以試試hermes直接接deepseek 看看,可能之前就是模型的問題而已
    這兩天DGX論壇上也把單台dgx spark裝deepseek flash 0731搞到看起來還不錯,可以試試. 若一台覺得精度不夠,可能要看用量決定是再買一台來張量並行,還是直接用線上的.
    兩台速度快很多,prefill 2000初 t/s, decode 40-60 tok/s, 精度也夠,看怎麼取捨了.

    linkdesuL 1 条回复 最后回复
    1
    • terryT 在线
      terryT 在线
      terry
      超级版主
      编写于 最后由 编辑
      #16

      Hermes直接接Deepseek就很好用.本地部署吃硬件,100G显存以内Qwen3.6 27b SGLang缺一不可,其他都是玩具。这些从几个月前就有大量测试佐证,没必要怀疑测试的人,自己一定要折腾其他方案。

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0
      • 包磊包 离线
        包磊包 离线
        包磊
        编写于 最后由 编辑
        #17

        单纯解决问题Hermes 跑 DeepSeek 是最简单的。其实我大部分工作都是这么完成的。折腾的原因是因为现成有一台 DGX,不用起来觉得亏的慌。没上Qwen3.6:27b 的前面已经说了。空了去试试。现在用SGLang 跑 qwen3:coder-next-FP8感觉也还行。生命不息,折腾不止😄

        1 条回复 最后回复
        0
        • M 离线
          M 离线
          mark
          超凡大师
          编写于 最后由 编辑
          #18

          7c08e03d-9cf8-444b-8af4-2634b479101e-image.jpeg

          是这个laguna 2.1 吗? 好像他是 做的qwen 3.6 27b

          1 条回复 最后回复
          1
          • soop ladiosS 离线
            soop ladiosS 离线
            soop ladios
            德高望重
            编写于 最后由 编辑
            #19

            這個模型我有用一陣子, 蠻不錯的, 不過有一些過度思考跟loop輸出的問題, 而且他們好像還在tune, 可能再等一陣子吧.

            1 条回复 最后回复
            0
            • 包磊包 离线
              包磊包 离线
              包磊
              编写于 最后由 编辑
              #20

              GDX 部署好了 SGLang+27B 了。Mamba size 要自己显式设定等于你的并发数*5,否者 SGLang 会限制你的并发数。SGLang 在部署27B 的时候竟然认不全所有共享内存。我把--mem-fraction-static 1.4 才把看 kVcache撑起来。这个具体数值可能要自己根据情况看。 Hermes 出了 0.20.0 版,a2a和框架通讯都获益,不需要 cron,不需要 codex cli。Hermes 调用CC switch 配置27B的 codex 做点个人小项目泡一晚上都很稳。@soop-ladios

              1 条回复 最后回复
              0
              • soop ladiosS soop ladios

                @包磊 不錯喔,不過如果你之前沒試過,或許可以試試hermes直接接deepseek 看看,可能之前就是模型的問題而已
                這兩天DGX論壇上也把單台dgx spark裝deepseek flash 0731搞到看起來還不錯,可以試試. 若一台覺得精度不夠,可能要看用量決定是再買一台來張量並行,還是直接用線上的.
                兩台速度快很多,prefill 2000初 t/s, decode 40-60 tok/s, 精度也夠,看怎麼取捨了.

                linkdesuL 离线
                linkdesuL 离线
                linkdesu
                编写于 最后由 编辑
                #21

                @soop-ladios 更进一步 2 台 DGX Spark 可以实现 1+1 > 2 的效果,看到没人提就分享一下,成本很高大家量力而行吧。仓库链接: https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

                soop ladiosS 1 条回复 最后回复
                0
                • 包磊包 离线
                  包磊包 离线
                  包磊
                  编写于 最后由 编辑
                  #22

                  我这里只有一台,deepseek 装上了,试了一下就停了,没法真的用。朋友那里有两台,在买线。过两天其他那里试试。

                  1 条回复 最后回复
                  0
                  • N 在线
                    N 在线
                    neo
                    编写于 最后由 编辑
                    #23

                    这两天试了下claude code+sglang+qwen3.6-27B,除了coding,干其他也还行。

                    1 条回复 最后回复
                    0
                    • linkdesuL linkdesu

                      @soop-ladios 更进一步 2 台 DGX Spark 可以实现 1+1 > 2 的效果,看到没人提就分享一下,成本很高大家量力而行吧。仓库链接: https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

                      soop ladiosS 离线
                      soop ladiosS 离线
                      soop ladios
                      德高望重
                      编写于 最后由 编辑
                      #24

                      @linkdesu 我已經用兩台跑很久了,0731出來也已經換上了,真心不錯,速度快,kv緩存也夠500K x 6.
                      不過coding上使用起來感覺還是差glm 5.2一點,純個人感覺,沒有甚麼根據.
                      單純論性價比,dsv4f用兩台,glm 5.2至少要四台,dsv4f還是比較高的

                      1 条回复 最后回复
                      1

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 没有帐号? 注册

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组