跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. 关于小公司跑本地大模型硬件建议

关于小公司跑本地大模型硬件建议

已定时 已固定 已锁定 已移动 AI硬件
本地模型rtxpro6000服务器
39 帖子 15 发布者 767 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Z zorg

    @KAKAHermes 我投mac studio,我也是从3090、5090后来转向mac 平台,macos反而最简单,少很多对硬件兼容性、散热、稳定性、可维护的时间和人力成本。我在跑omlx我觉得很友好,稳定。年初从m5 max 128开机部署好omlx以后它就一直在角落跑,甚至不是高密度长时间运行都可以直接用显示器的typec线充电,噪音可忽略,耗能少,环境友好。虽然不知道将来是否需要继续扩充多台,但是目前看4台m3 ultra也能达到内存池扩展的效果,就像老特说的,32G5090跑comfy ui就不算瓶颈了,这样mac做llm server endpoint,mac mini、macbook pro跑agent,5090跑comfy ui,系统风险也有隔离,看起来也是一个完整的场景了。

    张光璞张 离线
    张光璞张 离线
    张光璞
    劳动模范
    编写于 最后由 编辑
    #26

    @zorg 说:

    @KAKAHermes 我投mac studio,

    架构什么的我不懂,但我明白一件事: 都是用的台积电最新工艺,都是美帝最高科技 , 同工艺同时代产品下不可能老黄卡多费那么多电是白费的。

    1 条回复 最后回复
    0
    • CS6C CS6

      @KAKAHermes 這個價格,我勸你就別買了,除非你老闆真的人好錢多....
      你先去確認一下到底電源跟空間能差多少張卡?
      單純跑推理的話 B70 R9700 八卡就算一張以300瓦來算上電費還是省很多錢...
      甚至你可以買到四台 GB10 ...

      K 离线
      K 离线
      KAKAHermes
      编写于 最后由 编辑
      #27

      @CS6 考量伺服器兼容問題及卡的價格,現在最實際的方案似乎是 GB10了。不浪費現有伺服器的情況下,又可以快速部署服務:

      現有的伺服器可以增加內存去128或512GB, 之後部署API Gateway,作爲API Load Balancing,對接兩臺GB10, 物理分隔內部及外部需求。也可以保留未來擴充的可能性。(Node C)
      5a458686-3ac5-41a1-859d-e7fb0400cdc2-image.jpeg
      對內尖峰同時發問支持5人, 希望Token數要有15-25 每秒才可以接收。

      看看各位大神對這個方案有什麼看法。🤝

      許托比許 CS6C soop ladiosS 3 条回复 最后回复
      0
      • K KAKAHermes

        @CS6 考量伺服器兼容問題及卡的價格,現在最實際的方案似乎是 GB10了。不浪費現有伺服器的情況下,又可以快速部署服務:

        現有的伺服器可以增加內存去128或512GB, 之後部署API Gateway,作爲API Load Balancing,對接兩臺GB10, 物理分隔內部及外部需求。也可以保留未來擴充的可能性。(Node C)
        5a458686-3ac5-41a1-859d-e7fb0400cdc2-image.jpeg
        對內尖峰同時發問支持5人, 希望Token數要有15-25 每秒才可以接收。

        看看各位大神對這個方案有什麼看法。🤝

        許托比許 离线
        許托比許 离线
        許托比
        编写于 最后由 编辑
        #28

        @KAKAHermes 帶寬有點吃緊就是 不跑文字以外的應該還可以八

        1 条回复 最后回复
        0
        • K KAKAHermes

          @CS6 考量伺服器兼容問題及卡的價格,現在最實際的方案似乎是 GB10了。不浪費現有伺服器的情況下,又可以快速部署服務:

          現有的伺服器可以增加內存去128或512GB, 之後部署API Gateway,作爲API Load Balancing,對接兩臺GB10, 物理分隔內部及外部需求。也可以保留未來擴充的可能性。(Node C)
          5a458686-3ac5-41a1-859d-e7fb0400cdc2-image.jpeg
          對內尖峰同時發問支持5人, 希望Token數要有15-25 每秒才可以接收。

          看看各位大神對這個方案有什麼看法。🤝

          CS6C 离线
          CS6C 离线
          CS6
          技术大牛 劳动模范
          编写于 最后由 编辑
          #29

          @KAKAHermes 先去租來測試.... https://gpu-72ca.gputw.ai/zh-TW/pricing/gpu/DGX-Spark-GB10-4TB

          1 条回复 最后回复
          0
          • williamlouisW 离线
            williamlouisW 离线
            williamlouis
            超级版主
            编写于 最后由 编辑
            #30

            看计划应该资金不是很充足。
            建议用在线 api 先顶一阵。等硬件降价吧。
            如有加密不能外漏的。用现有硬件克服一下。

            个人主页:xlkj.org Telegram https://t.me/xlkjorg

            1 条回复 最后回复
            0
            • K KAKAHermes

              @CS6 考量伺服器兼容問題及卡的價格,現在最實際的方案似乎是 GB10了。不浪費現有伺服器的情況下,又可以快速部署服務:

              現有的伺服器可以增加內存去128或512GB, 之後部署API Gateway,作爲API Load Balancing,對接兩臺GB10, 物理分隔內部及外部需求。也可以保留未來擴充的可能性。(Node C)
              5a458686-3ac5-41a1-859d-e7fb0400cdc2-image.jpeg
              對內尖峰同時發問支持5人, 希望Token數要有15-25 每秒才可以接收。

              看看各位大神對這個方案有什麼看法。🤝

              soop ladiosS 离线
              soop ladiosS 离线
              soop ladios
              德高望重
              编写于 最后由 soop ladios 编辑
              #31

              @KAKAHermes 说:

              對內尖峰同時發問支持5人, 希望Token數要有15-25 每秒才可以接收。

              這一台GB10應該是做不到的. 需要TP才行. 建議買四台GB10跟一台CRS504 100G switch, 跑TP4 deepseek v4 flash vision exp, 或是不要switch跑兩組TP2
              兩者我都跑過, TP2 多concurrency tok/s 80+應該是沒有問題, TP4的數據沒有留, 應該是更快.
              跑litellm應該是不用那麼多ram, 數據分流litellm內部就可以做到, 不管下面接的是一組, 兩組還是多組.
              我現在litellm接了glm 5.3 (GB10 x 8), qwen 3.8 27B Q8 (v100 x 2), ornith-1.5 35B Q4(3060 12G + dram offload), deepseek v4 flash 0731 (GB10 x 2), qwen 3.8 flash next (GB10 x 1), 分別服務兩個網段. litellm也才用了一台i5-1135G7, 16G ram的小電腦而已.

              K 1 条回复 最后回复
              0
              • BunseiB 离线
                BunseiB 离线
                Bunsei
                德高望重
                编写于 最后由 Bunsei 编辑
                #32

                我推荐你去跟老板申请笔钱(2K差不多),然后去实际租一下试试看,测试一下各类硬件配置。 以免后面买了不合适,来回折腾,花点小钱探探路也是不错的。你自己能在这测试过程中积累到不错的经验。

                K 1 条回复 最后回复
                0
                • BunseiB Bunsei

                  我推荐你去跟老板申请笔钱(2K差不多),然后去实际租一下试试看,测试一下各类硬件配置。 以免后面买了不合适,来回折腾,花点小钱探探路也是不错的。你自己能在这测试过程中积累到不错的经验。

                  K 离线
                  K 离线
                  KAKAHermes
                  编写于 最后由 编辑
                  #33

                  @Bunsei 我有嘗試租借GB10 ,但很難模擬多人使用場景。

                  BunseiB soop ladiosS 2 条回复 最后回复
                  0
                  • K KAKAHermes

                    @Bunsei 我有嘗試租借GB10 ,但很難模擬多人使用場景。

                    BunseiB 离线
                    BunseiB 离线
                    Bunsei
                    德高望重
                    编写于 最后由 编辑
                    #34

                    @KAKAHermes 说:

                    @Bunsei 我有嘗試租借GB10 ,但很難模擬多人使用場景。

                    这个简单,你就直接全程交给chatgpt好了 😂

                    1 条回复 最后回复
                    0
                    • K KAKAHermes

                      @Bunsei 我有嘗試租借GB10 ,但很難模擬多人使用場景。

                      soop ladiosS 离线
                      soop ladiosS 离线
                      soop ladios
                      德高望重
                      编写于 最后由 编辑
                      #35

                      @KAKAHermes 可以用llama-benchy 測試多concurrency
                      https://github.com/eugr/llama-benchy

                      K 1 条回复 最后回复
                      0
                      • soop ladiosS soop ladios

                        @KAKAHermes 说:

                        對內尖峰同時發問支持5人, 希望Token數要有15-25 每秒才可以接收。

                        這一台GB10應該是做不到的. 需要TP才行. 建議買四台GB10跟一台CRS504 100G switch, 跑TP4 deepseek v4 flash vision exp, 或是不要switch跑兩組TP2
                        兩者我都跑過, TP2 多concurrency tok/s 80+應該是沒有問題, TP4的數據沒有留, 應該是更快.
                        跑litellm應該是不用那麼多ram, 數據分流litellm內部就可以做到, 不管下面接的是一組, 兩組還是多組.
                        我現在litellm接了glm 5.3 (GB10 x 8), qwen 3.8 27B Q8 (v100 x 2), ornith-1.5 35B Q4(3060 12G + dram offload), deepseek v4 flash 0731 (GB10 x 2), qwen 3.8 flash next (GB10 x 1), 分別服務兩個網段. litellm也才用了一台i5-1135G7, 16G ram的小電腦而已.

                        K 离线
                        K 离线
                        KAKAHermes
                        编写于 最后由 编辑
                        #36

                        @soop-ladios 是的,我也是計劃先買兩台GB10來跑TP,加上本身的伺服器跑LiteLLM。

                        1 条回复 最后回复
                        0
                        • soop ladiosS soop ladios

                          @KAKAHermes 可以用llama-benchy 測試多concurrency
                          https://github.com/eugr/llama-benchy

                          K 离线
                          K 离线
                          KAKAHermes
                          编写于 最后由 编辑
                          #37

                          @soop-ladios 多謝提醒,我測試一部試試,但不能租用兩部GB10 模擬TP吧。。。。

                          soop ladiosS 1 条回复 最后回复
                          0
                          • K KAKAHermes

                            @soop-ladios 多謝提醒,我測試一部試試,但不能租用兩部GB10 模擬TP吧。。。。

                            soop ladiosS 离线
                            soop ladiosS 离线
                            soop ladios
                            德高望重
                            编写于 最后由 soop ladios 编辑
                            #38

                            @KAKAHermes 我趁沒人用的空檔跑了一下給你參考:

                            DeepSeek V4 Flash Concurrency Benchmark

                            • 測試時間:2026-09-02
                            • 工具:llama-benchy 0.3.8.dev2+gff162bcfc
                            • 模型:deepseek-v4-flash
                            • 參數:PP=2048、TG=128、每組 5 runs、--no-cache

                            測試結果

                            Concurrency Prefill total Prefill/request TG total(持續) TG/request TG 1 秒峰值
                            4 1835.1 ± 24.0 tok/s 648.3 ± 327.4 tok/s 56.27 ± 3.52 tok/s 18.92 ± 2.84 tok/s 100.6 ± 5.2 tok/s
                            5 1820.6 ± 69.4 tok/s 598.5 ± 393.3 tok/s 56.97 ± 3.09 tok/s 16.30 ± 2.54 tok/s 108.6 ± 5.1 tok/s

                            Individual prefill 的 median:c4 為 487.2 tok/s/request,c5 為 485.5 tok/s/request。

                            這是vllm跑的TP2, 看起來是勉強到你的最低要求. 還是TP4比較有餘裕.
                            附註:

                            1. 為了增加更多可用ctx (目前是500K x 6), 我把max-num-batched-tokens設4096 , 再多會OOM. 如果把KV cache減少, 可以留多一點空間, 就可以把這個值調大, prefill會更快
                            2. 這是KV緩存完全沒命中的測試. 實際prefill數值要視使用情況而定, 可能更快也可能更慢. GB10是統一記憶體, KV緩存到ram不會是一個方案. 若常有長上下文冷啟動需求, 可能要考慮nvme緩存, 這需要折騰.
                            K 1 条回复 最后回复
                            1
                            • soop ladiosS soop ladios

                              @KAKAHermes 我趁沒人用的空檔跑了一下給你參考:

                              DeepSeek V4 Flash Concurrency Benchmark

                              • 測試時間:2026-09-02
                              • 工具:llama-benchy 0.3.8.dev2+gff162bcfc
                              • 模型:deepseek-v4-flash
                              • 參數:PP=2048、TG=128、每組 5 runs、--no-cache

                              測試結果

                              Concurrency Prefill total Prefill/request TG total(持續) TG/request TG 1 秒峰值
                              4 1835.1 ± 24.0 tok/s 648.3 ± 327.4 tok/s 56.27 ± 3.52 tok/s 18.92 ± 2.84 tok/s 100.6 ± 5.2 tok/s
                              5 1820.6 ± 69.4 tok/s 598.5 ± 393.3 tok/s 56.97 ± 3.09 tok/s 16.30 ± 2.54 tok/s 108.6 ± 5.1 tok/s

                              Individual prefill 的 median:c4 為 487.2 tok/s/request,c5 為 485.5 tok/s/request。

                              這是vllm跑的TP2, 看起來是勉強到你的最低要求. 還是TP4比較有餘裕.
                              附註:

                              1. 為了增加更多可用ctx (目前是500K x 6), 我把max-num-batched-tokens設4096 , 再多會OOM. 如果把KV cache減少, 可以留多一點空間, 就可以把這個值調大, prefill會更快
                              2. 這是KV緩存完全沒命中的測試. 實際prefill數值要視使用情況而定, 可能更快也可能更慢. GB10是統一記憶體, KV緩存到ram不會是一個方案. 若常有長上下文冷啟動需求, 可能要考慮nvme緩存, 這需要折騰.
                              K 离线
                              K 离线
                              KAKAHermes
                              编写于 最后由 编辑
                              #39

                              @soop-ladios 感謝提供寶貴數據!非常有參考性,真幫了大忙! 希望可以向TP4這個方向發展。

                              1 条回复 最后回复
                              0

                              你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                              厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                              有了你的建议,这篇帖子会更精彩哦 💗

                              注册 登录
                              回复
                              • 在新帖中回复
                              登录后回复
                              • 从旧到新
                              • 从新到旧
                              • 最多赞同


                              • 登录

                              • 登录或注册以进行搜索。
                              • 第一个帖子
                                最后一个帖子
                              0
                              • 版块
                              • 最新
                              • 标签
                              • 热门
                              • 用户
                              • 群组