跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. 关于小公司跑本地大模型硬件建议

关于小公司跑本地大模型硬件建议

已定时 已固定 已锁定 已移动 AI硬件
本地模型rtxpro6000服务器
39 帖子 15 发布者 767 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • CS6C 离线
    CS6C 离线
    CS6
    技术大牛 劳动模范
    编写于 最后由 编辑
    #5

    @kakahermes 先給預算還有具體用法,OCR API 可以買張便宜卡/ mac mini / CPU 單獨跑即可,多人服務一律建議上 AMD CPU server + NV GPU ,EPYC 7002/7003 DDR4 ECC 插滿 , 原生給 4~8 條 pcie 4.0x16
    GPU 選 R9700 / PRO 5000 72G / A100 80G / H100/ H200 / PRO 6000 96G 2~4 張 GPU

    個人認爲 HPE ProLiant DL380 Gen11 64G 完全不夠用,除非你的 20位同事都在摸魚,本地知识库本身不是問題,先抓出這25位的請求量有多少? 可以等待的時間有多長? 配合搭配的Agent框架?
    如果使用的頻率不高,你乾脆買GB10 *2 ,或是四張 R9700 / R9600D至少可以讓4~8個同事併發使用
    自家网页的ChatBot 你這部分的的流量出口跟入口也沒有計算....

    建議你先把服務架在 runPod 上試試看吧,設備很貴的

    K 1 条回复 最后回复
    1
    • CS6C CS6

      @kakahermes 先給預算還有具體用法,OCR API 可以買張便宜卡/ mac mini / CPU 單獨跑即可,多人服務一律建議上 AMD CPU server + NV GPU ,EPYC 7002/7003 DDR4 ECC 插滿 , 原生給 4~8 條 pcie 4.0x16
      GPU 選 R9700 / PRO 5000 72G / A100 80G / H100/ H200 / PRO 6000 96G 2~4 張 GPU

      個人認爲 HPE ProLiant DL380 Gen11 64G 完全不夠用,除非你的 20位同事都在摸魚,本地知识库本身不是問題,先抓出這25位的請求量有多少? 可以等待的時間有多長? 配合搭配的Agent框架?
      如果使用的頻率不高,你乾脆買GB10 *2 ,或是四張 R9700 / R9600D至少可以讓4~8個同事併發使用
      自家网页的ChatBot 你這部分的的流量出口跟入口也沒有計算....

      建議你先把服務架在 runPod 上試試看吧,設備很貴的

      K 离线
      K 离线
      KAKAHermes
      编写于 最后由 KAKAHermes 编辑
      #6

      @CS6 多些老特小特和CS6大神回覆👏

      早期预算是15万左右,直接用现有的HPE ProLiant DL380 Gen11 (会后续添加记忆体去128或256)配合RTX Pro 6000 即方案A 来跑上述需求。 而且还保留的升级的可能性,未来预算够,还可以添加多1-2张RTX Pro 6000。但现在价格飙去了20万,所以才考虑其他可行方案。

      GB10 x 2 也有考虑过,让HPE ProLiant DL380 Gen11作为流量入口与负载均衡器利用 Intel Xeon 的吞吐能力,处理每天 1000 次的 Chatbot 网页并发请求、运行 Docker 容器、管理反向代理(Nginx / Traefik)、以及处理较轻量的 OCR 任务。两台GB10 专心做 GPU 矩阵运算,而且还可以做到推理分流(内部知识库应用跟外部Chatbot及OCR分开), 但架构复杂度上升:从单机部署变成了多机分散式(DL380 + 2x GB10),内网需要配置好良好的 API 路由,维护成本大大提升。加上个人始终觉得GB10就是玩具。。。

      所以结论是先试试runPod 或租用云GPU,计算所需要的资源才决定购买哪些硬件。

      Tony WangT 1 条回复 最后回复
      0
      • CS6C 离线
        CS6C 离线
        CS6
        技术大牛 劳动模范
        编写于 最后由 编辑
        #7

        15万.... PRO6000 差不多要 60萬台幣了喔....
        建議你還是考慮一下 unPod 或租用云GPU , 然後仔細計算你的 DAU/WAU/MAU + TTFT
        你這個價格感覺只能 HPE ProLiant DL380 Gen11 up to RAM 256 + R9700 *2~4

        1 条回复 最后回复
        0
        • K KAKAHermes

          @CS6 多些老特小特和CS6大神回覆👏

          早期预算是15万左右,直接用现有的HPE ProLiant DL380 Gen11 (会后续添加记忆体去128或256)配合RTX Pro 6000 即方案A 来跑上述需求。 而且还保留的升级的可能性,未来预算够,还可以添加多1-2张RTX Pro 6000。但现在价格飙去了20万,所以才考虑其他可行方案。

          GB10 x 2 也有考虑过,让HPE ProLiant DL380 Gen11作为流量入口与负载均衡器利用 Intel Xeon 的吞吐能力,处理每天 1000 次的 Chatbot 网页并发请求、运行 Docker 容器、管理反向代理(Nginx / Traefik)、以及处理较轻量的 OCR 任务。两台GB10 专心做 GPU 矩阵运算,而且还可以做到推理分流(内部知识库应用跟外部Chatbot及OCR分开), 但架构复杂度上升:从单机部署变成了多机分散式(DL380 + 2x GB10),内网需要配置好良好的 API 路由,维护成本大大提升。加上个人始终觉得GB10就是玩具。。。

          所以结论是先试试runPod 或租用云GPU,计算所需要的资源才决定购买哪些硬件。

          Tony WangT 离线
          Tony WangT 离线
          Tony Wang
          超级版主
          编写于 最后由 编辑
          #8

          @KAKAHermes

          20-25人同时使用, 我理解是一共这么多人上班要用.

          你得先评估并发最大是多少, 要跑的模型大概是什么. 如果你并发数量大, 而且模型比较重的话, 我觉得方案A都不够用.

          1 条回复 最后回复
          0
          • imbiplaza ASUSI 离线
            imbiplaza ASUSI 离线
            imbiplaza ASUS
            至尊王者
            编写于 最后由 编辑
            #9

            最近看到的

            b56f2ab0-38b5-4c10-96ce-62a6dcec33c7-image.jpeg

            https://lcz.me/project/dcs

            1 条回复 最后回复
            0
            • CS6C 离线
              CS6C 离线
              CS6
              技术大牛 劳动模范
              编写于 最后由 编辑
              #10

              PRO6000 你就算切成3張vgpu…也就三個併發,算上VLLM/SGlang 佇列併發
              我覺得不行,我辦公室4張 pro6000 都不夠三個人使用了

              K 1 条回复 最后回复
              0
              • CS6C CS6

                PRO6000 你就算切成3張vgpu…也就三個併發,算上VLLM/SGlang 佇列併發
                我覺得不行,我辦公室4張 pro6000 都不夠三個人使用了

                K 离线
                K 离线
                KAKAHermes
                编写于 最后由 编辑
                #11

                @CS6 請教下 你們公司的使用場景大約是什麼?

                因爲我這邊外部場景主要是:

                • ChatBot 幫會員找找或推薦公司網站內容 (最多一天最多可能有100個會員每人會問5-10條問題)
                • 調用OCR的API。(判斷會員提交的PDF格式轉換成文字內容等,每天可能10-20單左右)

                內部場景就比較簡單,知識庫檢索(可能對接SQL Server)或者AI Agent調用。(同時使用人數可能15-20 人左右)

                1 条回复 最后回复
                0
                • CS6C 离线
                  CS6C 离线
                  CS6
                  技术大牛 劳动模范
                  编写于 最后由 编辑
                  #12

                  @kakahermes 如果沒有資安/資料政策,可慮一下接api 比較省錢吧?
                  OCR 我是接 Google 的請求數一週200內,一個月不到80臺幣吧?
                  Chatbot 也是API 讓他去讀你們Q&A md/json 就好了吧⋯⋯ 不要浪費錢啊,錢難賺
                  我們公司搞AI 研究跟產品的,都是重度使用,大家會自己配置模型

                  K 1 条回复 最后回复
                  0
                  • CS6C CS6

                    @kakahermes 如果沒有資安/資料政策,可慮一下接api 比較省錢吧?
                    OCR 我是接 Google 的請求數一週200內,一個月不到80臺幣吧?
                    Chatbot 也是API 讓他去讀你們Q&A md/json 就好了吧⋯⋯ 不要浪費錢啊,錢難賺
                    我們公司搞AI 研究跟產品的,都是重度使用,大家會自己配置模型

                    K 离线
                    K 离线
                    KAKAHermes
                    编写于 最后由 编辑
                    #13

                    @CS6 多些提醒,Chatbot 目前我們使用的是Chatbase 的雲端服務插件。 OCR也是有對接外部Azure 的LLM API Token。 主要是內部應用,涉及敏感資料知識庫及日常流程自動化(AI Agent),計劃是先內部部署本地模型,有額外算力才取代外部應用。

                    1 条回复 最后回复
                    0
                    • CS6C 离线
                      CS6C 离线
                      CS6
                      技术大牛 劳动模范
                      编写于 最后由 编辑
                      #14

                      那就插兩張R9700 上去吧⋯⋯
                      跑兩個 qwen 3.8 27b
                      主要是要考慮電源跟預算,你的選擇真的不多

                      K 1 条回复 最后回复
                      0
                      • CS6C CS6

                        那就插兩張R9700 上去吧⋯⋯
                        跑兩個 qwen 3.8 27b
                        主要是要考慮電源跟預算,你的選擇真的不多

                        K 离线
                        K 离线
                        KAKAHermes
                        编写于 最后由 KAKAHermes 编辑
                        #15

                        @CS6 感謝大神建議!但HPE ProLiant DL380 Gen11 伺服器未必支持Workstation版本的R9700, 這個才是最麻煩的地方,要麼就自組一台工作站。。。

                        CS6C 1 条回复 最后回复
                        0
                        • K KAKAHermes

                          @CS6 感謝大神建議!但HPE ProLiant DL380 Gen11 伺服器未必支持Workstation版本的R9700, 這個才是最麻煩的地方,要麼就自組一台工作站。。。

                          CS6C 离线
                          CS6C 离线
                          CS6
                          技术大牛 劳动模范
                          编写于 最后由 编辑
                          #16

                          @KAKAHermes 為啥不支援?????
                          你們家IDC IT 可以搞定吧,雙槽鼓風扇12pin 電源300w

                          K 1 条回复 最后回复
                          0
                          • CS6C CS6

                            @KAKAHermes 為啥不支援?????
                            你們家IDC IT 可以搞定吧,雙槽鼓風扇12pin 電源300w

                            K 离线
                            K 离线
                            KAKAHermes
                            编写于 最后由 KAKAHermes 编辑
                            #17

                            @CS6 HPE伺服器機箱空間及電源相信是足夠,不過需要額外購買GPU Power Cable Kit。其實如果可以安裝AI PRO R9700 工作站版本,那RTX PRO 5000 48/72GB 也應該可以安裝。

                            原本計劃的RTX PRO 6000 伺服器版本是被動散熱,還需要額外的High Performance Fan Module, GPU Riser & Air Baffle Kit等。

                            CS6C 1 条回复 最后回复
                            0
                            • K KAKAHermes

                              @CS6 HPE伺服器機箱空間及電源相信是足夠,不過需要額外購買GPU Power Cable Kit。其實如果可以安裝AI PRO R9700 工作站版本,那RTX PRO 5000 48/72GB 也應該可以安裝。

                              原本計劃的RTX PRO 6000 伺服器版本是被動散熱,還需要額外的High Performance Fan Module, GPU Riser & Air Baffle Kit等。

                              CS6C 离线
                              CS6C 离线
                              CS6
                              技术大牛 劳动模范
                              编写于 最后由 编辑
                              #18

                              @KAKAHermes 你的計劃沒錯,不推你N卡單純是你的不太合成本,HPE伺服器機箱空間應該是 4~8 卡看型號2U~4U分佈在四周,GPU Power Cable Kit 規格 A/M/I 新卡基本上一樣是12Pin 300~600w ,RTX PRO 6000 RTX PRO 5000 48/72GB 不推薦單純是 vgpu 分割後的CP值對你來說不高,15萬 RMB/HKD 都還是很極限的預算,可能滿足不了併發 session 需求,除非你都跑同一個模型給不同用途。

                              畢竟多一張卡就可以多開一個 session 速度還穩定(慢但可用), N卡 優勢是你可以跑更大的 context 還有速度超快(但多併發會拖慢),
                              所以才說你最好先做一下實驗確定需求

                              這部分我過幾週有空可以測試一下 PRO6000 跑 qwen 3.8 VLLM 到能併發多少用戶,
                              然後模擬 PRO6000 VS A100 / R9700 / 3090 對外 coding / RAG 服務的表現
                              真的要買 PRO6000 的話就要快,價格每天都在漲.....但有機會的話還是雙卡 PRO6000 起步會比較好

                              K 1 条回复 最后回复
                              1
                              • K KAKAHermes

                                场景: 一家小公司,主要是来跑本地知识库,提供20-25人同时使用,另外还有自家网页的ChatBot 及一些网站上的OCR API调用(流量200-500左右)

                                • 硬件规划方案 A: 已经有台全新HPE ProLiant DL380 Gen11 闲置的伺服器,64GB ECC DDR5 记忆体,10TB SSD硬盘。 打算采购RTX PRO 6000 96GB 伺服器版本。

                                • 硬件规划方案 B: 自组一套Workstation及RTX PRO 5000 72GB伺服器版本。但不能利用现有的伺服器硬件,分配显存也需要用其他手段来实现。

                                • 硬件规划方案 C:APPLE MAC STUDIO M5 ULTRA 256GB 统一内存。也不能利用现有的伺服器硬件,而且苹果生态跑AI也比较麻烦些。

                                原本考虑方案A ,因为RTX PRO 6000 有MIG技术,可以分配显存去不同应用VM,例如CHATBOX,OCR,本地知识库。但因为RTX PRO 6000价格一直上飙,由之前的13万港币,到现在16-20万港币了。
                                而方案B需要另外配一台工作站,成本也要13-14万。
                                因为苹果发布M5 Ultra 处理器的Mac Studio, 请问各位大神, 如果不考虑Confy UI等应用场景,是否方案C,10万左右的Mac Studio比较适合我们的应用场景?

                                Z 离线
                                Z 离线
                                zorg
                                德高望重
                                编写于 最后由 编辑
                                #19

                                @KAKAHermes 我投mac studio,我也是从3090、5090后来转向mac 平台,macos反而最简单,少很多对硬件兼容性、散热、稳定性、可维护的时间和人力成本。我在跑omlx我觉得很友好,稳定。年初从m5 max 128开机部署好omlx以后它就一直在角落跑,甚至不是高密度长时间运行都可以直接用显示器的typec线充电,噪音可忽略,耗能少,环境友好。虽然不知道将来是否需要继续扩充多台,但是目前看4台m3 ultra也能达到内存池扩展的效果,就像老特说的,32G5090跑comfy ui就不算瓶颈了,这样mac做llm server endpoint,mac mini、macbook pro跑agent,5090跑comfy ui,系统风险也有隔离,看起来也是一个完整的场景了。

                                許托比許 张光璞张 3 条回复 最后回复
                                1
                                • Z zorg

                                  @KAKAHermes 我投mac studio,我也是从3090、5090后来转向mac 平台,macos反而最简单,少很多对硬件兼容性、散热、稳定性、可维护的时间和人力成本。我在跑omlx我觉得很友好,稳定。年初从m5 max 128开机部署好omlx以后它就一直在角落跑,甚至不是高密度长时间运行都可以直接用显示器的typec线充电,噪音可忽略,耗能少,环境友好。虽然不知道将来是否需要继续扩充多台,但是目前看4台m3 ultra也能达到内存池扩展的效果,就像老特说的,32G5090跑comfy ui就不算瓶颈了,这样mac做llm server endpoint,mac mini、macbook pro跑agent,5090跑comfy ui,系统风险也有隔离,看起来也是一个完整的场景了。

                                  許托比許 离线
                                  許托比許 离线
                                  許托比
                                  编写于 最后由 编辑
                                  #20

                                  @zorg 说:

                                  mac studio

                                  mac studio的問題在於併發,你說的優點前提都是個人使用,小公司的場景很快就會面臨搶資源的問題

                                  1 条回复 最后回复
                                  0
                                  • CS6C CS6

                                    @KAKAHermes 你的計劃沒錯,不推你N卡單純是你的不太合成本,HPE伺服器機箱空間應該是 4~8 卡看型號2U~4U分佈在四周,GPU Power Cable Kit 規格 A/M/I 新卡基本上一樣是12Pin 300~600w ,RTX PRO 6000 RTX PRO 5000 48/72GB 不推薦單純是 vgpu 分割後的CP值對你來說不高,15萬 RMB/HKD 都還是很極限的預算,可能滿足不了併發 session 需求,除非你都跑同一個模型給不同用途。

                                    畢竟多一張卡就可以多開一個 session 速度還穩定(慢但可用), N卡 優勢是你可以跑更大的 context 還有速度超快(但多併發會拖慢),
                                    所以才說你最好先做一下實驗確定需求

                                    這部分我過幾週有空可以測試一下 PRO6000 跑 qwen 3.8 VLLM 到能併發多少用戶,
                                    然後模擬 PRO6000 VS A100 / R9700 / 3090 對外 coding / RAG 服務的表現
                                    真的要買 PRO6000 的話就要快,價格每天都在漲.....但有機會的話還是雙卡 PRO6000 起步會比較好

                                    K 离线
                                    K 离线
                                    KAKAHermes
                                    编写于 最后由 编辑
                                    #21

                                    @CS6 悲劇,早上跟供應商確認,RTX PRO 6000 已經漲到20萬港幣以上了,反而有另一個選擇,NVIDIA RTX PRO 6000D 84GB 閹割版本這張的價格還是沒有變動,但仍然是10萬左右。如果10萬左右價格有80% PRO 6000 的效能,是否對我們來說是個比較好的選擇? 未來可以加多張來跑併發。

                                    CS6C Rex FanR 2 条回复 最后回复
                                    0
                                    • K KAKAHermes

                                      @CS6 悲劇,早上跟供應商確認,RTX PRO 6000 已經漲到20萬港幣以上了,反而有另一個選擇,NVIDIA RTX PRO 6000D 84GB 閹割版本這張的價格還是沒有變動,但仍然是10萬左右。如果10萬左右價格有80% PRO 6000 的效能,是否對我們來說是個比較好的選擇? 未來可以加多張來跑併發。

                                      CS6C 离线
                                      CS6C 离线
                                      CS6
                                      技术大牛 劳动模范
                                      编写于 最后由 编辑
                                      #22

                                      @KAKAHermes 這個價格,我勸你就別買了,除非你老闆真的人好錢多....
                                      你先去確認一下到底電源跟空間能差多少張卡?
                                      單純跑推理的話 B70 R9700 八卡就算一張以300瓦來算上電費還是省很多錢...
                                      甚至你可以買到四台 GB10 ...

                                      K 1 条回复 最后回复
                                      0
                                      • kop wangK 离线
                                        kop wangK 离线
                                        kop wang
                                        超级版主
                                        编写于 最后由 编辑
                                        #23

                                        严格来讲,20人使用,假定每人只有半个qwen3.8-27B的上下文窗口,也就是128K,算下来就是2048K。

                                        2048K token的8bit kv cache,就需要64GB显存了,再加上模型本身,以及其他开销,单张RTX PRO 6000是不够的。

                                        而且你还不只是支持内部使用,还要对外提供chatBox。总体上来看你的预算和方案都是不太能支持的。

                                        虚心交流,一起进步

                                        1 条回复 最后回复
                                        0
                                        • K KAKAHermes

                                          @CS6 悲劇,早上跟供應商確認,RTX PRO 6000 已經漲到20萬港幣以上了,反而有另一個選擇,NVIDIA RTX PRO 6000D 84GB 閹割版本這張的價格還是沒有變動,但仍然是10萬左右。如果10萬左右價格有80% PRO 6000 的效能,是否對我們來說是個比較好的選擇? 未來可以加多張來跑併發。

                                          Rex FanR 离线
                                          Rex FanR 离线
                                          Rex Fan
                                          编写于 最后由 编辑
                                          #24

                                          @KAKAHermes 别相信这个6000D有 80% PRO 6000 的效能。实测就是一半多点(不然凭什么价格没涨起来)

                                          1 条回复 最后回复
                                          0

                                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                          有了你的建议,这篇帖子会更精彩哦 💗

                                          注册 登录
                                          回复
                                          • 在新帖中回复
                                          登录后回复
                                          • 从旧到新
                                          • 从新到旧
                                          • 最多赞同


                                          • 登录

                                          • 登录或注册以进行搜索。
                                          • 第一个帖子
                                            最后一个帖子
                                          0
                                          • 版块
                                          • 最新
                                          • 标签
                                          • 热门
                                          • 用户
                                          • 群组