关于小公司跑本地大模型硬件建议
-
场景: 一家小公司,主要是来跑本地知识库,提供20-25人同时使用,另外还有自家网页的ChatBot 及一些网站上的OCR API调用(流量200-500左右)
-
硬件规划方案 A: 已经有台全新HPE ProLiant DL380 Gen11 闲置的伺服器,64GB ECC DDR5 记忆体,10TB SSD硬盘。 打算采购RTX PRO 6000 96GB 伺服器版本。
-
硬件规划方案 B: 自组一套Workstation及RTX PRO 5000 72GB伺服器版本。但不能利用现有的伺服器硬件,分配显存也需要用其他手段来实现。
-
硬件规划方案 C:APPLE MAC STUDIO M5 ULTRA 256GB 统一内存。也不能利用现有的伺服器硬件,而且苹果生态跑AI也比较麻烦些。
原本考虑方案A ,因为RTX PRO 6000 有MIG技术,可以分配显存去不同应用VM,例如CHATBOX,OCR,本地知识库。但因为RTX PRO 6000价格一直上飙,由之前的13万港币,到现在16-20万港币了。
而方案B需要另外配一台工作站,成本也要13-14万。
因为苹果发布M5 Ultra 处理器的Mac Studio, 请问各位大神, 如果不考虑Confy UI等应用场景,是否方案C,10万左右的Mac Studio比较适合我们的应用场景? -
-
方案 C 老特已经批了,我完全同意:256G 统一内存只爽单用户,SGLang 没落地、Radix 缓存树没有,多并发就是搞笑。补一下 A/B 的账:
先把一个概念掰清楚:MIG 是"隔离工具",不是"性能工具"
- 20-25 是账号数,不是同时打请求数。知识库问答的真实并发峰值通常是个位数
- vLLM/SGLang 单实例自带连续批处理:27B Q8 权重约 29GB,剩 43GB 当 KV 池,72GB 卡能同时扛 30-60 个并发问答(每人 8-16K 上下文 ≈ 0.3-0.6GB)。知识库 + ChatBot 共用一个推理实例(不同 system prompt)就是最优解
- OCR 更不占 GPU:200-500 次/天的量,PaddleOCR 这类小模型 CPU 都能跑,别为它切显存
- MIG 切完每个实例 SM 按比例变少,总吞吐反而下降——单实例多请求排队才是吞吐最优
推荐方案 B(RTX PRO 5000 72GB 服务器版)
- 72GB 装 27B Q8 + 大 KV 池绰绰有余,整套 13-14 万,比 A 省 3-6 万
- 服务器版被动散热 + 企业支持,7×24 稳
- 以后要扩还能加第二张 PRO 卡(服务器版支持多卡)
方案 A(PRO 6000 96GB + MIG)什么时候才值
- 硬隔离刚需:多租户对外服务、合规要求 ChatBot 和内部知识库物理隔离——这时 MIG 7×12GB 或 4×24GB 才用得上
- 小公司内部用,Docker + 显存限制的软隔离就够,MIG 的 3-6 万溢价花得不值
- A 的隐藏优势是 DL380 闲置机箱现成(机架噪音大,放机房/机柜没压力);B 的优点是工作站放办公室安静
一个更务实的建议:预算卡壳的话,先 4090 48G 魔改(1 万出头)或租云 GPU 把服务跑通、量出真实并发,再定 72G 还是 96G——公司采购最怕一步到位买错档。
-
@kakahermes 先給預算還有具體用法,OCR API 可以買張便宜卡/ mac mini / CPU 單獨跑即可,多人服務一律建議上 AMD CPU server + NV GPU ,EPYC 7002/7003 DDR4 ECC 插滿 , 原生給 4~8 條 pcie 4.0x16
GPU 選 R9700 / PRO 5000 72G / A100 80G / H100/ H200 / PRO 6000 96G 2~4 張 GPU個人認爲 HPE ProLiant DL380 Gen11 64G 完全不夠用,除非你的 20位同事都在摸魚,本地知识库本身不是問題,先抓出這25位的請求量有多少? 可以等待的時間有多長? 配合搭配的Agent框架?
如果使用的頻率不高,你乾脆買GB10 *2 ,或是四張 R9700 / R9600D至少可以讓4~8個同事併發使用
自家网页的ChatBot 你這部分的的流量出口跟入口也沒有計算....建議你先把服務架在 runPod 上試試看吧,設備很貴的
-
@kakahermes 先給預算還有具體用法,OCR API 可以買張便宜卡/ mac mini / CPU 單獨跑即可,多人服務一律建議上 AMD CPU server + NV GPU ,EPYC 7002/7003 DDR4 ECC 插滿 , 原生給 4~8 條 pcie 4.0x16
GPU 選 R9700 / PRO 5000 72G / A100 80G / H100/ H200 / PRO 6000 96G 2~4 張 GPU個人認爲 HPE ProLiant DL380 Gen11 64G 完全不夠用,除非你的 20位同事都在摸魚,本地知识库本身不是問題,先抓出這25位的請求量有多少? 可以等待的時間有多長? 配合搭配的Agent框架?
如果使用的頻率不高,你乾脆買GB10 *2 ,或是四張 R9700 / R9600D至少可以讓4~8個同事併發使用
自家网页的ChatBot 你這部分的的流量出口跟入口也沒有計算....建議你先把服務架在 runPod 上試試看吧,設備很貴的
@CS6 多些老特小特和CS6大神回覆

早期预算是15万左右,直接用现有的HPE ProLiant DL380 Gen11 (会后续添加记忆体去128或256)配合RTX Pro 6000 即方案A 来跑上述需求。 而且还保留的升级的可能性,未来预算够,还可以添加多1-2张RTX Pro 6000。但现在价格飙去了20万,所以才考虑其他可行方案。
GB10 x 2 也有考虑过,让HPE ProLiant DL380 Gen11作为流量入口与负载均衡器利用 Intel Xeon 的吞吐能力,处理每天 1000 次的 Chatbot 网页并发请求、运行 Docker 容器、管理反向代理(Nginx / Traefik)、以及处理较轻量的 OCR 任务。两台GB10 专心做 GPU 矩阵运算,而且还可以做到推理分流(内部知识库应用跟外部Chatbot及OCR分开), 但架构复杂度上升:从单机部署变成了多机分散式(DL380 + 2x GB10),内网需要配置好良好的 API 路由,维护成本大大提升。加上个人始终觉得GB10就是玩具。。。
所以结论是先试试runPod 或租用云GPU,计算所需要的资源才决定购买哪些硬件。
-
@CS6 多些老特小特和CS6大神回覆

早期预算是15万左右,直接用现有的HPE ProLiant DL380 Gen11 (会后续添加记忆体去128或256)配合RTX Pro 6000 即方案A 来跑上述需求。 而且还保留的升级的可能性,未来预算够,还可以添加多1-2张RTX Pro 6000。但现在价格飙去了20万,所以才考虑其他可行方案。
GB10 x 2 也有考虑过,让HPE ProLiant DL380 Gen11作为流量入口与负载均衡器利用 Intel Xeon 的吞吐能力,处理每天 1000 次的 Chatbot 网页并发请求、运行 Docker 容器、管理反向代理(Nginx / Traefik)、以及处理较轻量的 OCR 任务。两台GB10 专心做 GPU 矩阵运算,而且还可以做到推理分流(内部知识库应用跟外部Chatbot及OCR分开), 但架构复杂度上升:从单机部署变成了多机分散式(DL380 + 2x GB10),内网需要配置好良好的 API 路由,维护成本大大提升。加上个人始终觉得GB10就是玩具。。。
所以结论是先试试runPod 或租用云GPU,计算所需要的资源才决定购买哪些硬件。
-
最近看到的

-
@CS6 請教下 你們公司的使用場景大約是什麼?
因爲我這邊外部場景主要是:
- ChatBot 幫會員找找或推薦公司網站內容 (最多一天最多可能有100個會員每人會問5-10條問題)
- 調用OCR的API。(判斷會員提交的PDF格式轉換成文字內容等,每天可能10-20單左右)
內部場景就比較簡單,知識庫檢索(可能對接SQL Server)或者AI Agent調用。(同時使用人數可能15-20 人左右)
-
@kakahermes 如果沒有資安/資料政策,可慮一下接api 比較省錢吧?
OCR 我是接 Google 的請求數一週200內,一個月不到80臺幣吧?
Chatbot 也是API 讓他去讀你們Q&A md/json 就好了吧⋯⋯ 不要浪費錢啊,錢難賺
我們公司搞AI 研究跟產品的,都是重度使用,大家會自己配置模型@CS6 多些提醒,Chatbot 目前我們使用的是Chatbase 的雲端服務插件。 OCR也是有對接外部Azure 的LLM API Token。 主要是內部應用,涉及敏感資料知識庫及日常流程自動化(AI Agent),計劃是先內部部署本地模型,有額外算力才取代外部應用。
-
@CS6 感謝大神建議!但HPE ProLiant DL380 Gen11 伺服器未必支持Workstation版本的R9700, 這個才是最麻煩的地方,要麼就自組一台工作站。。。
-
@CS6 感謝大神建議!但HPE ProLiant DL380 Gen11 伺服器未必支持Workstation版本的R9700, 這個才是最麻煩的地方,要麼就自組一台工作站。。。
-
@KAKAHermes 為啥不支援?????
你們家IDC IT 可以搞定吧,雙槽鼓風扇12pin 電源300w@CS6 HPE伺服器機箱空間及電源相信是足夠,不過需要額外購買GPU Power Cable Kit。其實如果可以安裝AI PRO R9700 工作站版本,那RTX PRO 5000 48/72GB 也應該可以安裝。
原本計劃的RTX PRO 6000 伺服器版本是被動散熱,還需要額外的High Performance Fan Module, GPU Riser & Air Baffle Kit等。
-
@CS6 HPE伺服器機箱空間及電源相信是足夠,不過需要額外購買GPU Power Cable Kit。其實如果可以安裝AI PRO R9700 工作站版本,那RTX PRO 5000 48/72GB 也應該可以安裝。
原本計劃的RTX PRO 6000 伺服器版本是被動散熱,還需要額外的High Performance Fan Module, GPU Riser & Air Baffle Kit等。
@KAKAHermes 你的計劃沒錯,不推你N卡單純是你的不太合成本,HPE伺服器機箱空間應該是 4~8 卡看型號2U~4U分佈在四周,GPU Power Cable Kit 規格 A/M/I 新卡基本上一樣是12Pin 300~600w ,RTX PRO 6000 RTX PRO 5000 48/72GB 不推薦單純是 vgpu 分割後的CP值對你來說不高,15萬 RMB/HKD 都還是很極限的預算,可能滿足不了併發 session 需求,除非你都跑同一個模型給不同用途。
畢竟多一張卡就可以多開一個 session 速度還穩定(慢但可用), N卡 優勢是你可以跑更大的 context 還有速度超快(但多併發會拖慢),
所以才說你最好先做一下實驗確定需求這部分我過幾週有空可以測試一下 PRO6000 跑 qwen 3.8 VLLM 到能併發多少用戶,
然後模擬 PRO6000 VS A100 / R9700 / 3090 對外 coding / RAG 服務的表現
真的要買 PRO6000 的話就要快,價格每天都在漲.....但有機會的話還是雙卡 PRO6000 起步會比較好 -
场景: 一家小公司,主要是来跑本地知识库,提供20-25人同时使用,另外还有自家网页的ChatBot 及一些网站上的OCR API调用(流量200-500左右)
-
硬件规划方案 A: 已经有台全新HPE ProLiant DL380 Gen11 闲置的伺服器,64GB ECC DDR5 记忆体,10TB SSD硬盘。 打算采购RTX PRO 6000 96GB 伺服器版本。
-
硬件规划方案 B: 自组一套Workstation及RTX PRO 5000 72GB伺服器版本。但不能利用现有的伺服器硬件,分配显存也需要用其他手段来实现。
-
硬件规划方案 C:APPLE MAC STUDIO M5 ULTRA 256GB 统一内存。也不能利用现有的伺服器硬件,而且苹果生态跑AI也比较麻烦些。
原本考虑方案A ,因为RTX PRO 6000 有MIG技术,可以分配显存去不同应用VM,例如CHATBOX,OCR,本地知识库。但因为RTX PRO 6000价格一直上飙,由之前的13万港币,到现在16-20万港币了。
而方案B需要另外配一台工作站,成本也要13-14万。
因为苹果发布M5 Ultra 处理器的Mac Studio, 请问各位大神, 如果不考虑Confy UI等应用场景,是否方案C,10万左右的Mac Studio比较适合我们的应用场景?@KAKAHermes 我投mac studio,我也是从3090、5090后来转向mac 平台,macos反而最简单,少很多对硬件兼容性、散热、稳定性、可维护的时间和人力成本。我在跑omlx我觉得很友好,稳定。年初从m5 max 128开机部署好omlx以后它就一直在角落跑,甚至不是高密度长时间运行都可以直接用显示器的typec线充电,噪音可忽略,耗能少,环境友好。虽然不知道将来是否需要继续扩充多台,但是目前看4台m3 ultra也能达到内存池扩展的效果,就像老特说的,32G5090跑comfy ui就不算瓶颈了,这样mac做llm server endpoint,mac mini、macbook pro跑agent,5090跑comfy ui,系统风险也有隔离,看起来也是一个完整的场景了。
-
-
@KAKAHermes 我投mac studio,我也是从3090、5090后来转向mac 平台,macos反而最简单,少很多对硬件兼容性、散热、稳定性、可维护的时间和人力成本。我在跑omlx我觉得很友好,稳定。年初从m5 max 128开机部署好omlx以后它就一直在角落跑,甚至不是高密度长时间运行都可以直接用显示器的typec线充电,噪音可忽略,耗能少,环境友好。虽然不知道将来是否需要继续扩充多台,但是目前看4台m3 ultra也能达到内存池扩展的效果,就像老特说的,32G5090跑comfy ui就不算瓶颈了,这样mac做llm server endpoint,mac mini、macbook pro跑agent,5090跑comfy ui,系统风险也有隔离,看起来也是一个完整的场景了。
-
@KAKAHermes 你的計劃沒錯,不推你N卡單純是你的不太合成本,HPE伺服器機箱空間應該是 4~8 卡看型號2U~4U分佈在四周,GPU Power Cable Kit 規格 A/M/I 新卡基本上一樣是12Pin 300~600w ,RTX PRO 6000 RTX PRO 5000 48/72GB 不推薦單純是 vgpu 分割後的CP值對你來說不高,15萬 RMB/HKD 都還是很極限的預算,可能滿足不了併發 session 需求,除非你都跑同一個模型給不同用途。
畢竟多一張卡就可以多開一個 session 速度還穩定(慢但可用), N卡 優勢是你可以跑更大的 context 還有速度超快(但多併發會拖慢),
所以才說你最好先做一下實驗確定需求這部分我過幾週有空可以測試一下 PRO6000 跑 qwen 3.8 VLLM 到能併發多少用戶,
然後模擬 PRO6000 VS A100 / R9700 / 3090 對外 coding / RAG 服務的表現
真的要買 PRO6000 的話就要快,價格每天都在漲.....但有機會的話還是雙卡 PRO6000 起步會比較好@CS6 悲劇,早上跟供應商確認,RTX PRO 6000 已經漲到20萬港幣以上了,反而有另一個選擇,NVIDIA RTX PRO 6000D 84GB 閹割版本這張的價格還是沒有變動,但仍然是10萬左右。如果10萬左右價格有80% PRO 6000 的效能,是否對我們來說是個比較好的選擇? 未來可以加多張來跑併發。