关于小公司跑本地大模型硬件建议
-
最近看到的

-
@CS6 請教下 你們公司的使用場景大約是什麼?
因爲我這邊外部場景主要是:
- ChatBot 幫會員找找或推薦公司網站內容 (最多一天最多可能有100個會員每人會問5-10條問題)
- 調用OCR的API。(判斷會員提交的PDF格式轉換成文字內容等,每天可能10-20單左右)
內部場景就比較簡單,知識庫檢索(可能對接SQL Server)或者AI Agent調用。(同時使用人數可能15-20 人左右)
-
@kakahermes 如果沒有資安/資料政策,可慮一下接api 比較省錢吧?
OCR 我是接 Google 的請求數一週200內,一個月不到80臺幣吧?
Chatbot 也是API 讓他去讀你們Q&A md/json 就好了吧⋯⋯ 不要浪費錢啊,錢難賺
我們公司搞AI 研究跟產品的,都是重度使用,大家會自己配置模型@CS6 多些提醒,Chatbot 目前我們使用的是Chatbase 的雲端服務插件。 OCR也是有對接外部Azure 的LLM API Token。 主要是內部應用,涉及敏感資料知識庫及日常流程自動化(AI Agent),計劃是先內部部署本地模型,有額外算力才取代外部應用。
-
@CS6 感謝大神建議!但HPE ProLiant DL380 Gen11 伺服器未必支持Workstation版本的R9700, 這個才是最麻煩的地方,要麼就自組一台工作站。。。
-
@CS6 感謝大神建議!但HPE ProLiant DL380 Gen11 伺服器未必支持Workstation版本的R9700, 這個才是最麻煩的地方,要麼就自組一台工作站。。。
-
@KAKAHermes 為啥不支援?????
你們家IDC IT 可以搞定吧,雙槽鼓風扇12pin 電源300w@CS6 HPE伺服器機箱空間及電源相信是足夠,不過需要額外購買GPU Power Cable Kit。其實如果可以安裝AI PRO R9700 工作站版本,那RTX PRO 5000 48/72GB 也應該可以安裝。
原本計劃的RTX PRO 6000 伺服器版本是被動散熱,還需要額外的High Performance Fan Module, GPU Riser & Air Baffle Kit等。
-
@CS6 HPE伺服器機箱空間及電源相信是足夠,不過需要額外購買GPU Power Cable Kit。其實如果可以安裝AI PRO R9700 工作站版本,那RTX PRO 5000 48/72GB 也應該可以安裝。
原本計劃的RTX PRO 6000 伺服器版本是被動散熱,還需要額外的High Performance Fan Module, GPU Riser & Air Baffle Kit等。
@KAKAHermes 你的計劃沒錯,不推你N卡單純是你的不太合成本,HPE伺服器機箱空間應該是 4~8 卡看型號2U~4U分佈在四周,GPU Power Cable Kit 規格 A/M/I 新卡基本上一樣是12Pin 300~600w ,RTX PRO 6000 RTX PRO 5000 48/72GB 不推薦單純是 vgpu 分割後的CP值對你來說不高,15萬 RMB/HKD 都還是很極限的預算,可能滿足不了併發 session 需求,除非你都跑同一個模型給不同用途。
畢竟多一張卡就可以多開一個 session 速度還穩定(慢但可用), N卡 優勢是你可以跑更大的 context 還有速度超快(但多併發會拖慢),
所以才說你最好先做一下實驗確定需求這部分我過幾週有空可以測試一下 PRO6000 跑 qwen 3.8 VLLM 到能併發多少用戶,
然後模擬 PRO6000 VS A100 / R9700 / 3090 對外 coding / RAG 服務的表現
真的要買 PRO6000 的話就要快,價格每天都在漲.....但有機會的話還是雙卡 PRO6000 起步會比較好 -
场景: 一家小公司,主要是来跑本地知识库,提供20-25人同时使用,另外还有自家网页的ChatBot 及一些网站上的OCR API调用(流量200-500左右)
-
硬件规划方案 A: 已经有台全新HPE ProLiant DL380 Gen11 闲置的伺服器,64GB ECC DDR5 记忆体,10TB SSD硬盘。 打算采购RTX PRO 6000 96GB 伺服器版本。
-
硬件规划方案 B: 自组一套Workstation及RTX PRO 5000 72GB伺服器版本。但不能利用现有的伺服器硬件,分配显存也需要用其他手段来实现。
-
硬件规划方案 C:APPLE MAC STUDIO M5 ULTRA 256GB 统一内存。也不能利用现有的伺服器硬件,而且苹果生态跑AI也比较麻烦些。
原本考虑方案A ,因为RTX PRO 6000 有MIG技术,可以分配显存去不同应用VM,例如CHATBOX,OCR,本地知识库。但因为RTX PRO 6000价格一直上飙,由之前的13万港币,到现在16-20万港币了。
而方案B需要另外配一台工作站,成本也要13-14万。
因为苹果发布M5 Ultra 处理器的Mac Studio, 请问各位大神, 如果不考虑Confy UI等应用场景,是否方案C,10万左右的Mac Studio比较适合我们的应用场景?@KAKAHermes 我投mac studio,我也是从3090、5090后来转向mac 平台,macos反而最简单,少很多对硬件兼容性、散热、稳定性、可维护的时间和人力成本。我在跑omlx我觉得很友好,稳定。年初从m5 max 128开机部署好omlx以后它就一直在角落跑,甚至不是高密度长时间运行都可以直接用显示器的typec线充电,噪音可忽略,耗能少,环境友好。虽然不知道将来是否需要继续扩充多台,但是目前看4台m3 ultra也能达到内存池扩展的效果,就像老特说的,32G5090跑comfy ui就不算瓶颈了,这样mac做llm server endpoint,mac mini、macbook pro跑agent,5090跑comfy ui,系统风险也有隔离,看起来也是一个完整的场景了。
-
-
@KAKAHermes 我投mac studio,我也是从3090、5090后来转向mac 平台,macos反而最简单,少很多对硬件兼容性、散热、稳定性、可维护的时间和人力成本。我在跑omlx我觉得很友好,稳定。年初从m5 max 128开机部署好omlx以后它就一直在角落跑,甚至不是高密度长时间运行都可以直接用显示器的typec线充电,噪音可忽略,耗能少,环境友好。虽然不知道将来是否需要继续扩充多台,但是目前看4台m3 ultra也能达到内存池扩展的效果,就像老特说的,32G5090跑comfy ui就不算瓶颈了,这样mac做llm server endpoint,mac mini、macbook pro跑agent,5090跑comfy ui,系统风险也有隔离,看起来也是一个完整的场景了。
-
@KAKAHermes 你的計劃沒錯,不推你N卡單純是你的不太合成本,HPE伺服器機箱空間應該是 4~8 卡看型號2U~4U分佈在四周,GPU Power Cable Kit 規格 A/M/I 新卡基本上一樣是12Pin 300~600w ,RTX PRO 6000 RTX PRO 5000 48/72GB 不推薦單純是 vgpu 分割後的CP值對你來說不高,15萬 RMB/HKD 都還是很極限的預算,可能滿足不了併發 session 需求,除非你都跑同一個模型給不同用途。
畢竟多一張卡就可以多開一個 session 速度還穩定(慢但可用), N卡 優勢是你可以跑更大的 context 還有速度超快(但多併發會拖慢),
所以才說你最好先做一下實驗確定需求這部分我過幾週有空可以測試一下 PRO6000 跑 qwen 3.8 VLLM 到能併發多少用戶,
然後模擬 PRO6000 VS A100 / R9700 / 3090 對外 coding / RAG 服務的表現
真的要買 PRO6000 的話就要快,價格每天都在漲.....但有機會的話還是雙卡 PRO6000 起步會比較好@CS6 悲劇,早上跟供應商確認,RTX PRO 6000 已經漲到20萬港幣以上了,反而有另一個選擇,NVIDIA RTX PRO 6000D 84GB 閹割版本這張的價格還是沒有變動,但仍然是10萬左右。如果10萬左右價格有80% PRO 6000 的效能,是否對我們來說是個比較好的選擇? 未來可以加多張來跑併發。
-
@CS6 悲劇,早上跟供應商確認,RTX PRO 6000 已經漲到20萬港幣以上了,反而有另一個選擇,NVIDIA RTX PRO 6000D 84GB 閹割版本這張的價格還是沒有變動,但仍然是10萬左右。如果10萬左右價格有80% PRO 6000 的效能,是否對我們來說是個比較好的選擇? 未來可以加多張來跑併發。
-
@CS6 悲劇,早上跟供應商確認,RTX PRO 6000 已經漲到20萬港幣以上了,反而有另一個選擇,NVIDIA RTX PRO 6000D 84GB 閹割版本這張的價格還是沒有變動,但仍然是10萬左右。如果10萬左右價格有80% PRO 6000 的效能,是否對我們來說是個比較好的選擇? 未來可以加多張來跑併發。
@KAKAHermes 别相信这个6000D有 80% PRO 6000 的效能。实测就是一半多点(不然凭什么价格没涨起来)
-
@KAKAHermes 我投mac studio,我也是从3090、5090后来转向mac 平台,macos反而最简单,少很多对硬件兼容性、散热、稳定性、可维护的时间和人力成本。我在跑omlx我觉得很友好,稳定。年初从m5 max 128开机部署好omlx以后它就一直在角落跑,甚至不是高密度长时间运行都可以直接用显示器的typec线充电,噪音可忽略,耗能少,环境友好。虽然不知道将来是否需要继续扩充多台,但是目前看4台m3 ultra也能达到内存池扩展的效果,就像老特说的,32G5090跑comfy ui就不算瓶颈了,这样mac做llm server endpoint,mac mini、macbook pro跑agent,5090跑comfy ui,系统风险也有隔离,看起来也是一个完整的场景了。
@KAKAHermes 我投mac studio,我也是从3090、5090后来转向mac 平台,macos反而最简单,少很多对硬件兼容性、散热、稳定性、可维护的时间和人力成本。我在跑omlx我觉得很友好,稳定。年初从m5 max 128开机部署好omlx以后它就一直在角落跑,甚至不是高密度长时间运行都可以直接用显示器的typec线充电,噪音可忽略,耗能少,环境友好。虽然不知道将来是否需要继续扩充多台,但是目前看4台m3 ultra也能达到内存池扩展的效果,就像老特说的,32G5090跑comfy ui就不算瓶颈了,这样mac做llm server endpoint,mac mini、macbook pro跑agent,5090跑comfy ui,系统风险也有隔离,看起来也是一个完整的场景了。
mac 只能一个人玩,现在来看mac M5 ultra 显卡的计算能力也就将将够一个人长上下文(跑170G 左右的deepseek flash v4) 。
M3 ultra 长上下文都 跑不过双机 DGX spark 。白瞎了那么大的内存带宽 -
@KAKAHermes 我投mac studio,我也是从3090、5090后来转向mac 平台,macos反而最简单,少很多对硬件兼容性、散热、稳定性、可维护的时间和人力成本。我在跑omlx我觉得很友好,稳定。年初从m5 max 128开机部署好omlx以后它就一直在角落跑,甚至不是高密度长时间运行都可以直接用显示器的typec线充电,噪音可忽略,耗能少,环境友好。虽然不知道将来是否需要继续扩充多台,但是目前看4台m3 ultra也能达到内存池扩展的效果,就像老特说的,32G5090跑comfy ui就不算瓶颈了,这样mac做llm server endpoint,mac mini、macbook pro跑agent,5090跑comfy ui,系统风险也有隔离,看起来也是一个完整的场景了。
-
@KAKAHermes 這個價格,我勸你就別買了,除非你老闆真的人好錢多....
你先去確認一下到底電源跟空間能差多少張卡?
單純跑推理的話 B70 R9700 八卡就算一張以300瓦來算上電費還是省很多錢...
甚至你可以買到四台 GB10 ...@CS6 考量伺服器兼容問題及卡的價格,現在最實際的方案似乎是 GB10了。不浪費現有伺服器的情況下,又可以快速部署服務:
現有的伺服器可以增加內存去128或512GB, 之後部署API Gateway,作爲API Load Balancing,對接兩臺GB10, 物理分隔內部及外部需求。也可以保留未來擴充的可能性。(Node C)

對內尖峰同時發問支持5人, 希望Token數要有15-25 每秒才可以接收。看看各位大神對這個方案有什麼看法。

-
@CS6 考量伺服器兼容問題及卡的價格,現在最實際的方案似乎是 GB10了。不浪費現有伺服器的情況下,又可以快速部署服務:
現有的伺服器可以增加內存去128或512GB, 之後部署API Gateway,作爲API Load Balancing,對接兩臺GB10, 物理分隔內部及外部需求。也可以保留未來擴充的可能性。(Node C)

對內尖峰同時發問支持5人, 希望Token數要有15-25 每秒才可以接收。看看各位大神對這個方案有什麼看法。

@KAKAHermes 帶寬有點吃緊就是 不跑文字以外的應該還可以八