跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
K

KAKAHermes

@KAKAHermes
取消关注 关注
关于
帖子
13
主题
1
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 关于小公司跑本地大模型硬件建议
    K KAKAHermes

    @soop-ladios 感謝提供寶貴數據!非常有參考性,真幫了大忙! 希望可以向TP4這個方向發展。

    AI硬件 本地模型 rtxpro6000 服务器

  • 关于小公司跑本地大模型硬件建议
    K KAKAHermes

    @soop-ladios 多謝提醒,我測試一部試試,但不能租用兩部GB10 模擬TP吧。。。。

    AI硬件 本地模型 rtxpro6000 服务器

  • 关于小公司跑本地大模型硬件建议
    K KAKAHermes

    @soop-ladios 是的,我也是計劃先買兩台GB10來跑TP,加上本身的伺服器跑LiteLLM。

    AI硬件 本地模型 rtxpro6000 服务器

  • 关于小公司跑本地大模型硬件建议
    K KAKAHermes

    @Bunsei 我有嘗試租借GB10 ,但很難模擬多人使用場景。

    AI硬件 本地模型 rtxpro6000 服务器

  • Asus Ascent GX10到货,双gb10的DSV4-Flash集群全程hermes远程部署
    K KAKAHermes

    留言希望看測試結果

    AI硬件 gb10 deepseek hermes

  • 关于小公司跑本地大模型硬件建议
    K KAKAHermes

    @CS6 考量伺服器兼容問題及卡的價格,現在最實際的方案似乎是 GB10了。不浪費現有伺服器的情況下,又可以快速部署服務:

    現有的伺服器可以增加內存去128或512GB, 之後部署API Gateway,作爲API Load Balancing,對接兩臺GB10, 物理分隔內部及外部需求。也可以保留未來擴充的可能性。(Node C)
    5a458686-3ac5-41a1-859d-e7fb0400cdc2-image.jpeg
    對內尖峰同時發問支持5人, 希望Token數要有15-25 每秒才可以接收。

    看看各位大神對這個方案有什麼看法。🤝

    AI硬件 本地模型 rtxpro6000 服务器

  • 关于小公司跑本地大模型硬件建议
    K KAKAHermes

    @CS6 悲劇,早上跟供應商確認,RTX PRO 6000 已經漲到20萬港幣以上了,反而有另一個選擇,NVIDIA RTX PRO 6000D 84GB 閹割版本這張的價格還是沒有變動,但仍然是10萬左右。如果10萬左右價格有80% PRO 6000 的效能,是否對我們來說是個比較好的選擇? 未來可以加多張來跑併發。

    AI硬件 本地模型 rtxpro6000 服务器

  • 关于小公司跑本地大模型硬件建议
    K KAKAHermes

    @CS6 HPE伺服器機箱空間及電源相信是足夠,不過需要額外購買GPU Power Cable Kit。其實如果可以安裝AI PRO R9700 工作站版本,那RTX PRO 5000 48/72GB 也應該可以安裝。

    原本計劃的RTX PRO 6000 伺服器版本是被動散熱,還需要額外的High Performance Fan Module, GPU Riser & Air Baffle Kit等。

    AI硬件 本地模型 rtxpro6000 服务器

  • 关于小公司跑本地大模型硬件建议
    K KAKAHermes

    @CS6 感謝大神建議!但HPE ProLiant DL380 Gen11 伺服器未必支持Workstation版本的R9700, 這個才是最麻煩的地方,要麼就自組一台工作站。。。

    AI硬件 本地模型 rtxpro6000 服务器

  • 关于小公司跑本地大模型硬件建议
    K KAKAHermes

    @CS6 多些提醒,Chatbot 目前我們使用的是Chatbase 的雲端服務插件。 OCR也是有對接外部Azure 的LLM API Token。 主要是內部應用,涉及敏感資料知識庫及日常流程自動化(AI Agent),計劃是先內部部署本地模型,有額外算力才取代外部應用。

    AI硬件 本地模型 rtxpro6000 服务器

  • 关于小公司跑本地大模型硬件建议
    K KAKAHermes

    @CS6 請教下 你們公司的使用場景大約是什麼?

    因爲我這邊外部場景主要是:

    • ChatBot 幫會員找找或推薦公司網站內容 (最多一天最多可能有100個會員每人會問5-10條問題)
    • 調用OCR的API。(判斷會員提交的PDF格式轉換成文字內容等,每天可能10-20單左右)

    內部場景就比較簡單,知識庫檢索(可能對接SQL Server)或者AI Agent調用。(同時使用人數可能15-20 人左右)

    AI硬件 本地模型 rtxpro6000 服务器

  • 关于小公司跑本地大模型硬件建议
    K KAKAHermes

    @CS6 多些老特小特和CS6大神回覆👏

    早期预算是15万左右,直接用现有的HPE ProLiant DL380 Gen11 (会后续添加记忆体去128或256)配合RTX Pro 6000 即方案A 来跑上述需求。 而且还保留的升级的可能性,未来预算够,还可以添加多1-2张RTX Pro 6000。但现在价格飙去了20万,所以才考虑其他可行方案。

    GB10 x 2 也有考虑过,让HPE ProLiant DL380 Gen11作为流量入口与负载均衡器利用 Intel Xeon 的吞吐能力,处理每天 1000 次的 Chatbot 网页并发请求、运行 Docker 容器、管理反向代理(Nginx / Traefik)、以及处理较轻量的 OCR 任务。两台GB10 专心做 GPU 矩阵运算,而且还可以做到推理分流(内部知识库应用跟外部Chatbot及OCR分开), 但架构复杂度上升:从单机部署变成了多机分散式(DL380 + 2x GB10),内网需要配置好良好的 API 路由,维护成本大大提升。加上个人始终觉得GB10就是玩具。。。

    所以结论是先试试runPod 或租用云GPU,计算所需要的资源才决定购买哪些硬件。

    AI硬件 本地模型 rtxpro6000 服务器

  • 关于小公司跑本地大模型硬件建议
    K KAKAHermes

    场景: 一家小公司,主要是来跑本地知识库,提供20-25人同时使用,另外还有自家网页的ChatBot 及一些网站上的OCR API调用(流量200-500左右)

    • 硬件规划方案 A: 已经有台全新HPE ProLiant DL380 Gen11 闲置的伺服器,64GB ECC DDR5 记忆体,10TB SSD硬盘。 打算采购RTX PRO 6000 96GB 伺服器版本。

    • 硬件规划方案 B: 自组一套Workstation及RTX PRO 5000 72GB伺服器版本。但不能利用现有的伺服器硬件,分配显存也需要用其他手段来实现。

    • 硬件规划方案 C:APPLE MAC STUDIO M5 ULTRA 256GB 统一内存。也不能利用现有的伺服器硬件,而且苹果生态跑AI也比较麻烦些。

    原本考虑方案A ,因为RTX PRO 6000 有MIG技术,可以分配显存去不同应用VM,例如CHATBOX,OCR,本地知识库。但因为RTX PRO 6000价格一直上飙,由之前的13万港币,到现在16-20万港币了。
    而方案B需要另外配一台工作站,成本也要13-14万。
    因为苹果发布M5 Ultra 处理器的Mac Studio, 请问各位大神, 如果不考虑Confy UI等应用场景,是否方案C,10万左右的Mac Studio比较适合我们的应用场景?

    AI硬件 本地模型 rtxpro6000 服务器
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组