有大神在本地部署 GLM 5.2 吗?
-
在本地部署模型 和云端感觉差太多了 还是云端通畅 稳定啊。一旦本地运行很多事情无法做啊。
-
最近我的DGX SPARK GB10增加到了10台, 其中八台拿來跑GLM5.2, ctx 320K x 10. 正在測試中, 感覺是比deepseek v4 flash強, 強多少要多跑幾天才知道
不過很慢, prefill 大概600-800, tok/s大概2x
ps. 四台就可以跑了, 參考 https://forums.developer.nvidia.com/t/glm-5-2-on-a-4x-gb10-cluster-22-tok-s-decode-256k-ctx-recipe/374125 -
最近我的DGX SPARK GB10增加到了10台, 其中八台拿來跑GLM5.2, ctx 320K x 10. 正在測試中, 感覺是比deepseek v4 flash強, 強多少要多跑幾天才知道
不過很慢, prefill 大概600-800, tok/s大概2x
ps. 四台就可以跑了, 參考 https://forums.developer.nvidia.com/t/glm-5-2-on-a-4x-gb10-cluster-22-tok-s-decode-256k-ctx-recipe/374125 -
20多應該還好吧, 至少可用
對了可以請教一下大大是怎麽Cluster的嗎? 是把每部Spark的ConnectX-7插到一個Switch上面嗎?
見到很多都是2部鏈接在一起
@566656661
2部鏈接在一起的話應該只能接到3台, 兩兩對接. 我是用MikroTik CRS804 switch 接到八台GB10的200G的port. -
@566656661
2部鏈接在一起的話應該只能接到3台, 兩兩對接. 我是用MikroTik CRS804 switch 接到八台GB10的200G的port. -
感謝回答, 因爲我不太熟悉網絡傳輸那方面, 所以有點好奇是怎麽連接

如果我沒理解錯的話左邊QSFP-DD應該就是連接4台Spark
然後在透過Ethernet 連接下一台Switch?
@566656661
@williamlouis 发布了个任务,有空的话可以接一个做作,超凡大师交易也问题不大。 -
感謝回答, 因爲我不太熟悉網絡傳輸那方面, 所以有點好奇是怎麽連接

如果我沒理解錯的話左邊QSFP-DD應該就是連接4台Spark
然後在透過Ethernet 連接下一台Switch?
@566656661
CRS804是4 port 400G QSFP56-DD, 每個port由八條獨立的資料通道組成, 所以可以分出2x200G, 4x100G等等. 買對線就可以接8台或16台DGX spark. 我看TP 8的時候網路流量好像也沒有到100G, 所以接16台應該對速度也沒有影響. 我是買這條線, 接了8台

-
@566656661
@williamlouis 发布了个任务,有空的话可以接一个做作,超凡大师交易也问题不大。 -
@566656661
CRS804是4 port 400G QSFP56-DD, 每個port由八條獨立的資料通道組成, 所以可以分出2x200G, 4x100G等等. 買對線就可以接8台或16台DGX spark. 我看TP 8的時候網路流量好像也沒有到100G, 所以接16台應該對速度也沒有影響. 我是買這條線, 接了8台

-
@566656661 这个难度我觉得小意思,你试试看,我作为站长不方便参与,要不然我恨不得自己做。
-
这个太不现实了,除非你是视金钱如粪土的富哥。
现在本地部署说实话还是有点儿尴尬,哪怕是27b这样的模型,哪怕你用的是5090,一到agent使用场景,因为现在毕竟是agent时代了,那个pp速度一慢了你如果要是没做好缓存优化的话,你是根本不会想主力用它的。如果只是聊个天,做一点文本工作聊天窗口那种,然后识别个图啊,OCR的话,我以前那个5070ti就挺好的,升级到5090也就是可以跑的量化精度高一点,但是依然解决不了稠密模型在本地部署情况下的慢的问题。你想27b都如此,那像glm5.2这种庞然大物,本地布属真的意义不大。你可以考虑租个云端的卡试验一下,最终的归宿应该还是调用的时候用API,反正现在智谱的,coding plan也买不到。 -
@566656661
抓紧学习,全能起来,
-
现在本地也就跑生图和视频现实点,文本大模型还是富哥们的玩具,真要投个几万十几万来搞,够充API到天荒地老了
-
如果有可跑的项目。可以考虑。为了测测 参数 整一套 没什么意义。结果是可以预测的。肯定不如在线的。

