这可能是目前本地部署GLM5.2 的最佳方案了
-
dgx spark的bandwidth在消费级虽然不差,但依然是硬伤,体感上和其他消费级卡比起来即便是接近,也在数学和物理上限制了吞吐,个人觉得属于高级入门或初级专业级,但对于4个并行能跑GLM5.2来说,性价比真不错,只是还是那句话:多卡支撑模型的能效比真的堪称是贵族
-
我跑的是這個 https://github.com/ciprianveg/gb10-glm-5.2
不過是用八台, 為了榨出更多的併發數, 我用了DCP4 , prefill跟tok/s都慢不少, 不過得到300K x 10 的ctx

如果是DCP1的話會快上不少, 這是作者的數據:

-
我跑的是這個 https://github.com/ciprianveg/gb10-glm-5.2
不過是用八台, 為了榨出更多的併發數, 我用了DCP4 , prefill跟tok/s都慢不少, 不過得到300K x 10 的ctx

如果是DCP1的話會快上不少, 這是作者的數據:

