这可能是目前本地部署GLM5.2 的最佳方案了
-
这个模型,体积算是在相对比较头部的模型里面,最适合本地部署的,体积没有那么的夸张。
翻到这个Repo,有实力的老哥可以冲了,只要1.8个w美元。速度也不差,完全可用
Concurrency C1–C4 (count 1→40)
C Median aggregate tok/s Best aggregate Best per-stream mean
1 40.3 40.3 40.3
2 56.1 63.3 31.7
3 72.0 72.7 26.0
4 95.7 102.4 25.6
Long prefill
Approx target Actual prompt tokens Wall Prefill tok/s Status
2k 1884 3.1s ~610 OK
8k 7467 14s ~535 OK
16k 14911 22s ~690 OK
32k 29792 48s ~626 OK
64k 59562 107s ~557 OK
96k 95981 190s ~506 OK -
dgx spark的bandwidth在消费级虽然不差,但依然是硬伤,体感上和其他消费级卡比起来即便是接近,也在数学和物理上限制了吞吐,个人觉得属于高级入门或初级专业级,但对于4个并行能跑GLM5.2来说,性价比真不错,只是还是那句话:多卡支撑模型的能效比真的堪称是贵族
-
我跑的是這個 https://github.com/ciprianveg/gb10-glm-5.2
不過是用八台, 為了榨出更多的併發數, 我用了DCP4 , prefill跟tok/s都慢不少, 不過得到300K x 10 的ctx

如果是DCP1的話會快上不少, 這是作者的數據:

-
我跑的是這個 https://github.com/ciprianveg/gb10-glm-5.2
不過是用八台, 為了榨出更多的併發數, 我用了DCP4 , prefill跟tok/s都慢不少, 不過得到300K x 10 的ctx

如果是DCP1的話會快上不少, 這是作者的數據:

