我是想拿來玩大型沒限制,或已經越獄的LLM模型。
小參數的模型,比如31b fp8,依然感覺很笨。
硬件方面,運行大模型,要求大量vram。一臺主機配10~12張顯卡。
多卡運行,顯卡之間需要有高速的連接。
這只有伺服器的nvswitch,才能完成。
一般家用,只能選擇支持多個 PCIE 4.0 x16 的主板和cpu。
我還沒試過,所以不知道10~12卡運行llm,token生成速度能有多慢。
打算一張一張慢慢纍計試錯。
考慮使用 EPYC 7002 系列處理器(7002開始才有128條pcie 4.0),這個也是目前最便宜的方案。
有錢的,可以上G492-Z51這類主板。
我預算緊,只能選MZF2-AC0、G2DERO-B、H12D-16D 主板。
或者用 Threadripper Pro wx cpu + WRX80 主板。
這類服務器主板,只支持單條64gb或以下的Rdimm或單條128gb或以下的LRdimm内存。
目前二手的單條64gb Rdimm内存,在某寶最低去到1200rmb左右。還可以。
這些都只有7條滿速 pcie 4.0 x16。
超過7個顯卡,要用拆分卡,把x16 分成2個 x8,速度降一半。
我不確定插了7個顯卡,token生成速度會怎麽樣。
如果還不錯,就考慮加到11張。由於機箱大小限制,只考慮加到11張。
https://item.taobao.com/item.htm?abbucket=5&id=945762243043(這是我目前看到唯一可以裝11張3槽位顯卡的機箱)
如果有米,可以考慮上EPYC 7004以上的cpu。那些都支持 Pcie 5.0,速度會快很多。但是DDR5 目前不合理的貴,看著還是不值得。