@kos-or
你説的pcie switch,其實就是我上面説的拆分卡。
拆分卡有2種。一種是帶plx芯片(或asm芯片)和retimer的拆分卡,另一種是不帶plx和retimer芯片的。
一般消費者cpu和主板,是不支持拆分。但是threadripper和epyc是支持的。
所以不需要買帶plx芯片的拆分卡。
那個帶芯片的拆分卡,把x16 分成2個x8,都要價2-3千rmb。
不帶芯片的拆分卡,大概300-500左右。
nvswitch的概念,其實就類似nvlink。差別在於,switch可以連接多個顯卡,而link只支持2個顯卡互聯。
所以,我不考慮使用nvlink,就是這個原因。
你説的那個pcie switch,拆分後,是會降速的。拆成2張,速度就變x8,拆成4張,就變x4。
nvswitch不會這樣降速。這就是nvswitch的優勢。這不是一般人能消費得起的硬件。
我看你之前的帖子說,你入手了threadripper pro wx 和 wrx80。
這個cpu是支持拆分的。你進bios,看看有沒有 bifurcation選項,就知道了。
好奇問問,這個cpu,是可以使用一般非ecc的消費者ram的,對嗎?
我之前問過chatgpt,得到答案是,pcie槽用的越多,顯卡數量越多,token生成速度會越慢。
token生產速度,跟顯卡算力、Vram頻寬和容量,關係較大。而pcie的聯通傳送資料的速度,如果太慢,就浪費了高頻寬的vram了。
你運行llm,一般都是把整個模型載入vram。所以ram的影響並不大。如果你想把模型放在ram,部分放在vram,還是算了。因爲,token生產速度,會慢到你放棄使用。
所以,我沒有太在意ram的速度。能運行和容量夠大就足夠了。
之前看yt上面,有人試過在epyc上面打開一堆軟件,去塞滿ram。但是,僅僅到了300多gb,電腦就卡了。
就算他支持2tb的ram,我覺得,好像也沒必要裝到那麽多。因爲cpu也沒辦法順暢運行。