跳转至内容
  • 首页
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

Clinton BillC

Clinton Bill

@Clinton Bill
取消关注 关注
关于
帖子
3
主题
0
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 5070ti super 5080 super 24gb
    Clinton BillC Clinton Bill

    @kos-or
    你説的pcie switch,其實就是我上面説的拆分卡。

    拆分卡有2種。一種是帶plx芯片(或asm芯片)和retimer的拆分卡,另一種是不帶plx和retimer芯片的。
    一般消費者cpu和主板,是不支持拆分。但是threadripper和epyc是支持的。
    所以不需要買帶plx芯片的拆分卡。
    那個帶芯片的拆分卡,把x16 分成2個x8,都要價2-3千rmb。
    不帶芯片的拆分卡,大概300-500左右。

    nvswitch的概念,其實就類似nvlink。差別在於,switch可以連接多個顯卡,而link只支持2個顯卡互聯。
    所以,我不考慮使用nvlink,就是這個原因。
    你説的那個pcie switch,拆分後,是會降速的。拆成2張,速度就變x8,拆成4張,就變x4。
    nvswitch不會這樣降速。這就是nvswitch的優勢。這不是一般人能消費得起的硬件。

    我看你之前的帖子說,你入手了threadripper pro wx 和 wrx80。
    這個cpu是支持拆分的。你進bios,看看有沒有 bifurcation選項,就知道了。

    好奇問問,這個cpu,是可以使用一般非ecc的消費者ram的,對嗎?

    我之前問過chatgpt,得到答案是,pcie槽用的越多,顯卡數量越多,token生成速度會越慢。
    token生產速度,跟顯卡算力、Vram頻寬和容量,關係較大。而pcie的聯通傳送資料的速度,如果太慢,就浪費了高頻寬的vram了。
    你運行llm,一般都是把整個模型載入vram。所以ram的影響並不大。如果你想把模型放在ram,部分放在vram,還是算了。因爲,token生產速度,會慢到你放棄使用。
    所以,我沒有太在意ram的速度。能運行和容量夠大就足夠了。
    之前看yt上面,有人試過在epyc上面打開一堆軟件,去塞滿ram。但是,僅僅到了300多gb,電腦就卡了。
    就算他支持2tb的ram,我覺得,好像也沒必要裝到那麽多。因爲cpu也沒辦法順暢運行。

    AI硬件 rtx5080

  • 5070ti super 5080 super 24gb
    Clinton BillC Clinton Bill

    @kos-or

    我是想拿來玩大型沒限制,或已經越獄的LLM模型。
    小參數的模型,比如31b fp8,依然感覺很笨。

    硬件方面,運行大模型,要求大量vram。一臺主機配10~12張顯卡。
    多卡運行,顯卡之間需要有高速的連接。
    這只有伺服器的nvswitch,才能完成。
    一般家用,只能選擇支持多個 PCIE 4.0 x16 的主板和cpu。

    我還沒試過,所以不知道10~12卡運行llm,token生成速度能有多慢。
    打算一張一張慢慢纍計試錯。

    考慮使用 EPYC 7002 系列處理器(7002開始才有128條pcie 4.0),這個也是目前最便宜的方案。
    有錢的,可以上G492-Z51這類主板。
    我預算緊,只能選MZF2-AC0、G2DERO-B、H12D-16D 主板。
    或者用 Threadripper Pro wx cpu + WRX80 主板。
    這類服務器主板,只支持單條64gb或以下的Rdimm或單條128gb或以下的LRdimm内存。
    目前二手的單條64gb Rdimm内存,在某寶最低去到1200rmb左右。還可以。

    這些都只有7條滿速 pcie 4.0 x16。
    超過7個顯卡,要用拆分卡,把x16 分成2個 x8,速度降一半。

    我不確定插了7個顯卡,token生成速度會怎麽樣。
    如果還不錯,就考慮加到11張。由於機箱大小限制,只考慮加到11張。
    https://item.taobao.com/item.htm?abbucket=5&id=945762243043(這是我目前看到唯一可以裝11張3槽位顯卡的機箱)

    如果有米,可以考慮上EPYC 7004以上的cpu。那些都支持 Pcie 5.0,速度會快很多。但是DDR5 目前不合理的貴,看著還是不值得。

    AI硬件 rtx5080

  • 5070ti super 5080 super 24gb
    Clinton BillC Clinton Bill

    super系列發佈的可能性,還是蠻大的。不只seasonic泄露消息,去年9月、今年4月、6月,都有不同的消息源透露super系列的詳細規格。

    我手上已經有2個3080 20g顯卡了。
    原本還想入手多10張 3080 20g。
    但是,看到這消息,頓時感覺3080 20g不香了。
    現在等看 5070 super 18g 和 5070ti super 24g。
    很可惜 5080 super 不是 32g。所以沒期待。

    AI硬件 rtx5080
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 首页
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组