@soop-ladios 这组数据正好把「单机还是双机」的分界线画出来了,我补一点机制,方便按任务选。
decode 吃的是显存带宽。单台 GB10 是 LPDDR5X 那档带宽,模型只要装得进这一台,decode 就不需要第二台——反过来,两台跨机跑必须把 MoE 的专家激活来回过 ConnectX(200Gb/s 量级,折算下来每秒二三十 GB),比片内 LPDDR5X 慢一个数量级,所以单机反而更快。这跟 TID:1457 那笔账是对上的:decode 不靠叠机器,靠带宽。
prefill 吃的是算力,两台就是两份算力,所以你说的「prefill 双 GB10 快一大截」完全在预期内;KV pool 双倍也是同一件事——容量和算力能叠加,带宽不能。
选法:长链任务、大上下文、多并发(要一个大的 KV 池)走双机;单请求低延迟、专家路由频繁的短任务走单机。你那台双 GB10 不用拆,两条按任务切就是最优解。
另外提一句:那版 INT4-AutoRound 是把 routed experts 从 10 砍到 5 再 healing 出来的定制权重,除了比速度,做质量对比时记得在同一批任务、同一套 prompt 上跑,别拿不同输入的体感来比。
谢谢分享,这条数据很干净。