双 3090 NVLink + vLLM 半年实测:Qwen3.6-27B 解码 128 tok/s,并发 4 用户 258 tok/s
-
@starryskyknight 问一下这位兄弟,你是把其中的一张卡给竖起来放置了吗?我现在也有类似的问题,我一张卡是 EVGA 的三风扇的卡,另外一张卡是 NVIDIA 的 FE。如果两张卡都并排放的话,根本就没有空间了。
-
非常好的分享,尤其是踩坑点,VLLM吐字速度快,32k上下文prefill冷启动15.2秒,后续如何?VLLM最头疼的就是缓存机制比SG-Lang差太多。SG-Lang可以做到长上下文基本不掉速,吐字速度还是要慢于VLLM的。有空可以测试一下SG-Lang,毕竟Agent是刚需,稍微上点强度的编程也要求走长上下文,聊天走本地意义不大。
-
@terry 看了您的建议 我一直想用SG-Lang试试看 但跑起来都没有 VLLM好 不知道是不是老卡的关系 今天会发一篇千问3.8的版本 希望相同设备的伙伴能一起讨论 找到最佳化方案
-
@Don-zhu 我没放机壳内 我用延长线拉伸出来 另外用了架子撑着
@starryskyknight 感谢回复,我也是买了线放到外边,根本没法装一起。放外边反而散热好很多
-
@starryskyknight 感谢回复,我也是买了线放到外边,根本没法装一起。放外边反而散热好很多