本人小白,希望得到论坛大神指点,在win系统和Ubuntu系统里部署本地大模型运行验证资料。
-
Linux系统的优势主要在兼容性和生态选择性上。
完全一致的生态的前提下,尤其是你选用的是llama.cpp,win和linux在工具,或者说运行层面基本上可以说没有性能差距。但是系统环境上是有差距的。比如冷启动后的ram占用,linux可以压到4GB以下,但是win一般而言会直接占总内存的20%~30%。
“使用几天后,我注意到一个现象:在上下文长度设为 256K 的情况下,token 生成速度从原来的 30+ 降到了 20+ Tokens/s,性能有一定回落。”
这个是正常的。越往后概率推演,每个轮次需要统计的上文就越多,必然会越慢
-
我现在只是设定 51200 而已,因为我观察过每一次的处理都是 1万左右
-
Linux系统的优势主要在兼容性和生态选择性上。
完全一致的生态的前提下,尤其是你选用的是llama.cpp,win和linux在工具,或者说运行层面基本上可以说没有性能差距。但是系统环境上是有差距的。比如冷启动后的ram占用,linux可以压到4GB以下,但是win一般而言会直接占总内存的20%~30%。
“使用几天后,我注意到一个现象:在上下文长度设为 256K 的情况下,token 生成速度从原来的 30+ 降到了 20+ Tokens/s,性能有一定回落。”
这个是正常的。越往后概率推演,每个轮次需要统计的上文就越多,必然会越慢
-
我在用这张卡。用的VLLM。主机配置太垃圾。但是也能跑50T/s.
你可以换个 在线AI 配置试试。30-20这个速度是有点LOW。 -
我在用这张卡。用的VLLM。主机配置太垃圾。但是也能跑50T/s.
你可以换个 在线AI 配置试试。30-20这个速度是有点LOW。@williamlouis 我换成Ubuntu24.04以后,Token一般可以稳定在35-45之间。除非上下文用到100K后会下降到32左右。处理一般任务足够了,短上下文可以在43左右。
-

单单sglang 这个理由。。。没有理由不用linux
-

单单sglang 这个理由。。。没有理由不用linux
@imbiplaza-ASUS 谢谢指点!感谢


-
我在用这张卡。用的VLLM。主机配置太垃圾。但是也能跑50T/s.
你可以换个 在线AI 配置试试。30-20这个速度是有点LOW。@williamlouis 感谢指点,我已换到Ubuntu24.04中,确实提速很明显。我在Ubuntu中部署的时候,显卡驱动安装时有几次失败,在彻底断电以后等待10秒,然后重启驱动加载成功,这个是我遇到的一个坑,希望其他人别遇到。
-

单单sglang 这个理由。。。没有理由不用linux
@imbiplaza-ASUS 我也想试试sglang怎么样?今晚是不是要搞搞看啥是sglang,我也很好奇。