SG Lang比LLM和Llama.cpp强在哪里?吐字速度更慢,但Raidx缓存树保证了Prefill快得多,开销也更小,Hermes响应更快,显卡功耗更低!
-
昨天部署了Qwen3.6 27b + SG-Lang,宿主机是Ubuntu服务器,显卡是4090 48G,我看大家讨论的热情挺高,论坛和评论区都有不少人问一些细节问题。单独个做个视频回答下。
第一就是我怎么配置的,为什么不给教程,我希望问这些问题的朋友认真看下视频,一个视频都不愿意看完,我回到你有什么意义呢?我全部的配置方案就是把用户名密码告诉Hermes,在电报上和它聊天,告诉它我的要求,然后我就去吃饭或者睡觉了。后来我要实现什么调试目标,我也是这样做的,如果有过不去的坎,它会和我请求,我衡量后告诉它,所有聊天的过程就是用这么朴素的语言,如果你搞不定,就多试试看,我就是这么搞的,骗你我能有什么好处?我的小乐助手,使用的是Docker+FP8权重跑起来的,各种参数和运行脚本都是它自己写的,我也把参数分享在了论坛,有需要的自己去找。

论坛也不是我一个人配置成功了,大家在Agent的操作下,配置了不同的模型,不同的参数,殊途同归,最后我们一起交流参数配置,这才有意义,你问为什么不出个教程,我还问你为什么不认真看我的视频呢。我很早就说了,自从我用上DeepSeek V4 Flahs+Hermes,我就再也没有手动配置过环境,无论是ComfyUI还是大模型,我都是让AI自己去配置。时代变了,别总问过时的问题。如果你不知道如何配置Hermes,去看我过往的视频。
第二就是SG-Lang相比于VLLM和LLama.cpp吐字速度快了多少,我没有去测,论坛有不少人测,说是25-30tokens/s,吐字速度肯定比VLLM和Llama.cpp慢多了,它们在不开启MTP的情况下都是在45tokens/s,如果怀疑数据就自己测试,我做个视频没必要骗大家,过往的视频都有测试记录,怀疑的人自己去看。老带着总有刁民想害朕的想法,就不适合学习AI。那么为什么明明SG-Lang的速度不如VLLM和LLama.cpp,部署又麻烦,干嘛要折腾它呢?

当然是它有过人之处,它的Radix缓存树极其高效,是真正的硬核缓存,不仅可以当前会话加速,Prefill只做增量工作,它也能夸会话使用,同一个类型的任务你开几个Agent,它会共享基础缓存,显存占用量会大大降低。4090 48G AWQ模型,有人开了六七个会话跑Agent,我们不会极限优化的,跑FP8模型的,运行两三个会话还是很轻松的。至于说运行效果,大家自己认真看,用心体会。就是它肯定不如DeepSeek V4 Flash快,但是相比于VLLM,SG-Lang显卡狂转,半天做一个任务好多了。对了,提到显卡,它运行时的最大功耗大概是330w左右,而且会很快回落,Llama.cpp和VLLM我实测的时候,基本是负载干满,超过400w是常态。
另外是关于显存消耗,论坛使用Q8模型的哥们是占用了45G以上,我的FP8模型是占用的41G出头,KV缓存是否使用FP8或者Q8量化,目前看来差距不是很夸张。我用了FP8 KV压缩显存还是占用41G出头,智力上也没啥变化,可能是哪里配置有问题,暂时不想去测试了。有观众问32G显卡能不能跑,肯定是可以的,因为Reddit,x等平台上都有跑起来的,选择4比特量化,Q4 GGUF或者AWQ都可以,新卡或许能用FP4权重的模型,可以大大降低显存开销。但我没去折腾,因为本地部署对于我而言就像是越野车,我一定想要买一个,可是平时出门我肯定开电动车,便宜又舒适。只要有了,我就不想折腾了。我建议有5090 32G,RTXpro5000以上卡的朋友去折腾体验肯定很好,如果是Pro6000,那就直接起飞了。

那么这个重金打造的本地助手有什么意义呢?意义可以说非常巨大,它是个多模态模型,还有去对齐版本的,而且智力很好,知识库规模够用,加上它可以配置搜索,完全用来打造私有业务再合适不过了。你的私密图片,视频,音频,文档等,都可以用它在本地处理。如果你要展开一个不方便公开的业务,用在线模型妥妥会泄露数据,那么用Qwen3.6在本地推理,可以大大降低被拒绝服务的概率,安全性也更好。
另外就是成本,有网友留言说它用DeepSeek处理了20多个网页就消耗了1美金,我不知道他是怎么用的,或许他用的不是官方的API,否则这点数据处理最多几毛钱人民币。但是也反映出一个问题,就是如果要AI Agent处理大量非重复数据,价格肯定下不来,因为缓存无法高效命中,这个时候用本地的SG-Lang,它也会变慢,但无妨,它后台一直运行,我们去干其他事,完全不用担心账单的问题。多开几个会话让它跑,它的单个会话tokens几乎不会怎么下降,总体会话的tokens就提升上来了,这是它相比于VLLM,Llama.cpp的另一个巨大优势。

本地部署一直是有一定技术门槛的,你掌握这些技巧,未来几年AI服务会快速发展,有不少小企业,小团体都会有构建私有AI服务的需求,这不就是多了一项谋生技能吗?配置起模型,Agent本质上不难,可是基于它打造个整体服务,能够迅速把客户的业务流程搬到AI服务上,这就是核心竞争力了。我们这些技术宅配置一个Hermes,接入
DeepSeek或者Qwen,看起来很简单,稍微学下就回了,你让培训机构,小诊所的人学会这玩意,那不比登天还难?以后会有很多我们意想不到的业务对AI产生需求,提前卡位总是没错的。讲实话,Qwen3.6 27b是个神器,就算它以后完全不升级了,它也能完成大多数常规任务了,以后大量的洋垃圾显卡淘汰,比如A100之类的,使用门槛会大大降低。我相信阿里还是会发一些升级版本的 ,可能不会每个版本都有,但是锁定一个版本,就向前推进一步,还是非常值得跟进的。

最近论坛的大神们,都开始感慨Coding Plan给的额度缩水了API涨价了,虽然有Deepeek这样的价格屠夫在,咱们不用担心用不起。可是哪一天DeepSeek这样浓眉大眼的也背叛革命了,我们还是要留一手的。其实很好搭配,就是Hermes躲开几个Profile,脏活累活的,启动本地Qwen3.6 27B,需要高逼格的,启动云端API,这样可以大大降低账单压力。最主要的是,自主权在自己手里,你可以决定什么业务上云,什么业务不上云。
而且有了本地模型,你完全可以做到日常指令用Qwen执行,特定需求比如编程、写作,调用在线AI。而且别忘了,本地还有ComfyUI生态,AI音视频画图都能搞,多买一张显卡,本地业务闭环,还是很值得折腾下的。
-
哈哈哈,老特开始出视频的对应图文帖了。
想到自己当初也是很热衷于搞SGLang部署qwen3.6-27b,怎奈明星模型3.6-27b横空出世的节骨眼SGLang更新没那么快跟上,导致不管怎么调参输出都是乱码,就说放一放,这一放就再也没拿起来过。
想想和自己的性格有关,上班时候的午饭大多就是离得近的西部马华牛肉面,味道不错量足干净,只要它没背叛我就不会换别家的,牙膏香皂洗发水也是,自认为在给自己节省筛选和试错成本。vLLM在当时更新很快,对qwen3.6支持得不错,选型期接住了qwen3.6的一波流量,就自然而然用了vLLM(多agent并行至少是比ollama强多了),到现在都很稳定也就不想换了。据我以点盖面的不客观观察,vLLM确实对模型的更新跟进更卷一些,好像也更重视中文社区一点,除了版本号vLLM更激进之外,小红书的官方账号粉丝也是vLLM比SGLang多了快一倍。所以,目前话筒继续还是留在vLLM这里吧,等万一vLLM犯了致命错误再考虑要不要给SGLang一个机会。