<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[SG Lang比LLM和Llama.cpp强在哪里？吐字速度更慢，但Raidx缓存树保证了Prefill快得多，开销也更小，Hermes响应更快，显卡功耗更低！]]></title><description><![CDATA[<p dir="auto">昨天部署了Qwen3.6 27b + SG-Lang，宿主机是Ubuntu服务器，显卡是4090 48G，我看大家讨论的热情挺高，论坛和评论区都有不少人问一些细节问题。单独个做个视频回答下。</p>
<p dir="auto">第一就是我怎么配置的，为什么不给教程，我希望问这些问题的朋友认真看下视频，一个视频都不愿意看完，我回到你有什么意义呢？我全部的配置方案就是把用户名密码告诉Hermes，在电报上和它聊天，告诉它我的要求，然后我就去吃饭或者睡觉了。后来我要实现什么调试目标，我也是这样做的，如果有过不去的坎，它会和我请求，我衡量后告诉它，所有聊天的过程就是用这么朴素的语言，如果你搞不定，就多试试看，我就是这么搞的，骗你我能有什么好处？我的小乐助手，使用的是Docker+FP8权重跑起来的，各种参数和运行脚本都是它自己写的，我也把参数分享在了论坛，有需要的自己去找。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/4a234c2f-0b7e-4947-b2d2-3b06fd223d59.jpeg" alt="让小乐配置Hermes.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">论坛也不是我一个人配置成功了，大家在Agent的操作下，配置了不同的模型，不同的参数，殊途同归，最后我们一起交流参数配置，这才有意义，你问为什么不出个教程，我还问你为什么不认真看我的视频呢。我很早就说了，自从我用上DeepSeek V4 Flahs+Hermes，我就再也没有手动配置过环境，无论是ComfyUI还是大模型，我都是让AI自己去配置。时代变了，别总问过时的问题。如果你不知道如何配置Hermes，去看我过往的视频。</p>
<p dir="auto">第二就是SG-Lang相比于VLLM和LLama.cpp吐字速度快了多少，我没有去测，论坛有不少人测，说是25-30tokens/s，吐字速度肯定比VLLM和Llama.cpp慢多了，它们在不开启MTP的情况下都是在45tokens/s，如果怀疑数据就自己测试，我做个视频没必要骗大家，过往的视频都有测试记录，怀疑的人自己去看。老带着总有刁民想害朕的想法，就不适合学习AI。那么为什么明明SG-Lang的速度不如VLLM和LLama.cpp，部署又麻烦，干嘛要折腾它呢？</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/2b519e58-0384-4b43-9a90-6108bda10453.jpeg" alt="vllm tokens大.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">当然是它有过人之处，它的Radix缓存树极其高效，是真正的硬核缓存，不仅可以当前会话加速，Prefill只做增量工作，它也能夸会话使用，同一个类型的任务你开几个Agent，它会共享基础缓存，显存占用量会大大降低。4090 48G AWQ模型，有人开了六七个会话跑Agent，我们不会极限优化的，跑FP8模型的，运行两三个会话还是很轻松的。至于说运行效果，大家自己认真看，用心体会。就是它肯定不如DeepSeek V4 Flash快，但是相比于VLLM，SG-Lang显卡狂转，半天做一个任务好多了。对了，提到显卡，它运行时的最大功耗大概是330w左右，而且会很快回落，Llama.cpp和VLLM我实测的时候，基本是负载干满，超过400w是常态。</p>
<p dir="auto">另外是关于显存消耗，论坛使用Q8模型的哥们是占用了45G以上，我的FP8模型是占用的41G出头，KV缓存是否使用FP8或者Q8量化，目前看来差距不是很夸张。我用了FP8 KV压缩显存还是占用41G出头，智力上也没啥变化，可能是哪里配置有问题，暂时不想去测试了。有观众问32G显卡能不能跑，肯定是可以的，因为Reddit，x等平台上都有跑起来的，选择4比特量化，Q4 GGUF或者AWQ都可以，新卡或许能用FP4权重的模型，可以大大降低显存开销。但我没去折腾，因为本地部署对于我而言就像是越野车，我一定想要买一个，可是平时出门我肯定开电动车，便宜又舒适。只要有了，我就不想折腾了。我建议有5090 32G，RTXpro5000以上卡的朋友去折腾体验肯定很好，如果是Pro6000，那就直接起飞了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/b88c45d5-6ccb-48de-a804-4ec743b20236.png" alt="4090 SG-Lang 330w最高.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">那么这个重金打造的本地助手有什么意义呢？意义可以说非常巨大，它是个多模态模型，还有去对齐版本的，而且智力很好，知识库规模够用，加上它可以配置搜索，完全用来打造私有业务再合适不过了。你的私密图片，视频，音频，文档等，都可以用它在本地处理。如果你要展开一个不方便公开的业务，用在线模型妥妥会泄露数据，那么用Qwen3.6在本地推理，可以大大降低被拒绝服务的概率，安全性也更好。</p>
<p dir="auto">另外就是成本，有网友留言说它用DeepSeek处理了20多个网页就消耗了1美金，我不知道他是怎么用的，或许他用的不是官方的API，否则这点数据处理最多几毛钱人民币。但是也反映出一个问题，就是如果要AI Agent处理大量非重复数据，价格肯定下不来，因为缓存无法高效命中，这个时候用本地的SG-Lang，它也会变慢，但无妨，它后台一直运行，我们去干其他事，完全不用担心账单的问题。多开几个会话让它跑，它的单个会话tokens几乎不会怎么下降，总体会话的tokens就提升上来了，这是它相比于VLLM，Llama.cpp的另一个巨大优势。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/e11c650b-0fa7-4cd9-a961-b8d60618c7f6.png" alt="kiki复制目录树.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">本地部署一直是有一定技术门槛的，你掌握这些技巧，未来几年AI服务会快速发展，有不少小企业，小团体都会有构建私有AI服务的需求，这不就是多了一项谋生技能吗？配置起模型，Agent本质上不难，可是基于它打造个整体服务，能够迅速把客户的业务流程搬到AI服务上，这就是核心竞争力了。我们这些技术宅配置一个Hermes，接入<br />
DeepSeek或者Qwen，看起来很简单，稍微学下就回了，你让培训机构，小诊所的人学会这玩意，那不比登天还难？以后会有很多我们意想不到的业务对AI产生需求，提前卡位总是没错的。</p>
<p dir="auto">讲实话，Qwen3.6 27b是个神器，就算它以后完全不升级了，它也能完成大多数常规任务了，以后大量的洋垃圾显卡淘汰，比如A100之类的，使用门槛会大大降低。我相信阿里还是会发一些升级版本的 ，可能不会每个版本都有，但是锁定一个版本，就向前推进一步，还是非常值得跟进的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/105dd220-b5ae-492e-ad91-c0976fe9da85.jpg" alt="机箱显卡2.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto">最近论坛的大神们，都开始感慨Coding Plan给的额度缩水了API涨价了，虽然有Deepeek这样的价格屠夫在，咱们不用担心用不起。可是哪一天DeepSeek这样浓眉大眼的也背叛革命了，我们还是要留一手的。其实很好搭配，就是Hermes躲开几个Profile，脏活累活的，启动本地Qwen3.6 27B，需要高逼格的，启动云端API，这样可以大大降低账单压力。最主要的是，自主权在自己手里，你可以决定什么业务上云，什么业务不上云。</p>
<p dir="auto">而且有了本地模型，你完全可以做到日常指令用Qwen执行，特定需求比如编程、写作，调用在线AI。而且别忘了，本地还有ComfyUI生态，AI音视频画图都能搞，多买一张显卡，本地业务闭环，还是很值得折腾下的。</p>
]]></description><link>https://lcz.me/topic/916/sg-lang比llm和llama.cpp强在哪里-吐字速度更慢-但raidx缓存树保证了prefill快得多-开销也更小-hermes响应更快-显卡功耗更低</link><generator>RSS for Node</generator><lastBuildDate>Sun, 26 Jul 2026 20:02:13 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/916.rss" rel="self" type="application/rss+xml"/><pubDate>Sat, 25 Jul 2026 03:00:00 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to SG Lang比LLM和Llama.cpp强在哪里？吐字速度更慢，但Raidx缓存树保证了Prefill快得多，开销也更小，Hermes响应更快，显卡功耗更低！ on Sat, 25 Jul 2026 08:05:08 GMT]]></title><description><![CDATA[<p dir="auto">哈哈哈，老特开始出视频的对应图文帖了。</p>
<p dir="auto">想到自己当初也是很热衷于搞SGLang部署qwen3.6-27b，怎奈明星模型3.6-27b横空出世的节骨眼SGLang更新没那么快跟上，导致不管怎么调参输出都是乱码，就说放一放，这一放就再也没拿起来过。</p>
<p dir="auto">想想和自己的性格有关，上班时候的午饭大多就是离得近的西部马华牛肉面，味道不错量足干净，只要它没背叛我就不会换别家的，牙膏香皂洗发水也是，自认为在给自己节省筛选和试错成本。vLLM在当时更新很快，对qwen3.6支持得不错，选型期接住了qwen3.6的一波流量，就自然而然用了vLLM（多agent并行至少是比ollama强多了），到现在都很稳定也就不想换了。据我以点盖面的不客观观察，vLLM确实对模型的更新跟进更卷一些，好像也更重视中文社区一点，除了版本号vLLM更激进之外，小红书的官方账号粉丝也是vLLM比SGLang多了快一倍。所以，目前话筒继续还是留在vLLM这里吧，等万一vLLM犯了致命错误再考虑要不要给SGLang一个机会。</p>
]]></description><link>https://lcz.me/post/10497</link><guid isPermaLink="true">https://lcz.me/post/10497</guid><dc:creator><![CDATA[benton yi]]></dc:creator><pubDate>Sat, 25 Jul 2026 08:05:08 GMT</pubDate></item><item><title><![CDATA[Reply to SG Lang比LLM和Llama.cpp强在哪里？吐字速度更慢，但Raidx缓存树保证了Prefill快得多，开销也更小，Hermes响应更快，显卡功耗更低！ on Sat, 25 Jul 2026 03:00:00 GMT]]></title><description><![CDATA[<p dir="auto">视频地址：<a href="https://youtu.be/_j1D1dscqaE" rel="nofollow ugc">https://youtu.be/_j1D1dscqaE</a></p>
]]></description><link>https://lcz.me/post/10480</link><guid isPermaLink="true">https://lcz.me/post/10480</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Sat, 25 Jul 2026 03:00:00 GMT</pubDate></item></channel></rss>