跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. AI Agent
  3. SG Lang比LLM和Llama.cpp强在哪里?吐字速度更慢,但Raidx缓存树保证了Prefill快得多,开销也更小,Hermes响应更快,显卡功耗更低!

SG Lang比LLM和Llama.cpp强在哪里?吐字速度更慢,但Raidx缓存树保证了Prefill快得多,开销也更小,Hermes响应更快,显卡功耗更低!

已定时 已固定 已锁定 已移动 AI Agent
qwen3.6-27bhermes4090
3 帖子 2 发布者 138 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT 离线
    terryT 离线
    terry
    超级版主
    编写于 最后由 编辑
    #1

    昨天部署了Qwen3.6 27b + SG-Lang,宿主机是Ubuntu服务器,显卡是4090 48G,我看大家讨论的热情挺高,论坛和评论区都有不少人问一些细节问题。单独个做个视频回答下。

    第一就是我怎么配置的,为什么不给教程,我希望问这些问题的朋友认真看下视频,一个视频都不愿意看完,我回到你有什么意义呢?我全部的配置方案就是把用户名密码告诉Hermes,在电报上和它聊天,告诉它我的要求,然后我就去吃饭或者睡觉了。后来我要实现什么调试目标,我也是这样做的,如果有过不去的坎,它会和我请求,我衡量后告诉它,所有聊天的过程就是用这么朴素的语言,如果你搞不定,就多试试看,我就是这么搞的,骗你我能有什么好处?我的小乐助手,使用的是Docker+FP8权重跑起来的,各种参数和运行脚本都是它自己写的,我也把参数分享在了论坛,有需要的自己去找。

    让小乐配置Hermes.jpeg

    论坛也不是我一个人配置成功了,大家在Agent的操作下,配置了不同的模型,不同的参数,殊途同归,最后我们一起交流参数配置,这才有意义,你问为什么不出个教程,我还问你为什么不认真看我的视频呢。我很早就说了,自从我用上DeepSeek V4 Flahs+Hermes,我就再也没有手动配置过环境,无论是ComfyUI还是大模型,我都是让AI自己去配置。时代变了,别总问过时的问题。如果你不知道如何配置Hermes,去看我过往的视频。

    第二就是SG-Lang相比于VLLM和LLama.cpp吐字速度快了多少,我没有去测,论坛有不少人测,说是25-30tokens/s,吐字速度肯定比VLLM和Llama.cpp慢多了,它们在不开启MTP的情况下都是在45tokens/s,如果怀疑数据就自己测试,我做个视频没必要骗大家,过往的视频都有测试记录,怀疑的人自己去看。老带着总有刁民想害朕的想法,就不适合学习AI。那么为什么明明SG-Lang的速度不如VLLM和LLama.cpp,部署又麻烦,干嘛要折腾它呢?

    vllm tokens大.jpeg

    当然是它有过人之处,它的Radix缓存树极其高效,是真正的硬核缓存,不仅可以当前会话加速,Prefill只做增量工作,它也能夸会话使用,同一个类型的任务你开几个Agent,它会共享基础缓存,显存占用量会大大降低。4090 48G AWQ模型,有人开了六七个会话跑Agent,我们不会极限优化的,跑FP8模型的,运行两三个会话还是很轻松的。至于说运行效果,大家自己认真看,用心体会。就是它肯定不如DeepSeek V4 Flash快,但是相比于VLLM,SG-Lang显卡狂转,半天做一个任务好多了。对了,提到显卡,它运行时的最大功耗大概是330w左右,而且会很快回落,Llama.cpp和VLLM我实测的时候,基本是负载干满,超过400w是常态。

    另外是关于显存消耗,论坛使用Q8模型的哥们是占用了45G以上,我的FP8模型是占用的41G出头,KV缓存是否使用FP8或者Q8量化,目前看来差距不是很夸张。我用了FP8 KV压缩显存还是占用41G出头,智力上也没啥变化,可能是哪里配置有问题,暂时不想去测试了。有观众问32G显卡能不能跑,肯定是可以的,因为Reddit,x等平台上都有跑起来的,选择4比特量化,Q4 GGUF或者AWQ都可以,新卡或许能用FP4权重的模型,可以大大降低显存开销。但我没去折腾,因为本地部署对于我而言就像是越野车,我一定想要买一个,可是平时出门我肯定开电动车,便宜又舒适。只要有了,我就不想折腾了。我建议有5090 32G,RTXpro5000以上卡的朋友去折腾体验肯定很好,如果是Pro6000,那就直接起飞了。

    4090 SG-Lang 330w最高.png

    那么这个重金打造的本地助手有什么意义呢?意义可以说非常巨大,它是个多模态模型,还有去对齐版本的,而且智力很好,知识库规模够用,加上它可以配置搜索,完全用来打造私有业务再合适不过了。你的私密图片,视频,音频,文档等,都可以用它在本地处理。如果你要展开一个不方便公开的业务,用在线模型妥妥会泄露数据,那么用Qwen3.6在本地推理,可以大大降低被拒绝服务的概率,安全性也更好。

    另外就是成本,有网友留言说它用DeepSeek处理了20多个网页就消耗了1美金,我不知道他是怎么用的,或许他用的不是官方的API,否则这点数据处理最多几毛钱人民币。但是也反映出一个问题,就是如果要AI Agent处理大量非重复数据,价格肯定下不来,因为缓存无法高效命中,这个时候用本地的SG-Lang,它也会变慢,但无妨,它后台一直运行,我们去干其他事,完全不用担心账单的问题。多开几个会话让它跑,它的单个会话tokens几乎不会怎么下降,总体会话的tokens就提升上来了,这是它相比于VLLM,Llama.cpp的另一个巨大优势。

    kiki复制目录树.png

    本地部署一直是有一定技术门槛的,你掌握这些技巧,未来几年AI服务会快速发展,有不少小企业,小团体都会有构建私有AI服务的需求,这不就是多了一项谋生技能吗?配置起模型,Agent本质上不难,可是基于它打造个整体服务,能够迅速把客户的业务流程搬到AI服务上,这就是核心竞争力了。我们这些技术宅配置一个Hermes,接入
    DeepSeek或者Qwen,看起来很简单,稍微学下就回了,你让培训机构,小诊所的人学会这玩意,那不比登天还难?以后会有很多我们意想不到的业务对AI产生需求,提前卡位总是没错的。

    讲实话,Qwen3.6 27b是个神器,就算它以后完全不升级了,它也能完成大多数常规任务了,以后大量的洋垃圾显卡淘汰,比如A100之类的,使用门槛会大大降低。我相信阿里还是会发一些升级版本的 ,可能不会每个版本都有,但是锁定一个版本,就向前推进一步,还是非常值得跟进的。

    机箱显卡2.jpg

    最近论坛的大神们,都开始感慨Coding Plan给的额度缩水了API涨价了,虽然有Deepeek这样的价格屠夫在,咱们不用担心用不起。可是哪一天DeepSeek这样浓眉大眼的也背叛革命了,我们还是要留一手的。其实很好搭配,就是Hermes躲开几个Profile,脏活累活的,启动本地Qwen3.6 27B,需要高逼格的,启动云端API,这样可以大大降低账单压力。最主要的是,自主权在自己手里,你可以决定什么业务上云,什么业务不上云。

    而且有了本地模型,你完全可以做到日常指令用Qwen执行,特定需求比如编程、写作,调用在线AI。而且别忘了,本地还有ComfyUI生态,AI音视频画图都能搞,多买一张显卡,本地业务闭环,还是很值得折腾下的。

    油管:https://www.youtube.com/@抡锤者

    1 条回复 最后回复
    1
    • terryT 离线
      terryT 离线
      terry
      超级版主
      编写于 最后由 编辑
      #2

      视频地址:https://youtu.be/_j1D1dscqaE

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0
      • benton yiB 离线
        benton yiB 离线
        benton yi
        德高望重
        编写于 最后由 编辑
        #3

        哈哈哈,老特开始出视频的对应图文帖了。

        想到自己当初也是很热衷于搞SGLang部署qwen3.6-27b,怎奈明星模型3.6-27b横空出世的节骨眼SGLang更新没那么快跟上,导致不管怎么调参输出都是乱码,就说放一放,这一放就再也没拿起来过。

        想想和自己的性格有关,上班时候的午饭大多就是离得近的西部马华牛肉面,味道不错量足干净,只要它没背叛我就不会换别家的,牙膏香皂洗发水也是,自认为在给自己节省筛选和试错成本。vLLM在当时更新很快,对qwen3.6支持得不错,选型期接住了qwen3.6的一波流量,就自然而然用了vLLM(多agent并行至少是比ollama强多了),到现在都很稳定也就不想换了。据我以点盖面的不客观观察,vLLM确实对模型的更新跟进更卷一些,好像也更重视中文社区一点,除了版本号vLLM更激进之外,小红书的官方账号粉丝也是vLLM比SGLang多了快一倍。所以,目前话筒继续还是留在vLLM这里吧,等万一vLLM犯了致命错误再考虑要不要给SGLang一个机会。

        1 条回复 最后回复
        0

        你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

        厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

        有了你的建议,这篇帖子会更精彩哦 💗

        注册 登录
        回复
        • 在新帖中回复
        登录后回复
        • 从旧到新
        • 从新到旧
        • 最多赞同


        • 登录

        • 没有帐号? 注册

        • 登录或注册以进行搜索。
        • 第一个帖子
          最后一个帖子
        0
        • 版块
        • 最新
        • 标签
        • 热门
        • 用户
        • 群组