跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. AI Agent
  4. Qwen3.8 27B本地实测:Q4/Q5/FP8多种量化,SGLang与llama.cpp跨平台体验。DeepSeek涨价,云端API不可靠,本地AI Agent部署走起!

Qwen3.8 27B本地实测:Q4/Q5/FP8多种量化,SGLang与llama.cpp跨平台体验。DeepSeek涨价,云端API不可靠,本地AI Agent部署走起!

已定时 已固定 已锁定 已移动 AI Agent
qwen-27bllama.cpp量化
2 帖子 1 发布者 155 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT 在线
    terryT 在线
    terry
    超级版主
    编写于 最后由 编辑
    #1

    有将近两天没有编程,主要是把英语频道更新了一下。两个英语频道因为有四五天都没更新了,我就把它们更新了一下,然后又把老特说那个频道更新了一下。还做了一次直播,就是在调试摄像头的时候被观众看到了,然后临时直播了一次,跟朋友们吹牛逼。

    今天上来之后我就开始尝试继续任务,结果服务没配好,试了很多次,试了很长时间才把它弄好。接着我就开始开发了,主力模型选的是千问3.8 27B Q4_K_M版本,Q5_K_M我也测过了。由于差距太小,体验不出来,我就直接把Q5的模型权重都给删了,不用它了。

    每一个问题,我测完之后,比如说先用Q4_K_M测,测完之后换Q5_K_M再继续测。然后我再从llama.cpp换到SGLang,或者从A卡换到N卡。我还测了N卡在FP8,也就是千问3.8 27B FP8权重下的体验。总体上,在我修复论坛Bug的所有任务中,它们的体验没有什么区别。无论你是Q4_K_M还是Q5_K_M,或者说是FP8,或者说是256K上下文还是128K上下文,我个人感觉都是够用的。

    这里我要说一下,如果你用的是Hermes,Hermes是比较吃上下文的,256K是比128K好用的,但是128K也够用。因为你用128K做上下文的话,Hermes会频繁压缩上下文。128K我在Codex上,包括在DeepSeek Harness上,是没有这么频繁遇到的,用起来挺好的。

    Qwen3.8 27b多种量化多平台测试.jpeg

    后面稳定之后,我一次给它提交6个Bug,它花了10分钟时间修复。无论如何,这属于一个长链的开发任务了,不过它依然比较好地完成了,而且128K上下文也是完全够了。

    另外就是有朋友跟我强调,说他要为GPT 5.6 Luna频繁折腾,说是可以用5.6 Ultra去执行任务规划,然后让5.6 Luna来执行具体任务。我讲实话,我觉得没有必要这么折腾。你本地买一张7900 XTX就能搞定的事情,用起来又丝滑,然后噪音也不大,你也不用担心Token数。

    5.6 Luna在编程方面,或者说在这种长链Agent任务上,它比起千问3.8 27B可以说就是智障。而且就算是GPT 5.6 Ultra,它的编程能力也并不比千问3.8 27B强,这个是实话实说。

    你们想一下,GPT我也是订阅了的,剩余额度100%。我不是那么傻,这个东西能用、能省钱,然后我不用它,我跟自己过不去吗?就是我认为用它来省下那点钱,都不值得我去浪费这个时间去折腾。虽然我鼠标点一下,或者执行一个脚本,把接口切换一下,我就能使用这些免费的额度,但是我都不愿意这么去尝试。

    我分析的都是我个人的实际体验,就是我认为没有必要去折腾。

    然后千问3.8 27B跟DeepSeek V4 Flash比起来如何?如果说是这种Agent长链任务,包括日常管理任务,V4 Flash还是有优势的。这个并不是模型编程能力或者Agent能力的缺陷,而是有些任务,V4 Flash的模型权重就注定了它比千问3.8 27B要更懂一些。

    比如说做字幕提取,其实我在DeepSeek Harness上用27B模型做过,它做的效果就完全不如DeepSeek V4 Flash做出来的效果。它们的思想实际上是差不多的,但是最后做出来的效果就是V4 Flash要更好,一次就能到位。它给我的最终结果,我直接拖进来就能用。

    但这样的差距是可以通过提示词约束的。比如说你给千问3.8 27B下死命令,让它必须去搜索实时新闻,然后把相关的专业名词替换掉,把这些错误修复,它也是能够完成的。差距就是DeepSeek V4 Flash不需要你去给它强调,它自己就能搞定,因为它的知识库本身就能覆盖大部分专业名词。而且说实话,它大部分时候都会自己上网去搜。

    a1f975a3-5517-4c82-a999-de3b4d485a85-image.jpeg

    也就是说,我个人认为,在模型的Agent能力,包括编程能力上,即便是Q4_K_M版本的千问3.8 27B,它的能力跟DeepSeek V4 Flash也是处于同一个水平。差就差在模型的尺寸上,它的知识库是不全的。

    然后关于DeepSeek V4 Pro,我现在用它干什么?就是我要设计一个新的任务,比如说要开发一个APP,我就让它来规划;或者我要去做一个播放器、一个什么剪辑器,我就让它来开发,让它把大的框架定下来。只要大的框架定下来,基本框架跑起来了,剩下来的我就引入千问27B来做。

    我现在也不怎么用DeepSeek V4 Flash了。DeepSeek V4 Flash还是在Telegram上帮我管理论坛,做日常运维维护。论坛这些等级的晋升,然后一些日常的备份、发一些资讯、发一些公告,或者说论坛程序的升级,这些都是小任务。

    昨天OpenAI的服务不是瘫痪了将近一个小时吗?让我想到了很多事情。讲实话,我们还是要在本地搭建一下私有AI,因为像我现在的工作已经完全依赖AI了,没有AI的话,我的工作已经没有办法进行了。

    你说一张7900 XTX,当时我推荐的时候是6000块钱出头,后来降到了5000,现在可能又涨到了7000。就这么点钱,又非常安静,功耗也不高,噪音也不高,给你保修三年,还要什么自行车?能给你干这么多活。都不说去跑MiniMax H3这样的模型了,能有一天驱动主流Agent,而且体验还非常丝滑,这也是最近才发生的事情。

    7900xtx戴尔笔记本显卡坞.jpeg

    像我家里面还有4090 48G,还有几个笔记本、MacBook、Mac mini。它们有的是用来跑Agent,有的是用来剪辑视频。然后我的4060 Ti显卡坞也可以用来做备份。

    如果说忽然之间GPT不向我们中国用户提供服务了,那你本地有一个备份服务不是挺好的吗?然后我们不要以为国产API就能够一直稳定。比如说DeepSeek,它忽然间涨价了,很多人用起来就肉疼了。那你本地有一个备份,是不是你的工作流不至于有大的变动?

    而且说实话,一个关键的就是,我之前在测千问3.6 27B的时候反复给大家强调,千问3.6 27B在当时已经非常智能了,在SGLang的驱动下,它的体验就非常好了。只不过当时3.6还没有现在3.8这么牛逼,而且当时你必须要用SGLang。当时用llama.cpp,尤其是用AMD显卡,那简直就是灾难。

    但是你用SGLang的开销又非常高。SGLang里没有48G的显存,你是玩不转的。就32G的5090,你玩起来相对而言都是比较勉强的。因为Q4_K_M量化版本的权重本身就16G、17G,系统开销4G左右,那就21G、22G左右。你还要KV缓存,还要再占用一部分。这个缓存本身跑起来就得占用一部分显存,留给KV缓存的也就是8、9G,10G不到。

    你多开就不可能了,发挥不了5090这张卡这么大的优势。A卡就更不用说了,像7900 XTX,SGLang就跑不起来,AI PRO R9700跑起来比较勉强。

    最近由于Vulkan驱动的大更新,由于MTP技术的流行,由于llama.cpp把这两个改动都继承进去了。llama.cpp就是非常轻量级、资源开销极小、有手就会用的这么一个推理框架。那么现在个人本地驱动Agent的门槛就大大降低了。

    甚至我都建议,如果现在你想要入门AI的话,你就去买两张7900 XTX。一张跑千问3.8 27B,另外一张用来跑视频模型。或者说你不跑视频模型的时候,就用另外一张也跑一个千问3.8 27B模型,驱动一些小的日常指令。

    因为7900 XTX的24G显存不足以驱动Agent的长上下文多开,会话多开它是扛不住的。两张卡按照现在的价格加起来一万三四,再加上洋垃圾平台,我们算上硬盘、电源、内存、CPU,3000块钱,那么一万七八千块钱就可以在本地打造一个相对比较安静的家庭智能中心,你就有了一个强大的AI助手。

    最重要的是什么?3.8 27B现在已经有的能力,就可以完成非常重的任务了。将来哪怕它不升级了、不改进了,你现在把这个生产力锁定住,它也能在未来几年帮你干很多活。

    当然了,我相信阿里巴巴是不可能放弃27B这个黄金模型的,因为这一块的战争已经结束了。像谷歌的Gemma,Meta的Llama,这些国外大厂30B左右黄金尺寸的模型,已经被阿里巴巴打得可以说是溃不成军了。它们已经失去了竞争力,事实上退出了竞争。现在千问3.8 27B就是这个黄金标准,所以说我认为它未来一定还会持续开发。

    另外一个就是,我们要看到DeepSeek已经退出了小尺寸模型的竞争。它现在主打的就是300B级别的,要么就是1T以上的这种大参数MoE模型。

    总之,这个时候我们下定决心在本地部署自己的私有助手。当然在线API我们也不是说完全不用,还是要把它用起来。只不过我们有了自己的本地助手之后,在线的用量就可以控制了。

    以前涨价之前,大概一天花个两块钱、一块多钱。现在稍微做点事情,五六块钱就没了。昨天是完全没做事,就是它给我维护论坛,我就配了一次脚本,并且工作量也不是很大,昨天就花了八块钱。

    这点钱是不值得我们劳心费力的,但是如果说你用它做事,每天有40块钱、50块钱、60块钱的开销,那你一个月2000多块钱的开销就不低了。一年下来,你就能买一张非常不错的显卡了。

    DeepSeek API 开销

    更重要的是,本地我们是可以下载很多无审查版本的,也是可以完全自由创作的。比如说你对现在有些剧情不太满意,想要打造属于自己的私密剧情,你用MiniMax H3就能搞得定。但是你写稿子的时候,总得有一个愿意打破审查的AI来帮你写稿子。你要把岛国的爱情故事剧本发到DeepSeek上面,发到任何平台都不会让你生成。当然马斯克的AI可能会帮你生成,不过它也是有尺度的。

    然后我还有一个没有测,就是等一会儿把视频录完之后,我要去测一下SpBit量化版本的权重在SGLang底下的表现。如果说它表现好的话,那么我在SGLang底下就可以多开,我也就不用去买第二张7900 XTX了。

    因为我现在生成视频并不是一个时时刻刻要执行的任务,一天可能就跑那么一个小时不到,把这个事情搞完,剩下来这张4090 48G就空出来了,我就不如让它多开。

    到时候我会在新的视频中跟大家分享。好的,本期视频就到这里,我们下期再见。

    油管:https://www.youtube.com/@抡锤者

    1 条回复 最后回复
    1
    • terryT 在线
      terryT 在线
      terry
      超级版主
      编写于 最后由 编辑
      #2

      Youtube Video

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0

      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

      有了你的建议,这篇帖子会更精彩哦 💗

      注册 登录
      回复
      • 在新帖中回复
      登录后回复
      • 从旧到新
      • 从新到旧
      • 最多赞同


      • 登录

      • 登录或注册以进行搜索。
      • 第一个帖子
        最后一个帖子
      0
      • 版块
      • 最新
      • 标签
      • 热门
      • 用户
      • 群组