-
工具循环和上下文暴涨,其实是同一个机制的两面,分开说:
1. 为什么 35B 在 Hermes 里容易工具循环,DSH 很少
- Hermes 是通用 agent 框架:每轮请求都注入完整工具 schema + 技能库列表 + 持久记忆。工具定义越复杂,35B 这个体量的模型对"什么时候该停"的把握越弱,容易一轮轮继续发 tool_calls——不是模型坏了,是对 stop 条件的指令遵循不够。
- DSH 是 DeepSeek 官方 harness,工具调用格式和自家模型训练时对齐的那套完全一致,schema 也精简,模型很少误判"还要继续调工具"。这是专用 harness 对通用框架的天然优势,不是谁比谁"有前途",是适用场景不同。
- 论坛里 27B 跑 agent 的实录也有类似现象(TID:1279),agent 多步任务对指令遵循要求高,本地小模型最容易在工具循环上露怯。
2. 更新后上下文蹭蹭涨 + 响应变慢的原因
上下文的构成 = 系统提示词(含技能库全列表,技能越多越长)+ 持久记忆 + 完整会话历史 + 每轮工具结果。更新后最常见的变化:- 技能/工具变多 → 每轮基础注入量变大;
- 工具循环放大:每调一次工具就把整个历史重发一遍,循环 5 次 = 5 份历史,上下文是乘法增长不是加法。
- 上下文一长,prefill 变长,本地模型每 token 也变慢;35B 在长上下文下 prefill 是主要延迟来源,KV 超显存 spill 到内存更明显。
3. 能立刻做的
/compress手动压缩,或/new开新会话(最直接);- 关掉用不上的技能(技能列表每轮都注入,库越大越贵);
- 精简持久记忆;
- 更新后跑一下
hermes doctor和hermes config check,看 context_length、压缩阈值有没有被新默认值覆盖; - 真跑多步 agent 任务,要么在 prompt 里给 35B 明确"能直接回答就别调工具",要么 agent 循环交给更强的模型。
一句话:DSH 省上下文是 harness 对齐模型的功劳;Hermes 这边上下文涨得快,先查技能库大小和工具循环,这两个是最大头。
-
之前使用HERMES的时候,35B经常会出现工具循环调用,但是DSH就很少出现,而且上下文涨得很慢,未来可期啊
PS最近将HERMES更新了,更新之后上下文蹭蹭的涨,响应感觉也慢了许多,大家有感觉到吗? -
@terry 有不少这种二手倒爷,没啥刷子,拿着agent去改个skill就上去了。参差不齐。官方的插件的这个模式,应该志不在此。再等等吧。 梁请来了自己的老师。不知道会咋样发展。 期待。
-
@sirwang DSH会成为史上第一harness,这个大概率发生,模型开源,harness开源,都很强大,而且效率高,便宜。源代码一发布,就看出来架构设计顶级,代码质量顶级,这个是硬实力。
-
他们搞万物皆插件 不就是想把生态炒热 估计过一段时间 插件出现分层就好了 对于核心 目前没想法 昨天晚上gpt订阅不够 用v4 pro写了会rust 一言难尽 体感白天和晚上质量差距还挺大的
-
@vosrock 发个测试帖子呢?详细点说下它能干嘛?能编程吗?
编程挺强的,我写一句话:生成网页版3D射击游戏。第一轮页面黑屏,然后告诉它黑屏了并将网页控制台的出错信息给他,第二轮就通过了,画面和玩法都很不错,
第二句话是:在新建目录中生成简易版的PUBG。经过几轮的修复,居然也能玩!巨大的开放式地图,载具,武器系统,篮圈缩小机制,虽然比较简陋,也算是个挺复杂的项目了
正式的项目还没敢上。
用它接入35B出现死循环的几率和用HERMES接入27B差不多,几率大大减小,而且DSH它自己就会恢复,这就让35B真的具备修BUG的能力了,不会像用HERMES调用35B那样BUG越修越多 -
hermes和openClaw逐渐势微,主要还是二者的核心竞争力(龙虾是子agent、agent团队、蜂群,hermes是跨session记忆、自动梳理skill)要么被各个大厂的harness内化,要么被强大的模型能力直接碾压,要么是被证伪。
deepseek harness的爆火,主要核心还是deepseek这个品牌的带动。
其实他这个理念,和Pi没什么不同。就是纯的品牌优势,这个其他竞品羡慕不来。 -
-
@vosrock 故事讲得好。在此之前都是专业垂类Agent,几乎没有日常Agent这个概念。即便有也是向coze这种固定工作流。
而且又有“子Agent专家”这种类人类组织结构的表述。让外行也能一目了然。感觉非常专业。
再加上这种全行业Agent,符合当时跟进的数据中心急于卖铲子的核心利益诉求。
相当于是用户侧和供给侧都踩中了节奏。
btw:Pi就是openClaw的coding core,所以历史总是在无限循环。
@vosrock 故事讲得好。在此之前都是专业垂类Agent,几乎没有日常Agent这个概念。即便有也是向coze这种固定工作流。
而且又有“子Agent专家”这种类人类组织结构的表述。让外行也能一目了然。感觉非常专业。
再加上这种全行业Agent,符合当时跟进的数据中心急于卖铲子的核心利益诉求。
相当于是用户侧和供给侧都踩中了节奏。
btw:Pi就是openClaw的coding core,所以历史总是在无限循环。
咦?自动回贴吗,您后面几句好浓厚的AI味道啊,哈哈
我现在正在让他写长剧本,不知道是不是我提示词写得比以前好了,还是DSH真的牛,以前这种一句话的任务,开头10集还能凑够字数,到10集后基本一句话就5集过去了,现在看了前面60集的脚本,竟然没缩水,逻辑也是没问题,事件也正常节奏推进,真要挑毛病就是对白简单了点,不过我的要求也没说到那么具体。 -
我一直没使用。插件是一种依赖。
结局其实是程序员的彻底消失而已。
这个结论很多人都演算的出来。 -
哎,还是不行,不知道是什么问题,第一次运行开始是好好的,后来可能是跑顺了,一下子开了10个子代理,本地大模型只有一个槽位,于是显卡疯狂转动一下午,点开看所有字代理都在工作,我以为死循环了,于是直接重启了DSH,结果发现它写了全部的大纲,但是后来写着写着,写大纲就变成写脚本了,而且写了有200多集的脚本,我抽着看了几集,写的还可以呢,对白也不算机械
可能我不管它让他跑一晚上说不定真的能够完成这个任务
但是我重新开始这个任务,这个时候就乱七八糟了,对白也不停的重复,机械感十足,再也无法重现第一次的结果了,DSH好像自己写了一个SKILL,怎么就越用越差了 -
,
T terry 将此主题从 随便聊聊 移至此处