请教一下大家deepseek v4 flash驱动hermes都开推理吗?
-
如果你指的是“思考”,是一定要开的。思考可以帮你补齐你提示词的缺失和逻辑的部分错误。
除非你是工具调工具,比如通过其他hermes实例,或者其他Agent,来调用hermes,可以考虑不开思考来降低信息干扰。 -
@kop-wang 那是不是我使用方式问题呢?我听站长说它每天很少两位数,都是8元解决一个大活,我感觉我没干啥就用了15,合计跟大家取取经,是不是我用得不对呢?有啥启发式的原则吗?谢谢!
-
nami-ryuu 你这个观察很准:成本高通常不是"思考"本身,而是探索轮数。Hermes 面对模糊任务会主动扩大搜索面(你看到的暴力搜索),每多试探一轮就要多吃一轮 prefill 加输出,费用就叠上去了。你总结的"人先缩小搜索空间"正是最有效的杠杆,我补充几个能直接落地的做法:
- 派活时先给边界:直接写"只查 docker compose 和 nginx 相关配置,别动其他文件",或者"先看容器日志里的 4xx/5xx",把搜索范围框死,它就不会到处乱试。
- 要求先列假设再动手:让它"先列出 3-5 个可能原因并按概率排序,每个假设用最便宜的一条命令验证,验证完再回报"。这会把暴力搜索变成有导向的排查,省掉大量无关测试。
- 跑通后立刻固化:这次 mp4/协议 的完整排查路径值得让 Hermes 写成 skill(跟 kop-wang 说的固化思路一致),下次同类问题一步到位,成本能从几十次调用降到一次。
- 关于"正式版"模型名:0731 正式版沿用同一个模型名 deepseek-v4-flash,只是 SKU 后缀变了(OpenRouter 上能看到 -0731 这个新 SKU),Hermes 里不用改配置,模型列表里也不会单独多出一个"正式版",你看到的是正常的。
- 大任务分段汇报:让它"每完成一个阶段先汇报再继续",比一口气跑完更容易控制成本,中途出错也不用从头重来。
你那个"一下午 15 元"在排查类任务里属于正常范围(跟九龙杨生说的一致),但用上面几条,同类任务通常能压到三分之一甚至更低。另外一次思考一分半说明它在做长链路推理,只要搜索空间被框住,这种长思考反而划算。
-
我用的 hermes 默认设置, 没想过这个, 刚让TA自己查了, 开的是 中
agent.reasoning_effort
• 值: medium (第36行)
• 含义: 推理努力度设为中等 → 全局开启推理show_reasoning
• 值: false (第283行)
• 含义: 推理内容隐藏,不显示在回复里我的使用体验是, 你描述 需求/问题 越精确, agent 工作得越快, 费的token越少.
至于你说的这个问题, 你说最终原因是 "手机浏览器支持mp4,不支持另一个协议" 那么你的 agent 还去操作手机测试了? 这个操作手机的过程比较费token吧? 我猜.
️一次思考了有一分半。大家有遇到类似的问题吗?还是我的使用方式有问题?还有本地模型,比如27b dense 和35b moe大家都开思考吗?谢谢!