跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI Agent
  4. 一天消耗了80M的deepseek token

一天消耗了80M的deepseek token

已定时 已固定 已锁定 已移动 AI Agent
deepseek
15 帖子 4 发布者 534 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Hudson WongH 离线
    Hudson WongH 离线
    Hudson Wong
    发表于 最后由 编辑
    #1

    99045ebf-4dd6-40e1-8630-1970849c01f0-image.jpeg

    大家好,我是hudson, 马来西亚的哥们。
    我自己搭建了hermes agent, 用deepseek v4 flash,
    我其实只是普通用来上网,聊聊天,也不是跑什么赚钱项目。
    不过那个token消耗的有些吓人。
    想问问哥们有什么建议优化,和有什么设定呢?

    我叫hermes 自己总结

    注意:这是关工具集之前的旧dump!关掉browser/vision/tts/image_gen/computer_use后,现在的工具数应该是71-12=约59个。

    以下是完整的数据结构说明:


    1️⃣ System Prompt
    大小约 23K chars,结构如下:

    ┌─ 核心身份 ~200 chars
    │ "You are Hermes Agent, an intelligent AI assistant..."
    ├─ 文档指引 ~200 chars
    │ "Documentation at https://hermes-agent.nousresearch.com/docs"
    ├─ 行为规则 ~600 chars
    │ # Finishing the job — 必须执行到出结果
    │ # Parallel tool calls — 独立操作并行调用
    ├─ 记忆规则 ~400 chars
    │ "Save durable facts using memory tool..."
    ├─ 工具使用规则 ~500 chars
    │ "You MUST use your tools to take action..."
    ├─ Skills索引 ~所有skill名前57字 ~1-2K chars
    ├─ Mnemosyne Context ~注入的记忆 ~1-5K chars
    ├─ User Profile ~注入的用户设定 ~1.3K chars
    └─ 平台格式说明 ~200 chars
    Telegram/Markdown格式等

    2️⃣ Tool Schema(旧版71个,关掉后约59个)
    每个工具 = 函数名 + 描述 + JSON Schema(参数名 + 类型 + 描述 + 是否必填)

    分类:
    Web (search+extract)
    • 工具数: 2
    • 占用tokens约: ~400
    Terminal+Process
    • 工具数: 2
    • 占用tokens约: ~600
    File (read/write/patch/search)
    • 工具数: 4
    • 占用tokens约: ~800
    Browser 🌐 (旧有11个,现关)
    • 工具数: ~11
    • 占用tokens约: ~2,500
    Computer_use 🖱️ (旧有1个,现关)
    • 工具数: 1
    • 占用tokens约: ~1,500
    Vision 👁️ (旧有1个,现关)
    • 工具数: 1
    • 占用tokens约: ~500
    Image_gen 🎨 (旧有1个,现关)
    • 工具数: 1
    • 占用tokens约: ~400
    TTS 🔊 (旧有1个,现关)
    • 工具数: 1
    • 占用tokens约: ~400

    Skills (list/view/manage)
    • 工具数: 3
    • 占用tokens约: ~500
    Memory (工具)
    • 工具数: 19
    • 占用tokens约: ~3,000
    Session_search
    • 工具数: 1
    • 占用tokens约: ~300
    Clarify
    • 工具数: 1
    • 占用tokens约: ~200
    Execute_code + Delegate
    • 工具数: 2
    • 占用tokens约: ~600
    Cronjob
    • 工具数: 1
    • 占用tokens约: ~600
    Todo
    • 工具数: 1
    • 占用tokens约: ~150
    通用 (patch, write_file等)
    • 工具数: 3
    • 占用tokens约: ~500
    关掉5个工具集后,每轮省约5K tokens✅

    3️⃣ Skills Prompt
    Skills 是按需加载的——系统提示里只有索引(名字+57字简介),完整内容在 skill_view() 时才拉取。


    各位可以给给意见吗。
    先谢了。

    1 条回复 最后回复
    2
    • williamlouisW 离线
      williamlouisW 离线
      williamlouis
      超级版主
      发表于 最后由 编辑
      #2

      省不省主要是看命中率。
      Hermes 如果你生成了 skill 它就不会耗费大量的 tokens
      80M 如果都是非命中的消耗就是正常的。
      你的疑问是什么?
      你给闲聊场景配了全套工程化工具集?
      那就先砍工具、再压提示词、最后管上下文,token 消耗应该能降到现在的 1/5 到 1/10。
      □ 1. 禁用所有非核心工具(目标:≤10 个)
      □ 2. 精简 System Prompt 到 5K 字符以内
      □ 3. Memory 工具合并为 2-3 个
      □ 4. 设置历史消息上限(10-15 轮)
      □ 5. 开启对话摘要机制
      □ 6. 观察 1 天 token 消耗,再决定是否加模型路由。

      个人主页:xlkj.org Telegram https://t.me/xlkjorg

      Hudson WongH 1 条回复 最后回复
      0
      • williamlouisW williamlouis

        省不省主要是看命中率。
        Hermes 如果你生成了 skill 它就不会耗费大量的 tokens
        80M 如果都是非命中的消耗就是正常的。
        你的疑问是什么?
        你给闲聊场景配了全套工程化工具集?
        那就先砍工具、再压提示词、最后管上下文,token 消耗应该能降到现在的 1/5 到 1/10。
        □ 1. 禁用所有非核心工具(目标:≤10 个)
        □ 2. 精简 System Prompt 到 5K 字符以内
        □ 3. Memory 工具合并为 2-3 个
        □ 4. 设置历史消息上限(10-15 轮)
        □ 5. 开启对话摘要机制
        □ 6. 观察 1 天 token 消耗,再决定是否加模型路由。

        Hudson WongH 离线
        Hudson WongH 离线
        Hudson Wong
        发表于 最后由 编辑
        #3

        @williamlouis
        感谢超级版主。
        我觉得就是hermes 把全套玩意都上传了。
        45ca83b1-b5c7-42f6-8292-17db4e0718c9-image.jpeg
        以昨天来说,我请求了2055次api, 100M昨天,问题我只是上网查查资料,总结一下,出于调教环节,都还没有去到生产力环节😖

        Hermes 如果你生成了 skill 它就不会耗费大量的 tokens -
        我这几天就是一直纠结为什么token那么高,改了配置好几次。感觉好像把skill都删除掉了。不懂是不会原因。
        我从星期六到今天已经用了rmb30,而且什么生产力工作都还未做。
        我的目标是让他整理我的书籍,还有定时工作的excel,都还没有发展到那一步。

        我根据超级版主给的建议调整了一下。
        我今天在试看看,之后再update.

        谢谢。

        terryT 1 条回复 最后回复
        0
        • Hudson WongH Hudson Wong

          @williamlouis
          感谢超级版主。
          我觉得就是hermes 把全套玩意都上传了。
          45ca83b1-b5c7-42f6-8292-17db4e0718c9-image.jpeg
          以昨天来说,我请求了2055次api, 100M昨天,问题我只是上网查查资料,总结一下,出于调教环节,都还没有去到生产力环节😖

          Hermes 如果你生成了 skill 它就不会耗费大量的 tokens -
          我这几天就是一直纠结为什么token那么高,改了配置好几次。感觉好像把skill都删除掉了。不懂是不会原因。
          我从星期六到今天已经用了rmb30,而且什么生产力工作都还未做。
          我的目标是让他整理我的书籍,还有定时工作的excel,都还没有发展到那一步。

          我根据超级版主给的建议调整了一下。
          我今天在试看看,之后再update.

          谢谢。

          terryT 在线
          terryT 在线
          terry
          超级版主
          发表于 最后由 编辑
          #4

          @Hudson-Wong 你如果整理书籍,无论如何tokens消耗都高,因为输入很多,而且每次都不同内容,没有缓存命中。这种机械工作建议你使用openrouter上的免费英伟达模型。

          油管:https://www.youtube.com/@抡锤者

          Hudson WongH 1 条回复 最后回复
          0
          • terryT terry

            @Hudson-Wong 你如果整理书籍,无论如何tokens消耗都高,因为输入很多,而且每次都不同内容,没有缓存命中。这种机械工作建议你使用openrouter上的免费英伟达模型。

            Hudson WongH 离线
            Hudson WongH 离线
            Hudson Wong
            发表于 最后由 编辑
            #5

            @terry
            hi 站长,我是你的忠实粉丝,你是我的学习对象。
            你说的很对,类似论坛这种交流模式,是和所谓的on time交流是不一样的。
            可以把事情说清楚。
            虽然我不是AI之类的相关,不过每次看你的视频,让我对事情都有多方位的看法。
            果然是写作高手,捏手就来。

            关于整理书籍
            问题是我都还没有开始处理书籍,可能就处理了1本。
            其他很多时候就是捣鼓那些工具,里面的设定,都觉得很恐怖了。

            顺便一问,我如果把openrouter的免费模型来干这个货呢?
            我一丢给hermes deepseek,他就立刻解析了。

            我自己有一张8gb显卡,想装一个守门员,路由模型,类似qwen 9b之类的,不过站长说过那些模型基本上是智障,所以向问问你我的情况,9b够用吗

            terryT 1 条回复 最后回复
            1
            • Hudson WongH Hudson Wong

              @terry
              hi 站长,我是你的忠实粉丝,你是我的学习对象。
              你说的很对,类似论坛这种交流模式,是和所谓的on time交流是不一样的。
              可以把事情说清楚。
              虽然我不是AI之类的相关,不过每次看你的视频,让我对事情都有多方位的看法。
              果然是写作高手,捏手就来。

              关于整理书籍
              问题是我都还没有开始处理书籍,可能就处理了1本。
              其他很多时候就是捣鼓那些工具,里面的设定,都觉得很恐怖了。

              顺便一问,我如果把openrouter的免费模型来干这个货呢?
              我一丢给hermes deepseek,他就立刻解析了。

              我自己有一张8gb显卡,想装一个守门员,路由模型,类似qwen 9b之类的,不过站长说过那些模型基本上是智障,所以向问问你我的情况,9b够用吗

              terryT 在线
              terryT 在线
              terry
              超级版主
              发表于 最后由 terry 编辑
              #6

              @Hudson-Wong 这些模型都是弱智,没啥用处,不是说了openrouter有免费模型,你让hermes设置,最后估计会给你返回一个120b的模型,那个模型分析文档足够了,其它的不行。

              你需要明白,整理文档需要一定的知识面,最少27b-35b才算基础过关,要有足够长的上下文,最好256k,上下文不够怎么整理。

              另外别动不动就粉别人,都是出来混口饭吃的,信息对你有用你就采纳下,对你没用你就忽视。解答了你就感谢下,没解答不要动气,也感谢下,基本礼貌就行了。

              油管:https://www.youtube.com/@抡锤者

              Hudson WongH 1 条回复 最后回复
              0
              • terryT terry

                @Hudson-Wong 这些模型都是弱智,没啥用处,不是说了openrouter有免费模型,你让hermes设置,最后估计会给你返回一个120b的模型,那个模型分析文档足够了,其它的不行。

                你需要明白,整理文档需要一定的知识面,最少27b-35b才算基础过关,要有足够长的上下文,最好256k,上下文不够怎么整理。

                另外别动不动就粉别人,都是出来混口饭吃的,信息对你有用你就采纳下,对你没用你就忽视。解答了你就感谢下,没解答不要动气,也感谢下,基本礼貌就行了。

                Hudson WongH 离线
                Hudson WongH 离线
                Hudson Wong
                发表于 最后由 编辑
                #7

                @terry
                明白的版主,果然是实在人。

                我尝试下,用groq免费api之类的。我研究下。

                terryT 1 条回复 最后回复
                0
                • Hudson WongH Hudson Wong

                  @terry
                  明白的版主,果然是实在人。

                  我尝试下,用groq免费api之类的。我研究下。

                  terryT 在线
                  terryT 在线
                  terry
                  超级版主
                  发表于 最后由 编辑
                  #8

                  @Hudson-Wong 提了很多次了,你直接使用openrouter上的hermes,它用量足够,你模型够大,groq有很多都是小模型,和弱智没啥区别。

                  油管:https://www.youtube.com/@抡锤者

                  Hudson WongH 1 条回复 最后回复
                  0
                  • terryT terry

                    @Hudson-Wong 提了很多次了,你直接使用openrouter上的hermes,它用量足够,你模型够大,groq有很多都是小模型,和弱智没啥区别。

                    Hudson WongH 离线
                    Hudson WongH 离线
                    Hudson Wong
                    发表于 最后由 编辑
                    #9

                    @terry
                    好的,我openrouter 一直碰到409 error,groq不会,我还以为groq比较好。
                    我i现在就试试看。

                    1 条回复 最后回复
                    0
                    • 九龙杨生九 离线
                      九龙杨生九 离线
                      九龙杨生
                      技术大牛 劳动模范
                      发表于 最后由 编辑
                      #10

                      问题不大,才80M,我最多一天用900多M,量大管饱!!

                      73d4dc5b-db8c-41c4-8e5e-5c4ba080d3a3-image.jpeg

                      欢迎访问亿量科技官网
                      欢迎访问亿量科技油管频道

                      williamlouisW 1 条回复 最后回复
                      0
                      • 九龙杨生九 九龙杨生

                        问题不大,才80M,我最多一天用900多M,量大管饱!!

                        73d4dc5b-db8c-41c4-8e5e-5c4ba080d3a3-image.jpeg

                        williamlouisW 离线
                        williamlouisW 离线
                        williamlouis
                        超级版主
                        发表于 最后由 编辑
                        #11

                        @九龙杨生 你开发卫星了?

                        个人主页:xlkj.org Telegram https://t.me/xlkjorg

                        九龙杨生九 1 条回复 最后回复
                        0
                        • williamlouisW williamlouis

                          @九龙杨生 你开发卫星了?

                          九龙杨生九 离线
                          九龙杨生九 离线
                          九龙杨生
                          技术大牛 劳动模范
                          发表于 最后由 编辑
                          #12

                          @williamlouis 应该是那一天干了比较久,把公司AI方面的模块基本都写出来了

                          欢迎访问亿量科技官网
                          欢迎访问亿量科技油管频道

                          1 条回复 最后回复
                          0
                          • Hudson WongH 离线
                            Hudson WongH 离线
                            Hudson Wong
                            编写于 最后由 编辑
                            #13

                            更新一下我最近情况。

                            之前用openrouter碰壁就是因为没有充值个usd 10,
                            充了进去单日request 可以到1000,就够用了。
                            然后也用agnes 2.5 flash 免费AI

                            现在用小红书的开源dots3, 基本上满足日常需求,
                            不过需要配置东西的时候,也是要deepseek v4 flash才成功

                            terryT 1 条回复 最后回复
                            0
                            • Hudson WongH Hudson Wong

                              更新一下我最近情况。

                              之前用openrouter碰壁就是因为没有充值个usd 10,
                              充了进去单日request 可以到1000,就够用了。
                              然后也用agnes 2.5 flash 免费AI

                              现在用小红书的开源dots3, 基本上满足日常需求,
                              不过需要配置东西的时候,也是要deepseek v4 flash才成功

                              terryT 在线
                              terryT 在线
                              terry
                              超级版主
                              编写于 最后由 编辑
                              #14

                              @Hudson-Wong 免费模型很蠢,尤其英伟达的,和特么智障一样,但是基础运维没问题。

                              油管:https://www.youtube.com/@抡锤者

                              Hudson WongH 1 条回复 最后回复
                              0
                              • terryT terry

                                @Hudson-Wong 免费模型很蠢,尤其英伟达的,和特么智障一样,但是基础运维没问题。

                                Hudson WongH 离线
                                Hudson WongH 离线
                                Hudson Wong
                                编写于 最后由 编辑
                                #15

                                @terry
                                是的,那个Lighting模型很好的演示了,什么叫做很快,不过全错。
                                还有那个ultra 3, 简直愧对了他550b moe的模型。哈哈。
                                希望下次有些国内的好模型可以在openrouter薅薅羊毛。

                                我现在看看小红书的dots3如何,暂时看起来比nemotron聪明。
                                我基本上都是做个人agent,和用来给老婆小孩做做记录等等。

                                1 条回复 最后回复
                                1

                                你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                有了你的建议,这篇帖子会更精彩哦 💗

                                注册 登录
                                回复
                                • 在新帖中回复
                                登录后回复
                                • 从旧到新
                                • 从新到旧
                                • 最多赞同


                                • 登录

                                • 登录或注册以进行搜索。
                                • 第一个帖子
                                  最后一个帖子
                                0
                                • 版块
                                • 最新
                                • 标签
                                • 热门
                                • 用户
                                • 群组