跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. 请教你们都是怎么解决上下文总是满了的问题?

请教你们都是怎么解决上下文总是满了的问题?

已定时 已固定 已锁定 已移动 LLM讨论区
本地模型
22 帖子 11 发布者 821 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • M mark

    32G内存 稍微, 有点小了. 64G吧

    S 离线
    S 离线
    sarcoma
    发表于 最后由 编辑
    #7

    @mark 纯GPU推理,需要这么大的RAM么?好奇😯

    1 条回复 最后回复
    0
    • M 离线
      M 离线
      mark
      超凡大师
      发表于 最后由 编辑
      #8

      kv cache 知道吗?

      S 1 条回复 最后回复
      1
      • 怪 离线
        怪 离线
        怪叔叔
        发表于 最后由 编辑
        #9

        还会有同一个session下命令调用次数得限制吧。不过这个配置文件里可以改大

        V 1 条回复 最后回复
        0
        • M mark

          32G内存 稍微, 有点小了. 64G吧

          V 离线
          V 离线
          vanvj
          发表于 最后由 编辑
          #10

          @mark 主板买的早,DDR5的内存,确实想再买32G添上去,不过还好开始降价了,再等等吧。

          1 条回复 最后回复
          0
          • 怪 怪叔叔

            还会有同一个session下命令调用次数得限制吧。不过这个配置文件里可以改大

            V 离线
            V 离线
            vanvj
            发表于 最后由 编辑
            #11

            @怪叔叔 这个有调整,其实是无数次死循环后,被迫改的,加了不少规则,确实不容易死了,但上下文平均增加了一点点。

            1 条回复 最后回复
            0
            • M mark

              kv cache 知道吗?

              S 离线
              S 离线
              sarcoma
              发表于 最后由 sarcoma 编辑
              #12

              @mark kv cache放VRAM里就行了啊 放内存慢

              1 条回复 最后回复
              0
              • BunseiB 离线
                BunseiB 离线
                Bunsei
                发表于 最后由 编辑
                #13

                只能压缩咯,对我来说在上下文>32K的时候,prefill速度我就已经无法接受了。(R9700)

                1 条回复 最后回复
                0
                • V vanvj

                  │完整配置一览:

                  硬件                                                                                                                                                                  
                                                                                                                                                                                        
                    项目   规格                                                                                                                                                         
                    ─────  ───────────────────────────────────                                                                                                                          
                    CPU    Intel i5-12600KF                                                                                                                                             
                    GPU    AMD Radeon RX 7900 XTX(24GB VRAM)                                                                                                                          
                    内存   30GB(9.3GB 在用,21GB 可用)                                                                                                                                
                    硬盘   937GB NVMe(258GB 已用,29%)                                                                                                                                
                    系统   Ubuntu 26.04,内核 7.0.0                                                                                                                                     
                    有线   192.168.2.120(enp5s0)                                                                                                                                      
                    Wi-Fi  192.168.200.107(wlp6s0,备用)                                                                                                                              
                                                                                                                                                                                        
                  模型推理                                                                                                                                                              
                                                                                                                                                                                        
                    项目      值                                                                                                                                                        
                    ────────  ───────────────────────────────────────                                                                                                                   
                    模型      Qwen3.6-27B-MTP Q4_K_M                                                                                                                                    
                    上下文    98,304 tokens                                                                                                                                             
                    上下文    98,304 tokens                                                                                                                                             
                    推理      MTP draft 模式(最大 2 个 draft token)                                                                                                                   
                    速度      ~45 tok/s                                                                                                                                                 
                    GPU       全层 offload(-ngl 99)                                                                                                                                   
                    KV cache  q4_0(省显存)                                                                                                                                            
                    模板      temp 0.4、top-p 0.95                                                                                                                                      
                                                                                                                                                                                        
                  Hermes 配置                                                                                                                                                           
                                                                                                                                                                                        
                    项目         值                                                                                                                                                     
                    ───────────  ──────────────────────────────────                                                                                                                     
                    版本         v0.17.0(~/bin/hugo v0.163.3)                                                                                                                         
                    最大轮次     50                                                                                                                                                     
                    压缩         开启,50% 阈值 → 压缩到 40%                                                                                                                            
                    MEMORY 上限  4,400 字符                                                                                                                                             
                    USER 上限    2,750 字符                                                                                                                                             
                    SOUL.md      31 行(防死循环 + skill 加载规则)                                                                                                                     
                    Dashboard    :9119,auth: basic(vanvj)                                                                                                                            
                    fallback     DeepSeek V4 Flash                                                                                                                                      
                                                                                                                                                                                        
                  部署项目(~/project/)                                                                                                                                                
                                                                                                                                                                                        
                    项目       说明                                                                                                                                                     
                    ─────────  ─────────────────────                                                                                                                                    
                    monkvan    神话传说(hugo-book)                                                                                                                                    
                    monkvancn  中国神话                                                                                                                                                 
                    oldvan     老梵博客(LoveIt)                                                                                                                                       
                    wellness   养生站(FixIt)                                                                                                                                          
                                                                                                                                                                                        
                  当前会话状态                                                                                                                                                          
                                                                                                                                                                                        
                    项目             值                                                                                                                                                 
                    ───────────────  ──────────────────────────────                                                                                                                     
                    活跃会话         1                                                                                                                                                  
                    当前水位         38,204 / 98,304 tokens(39%)                                                                                                                      
                    缓存命中         58%                                                                                                                                                
                    Watchdog         每 5 分钟检测,>60% 自动存快照                                                                                                                     
                    Save-state cron  每 10 分钟自动备份
                  
                  Dan XiaD 离线
                  Dan XiaD 离线
                  Dan Xia
                  编写于 最后由 编辑
                  #14

                  @vanvj 上下文开的有点保守了。我跟你一样的显卡,一样的模型,不加载mmproj,上下文可以开到160K。多轮会话后累积上下文太长了prefill速度受不了,但是把--cache-ram、--cache-prompt、--cache-reuse都用上,其实也就还好。我实际使用最多拉到了110K,能忍。7900XTX跑llama.cpp最重要的一点是用vulkan,别用rocm。1c604772-da5a-4598-84b5-f7d951f52012-image.jpeg

                  terryT 1 条回复 最后回复
                  1
                  • Dan XiaD Dan Xia

                    @vanvj 上下文开的有点保守了。我跟你一样的显卡,一样的模型,不加载mmproj,上下文可以开到160K。多轮会话后累积上下文太长了prefill速度受不了,但是把--cache-ram、--cache-prompt、--cache-reuse都用上,其实也就还好。我实际使用最多拉到了110K,能忍。7900XTX跑llama.cpp最重要的一点是用vulkan,别用rocm。1c604772-da5a-4598-84b5-f7d951f52012-image.jpeg

                    terryT 离线
                    terryT 离线
                    terry
                    超级版主
                    编写于 最后由 编辑
                    #15

                    @Dan-Xia 这是个很有含金量的分享。

                    油管:https://www.youtube.com/@抡锤者

                    1 条回复 最后回复
                    0
                    • stxpnetS 离线
                      stxpnetS 离线
                      stxpnet
                      超凡大师
                      编写于 最后由 编辑
                      #16

                      目前只能盯着,长上下文 中长程任务应该是大家共同的目标吧? 我目前168K上下文,到100K就不想继续了,掉速非常严重

                      26-08-19
                      双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
                      8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

                      terryT 1 条回复 最后回复
                      0
                      • V 离线
                        V 离线
                        vanvj
                        编写于 最后由 编辑
                        #17

                        对比结果:

                        | 指标      | Vulkan                  | ROCm                     | 差异           |
                        |-----------|-------------------------|--------------------------|----------------|
                        | 生成速度  | 40.6 t/s (362 tok/8.9s) | 29.9 t/s (402 tok/13.4s) | Vulkan 快 36%  |
                        | 首 token  | ~1.1s                   | ~1.5s                    | Vulkan 稍快    |
                        | VRAM 占用 | 84%                     | 88-90%                   | Vulkan 省 4-6% |
                        | 温度/功耗 | 待测                    | 待测                     | -              |
                        
                        Vulkan(RADV)在 RX 7900 XTX 上比 ROCm 快 36%,而且 VRAM 占用更低。确实符合预期——RADV Vulkan 驱动在 RDNA3 上的优化现在比 ROCm 的 HIP 后端更好。
                        
                        1 条回复 最后回复
                        2
                        • stxpnetS stxpnet

                          目前只能盯着,长上下文 中长程任务应该是大家共同的目标吧? 我目前168K上下文,到100K就不想继续了,掉速非常严重

                          terryT 离线
                          terryT 离线
                          terry
                          超级版主
                          编写于 最后由 编辑
                          #18

                          @stxpnet 是的,物理解决,没有什么任务需要聊这么久,如果有,就换在线的。

                          油管:https://www.youtube.com/@抡锤者

                          1 条回复 最后回复
                          0
                          • stxpnetS 离线
                            stxpnetS 离线
                            stxpnet
                            超凡大师
                            编写于 最后由 stxpnet 编辑
                            #19

                            5596b7e4-62c3-4464-bfe9-8093bbc4311b-image.jpeg

                            土方法,但有效,让它总结,然后复制总结的MD文件,在下一个干净会话里面开启新征程

                            26-08-19
                            双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
                            8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

                            kos orK 1 条回复 最后回复
                            1
                            • stxpnetS 离线
                              stxpnetS 离线
                              stxpnet
                              超凡大师
                              编写于 最后由 编辑
                              #20

                              5d445bb4-41ca-40c7-af15-327de5cacd55-image.jpeg
                              不用等它自己进化,也可以引导它进行一些进化

                              26-08-19
                              双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
                              8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

                              1 条回复 最后回复
                              1
                              • stxpnetS 离线
                                stxpnetS 离线
                                stxpnet
                                超凡大师
                                编写于 最后由 stxpnet 编辑
                                #21

                                af41649f-f0f1-4d26-8970-8a26a3ccd718-image.jpeg
                                就这样,如果后续有时间就一键继续,如果没时间就放到笔记里面晾着,或者直接让HERMES记录到TODO,到点提醒

                                26-08-19
                                双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
                                8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

                                1 条回复 最后回复
                                0
                                • stxpnetS stxpnet

                                  5596b7e4-62c3-4464-bfe9-8093bbc4311b-image.jpeg

                                  土方法,但有效,让它总结,然后复制总结的MD文件,在下一个干净会话里面开启新征程

                                  kos orK 在线
                                  kos orK 在线
                                  kos or
                                  技术大牛 劳动模范
                                  编写于 最后由 编辑
                                  #22

                                  @stxpnet

                                  handoff 一氣呵成 讚讚 🙂

                                  1 条回复 最后回复
                                  0

                                  你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                  厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                  有了你的建议,这篇帖子会更精彩哦 💗

                                  注册 登录
                                  回复
                                  • 在新帖中回复
                                  登录后回复
                                  • 从旧到新
                                  • 从新到旧
                                  • 最多赞同


                                  • 登录

                                  • 登录或注册以进行搜索。
                                  • 第一个帖子
                                    最后一个帖子
                                  0
                                  • 版块
                                  • 最新
                                  • 标签
                                  • 热门
                                  • 用户
                                  • 群组