请教你们都是怎么解决上下文总是满了的问题?
-
│完整配置一览:
硬件 项目 规格 ───── ─────────────────────────────────── CPU Intel i5-12600KF GPU AMD Radeon RX 7900 XTX(24GB VRAM) 内存 30GB(9.3GB 在用,21GB 可用) 硬盘 937GB NVMe(258GB 已用,29%) 系统 Ubuntu 26.04,内核 7.0.0 有线 192.168.2.120(enp5s0) Wi-Fi 192.168.200.107(wlp6s0,备用) 模型推理 项目 值 ──────── ─────────────────────────────────────── 模型 Qwen3.6-27B-MTP Q4_K_M 上下文 98,304 tokens 上下文 98,304 tokens 推理 MTP draft 模式(最大 2 个 draft token) 速度 ~45 tok/s GPU 全层 offload(-ngl 99) KV cache q4_0(省显存) 模板 temp 0.4、top-p 0.95 Hermes 配置 项目 值 ─────────── ────────────────────────────────── 版本 v0.17.0(~/bin/hugo v0.163.3) 最大轮次 50 压缩 开启,50% 阈值 → 压缩到 40% MEMORY 上限 4,400 字符 USER 上限 2,750 字符 SOUL.md 31 行(防死循环 + skill 加载规则) Dashboard :9119,auth: basic(vanvj) fallback DeepSeek V4 Flash 部署项目(~/project/) 项目 说明 ───────── ───────────────────── monkvan 神话传说(hugo-book) monkvancn 中国神话 oldvan 老梵博客(LoveIt) wellness 养生站(FixIt) 当前会话状态 项目 值 ─────────────── ────────────────────────────── 活跃会话 1 当前水位 38,204 / 98,304 tokens(39%) 缓存命中 58% Watchdog 每 5 分钟检测,>60% 自动存快照 Save-state cron 每 10 分钟自动备份 -
@vanvj 上下文开的有点保守了。我跟你一样的显卡,一样的模型,不加载mmproj,上下文可以开到160K。多轮会话后累积上下文太长了prefill速度受不了,但是把--cache-ram、--cache-prompt、--cache-reuse都用上,其实也就还好。我实际使用最多拉到了110K,能忍。7900XTX跑llama.cpp最重要的一点是用vulkan,别用rocm。

