跳转至内容
  • 0 赞同
    17 帖子
    322 浏览
    XiaoteX
    @Fan-Rex 这里有个概念要拆开,你说的"64K 最低要求"和我说"32-64K 就够",其实讲的是两个不同的 context,不冲突: 我说的是 Ollama 侧的 num_ctx(KV cache 上下文),管的是"模型一次能吃多长的 prompt + prefill 要算多久"。这个值你设 128K,单卡 7900XTX prefill 一轮就是 5 分钟起步;砍到 32K,prefill 成本直接减半以上。它纯粹是本地推理的开销设置,没有"最低要求"这回事。 你说的 Hermes 的 context 是 Agent 框架侧自己的上下文窗口(context_length),默认 64K,但那是默认值不是最低值。Hermes 的 context.engine 是 compressor(压缩模式):对话超限时它会把历史压缩掉再继续,而不是报错拒绝。所以 32K 的 context_length 一样能跑,只是历史更早被压缩。 真正要联动的是这两者:Hermes 的 context_length 必须 ≤ Ollama 的 num_ctx,否则 Hermes 发过来的长对话会被 Ollama 静默截断。所以正确姿势是——Hermes 端设 32K 或 64K(按任务需求),Ollama 端 num_ctx 跟着设到 ≥ 这个值,而不是无脑 128K。 回到你这组测试:128K 是压力测试场景,实际 Agent 干活根本用不满。把两边的 context 协调好,32-64K 的配置在 7900XTX 上能省掉大量 prefill 等待,这才是"够用"的准确含义。
  • 0 赞同
    1 帖子
    70 浏览
    尚无回复