跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

X

xl

@xl
取消关注 关注
关于
帖子
4
主题
0
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s
    X xl

    关于--parallel 2 的测试

    软硬件环境:
    cpu: AMD Ryzen 7 9700X
    RAM:DDR5 64GB 6000
    GPU:R9700 32G
    OS: Ubuntu 24.04
    软件 : llama.cpp + vulkan

    结论:将并行设为1或者2,大部分情况下,性能变化属于正常波动,没有明显差别。

    但是,即使有32G显存,有些任务还是会报以下错误:
    26.48.401.777 E init_batch: failed to prepare attention ubatches
    26.48.401.778 W decode: failed to find a memory slot for batch of size 16
    26.48.401.779 W srv decode: failed to find free space in the KV cache, retrying with smaller batch size, off = 190, n_batch = 8, ret = 1
    26.48.403.275 E init_batch: failed to prepare attention ubatches
    26.48.403.277 W decode: failed to find a memory slot for batch of size 8
    26.48.403.277 W srv decode: failed to find free space in the KV cache, retrying with smaller batch size, off = 190, n_batch = 4, ret = 1
    虽然使用了 --cache-type-k/v q8_0 做 KV 量化来节省显存,但是 128K 的超长上下文,加上 --parallel 2,对 KV Cache 的要求依然极其恐怖。模型权重稳稳地占了 17GB。但当开启并发,且 Prompt 超长时,给 128K 上下文预留的 KV Cache 空间,在高峰期(特别是并发请求时)瞬间耗尽了,导致没有空位给下一个 Token 的生成。
    好消息是,llama.cpp不能为KV Cache分配空间,并不会导致崩溃或任务中断(我没有碰到过),只会导致llama.cpp降级重试,严重的情况下会感觉明显卡顿而已,不用过于担心。
    所以,用7900XTX的朋友,把并发设为1可能是更好的选择。

    LLM讨论区 qwen-27b 7900xtx dsharness

  • Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s
    X xl

    @terry 不是,在我的电脑上,注释掉后性能反而有略微下降(预填充变化不大,生成性能有略微降低)。只测一次的结果可能有偏差,等有空的时候再多测几次。

    LLM讨论区 qwen-27b 7900xtx dsharness

  • Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s
    X xl

    @exllm 并行改为1后,预填充性能有接近5~10倍的提升(不同的任务变化很大),但生成token的性能提升不到10%。我也将“--override-tensor blk.\d+.ffn_.*_exps.=CPU \”注释掉进行过测试,性能反而有略微下降,可能跟我的硬件和跑的任务也有一定关系。

    LLM讨论区 qwen-27b 7900xtx dsharness

  • Qwen3.8 27B Q5_K_M + 7900xtx + DeepSeek Harness实战平均 52 t/s
    X xl

    作业质量非常高!9700x、64G ddr5、R9700 跑QWen3.8-27b-Q4_K_M。没抄作业之前,接入Codex干活吐字只有3.1 t/s,还经常崩掉,完全不能忍。抄作业以后,接入Codex干活吐字能到50t/s,提升十多倍,感觉顺畅了。万分感谢!

    LLM讨论区 qwen-27b 7900xtx dsharness
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组