@David-Chen 丑一点我能忍,问题是它完全不能正确理解log的内容,画出来的曲线是prompt越长prefill越快,这能忍啊。。。
Dan Xia
@Dan Xia
-
Meta Muse Glimmer 30B实测:4090D 48G + Hermes + Codex Agent/编程测试,挑战Qwen 27B?请原谅我被逗笑了!速度飞快,编程一塌糊涂! -
Meta Muse Glimmer 30B实测:4090D 48G + Hermes + Codex Agent/编程测试,挑战Qwen 27B?请原谅我被逗笑了!速度飞快,编程一塌糊涂!昨天拿了两段llama.cpp分别用vulkan和rocm跑相同模型的log,让Qwen3.6-27B和Muse Glimmer分别用svg把prefill速度随prompt增长而衰减的曲线画出来。
这是Qwen3.6-27B画的:

这是Muse Glimmer画的:

能说啥呢?meta棒棒的!
-
请教你们都是怎么解决上下文总是满了的问题?@vanvj 上下文开的有点保守了。我跟你一样的显卡,一样的模型,不加载mmproj,上下文可以开到160K。多轮会话后累积上下文太长了prefill速度受不了,但是把--cache-ram、--cache-prompt、--cache-reuse都用上,其实也就还好。我实际使用最多拉到了110K,能忍。7900XTX跑llama.cpp最重要的一点是用vulkan,别用rocm。

-
PVE HomeLab ( R9700x2+3090) 極限方案@sarcoma 建议考虑容器,可以直接映射,一张显卡映射给多个CT。我的llama.cpp、comfyui、musubi-tuner等都是各自一个独立容器,共用一张7900XTX,保证各自的环境都是干净的,出问题也不会影响其他东西。
-
关于 Hermes 干活的, 严!重!警!告!!!我的NAS是ro挂载才敢让hermes用,胆子小,就怕它这么搞一出。