跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

N

neo

@neo
取消关注 关注
关于
帖子
10
主题
0
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功
    N neo

    感谢楼主分享,如果可以,试试INT4是否能正常运行,感觉这个更有意义,毕竟当下显存太珍贵了。

    LLM讨论区 r9700 ai-pro-r9700 sg-lang

  • llama.cpp目前有重大性能BUG:checkpoint的巡回逻辑对于混合模型(比如qwen3.6-27B)无效,从而导致大概率每次对话都要prefill全文,严重拖慢速度
    N neo

    @laobenxiong hermes每个N轮对话,会自动运行一个background_review,总结对话中的记忆和skill,在单slot中会导致system prompt与之前的不一致,所以prefill全部失效,而且hermes硬编码这个任务必须主模型亲自来完成,对于目前的llama.cpp版本来说确实不太友好。

    LLM讨论区 llama.cpp

  • llama.cpp目前有重大性能BUG:checkpoint的巡回逻辑对于混合模型(比如qwen3.6-27B)无效,从而导致大概率每次对话都要prefill全文,严重拖慢速度
    N neo

    @terry 是的,本来第一目标也是sglang,奈何有目前无法逾越的问题,只能退而求其次了。

    LLM讨论区 llama.cpp

  • llama.cpp目前有重大性能BUG:checkpoint的巡回逻辑对于混合模型(比如qwen3.6-27B)无效,从而导致大概率每次对话都要prefill全文,严重拖慢速度
    N neo

    @kop-wang 大神不敢当,小学生而已,共同进步。你的情况我没有遇到,也许可以先关闭cuda-graph或前缀缓存启动一次试试,实在不行用我现在这个模型试下:shawnw3i/Qwen3.6-27B-AWQ-MTP,参考启动参数:
    vllm serve /path/to/models/Qwen3.6-27B-AWQ-MTP
    --tensor-parallel-size 2
    --max-model-len 262144
    --gpu-memory-utilization 0.88
    --kv-cache-dtype fp8
    --max-num-seqs 2
    --reasoning-parser qwen3
    --enable-auto-tool-choice
    --tool-call-parser qwen3_coder
    --port 9527 --host 0.0.0.0
    --trust-remote-code
    --served-model-name Qwen3.6-27B-AWQ-MTP
    --max-num-batched-tokens 16384
    --enable-prefix-caching
    --speculative-config '{"method":"mtp","num_speculative_tokens":3}'
    另外如果要用turboguant(跟MTP有兼容性问题),现在的版本需要先合并issues里的两个补丁,或者等0.23版本,以上希望可以帮到你。

    LLM讨论区 llama.cpp

  • llama.cpp目前有重大性能BUG:checkpoint的巡回逻辑对于混合模型(比如qwen3.6-27B)无效,从而导致大概率每次对话都要prefill全文,严重拖慢速度
    N neo

    是的,这个问题困扰我挺久了,严重影响任务节奏,前几天换成VLLM后,目前感觉还挺不错,开启前缀缓存,hit百分之八九十,开MTP后推理速度跟llama相差无几,而且可以多任务并行,如果不想折腾推荐先用vllm。SGLANG运行Qwen3.6 INT4时目前兼容度还不是很好,有bug,注意避坑。

    LLM讨论区 llama.cpp

  • 实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率
    N neo

    感谢楼主的分享,经过几天测试,发现使用后确实kv缓存被prefill的次数明显减少,这点非常到位,同时也发现在hermes中agent调用工具时频繁出现只说不做的情况,不知大家是否也有这样的情况?我准备试着结合Qwen原版和Fix版本合成一个新的版本来测试一下,有相同情况的朋友可以来指导探讨下。

    AI Agent hermes

  • 小白求助:2*2080Ti 22G还是2*3080 20G
    N neo

    劝你3080 20G,架构比2080新一代,有代差的,而且估计一年以后2080很多框架新版本不会再兼容2080了,显存带宽差不多翻一倍,这个很重要啊。
    唯一缺点:魔改卡,散热必须做好,还有质保很重要。
    有一句话:花3090一半的钱,买3090百分之80的性能说的就是它。

    AI硬件 rtx3080

  • 实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率
    N neo

    牛牛牛,加了Qwen-Fixed-Chat-Templates之后,测试了下,缓存果然没有不命中了,没毛病

    AI Agent hermes

  • 大模型16G卡的春天
    N neo

    我今天刚好遇到这个问题,双q4_0,在hermes中context跑到50~60k,agent说话会开始漂移了,不过50k以内是可以的。

    LLM讨论区

  • 欢迎来到抡锤者社区!
    N neo

    各位道友,有礼了

    随便聊聊
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组