跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

C

c0aster

@c0aster
取消关注 关注
关于
帖子
38
主题
4
分享
0
群组
0
粉丝
1
关注
0

帖子

最新 最佳 有争议的

  • 8g的HBM矿卡170hx解封了
    C c0aster

    通过综合的信息,目前可能是矿老板想高价出一波,目前按JS发的跑QWEN3.6的视频,非常慢,都比不了2080TI

    AI硬件

  • (筹备中)AI 产品溢出产能回收计划 & 实战任务发布
    C c0aster

    有兴趣,希望能接单,有很强的IT运维能力,有一定开发能力,有一套虚拟化服务器+2张3090。

    网络技术

  • 实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率
    C c0aster

    @Colt 说:

    我是llama.cpp + Qwen3.6-27B + hermes 重度使用者,每天至少1个小时以上。基本上智能家居+网络配置+日常电脑任务+记账 都转到AI上了。三者配合最大的问题还是prompt重算的问题,初略统计,基本上context累计到40-50K以上(尤其是频繁工具调用),就会开始出现prompt重算,之后越聊会越频繁。到最后基本就不可用了。为了缓解这个问题,频繁调试llama.cpp启动参数,都无法彻底解决。

    好在一直都有人在致力于优化,我相信终会得到解决。以下是近期一些prompt重算问题的进展:

    1. https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates 更新到了v21版本,我更新它之后,解决了hermes新版读取memory报错的一个bug(hermes自己分析是prompt/template 格式问题)。但对prompt重算改善不大。

    2. https://github.com/ggml-org/llama.cpp/issues/22746#issuecomment-4843582985 这个issue持续有人在跟进,并提供了patch。开源的意义就在于此。

    看了issue ,patch没有被合并,要用只有自己编译修复了的旧版,

    AI Agent hermes

  • RTX 3090 24G 最佳 27B模型? 测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF
    C c0aster

    对比其他衍生的27B,对比咋样

    LLM讨论区 rtx3090

  • 为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住
    C c0aster

    @stxpnet 等抄你作业,我现在跑的3090club

    LLM讨论区 rtx3090 open-code

  • 为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住
    C c0aster

    反正跑不满,然后就check point,重新生成缓存,就这个时间也长,24G内存还是少了

    LLM讨论区 rtx3090 open-code

  • 没被GPT封号,被KIMI封号了.收了会员费还不让你访问.
    C c0aster

    @mark 都不用看你IP什么的,你中国人语义语境风格都暴露了

    Mark专区 gpt

  • 为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住
    C c0aster

    @stxpnet 应该是这个问题,我让他修BUG,最后循环胡说了

    LLM讨论区 rtx3090 open-code

  • 06-21 Hermes 调用本机 Carnice-27B 模型体验 & 模板优化分享
    C c0aster

    分析是KV缓存没命中然后重新生成,并且hermes传了至少65K的上下文

    LLM讨论区 hermes

  • 06-21 Hermes 调用本机 Carnice-27B 模型体验 & 模板优化分享
    C c0aster

    @stxpnet 那你现在这个配置,hermes反应快不,我的得等几分钟才开始干活

    LLM讨论区 hermes

  • 论坛宕机原因和修复
    C c0aster

    @terry 需要管理可以私我,反正每天上班摸鱼

    站点公告

  • 06-21 Hermes 调用本机 Carnice-27B 模型体验 & 模板优化分享
    C c0aster

    牛逼,赶紧替换试试

    LLM讨论区 hermes

  • 论坛宕机原因和修复
    C c0aster

    @terry 我有些企业运维经验,中小站还有点经验

    站点公告

  • 全站首发:RTX 3090 24G 无痛爽玩 华为最新开源KV cache格式 (每日更新总结,希望3090卡友进来讨论)
    C c0aster

    坐等大佬更新,等一波抄作业

    LLM讨论区 rtx3090

  • 为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住
    C c0aster

    @Tony-Wang 感谢版主的建议,那我一个一个参数细调吧,用的opencode写代码,bug修着修着,然后就开始出问题了,我看了下,可能是提示语词里有一些转义字符特别是点号和斜杠这些(看日志遇到这些才出的问题,我也只是看表面日志判断的),导致他开始混乱了

    LLM讨论区 rtx3090 open-code

  • 为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住
    C c0aster

    @stxpnet 已经没有用hermes了,用的Opencode,主要来写项目,确实温度是0.6,那我加大一点点看看

    LLM讨论区 rtx3090 open-code

  • 为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住
    C c0aster

    @Kk-Hh 这个就是3090 club的参数,我只加一个fix的chat 模板

    LLM讨论区 rtx3090 open-code

  • 3090单卡跑的3090 club项目,hermes很慢,可能是啥原因呢?
    C c0aster

    @wwcd2016 是的,看来3090还是显存不太够

    LLM讨论区 rtx3090 hermes

  • 为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住
    C c0aster
    services:
      ik-llama-qwen36-27b-iq4ks-mtp:
        image: ${IK_LLAMA_IMAGE:-ghcr.io/ikawrakow/ik-llama-cpp@sha256:5f914f1ccade922417af58c94bd1cbb558052c8852d86678ead3fe693eec0143}
        container_name: "${ESTATE_CONTAINER:-ik-llama-qwen36-27b}"
        restart: unless-stopped
        ports:
          - "${ESTATE_PORT:-${PORT:-8020}}:8080"
        volumes:
          - "${MODEL_DIR:-../../../../../../models-cache}:/models:ro"
        # server target ENTRYPOINT is /app/llama-server — args only below.
        # ⚠ -np 1 is intentional on a single 24 GB card — do NOT raise it to
        #   "parallelize." One GPU is compute-bound: extra slots divide its
        #   throughput, they don't multiply it. At -np 4 each slot fell to
        #   ~14 tok/s here — slow enough to trip agentic clients' per-request
        #   timeouts (aider ran 1/30) — and -np>1 also auto-disables MTP and
        #   can OOM the spec-context buffer. On a higher-throughput card (e.g.
        #   5090) or multi-GPU the trade may flip — re-validate before raising.
        command: >-
          --host 0.0.0.0
          --port 8080
          --model /models/${GGUF_FILE:-qwen3.6-27b-gguf/ubergarm-mtp-iq4ks/Qwen3.6-27B-MTP-IQ4_KS.gguf}
          -ngl 99
          --ctx-size ${CTX_SIZE:-200000}
          -b ${BATCH_SIZE:-4096}
          -ub ${UBATCH_SIZE:-1024}
          -np ${NP:-1}
          -ctk ${KV_TYPE:-q4_0}
          -ctv ${KV_TYPE:-q4_0}
          -khad
          -vhad
          -ngld 99
          --spec-type mtp:n_max=${MTP_DRAFT_N_MAX:-2},p_min=${DRAFT_P_MIN:-0.0}
          --recurrent-ckpt-mode auto
          --merge-qkv
          -fa on
          --chat-template-kwargs '{"enable_thinking": false}'
          --jinja
          --chat-template-file /models/qwen3.6-27b-gguf/ubergarm-mtp-iq4ks/chat_template.jinja
          --parallel-tool-calls
          --reasoning ${REASONING:-off}
          --reasoning-format ${REASONING_FORMAT:-deepseek}
          --temp ${TEMP:-${TEMPERATURE:-0.6}}
          --top-p ${TOP_P:-0.95}
          --top-k ${TOP_K:-20}
          --min-p ${MIN_P:-0.0}
          --repeat-penalty ${REPEAT_PENALTY:-1.0}
        deploy:
          resources:
            reservations:
              devices:
                - driver: nvidia
                  device_ids: ["${ESTATE_GPUS:-${CUDA_VISIBLE_DEVICES:-0}}"]
                  capabilities: [gpu]
    
    

    症状如图:
    07f8ebf3-5c42-4694-8a1b-daba191a0f79-image.jpeg

    LLM讨论区 rtx3090 open-code

  • 3090单卡跑的3090 club项目,hermes很慢,可能是啥原因呢?
    C c0aster

    @stxpnet

    services:
      ik-llama-qwen36-27b-iq4ks-mtp:
        image: ${IK_LLAMA_IMAGE:-ghcr.io/ikawrakow/ik-llama-cpp@sha256:5f914f1ccade922417af58c94bd1cbb558052c8852d86678ead3fe693eec0143}
        container_name: "${ESTATE_CONTAINER:-ik-llama-qwen36-27b}"
        restart: unless-stopped
        ports:
          - "${ESTATE_PORT:-${PORT:-8020}}:8080"
        volumes:
          - "${MODEL_DIR:-../../../../../../models-cache}:/models:ro"
        # server target ENTRYPOINT is /app/llama-server — args only below.
        # ⚠ -np 1 is intentional on a single 24 GB card — do NOT raise it to
        #   "parallelize." One GPU is compute-bound: extra slots divide its
        #   throughput, they don't multiply it. At -np 4 each slot fell to
        #   ~14 tok/s here — slow enough to trip agentic clients' per-request
        #   timeouts (aider ran 1/30) — and -np>1 also auto-disables MTP and
        #   can OOM the spec-context buffer. On a higher-throughput card (e.g.
        #   5090) or multi-GPU the trade may flip — re-validate before raising.
        command: >-
          --host 0.0.0.0
          --port 8080
          --model /models/${GGUF_FILE:-qwen3.6-27b-gguf/ubergarm-mtp-iq4ks/Qwen3.6-27B-MTP-IQ4_KS.gguf}
          -ngl 99
          --ctx-size ${CTX_SIZE:-200000}
          -b ${BATCH_SIZE:-4096}
          -ub ${UBATCH_SIZE:-1024}
          -np ${NP:-1}
          -ctk ${KV_TYPE:-q4_0}
          -ctv ${KV_TYPE:-q4_0}
          -khad
          -vhad
          -ngld 99
          --spec-type mtp:n_max=${MTP_DRAFT_N_MAX:-2},p_min=${DRAFT_P_MIN:-0.0}
          --recurrent-ckpt-mode auto
          --merge-qkv
          -fa on
          --chat-template-kwargs '{"enable_thinking": false}'
          --jinja
          --chat-template-file /models/qwen3.6-27b-gguf/ubergarm-mtp-iq4ks/chat_template.jinja
          --parallel-tool-calls
          --reasoning ${REASONING:-off}
          --reasoning-format ${REASONING_FORMAT:-deepseek}
          --temp ${TEMP:-${TEMPERATURE:-0.6}}
          --top-p ${TOP_P:-0.95}
          --top-k ${TOP_K:-20}
          --min-p ${MIN_P:-0.0}
          --repeat-penalty ${REPEAT_PENALTY:-1.0}
        deploy:
          resources:
            reservations:
              devices:
                - driver: nvidia
                  device_ids: ["${ESTATE_GPUS:-${CUDA_VISIBLE_DEVICES:-0}}"]
                  capabilities: [gpu]
    
    LLM讨论区 rtx3090 hermes
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组