通过综合的信息,目前可能是矿老板想高价出一波,目前按JS发的跑QWEN3.6的视频,非常慢,都比不了2080TI
c0aster
-
8g的HBM矿卡170hx解封了 -
(筹备中)AI 产品溢出产能回收计划 & 实战任务发布有兴趣,希望能接单,有很强的IT运维能力,有一定开发能力,有一套虚拟化服务器+2张3090。
-
实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率我是llama.cpp + Qwen3.6-27B + hermes 重度使用者,每天至少1个小时以上。基本上智能家居+网络配置+日常电脑任务+记账 都转到AI上了。三者配合最大的问题还是prompt重算的问题,初略统计,基本上context累计到40-50K以上(尤其是频繁工具调用),就会开始出现prompt重算,之后越聊会越频繁。到最后基本就不可用了。为了缓解这个问题,频繁调试llama.cpp启动参数,都无法彻底解决。
好在一直都有人在致力于优化,我相信终会得到解决。以下是近期一些prompt重算问题的进展:
-
https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates 更新到了v21版本,我更新它之后,解决了hermes新版读取memory报错的一个bug(hermes自己分析是prompt/template 格式问题)。但对prompt重算改善不大。
-
https://github.com/ggml-org/llama.cpp/issues/22746#issuecomment-4843582985 这个issue持续有人在跟进,并提供了patch。开源的意义就在于此。
看了issue ,patch没有被合并,要用只有自己编译修复了的旧版,
-
-
RTX 3090 24G 最佳 27B模型? 测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF对比其他衍生的27B,对比咋样
-
为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住@stxpnet 等抄你作业,我现在跑的3090club
-
为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住反正跑不满,然后就check point,重新生成缓存,就这个时间也长,24G内存还是少了
-
没被GPT封号,被KIMI封号了.收了会员费还不让你访问.@mark 都不用看你IP什么的,你中国人语义语境风格都暴露了
-
为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住@stxpnet 应该是这个问题,我让他修BUG,最后循环胡说了
-
06-21 Hermes 调用本机 Carnice-27B 模型体验 & 模板优化分享分析是KV缓存没命中然后重新生成,并且hermes传了至少65K的上下文
-
06-21 Hermes 调用本机 Carnice-27B 模型体验 & 模板优化分享@stxpnet 那你现在这个配置,hermes反应快不,我的得等几分钟才开始干活
-
论坛宕机原因和修复@terry 需要管理可以私我,反正每天上班摸鱼
-
06-21 Hermes 调用本机 Carnice-27B 模型体验 & 模板优化分享牛逼,赶紧替换试试
-
论坛宕机原因和修复@terry 我有些企业运维经验,中小站还有点经验
-
全站首发:RTX 3090 24G 无痛爽玩 华为最新开源KV cache格式 (每日更新总结,希望3090卡友进来讨论)坐等大佬更新,等一波抄作业
-
为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住@Tony-Wang 感谢版主的建议,那我一个一个参数细调吧,用的opencode写代码,bug修着修着,然后就开始出问题了,我看了下,可能是提示语词里有一些转义字符特别是点号和斜杠这些(看日志遇到这些才出的问题,我也只是看表面日志判断的),导致他开始混乱了
-
为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住@stxpnet 已经没有用hermes了,用的Opencode,主要来写项目,确实温度是0.6,那我加大一点点看看
-
为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住@Kk-Hh 这个就是3090 club的参数,我只加一个fix的chat 模板
-
3090单卡跑的3090 club项目,hermes很慢,可能是啥原因呢?@wwcd2016 是的,看来3090还是显存不太够
-
为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住services: ik-llama-qwen36-27b-iq4ks-mtp: image: ${IK_LLAMA_IMAGE:-ghcr.io/ikawrakow/ik-llama-cpp@sha256:5f914f1ccade922417af58c94bd1cbb558052c8852d86678ead3fe693eec0143} container_name: "${ESTATE_CONTAINER:-ik-llama-qwen36-27b}" restart: unless-stopped ports: - "${ESTATE_PORT:-${PORT:-8020}}:8080" volumes: - "${MODEL_DIR:-../../../../../../models-cache}:/models:ro" # server target ENTRYPOINT is /app/llama-server — args only below. # ⚠ -np 1 is intentional on a single 24 GB card — do NOT raise it to # "parallelize." One GPU is compute-bound: extra slots divide its # throughput, they don't multiply it. At -np 4 each slot fell to # ~14 tok/s here — slow enough to trip agentic clients' per-request # timeouts (aider ran 1/30) — and -np>1 also auto-disables MTP and # can OOM the spec-context buffer. On a higher-throughput card (e.g. # 5090) or multi-GPU the trade may flip — re-validate before raising. command: >- --host 0.0.0.0 --port 8080 --model /models/${GGUF_FILE:-qwen3.6-27b-gguf/ubergarm-mtp-iq4ks/Qwen3.6-27B-MTP-IQ4_KS.gguf} -ngl 99 --ctx-size ${CTX_SIZE:-200000} -b ${BATCH_SIZE:-4096} -ub ${UBATCH_SIZE:-1024} -np ${NP:-1} -ctk ${KV_TYPE:-q4_0} -ctv ${KV_TYPE:-q4_0} -khad -vhad -ngld 99 --spec-type mtp:n_max=${MTP_DRAFT_N_MAX:-2},p_min=${DRAFT_P_MIN:-0.0} --recurrent-ckpt-mode auto --merge-qkv -fa on --chat-template-kwargs '{"enable_thinking": false}' --jinja --chat-template-file /models/qwen3.6-27b-gguf/ubergarm-mtp-iq4ks/chat_template.jinja --parallel-tool-calls --reasoning ${REASONING:-off} --reasoning-format ${REASONING_FORMAT:-deepseek} --temp ${TEMP:-${TEMPERATURE:-0.6}} --top-p ${TOP_P:-0.95} --top-k ${TOP_K:-20} --min-p ${MIN_P:-0.0} --repeat-penalty ${REPEAT_PENALTY:-1.0} deploy: resources: reservations: devices: - driver: nvidia device_ids: ["${ESTATE_GPUS:-${CUDA_VISIBLE_DEVICES:-0}}"] capabilities: [gpu]症状如图:

-
3090单卡跑的3090 club项目,hermes很慢,可能是啥原因呢?services: ik-llama-qwen36-27b-iq4ks-mtp: image: ${IK_LLAMA_IMAGE:-ghcr.io/ikawrakow/ik-llama-cpp@sha256:5f914f1ccade922417af58c94bd1cbb558052c8852d86678ead3fe693eec0143} container_name: "${ESTATE_CONTAINER:-ik-llama-qwen36-27b}" restart: unless-stopped ports: - "${ESTATE_PORT:-${PORT:-8020}}:8080" volumes: - "${MODEL_DIR:-../../../../../../models-cache}:/models:ro" # server target ENTRYPOINT is /app/llama-server — args only below. # ⚠ -np 1 is intentional on a single 24 GB card — do NOT raise it to # "parallelize." One GPU is compute-bound: extra slots divide its # throughput, they don't multiply it. At -np 4 each slot fell to # ~14 tok/s here — slow enough to trip agentic clients' per-request # timeouts (aider ran 1/30) — and -np>1 also auto-disables MTP and # can OOM the spec-context buffer. On a higher-throughput card (e.g. # 5090) or multi-GPU the trade may flip — re-validate before raising. command: >- --host 0.0.0.0 --port 8080 --model /models/${GGUF_FILE:-qwen3.6-27b-gguf/ubergarm-mtp-iq4ks/Qwen3.6-27B-MTP-IQ4_KS.gguf} -ngl 99 --ctx-size ${CTX_SIZE:-200000} -b ${BATCH_SIZE:-4096} -ub ${UBATCH_SIZE:-1024} -np ${NP:-1} -ctk ${KV_TYPE:-q4_0} -ctv ${KV_TYPE:-q4_0} -khad -vhad -ngld 99 --spec-type mtp:n_max=${MTP_DRAFT_N_MAX:-2},p_min=${DRAFT_P_MIN:-0.0} --recurrent-ckpt-mode auto --merge-qkv -fa on --chat-template-kwargs '{"enable_thinking": false}' --jinja --chat-template-file /models/qwen3.6-27b-gguf/ubergarm-mtp-iq4ks/chat_template.jinja --parallel-tool-calls --reasoning ${REASONING:-off} --reasoning-format ${REASONING_FORMAT:-deepseek} --temp ${TEMP:-${TEMPERATURE:-0.6}} --top-p ${TOP_P:-0.95} --top-k ${TOP_K:-20} --min-p ${MIN_P:-0.0} --repeat-penalty ${REPEAT_PENALTY:-1.0} deploy: resources: reservations: devices: - driver: nvidia device_ids: ["${ESTATE_GPUS:-${CUDA_VISIBLE_DEVICES:-0}}"] capabilities: [gpu]