【7900xtx】装了个claude code,一天烧3000万token,莫非是我本地大模型太蠢了?坑在哪里?
-

本地大模型还是使用Qwen3.6-27B
Qwen3.6-27B-uncensored-abliterated-MTP-i1-IQ4_XS-FFN-IQ3.gguf
模型 Qwen3.6-27B 极速版 启动成功!
——————————————————————————————
服务地址: http://localhost:8080
API端点: http://localhost:8080/v1/
PID: 60463
日志文件: /tmp/llama_server.log
启动参数: -ngl 999 -c 131072 --cache-type-k q4_0 --cache-type-v q4_0 --reasoning off --cont-batching --cache-prompt

说说感受,claude code的体感确实比hermes好很多,无论从速度上还是从友好程度上,断了可以从断的位置直接新开。
hermes我拿来编程,动不动上下文满了,基本进入不了下一步。
能用的时间长一些,唯一不足的是经常显示400,说是调用工具错误,新开一个又能用了。 -
@koala 请问一下,你的claude code是搭配cc-switch一起使用吗?
我的环境跟你差不多,也是7900xtx+Qwen3.6-27B-MTP , 使用Hermes速度上还能接受,但接上claude code使用的速度简直拉垮~我问它去查一下local LLM trending, 它查了14分钟,我是依照零度的教学设定的,是能用,但速度很惨啊, 是哪边要特别设定或调整吗?

-
@艷陽天 对,搭配cc-switch,你想让他聪明点,调用各种工具的话就不能使用越狱版本的,需要用到原版,好像MTP也不能用。不行你就换更大的模型https://lcz.me/topic/792/实测-7900xtx使用qwen3.6-35b-a3b速度稳定在80-t-s
-
速度上主要是体量的区别。Hermes的skill和ToolList,再加上memery和既有聊天记录的索引,太重了。
至于说烧token的问题,主要得以一个可以量化的任务为前提来比较。
举个例子,Claude Code因为冷启动提示词少,所以prefill速度相对较高,也能帮你烧更多的token。
相反的,假如你的Claude Code配置有问题,导致部分能力缺失,LLM总是循环请求不存在,或者无法正常运行的Tool,也会导致大量的浪费。所以废token要定量对比分析才行。
