RTX 3090 24G 最佳 27B模型? 测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF
-
起因是在论坛看到有大神介绍 柠檬隐士的那个
13.3GB的 Huihui-Qwen3.6-27B-abliterated-i1-IQ4_XS-FFN-IQ3.gguf,据说在3080 20G显卡上面速度起飞,同时还能保持长上下文,低分歧率。
于是过去一探究竟,又看到 柠檬大神说,如果你需要长上下文,推荐下面这个模型。 模型卡上直接写明了不带MTP的适合 16G显存。

于是我下载了带MTP的i1版本,这个体积也是挺小了。

看来i1 这个标志对长上下文 分歧率应该有一定的稳定作用,
考虑该模型在BPW在4.25-4.6之间,所以我用了以下的参数:
上下文直接拉220K,/data/models/ikllama-616.cpp/build/bin/llama-server \ --host 0.0.0.0 --port 8025 \ --model /data/model3/Qwen3.6-27B.i1-IQ4_KS-attn_qkv-IQ4_KS-i1_MTP-chunter-longcontext.gguf \ --ctx-size 220000 -n 12000 \ -ngl 99 \ -ngld 99 \ -b 2048 -ub 512 \ -np 1 \ -ctk q5_0 -ctv q5_0 \ --cache-type-k-draft q4_1 --cache-type-v-draft q4_1 \ -khad -vhad \ --merge-qkv \ -fa on \ --jinja \ --parallel-tool-calls \ --spec-type mtp:n_max=2,p_min=0.0 \ --recurrent-ckpt-mode auto \ --chat-template-kwargs '{"preserve_thinking":true}' \ --reasoning-format deepseek --reasoning-budget 768 \ --chat-template-file /data/model2/qwen3.6-27b-gguf/chat_template-Qwen36-spiritbuun.jinja \ --reasoning off --temp 0.6 --top-k 20 --top-p 0.95启动后占用显存在20G左右,这是ikllama的特色,有一部分“环形”层已加载到了CPU+内存里面。 首先来跑个 tooleval:

分数93分挺不错,只是token效率偏低(某些模型可以达到0.5 pts /1000 token)
这时再跑一个简单的问答题,速率降到了53T/S

14:47开始俄罗斯方块:

-
我的提示词似乎还是有矛盾,我本来想让它分拆模块来实现更好的效果,
它首先直接完成了一个1042行的HTML文件。
14:51,已经在浏览器中弹出并开始playwright测试了。
我试玩了,还是有消行消不干净的BUG。不知道是什么原因。 可能是参数不合适,或者提示词太乱了?
-
,
T terry 固定了此主题
-
,系统 取消固定了此主题
-
起因是在论坛看到有大神介绍 柠檬隐士的那个
13.3GB的 Huihui-Qwen3.6-27B-abliterated-i1-IQ4_XS-FFN-IQ3.gguf,据说在3080 20G显卡上面速度起飞,同时还能保持长上下文,低分歧率。
于是过去一探究竟,又看到 柠檬大神说,如果你需要长上下文,推荐下面这个模型。 模型卡上直接写明了不带MTP的适合 16G显存。

于是我下载了带MTP的i1版本,这个体积也是挺小了。

看来i1 这个标志对长上下文 分歧率应该有一定的稳定作用,
考虑该模型在BPW在4.25-4.6之间,所以我用了以下的参数:
上下文直接拉220K,/data/models/ikllama-616.cpp/build/bin/llama-server \ --host 0.0.0.0 --port 8025 \ --model /data/model3/Qwen3.6-27B.i1-IQ4_KS-attn_qkv-IQ4_KS-i1_MTP-chunter-longcontext.gguf \ --ctx-size 220000 -n 12000 \ -ngl 99 \ -ngld 99 \ -b 2048 -ub 512 \ -np 1 \ -ctk q5_0 -ctv q5_0 \ --cache-type-k-draft q4_1 --cache-type-v-draft q4_1 \ -khad -vhad \ --merge-qkv \ -fa on \ --jinja \ --parallel-tool-calls \ --spec-type mtp:n_max=2,p_min=0.0 \ --recurrent-ckpt-mode auto \ --chat-template-kwargs '{"preserve_thinking":true}' \ --reasoning-format deepseek --reasoning-budget 768 \ --chat-template-file /data/model2/qwen3.6-27b-gguf/chat_template-Qwen36-spiritbuun.jinja \ --reasoning off --temp 0.6 --top-k 20 --top-p 0.95启动后占用显存在20G左右,这是ikllama的特色,有一部分“环形”层已加载到了CPU+内存里面。 首先来跑个 tooleval:

分数93分挺不错,只是token效率偏低(某些模型可以达到0.5 pts /1000 token)
这时再跑一个简单的问答题,速率降到了53T/S

14:47开始俄罗斯方块:

这时再跑一个简单的问答题,速率降到了53T/S
我觉得这个速度在3090上是正常的。

我用的模型和启动参数:
unsloth\Qwen3.6-27B-MTP-GGUF\Qwen3.6-27B-unslothMTP-Q4_K_M.gguf
--reasoning off ^ --n-gpu-layers -1 ^ --ctx-size 131072 ^ --batch-size 4096^ --ubatch-size 2048 ^ --flash-attn on ^ --cache-type-k q4_0 ^ --cache-type-v q4_0 ^ --spec-type draft-mtp ^ --spec-draft-n-max 3 ^ --spec-draft-n-min 1 ^ --temp 0.7 ^ --parallel 1 ^ --kv-unified ^ --mlock ^ --jinja ^ --threads 16 ^ --threads-batch 16 ^ --no-warmup华南金牌洋垃圾主板和CPU