<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[RTX 3090 24G 最佳 27B模型？  测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF]]></title><description><![CDATA[<p dir="auto">起因是在论坛看到有大神介绍 柠檬隐士的那个<br />
13.3GB的 Huihui-Qwen3.6-27B-abliterated-i1-IQ4_XS-FFN-IQ3.gguf，据说在3080 20G显卡上面速度起飞，同时还能保持长上下文，低分歧率。<br />
于是过去一探究竟，又看到 柠檬大神说，如果你需要长上下文，推荐下面这个模型。 模型卡上直接写明了不带MTP的适合 16G显存。<br />
<img src="https://upload.lcz.me/uploads/35454a0b-6566-4892-ac58-5cc103baab6a.jpeg" alt="78ae74d4-ea24-4aed-a394-f8722ca2f20b-image.jpeg" class=" img-fluid img-markdown" /><br />
于是我下载了带MTP的i1版本，这个体积也是挺小了。<br />
<img src="https://upload.lcz.me/uploads/2a220887-7e06-4513-995a-7bafb8573896.jpeg" alt="eb5de071-8400-4d65-b258-bde229286e8c-image.jpeg" class=" img-fluid img-markdown" /><br />
看来i1 这个标志对长上下文 分歧率应该有一定的稳定作用，<br />
考虑该模型在BPW在4.25-4.6之间，所以我用了以下的参数：<br />
上下文直接拉220K，</p>
<pre><code>/data/models/ikllama-616.cpp/build/bin/llama-server \
  --host 0.0.0.0 --port 8025 \
  --model  /data/model3/Qwen3.6-27B.i1-IQ4_KS-attn_qkv-IQ4_KS-i1_MTP-chunter-longcontext.gguf \
  --ctx-size 220000 -n 12000 \
  -ngl 99 \
  -ngld 99 \
  -b 2048 -ub 512 \
  -np 1 \
  -ctk q5_0 -ctv q5_0 \
  --cache-type-k-draft q4_1 --cache-type-v-draft q4_1 \
  -khad -vhad \
  --merge-qkv \
  -fa on \
  --jinja \
  --parallel-tool-calls \
  --spec-type mtp:n_max=2,p_min=0.0 \
  --recurrent-ckpt-mode auto \
    --chat-template-kwargs '{"preserve_thinking":true}' \
   --reasoning-format deepseek --reasoning-budget 768 \
     --chat-template-file /data/model2/qwen3.6-27b-gguf/chat_template-Qwen36-spiritbuun.jinja \
     --reasoning off  --temp 0.6 --top-k 20 --top-p 0.95 
</code></pre>
<p dir="auto">启动后占用显存在20G左右，这是ikllama的特色，有一部分“环形”层已加载到了CPU+内存里面。 首先来跑个 tooleval:<br />
<img src="https://upload.lcz.me/uploads/9959a82f-31cf-4644-b0b2-a63a66687ff9.jpeg" alt="262a4f9b-09e1-404f-ad53-8da870d72801-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">分数93分挺不错，只是token效率偏低（某些模型可以达到0.5 pts /1000 token)<br />
这时再跑一个简单的问答题，速率降到了53T/S<br />
<img src="https://upload.lcz.me/uploads/00bebac0-c2f5-495f-b60a-5714c962f506.jpeg" alt="43975540-3455-4a45-a005-6d8f7bbf6279-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">14:47开始俄罗斯方块：<br />
<img src="https://upload.lcz.me/uploads/97af75e0-67b0-4195-96f1-13811f73982b.jpeg" alt="fc014d18-8b2e-4f71-944d-d2c1edec3c95-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/769/rtx-3090-24g-最佳-27b模型-测试chunter789-qwen3.6-27b-i1-iq4_ks-gguf</link><generator>RSS for Node</generator><lastBuildDate>Sun, 26 Jul 2026 22:17:06 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/769.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 03 Jul 2026 06:48:34 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to RTX 3090 24G 最佳 27B模型？  测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF on Fri, 10 Jul 2026 12:37:27 GMT]]></title><description><![CDATA[<p dir="auto">总之。3090 24g单卡 。hermes 能用的方案我都试验过了。基本不完美。</p>
]]></description><link>https://lcz.me/post/9646</link><guid isPermaLink="true">https://lcz.me/post/9646</guid><dc:creator><![CDATA[wwcd2016]]></dc:creator><pubDate>Fri, 10 Jul 2026 12:37:27 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 3090 24G 最佳 27B模型？  测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF on Wed, 08 Jul 2026 07:26:59 GMT]]></title><description><![CDATA[<p dir="auto">对比其他衍生的27B，对比咋样</p>
]]></description><link>https://lcz.me/post/9440</link><guid isPermaLink="true">https://lcz.me/post/9440</guid><dc:creator><![CDATA[c0aster]]></dc:creator><pubDate>Wed, 08 Jul 2026 07:26:59 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 3090 24G 最佳 27B模型？  测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF on Wed, 08 Jul 2026 03:44:21 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/stxpnet" aria-label="Profile: stxpnet">@<bdi>stxpnet</bdi></a> <a href="/post/9111">说</a>:</p>
<p dir="auto">这时再跑一个简单的问答题，速率降到了53T/S</p>
</blockquote>
<p dir="auto">我觉得这个速度在3090上是正常的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/a6e5a4d2-98c3-4eb4-951b-8949115ec381.jpeg" alt="cfb0851a-4714-4153-8aed-5ae853d9628f-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">我用的模型和启动参数：</p>
<p dir="auto">unsloth\Qwen3.6-27B-MTP-GGUF\Qwen3.6-27B-unslothMTP-Q4_K_M.gguf</p>
<pre><code>--reasoning off ^
--n-gpu-layers -1 ^
--ctx-size 131072 ^
--batch-size 4096^
--ubatch-size 2048 ^
--flash-attn on ^
--cache-type-k q4_0 ^
--cache-type-v q4_0 ^
--spec-type draft-mtp ^
--spec-draft-n-max 3 ^
--spec-draft-n-min 1 ^
--temp 0.7 ^
--parallel 1 ^
--kv-unified ^
--mlock ^
--jinja ^
--threads 16 ^
--threads-batch 16 ^
--no-warmup
</code></pre>
<p dir="auto">华南金牌洋垃圾主板和CPU</p>
]]></description><link>https://lcz.me/post/9429</link><guid isPermaLink="true">https://lcz.me/post/9429</guid><dc:creator><![CDATA[joker_chang]]></dc:creator><pubDate>Wed, 08 Jul 2026 03:44:21 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 3090 24G 最佳 27B模型？  测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF on Fri, 03 Jul 2026 07:01:16 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/stxpnet" aria-label="Profile: stxpnet">@<bdi>stxpnet</bdi></a> 可以，没个帖子都很有技术含量，发帖简要干脆，没有废话，图文并茂，值得学习。</p>
]]></description><link>https://lcz.me/post/9113</link><guid isPermaLink="true">https://lcz.me/post/9113</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Fri, 03 Jul 2026 07:01:16 GMT</pubDate></item><item><title><![CDATA[Reply to RTX 3090 24G 最佳 27B模型？  测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF on Fri, 03 Jul 2026 06:55:30 GMT]]></title><description><![CDATA[<p dir="auto">我的提示词似乎还是有矛盾，我本来想让它分拆模块来实现更好的效果，<br />
它首先直接完成了一个1042行的HTML文件。<br />
14:51，已经在浏览器中弹出并开始playwright测试了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/c18c2c75-3c24-4e2e-8c97-050c3c22f7c0.jpeg" alt="13355373-d2ac-45ed-9564-adda37abe13b-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">我试玩了，还是有消行消不干净的BUG。不知道是什么原因。 可能是参数不合适，或者提示词太乱了？</p>
]]></description><link>https://lcz.me/post/9112</link><guid isPermaLink="true">https://lcz.me/post/9112</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Fri, 03 Jul 2026 06:55:30 GMT</pubDate></item></channel></rss>