<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[请教一下QWEN 3.8 27B GGUF和llama.cpp框架的选择]]></title><description><![CDATA[<p dir="auto">之前试过几十个GGUF的QWEN 3.6 27B，感觉对于RTX3090显卡，最好的就体积在16-18G的。<br />
今天看到byteshape居然都开始量化稠密模型了：<br />
<img src="https://upload.lcz.me/uploads/323b0ef3-5096-418f-85c5-c57d3840a1d5.jpeg" alt="598df9a8-1e1a-40da-a722-87ce88a785a2-image.jpeg" class=" img-fluid img-markdown" /><br />
它只有这几种格式，相信有它自己道理：<br />
<img src="https://upload.lcz.me/uploads/7a2f4dd4-03dc-4c56-962f-aa03c27b080c.jpeg" alt="8733184e-c74b-42e8-9428-a5f1a3a22ac0-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">我的问题是，目前在Q4 - Q6这个区间，最好的量化格式是哪家？<br />
UD 3.0 ,Byteshape,还是 ?</p>
<p dir="auto">最好的框架呢？ 我用过的有beellama  buunllama ik llama 和官方的。</p>
]]></description><link>https://lcz.me/topic/1373</link><generator>RSS for Node</generator><lastBuildDate>Thu, 10 Sep 2026 00:44:14 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1373.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 28 Aug 2026 00:47:01 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 请教一下QWEN 3.8 27B GGUF和llama.cpp框架的选择 on Sat, 29 Aug 2026 13:55:36 GMT]]></title><description><![CDATA[<p dir="auto">再补充一点啊！ 150k 60t/s 其实是不可能的啊！超过90k以后降速，130k以后就只有几个token/s了。但是 不死机，能抗一阵子就缓过来了。</p>
]]></description><link>https://lcz.me/post/14798</link><guid isPermaLink="true">https://lcz.me/post/14798</guid><dc:creator><![CDATA[wwcd2016]]></dc:creator><pubDate>Sat, 29 Aug 2026 13:55:36 GMT</pubDate></item><item><title><![CDATA[Reply to 请教一下QWEN 3.8 27B GGUF和llama.cpp框架的选择 on Sat, 29 Aug 2026 02:36:41 GMT]]></title><description><![CDATA[<p dir="auto">3090单卡</p>
<p dir="auto">我之前呢是觉得 3090 单卡是不可能有生产力的，所以一直是有卡，从来没有用过。本地部署<br />
直到 DSH 出来以后，我更加坚信本地 VLLM 没有任何意义。</p>
<p dir="auto">直到我把<a href="https://github.com/syv-ai/qwen38-27b-rtx3090" rel="nofollow ugc">https://github.com/syv-ai/qwen38-27b-rtx3090</a><br />
这个链接丢给 DSH，然后所有的事情我都没做。他帮我弄出来一个。|<br />
150k 60t/s 已经稳定地跑了几天了，好像 DSH 也能用。中间所有的坑，全都碰到了。<br />
比如说打循环，比如说 call tool 卡了.但是直接都是在 DSH区里面切换成 Deepseek 在线模型以后让它自己处理都搞定<br />
好像中间有那么一两次没搞定，我就DSH让他来看这个论坛具体他怎么搞定的不知道，但是大概花了十来块钱吧，他就 OK 了。</p>
]]></description><link>https://lcz.me/post/14697</link><guid isPermaLink="true">https://lcz.me/post/14697</guid><dc:creator><![CDATA[wwcd]]></dc:creator><pubDate>Sat, 29 Aug 2026 02:36:41 GMT</pubDate></item><item><title><![CDATA[Reply to 请教一下QWEN 3.8 27B GGUF和llama.cpp框架的选择 on Fri, 28 Aug 2026 01:27:46 GMT]]></title><description><![CDATA[<p dir="auto">使用第三方权重如果想摸索一个最合适的甜点，只能自己测。<br />
不光要测性能，还得测能力。<br />
比如你说的Byteshape的Q4，和unsloth的Q4压根就不是一回事。<br />
包括还有各种非拒绝微调导致的智商下降。</p>
<p dir="auto">所以Deepseek官方也曾经表述，说第三方部署的成本在性能能力相等的情况下，成本不会比他们官方低。<br />
这个主要表述的就是调优的难度。</p>
]]></description><link>https://lcz.me/post/14483</link><guid isPermaLink="true">https://lcz.me/post/14483</guid><dc:creator><![CDATA[kop wang]]></dc:creator><pubDate>Fri, 28 Aug 2026 01:27:46 GMT</pubDate></item><item><title><![CDATA[Reply to 请教一下QWEN 3.8 27B GGUF和llama.cpp框架的选择 on Fri, 28 Aug 2026 01:20:46 GMT]]></title><description><![CDATA[<p dir="auto">Q4-Q6 区间现在的格局大概是这样：</p>
<p dir="auto"><strong>量化格式，质量/bit 排序</strong></p>
<ul>
<li>UD 系（Unsloth Dynamic，你说的 UD 3.0 应该就是它）：同体积质量明显比老 K-quants 高一档，UD-Q4_K_XL 这类 XL 后缀是"同 bit 数加大 block 精度"。27B 的 UD-Q4_K_XL 大概 17-18G，正好在你说的 16-18G 甜点里；Q5 系要 19-20G，单卡 24G 会挤 KV 空间，双卡分摊的话可以上。</li>
<li>老 K-quants（Q4_K_M / Q5_K_M）：最稳、生态最广，但同体积比 UD 差一档。</li>
<li>IQ 系（IQ4_XS 等）：主要省体积/省显存，3090 不缺这点体积，不优先。</li>
<li>实测口碑上 UD-Q4_K_XL 是目前 24G 卡的公认甜点，也是 Unsloth 官方推荐日常档。</li>
</ul>
<p dir="auto"><strong>Byteshape 单独说</strong><br />
它家的文件不是标准 GGUF 档位——是它自己的 ShapeLearn 方法自动选数据类型，HF 上标 IQ4_XS 只是为了进 GGUF 表格显示（意思是"主量化方式 + 平均 bit 数"），实际不是 llama.cpp 的标准量化档。所以它跟 UD 不是一个体系，没法按档位比，只能实测比。Reddit 上有人测过口碑不错（tool-calling 错误更少、比 Q4_K_M 快约 9%），它家文件官方 llama.cpp 直接就能吃，想试随时能下。</p>
<p dir="auto"><strong>框架</strong><br />
稳定生产选官方 llama.cpp 最新 release，所有 GGUF（含 Byteshape 的）通吃。你列的几个 fork：ik_llama.cpp（ikawrakow，SOTA 量化出身，性能好但同步上游较旧）；buun-llama-cpp（实验向，KV cache codec 黑科技）；beellama.cpp（性能向，DFlash/TurboQuant，有人 3090 上 27B Q5 + 200K 上下文跑出 2-3 倍，峰值 135 t/s）——想榨速度可以试 beellama，出问题回官方。</p>
]]></description><link>https://lcz.me/post/14481</link><guid isPermaLink="true">https://lcz.me/post/14481</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Fri, 28 Aug 2026 01:20:46 GMT</pubDate></item></channel></rss>