<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[RTX3090单卡 24G继续狂奔,测一个9天前发布的2比特 12G 千问3.6-35B模型（160K,F16 KV CACHE?)]]></title><description><![CDATA[<p dir="auto">没买到第二张RTX 3090 （全新的要1万，黑猛禽也要9300），那就慢慢看吧。<br />
这两天顺便折腾了一下，把P100 16G放在第二个PCIE上面跟3090做 8X/8X拆分，拆分是拆分了，但是也跑不起来。<br />
最后索性把视觉塔卸载到P100上面，3090里面全部放权重。160K上下文+Q8 KVCACHE就这样跑着吧。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/4dd262ef-e961-4c6c-a2f0-c55e860b937b.jpeg" alt="6d93fd0d-6803-4c87-9ba2-d44ef58de346-image.jpeg" class=" img-fluid img-markdown" /><br />
今天逛X的时候有个新发现，眼前一亮。号称12G权重，另一个X用户说双F16 都可以跑，这也过于逆天了吧。 以下是那个实验室自己发布的评测数据：<br />
<img src="https://upload.lcz.me/uploads/c6eb5668-025f-4f58-935c-8f666529cc27.jpeg" alt="34557350-183a-481c-84c8-1f203799cf06-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/e75b860a-77db-4d30-b61a-95c1e26d951b.jpeg" alt="8b60ddbe-4b01-453b-bb7d-ce702772493a-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">另一个X用户发表的，F16 KV CACHE，164K上下文：<br />
<img src="https://upload.lcz.me/uploads/21a16321-ccab-4fad-aa48-f5a32c6a84ac.jpeg" alt="53d22689-62b6-4f24-b017-bca24316eea1-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">按它这种算法 ，那RTX 4090 48G不得跑上480K上下文？</p>
<p dir="auto"><a href="http://xn--hf-mirror-pw7n31tj27v.com" rel="nofollow ugc">首先从hf-mirror.com</a>，依然无法下载，依然是xet问题，看来我大天朝还没人下载过这模型。<br />
然后modelscope居然已经有了（<a href="https://modelscope.cn/models/EschaLabs/Qwen3.6-35B-A3B-Escha-W2" rel="nofollow ugc">https://modelscope.cn/models/EschaLabs/Qwen3.6-35B-A3B-Escha-W2</a>  <a href="https://huggingface.co/EschaLabs/escha-runtime-qwen3moe" rel="nofollow ugc">https://huggingface.co/EschaLabs/escha-runtime-qwen3moe</a> 可以把这两个URL丢 给HERMES，给它30G硬盘空间，然后坐等开玩），我让hermes自己折腾了 半小时：</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/fc89e0a9-4a23-4156-94df-79197fb9f7c4.jpeg" alt="b53766ce-c896-4b68-a740-2703de90346a-image.jpeg" class=" img-fluid img-markdown" /><br />
安装阶段都是qwen 3.6 35b a3b搞掂的，后来有CUDA 13与CUDA 12.9的兼容性问题，切来切去太麻烦，就deepseek v4 flash搞掂的。<br />
赶紧开玩：<br />
<img src="%5B%5Berror:api.413%5D%5D" alt="ceb1cb97-5936-41da-a3b9-bfc940bc096f-image.jpeg" class=" img-fluid img-markdown" /><br />
起始有135左右，过了一会儿掉到了110多。 没有WEBUI还真不习惯，先拉个openwebui的镜像试试。</p>
<p dir="auto">tooleval 分数，掉分全部掉在了预填充上面：<br />
<img src="https://upload.lcz.me/uploads/72c7313f-2a89-44b0-89a8-26d97d9f26b1.jpeg" alt="87431eef-cef1-4e1c-9eba-8c03b9a3b800-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/1043</link><generator>RSS for Node</generator><lastBuildDate>Thu, 10 Sep 2026 00:43:31 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1043.rss" rel="self" type="application/rss+xml"/><pubDate>Thu, 06 Aug 2026 16:51:28 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to RTX3090单卡 24G继续狂奔,测一个9天前发布的2比特 12G 千问3.6-35B模型（160K,F16 KV CACHE?) on Wed, 12 Aug 2026 08:49:51 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/stxpnet" aria-label="Profile: stxpnet">@<bdi>stxpnet</bdi></a> <a href="/post/11577">说</a>:</p>
<p dir="auto">没买到第二张RTX 3090 （全新的要1万，黑猛禽也要9300）</p>
</blockquote>
<p dir="auto">我就不信还能买到全新的......</p>
]]></description><link>https://lcz.me/post/11962</link><guid isPermaLink="true">https://lcz.me/post/11962</guid><dc:creator><![CDATA[joker_chang]]></dc:creator><pubDate>Wed, 12 Aug 2026 08:49:51 GMT</pubDate></item><item><title><![CDATA[Reply to RTX3090单卡 24G继续狂奔,测一个9天前发布的2比特 12G 千问3.6-35B模型（160K,F16 KV CACHE?) on Fri, 07 Aug 2026 03:15:30 GMT]]></title><description><![CDATA[<p dir="auto">2比特这些都是垃圾，不具备可用性。黑盒存在不值得尝试，一秒钟都不值得浪费。</p>
]]></description><link>https://lcz.me/post/11605</link><guid isPermaLink="true">https://lcz.me/post/11605</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Fri, 07 Aug 2026 03:15:30 GMT</pubDate></item><item><title><![CDATA[Reply to RTX3090单卡 24G继续狂奔,测一个9天前发布的2比特 12G 千问3.6-35B模型（160K,F16 KV CACHE?) on Fri, 07 Aug 2026 02:18:07 GMT]]></title><description><![CDATA[<p dir="auto">要特意用自家東西的時候已經要打上一個大問號了</p>
]]></description><link>https://lcz.me/post/11598</link><guid isPermaLink="true">https://lcz.me/post/11598</guid><dc:creator><![CDATA[566656661]]></dc:creator><pubDate>Fri, 07 Aug 2026 02:18:07 GMT</pubDate></item><item><title><![CDATA[Reply to RTX3090单卡 24G继续狂奔,测一个9天前发布的2比特 12G 千问3.6-35B模型（160K,F16 KV CACHE?) on Fri, 07 Aug 2026 00:19:19 GMT]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/8bd945e2-c6e7-41aa-9c87-d0ee7666eb19.jpeg" alt="bce4c408-7a04-45b5-b294-79443ec7c927-image.jpeg" class=" img-fluid img-markdown" /><br />
WEBUI写出来的坦克大战，挺惊艳的，但是一动就卡死了。</p>
<p dir="auto">用hermes调用 它写出来的超级玛丽，画面相对惊艳，但是依旧进游戏之后，卡死动不了。感觉循环很严重：<br />
<img src="https://upload.lcz.me/uploads/38270098-3d50-4ea1-a3b4-e22a682e8f20.jpeg" alt="3adaba03-3098-4182-8ab0-3309d6f4fc13-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">另外这个模型需要单独的运行时和可执行程序,reddit有人质疑存在恶意软件风险：<br />
<img src="https://upload.lcz.me/uploads/201f8452-c231-4d57-be18-fae2db15255c.jpeg" alt="64b690ec-00dc-4bac-bd7d-d7e1426097cb-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">一句话总结：有一定潜力，但不多，给我的感觉很像那个bonsai 27B,可以留足够大的空间给K V CACHE，但感觉总差点意思，很可能是原始权重与 k/v cache之间量化等级差异过大（权重约2-3BPW,K V CACHE却是Q8-F16等级） 。<br />
缺点：1.没有视觉。 我还是回到我的初始方案。甚至让我想测一测UNSLOTH的Q3KM MTP的效果。<br />
2.可执行文件是闭源的，有恶意软件风险，没把握的要在关掉之前让HERMES自己排查一下系统，晚上睡觉关机。</p>
]]></description><link>https://lcz.me/post/11591</link><guid isPermaLink="true">https://lcz.me/post/11591</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Fri, 07 Aug 2026 00:19:19 GMT</pubDate></item></channel></rss>