<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[借着QWEN3.8MOE的发布，秀一下QWEN3.6MOE DDR4的性能]]></title><description><![CDATA[<pre><code>.\hermeswork\llama.cpp\build\bin\Release\llama-server.exe -m D:\hermeswork\models\Qwen3.6-35B-A3B-uncensored-heretic-Native-MTP-Preserved-Q8_0.gguf `
 -c 262144 `
 -ngl 999 `
 -t 24 `
 -tb 24 `
 -b 32768 `
 -ub 4096 `
 -np 1 `
 -ncmoe 26 `
 --temp 0.1 `
 --top-p 0.9 `
 --top-k 40 `
 --min-p 0.05 `
 --presence-penalty 1.0 `
 --repeat-penalty 1.05 `
 --flash-attn on `
 --reasoning off `
 -ctk q8_0 `
 -ctv q8_0 `
 -cms 16384 `
 --ctx-checkpoints 48 `
 --cache-reuse 4096 `
 --host 0.0.0.0 `
 --port 11434 `
 --load-mode mlock

</code></pre>
<p dir="auto">初始PR1400,32TS，讲真这个量化精度其实损失很低了，我下载模型的时候打算用MTP的，后来发现MTP不会带来任何的加速，我估计是PCI带宽是瓶颈，（还轮不到DDR4）<br />
咦我好像发不了图片</p>
]]></description><link>https://lcz.me/topic/1342</link><generator>RSS for Node</generator><lastBuildDate>Thu, 10 Sep 2026 00:43:56 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1342.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 26 Aug 2026 15:38:19 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 借着QWEN3.8MOE的发布，秀一下QWEN3.6MOE DDR4的性能 on Wed, 26 Aug 2026 15:43:15 GMT]]></title><description><![CDATA[<p dir="auto">所以125BA6BMOE很值得期待啊，从我的这套东西跑Ds4F的裁剪版本经验来看，PR800，15TS应该可以做到，结合DSH跑长任务的能力，也许垃圾硬件真就可以干活了。</p>
]]></description><link>https://lcz.me/post/14166</link><guid isPermaLink="true">https://lcz.me/post/14166</guid><dc:creator><![CDATA[vosrock]]></dc:creator><pubDate>Wed, 26 Aug 2026 15:43:15 GMT</pubDate></item></channel></rss>