<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[SGLang运行Qwen3.6-27B-AWQ/FP8成功（双3080 20G）]]></title><description><![CDATA[<h1>SGLang运行Qwen3.6-27B-AWQ/FP8成功（双3080 20G）</h1>
<h2>目录</h2>
<ul>
<li>Qwen3.6-27B-FP8</li>
<li>Qwen3.6-27B-AWQ-INT4</li>
<li>Qwen3.6-27B-AWQ-MTP</li>
<li>会话测试</li>
<li>最后</li>
</ul>
<h2>Qwen3.6-27B-FP8</h2>
<p dir="auto"><img src="https://upload.lcz.me/uploads/6fbdaa54-14d7-48eb-aee7-8671cff1731d.jpeg" alt="04575d3b-9658-40bb-b24b-aab697ea07ab-image.jpeg" class=" img-fluid img-markdown" /></p>
<ul>
<li>生成速度 38t/s，非常稳定</li>
<li>总上下文长度纯文推理到170K左右，显存吃紧</li>
</ul>
<h2>Qwen3.6-27B-AWQ-INT4</h2>
<p dir="auto"><img src="https://upload.lcz.me/uploads/a84fe709-bea7-4357-9ac2-8486cdc8bb65.jpeg" alt="7a2dffe2-ca9e-4100-9f4b-569e8400bc54-image.jpeg" class=" img-fluid img-markdown" /></p>
<ul>
<li>生成速度 ~53-54 token/s</li>
<li>总上下文长度 380k 左右（应该还可优化），显存充裕</li>
</ul>
<h2>Qwen3.6-27B-AWQ-MTP</h2>
<p dir="auto"><img src="https://upload.lcz.me/uploads/f9625a8e-9ddc-46d1-b555-06713e9e040f.jpeg" alt="9490413a-5c66-417f-b44d-0909ffdc9efc-image.jpeg" class=" img-fluid img-markdown" /></p>
<ul>
<li>生成速度 65–83 token/s</li>
<li>总上下文长度 260k 左右（应该还可优化），显存充裕</li>
</ul>
<h2>对话测试</h2>
<ul>
<li>
<ol>
<li></li>
</ol>
</li>
</ul>
<p dir="auto"><img src="https://upload.lcz.me/uploads/069c7385-a08b-40b7-a90c-658410c9c0b2.jpeg" alt="84bec4bd-6176-4583-b7a1-109ddd2636d1-image.jpeg" class=" img-fluid img-markdown" /></p>
<ul>
<li>
<ol start="2">
<li></li>
</ol>
</li>
</ul>
<p dir="auto"><img src="https://upload.lcz.me/uploads/e56ecc3d-1db0-4742-ad8f-00450887be94.jpeg" alt="9539120f-b13f-4ad5-9479-5320e68fcb33-image.jpeg" class=" img-fluid img-markdown" /><br />
-3.<br />
<img src="https://upload.lcz.me/uploads/30682bb9-a20f-4552-b25d-df12bfa55034.jpeg" alt="cf311266-b0bd-45e5-9fbc-c3844b280e06-image.jpeg" class=" img-fluid img-markdown" /></p>
<h2>最后</h2>
<ul>
<li>SGLang版本0.5.16</li>
<li>启动参数只需很基本的参数即可，无需太复杂</li>
<li>之前没成功可能：1. SGLang版本问题  2. CUDA-tools版本与torch版本匹配问题</li>
<li>随问随答的感觉很好，mama再也不用担心等太久花谢了</li>
</ul>
]]></description><link>https://lcz.me/topic/985/sglang运行qwen3.6-27b-awq-fp8成功-双3080-20g</link><generator>RSS for Node</generator><lastBuildDate>Tue, 11 Aug 2026 13:47:02 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/985.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 31 Jul 2026 11:41:48 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to SGLang运行Qwen3.6-27B-AWQ/FP8成功（双3080 20G） on Sun, 09 Aug 2026 12:01:40 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/ydm" aria-label="Profile: YDM">@<bdi>YDM</bdi></a> 这个和SG-lang无关，和模型有关，Qwen也不是每次都能答对。训练过的就100%能答对。</p>
]]></description><link>https://lcz.me/post/11784</link><guid isPermaLink="true">https://lcz.me/post/11784</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Sun, 09 Aug 2026 12:01:40 GMT</pubDate></item><item><title><![CDATA[Reply to SGLang运行Qwen3.6-27B-AWQ/FP8成功（双3080 20G） on Sun, 09 Aug 2026 12:08:13 GMT]]></title><description><![CDATA[<p dir="auto">我雙5070ti 16gb llama.cpp用Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-Q5_K_M.gguf，跑hermes 問去洗車的問題。<br />
<img src="https://upload.lcz.me/uploads/7c75f839-4671-486e-bf8b-8863fffd166c.jpeg" alt="f9f083b6-ec0d-4546-a5b2-2401884e148b-image.jpeg" class=" img-fluid img-markdown" /><br />
<img src="https://upload.lcz.me/uploads/420d79e0-6b3e-49b1-ba94-48897bbfb853.jpeg" alt="45ef730c-1257-4e63-8122-0cd52b220d04-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">SGLang 學習中!!~</p>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 好的，跑題了^^!!</p>
]]></description><link>https://lcz.me/post/11783</link><guid isPermaLink="true">https://lcz.me/post/11783</guid><dc:creator><![CDATA[YDM]]></dc:creator><pubDate>Sun, 09 Aug 2026 12:08:13 GMT</pubDate></item><item><title><![CDATA[Reply to SGLang运行Qwen3.6-27B-AWQ/FP8成功（双3080 20G） on Sun, 09 Aug 2026 09:05:34 GMT]]></title><description><![CDATA[<p dir="auto">50+ token/s 是真香，用过才知道 20+ 还是太苦了</p>
]]></description><link>https://lcz.me/post/11781</link><guid isPermaLink="true">https://lcz.me/post/11781</guid><dc:creator><![CDATA[linkdesu]]></dc:creator><pubDate>Sun, 09 Aug 2026 09:05:34 GMT</pubDate></item><item><title><![CDATA[Reply to SGLang运行Qwen3.6-27B-AWQ/FP8成功（双3080 20G） on Sun, 09 Aug 2026 03:37:29 GMT]]></title><description><![CDATA[<p dir="auto">这两天在 GDX 上折腾 SGLang 配 27B。还是有点坑的。默认 Mamba 开很大，不匹配你的并发数。认不全统一内存的总量，kvcache 被 Mamba 挤压。手动设置Mamba size 要注意 和并发数不是 1 :1。最后我把--mem-fraction-static 1.4 才勉强把 kvcache 撑起来。</p>
]]></description><link>https://lcz.me/post/11760</link><guid isPermaLink="true">https://lcz.me/post/11760</guid><dc:creator><![CDATA[包磊]]></dc:creator><pubDate>Sun, 09 Aug 2026 03:37:29 GMT</pubDate></item></channel></rss>