<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[【首發實測】RTX 5070 Ti 16G 跑 Qwen3.8-27B 完整部署指南：從模型選擇到生產級調優，避坑全記錄]]></title><description><![CDATA[<p dir="auto"><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/26a0.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--warning" style="height:23px;width:auto;vertical-align:middle" title="⚠" alt="⚠" />️ <strong>此帖已過時，請參考新版：</strong></p>
<p dir="auto"><a href="https://lcz.me/topic/1207/">https://lcz.me/topic/1207/</a></p>
<hr />
<p dir="auto">新版已修正：</p>
<ul>
<li>Q4_K_M 與 IQ4_XS 定位對調修正</li>
<li>16GB 卡跑 27B 首選 IQ4_XS 全層（38-43 t/s）</li>
<li>Q4_K_M 需 offload（18-27 t/s）</li>
<li>MTP 於 16G 卡會 OOM，需 24G+ 顯存</li>
<li>移除「唯一」說法（Gemma-3-27B Q4_K_M 15.4GB 也能全層）</li>
</ul>
<p dir="auto">本帖保留僅為記錄，不再維護。</p>
]]></description><link>https://lcz.me/topic/1206/首發實測-rtx-5070-ti-16g-跑-qwen3.8-27b-完整部署指南-從模型選擇到生產級調優-避坑全記錄</link><generator>RSS for Node</generator><lastBuildDate>Sat, 22 Aug 2026 00:26:29 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1206.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 19 Aug 2026 18:26:21 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 【首發實測】RTX 5070 Ti 16G 跑 Qwen3.8-27B 完整部署指南：從模型選擇到生產級調優，避坑全記錄 on Fri, 21 Aug 2026 09:02:23 GMT]]></title><description><![CDATA[<p dir="auto">感謝逐條幫忙核數據，四點都已修正，新版 <a href="https://lcz.me/topic/1207/">#1207</a> 裡 Q4_K_M 和 IQ4_XS 的定位對調了，MTP 也改成「16G 卡上會 OOM」的措辭，「唯一」也拿掉了。舊帖保留僅為記錄。NVFP4 那邊如果 llama.cpp 更新了你方便跑一組對比數據，歡迎直接回在 1207 底下。</p>
]]></description><link>https://lcz.me/post/13305</link><guid isPermaLink="true">https://lcz.me/post/13305</guid><dc:creator><![CDATA[王池川]]></dc:creator><pubDate>Fri, 21 Aug 2026 09:02:23 GMT</pubDate></item><item><title><![CDATA[Reply to 【首發實測】RTX 5070 Ti 16G 跑 Qwen3.8-27B 完整部署指南：從模型選擇到生產級調優，避坑全記錄 on Fri, 21 Aug 2026 07:04:03 GMT]]></title><description><![CDATA[<p dir="auto">感謝逐條幫忙核數據，四點都已修正，新版 <a href="https://lcz.me/topic/1207/">#1207</a> 裡 Q4_K_M 和 IQ4_XS 的定位對調了，MTP 也改成「16G 卡上會 OOM」的措辭，「唯一」也拿掉了。舊帖保留僅為記錄。NVFP4 那邊如果 llama.cpp 更新了你方便跑一組對比數據，歡迎直接回在 1207 底下。</p>
]]></description><link>https://lcz.me/post/13257</link><guid isPermaLink="true">https://lcz.me/post/13257</guid><dc:creator><![CDATA[王池川]]></dc:creator><pubDate>Fri, 21 Aug 2026 07:04:03 GMT</pubDate></item><item><title><![CDATA[Reply to 【首發實測】RTX 5070 Ti 16G 跑 Qwen3.8-27B 完整部署指南：從模型選擇到生產級調優，避坑全記錄 on Wed, 19 Aug 2026 19:08:02 GMT]]></title><description><![CDATA[<p dir="auto">帮您把几个数字对一下，不然照着抄的坛友会踩坑：</p>
<p dir="auto"><strong>1. 结论里 16.5 + 1.2 = 15.8 是串行了</strong><br />
Q4_K_M 权重 16.5GB + 32K KV ≈ 1.2GB = 17.7GB，超 16GB。15.8GB 那个数是表格里 <strong>IQ4_XS</strong> 的最小显存（14.8GB 权重 + ~1GB KV），不是 Q4_K_M 的。</p>
<p dir="auto"><strong>2. "全层上 GPU、不 OOM" 只对 IQ4_XS 成立</strong></p>
<ul>
<li>16GB 卡（驱动再占 0.5-1GB）物理上装不下 16.5GB 的 Q4_K_M 全层，您表格自己写着 Q4_K_M 最小显存 17.5GB。</li>
<li>硬上只能 --ngl 28-30 丢几层给内存 + --cache-ram。带宽账（按 1 token/次前向、无投机解码）：896GB/s 读 ~15GB + PCIe 5.0 回传 ~1-2GB → decode 实际约 18-27 t/s，到不了 38-45。</li>
<li>您实测的 38-45 t/s 其实和 <strong>IQ4_XS 全层上卡</strong>吻合：896 ÷ 14.8 ≈ 60 t/s 理论 × ~75% 效率 ≈ 42 t/s。所以 16G 卡上 <strong>IQ4_XS 才是表格里 Q4_K_M 那个位置的选择</strong>，这两个的定位建议对调。</li>
</ul>
<p dir="auto"><strong>3. "16GB 上無 MTP 版本可用" 是显存放不下，不是没有版本</strong><br />
unsloth 官方就有 Qwen3.8-27B-MTP-GGUF（您 1204 帖的链接列表里也放了）。16G 卡跑不了是因为 MTP draft 模型要多占 ~1-2GB，IQ4_XS 都贴边——措辞建议改成"16G 卡上 MTP 会 OOM"更准确。</p>
<p dir="auto"><strong>4. "唯一能全层上 GPU 的密集模型" 也不成立</strong><br />
您自己的表里 Gemma-3-27B Q4_K_M 15.4GB &lt; 16GB，同样能全层。Gemma 编程弱一档的判断我同意，但"唯一"去掉更严谨——Qwen3.8 真正胜出的是 256K 上下文 + 原生工具调用。</p>
<p dir="auto">NVFP4 的判断完全同意：PR #21095 合并后 5070 Ti 才是完全体（~13GB / 55-65 t/s），那篇迁移指南值得期待。到时候我可以帮您跑一组 llama.cpp 最新版 + NVFP4 的对比数据。</p>
]]></description><link>https://lcz.me/post/12967</link><guid isPermaLink="true">https://lcz.me/post/12967</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Wed, 19 Aug 2026 19:08:02 GMT</pubDate></item></channel></rss>