<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。]]></title><description><![CDATA[<p dir="auto">这几天一直在看特哥的视频，真的收获很大，先特此表达一下感谢<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f64f.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--pray" style="height:23px;width:auto;vertical-align:middle" title="🙏" alt="🙏" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f3fb.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--skin-tone-2" style="height:23px;width:auto;vertical-align:middle" title="🏻" alt="🏻" />。</p>
<p dir="auto">同时也想借此机会请教一个问题。最近我入手了一张 AMD AI Pro R9700 显卡，并在 AI 助手的帮助下，在本地部署了 Qwen3.8-27B 模型，主要用于日常实验和办公学习。我本人算是纯小白，不太懂底层技术，基本是靠 AI 一步步指导完成的。</p>
<p dir="auto">使用几天后，我注意到一个现象：在上下文长度设为 256K 的情况下，token 生成速度从原来的 30+ 降到了 20+ Tokens/s，性能有一定回落。</p>
<p dir="auto">由于在特哥的视频里经常听到，在 Ubuntu 系统下部署模型，性能和稳定性会更有优势，所以我特意让帮我部署的 AI 查了相关资料，并尝试验证这个说法是否成立。不过得到的反馈是“提升空间不大，没必要再折腾”。</p>
<p dir="auto">考虑到自己经验有限，还是想把这几天的部署和测试资料整理出来，发到论坛里供大家参考，也真心希望能听听各位有经验的大佬的看法和建议。</p>
<p dir="auto">提前谢谢各位了～！<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f64f.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--pray" style="height:23px;width:auto;vertical-align:middle" title="🙏" alt="🙏" /></p>
<p dir="auto"><a href="%5B%5Berror:api.413%5D%5D">llama-cpp-局域网AI服务器-完整部署手册.pdf</a> <a href="%5B%5Berror:api.413%5D%5D">llama-cpp-模型服务启动与使用指南.pdf</a> <a href="%5B%5Berror:api.413%5D%5D">llama-cpp-Qwen3.8-部署与测试报告.pdf</a> <a href="%5B%5Berror:api.413%5D%5D">llama-server修改规划与验证结果-2026-09-02.pdf</a><br />
<img src="https://upload.lcz.me/uploads/4d05727a-7f62-4799-b3d1-0f39375022dc.png" alt="截屏2026-09-01 04.54.38.png" class=" img-fluid img-markdown" /><br />
<img src="https://upload.lcz.me/uploads/917ed49d-0bb9-4508-846a-a3fd2ad08498.jpg" alt="截屏2026-09-02 02.28.49.jpg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/1459</link><generator>RSS for Node</generator><lastBuildDate>Thu, 10 Sep 2026 00:43:35 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1459.rss" rel="self" type="application/rss+xml"/><pubDate>Tue, 01 Sep 2026 19:31:33 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。 on Tue, 08 Sep 2026 18:21:05 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/imbiplaza-asus" aria-label="Profile: imbiplaza-ASUS">@<bdi>imbiplaza-ASUS</bdi></a> 我也想试试sglang怎么样？今晚是不是要搞搞看啥是sglang，我也很好奇。</p>
]]></description><link>https://lcz.me/post/16774</link><guid isPermaLink="true">https://lcz.me/post/16774</guid><dc:creator><![CDATA[Magic629]]></dc:creator><pubDate>Tue, 08 Sep 2026 18:21:05 GMT</pubDate></item><item><title><![CDATA[Reply to 本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。 on Tue, 08 Sep 2026 16:39:20 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/williamlouis" aria-label="Profile: williamlouis">@<bdi>williamlouis</bdi></a> 感谢指点，我已换到Ubuntu24.04中，确实提速很明显。我在Ubuntu中部署的时候，显卡驱动安装时有几次失败，在彻底断电以后等待10秒，然后重启驱动加载成功，这个是我遇到的一个坑，希望其他人别遇到。</p>
]]></description><link>https://lcz.me/post/16762</link><guid isPermaLink="true">https://lcz.me/post/16762</guid><dc:creator><![CDATA[Magic629]]></dc:creator><pubDate>Tue, 08 Sep 2026 16:39:20 GMT</pubDate></item><item><title><![CDATA[Reply to 本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。 on Tue, 08 Sep 2026 16:35:15 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/imbiplaza-asus" aria-label="Profile: imbiplaza-ASUS">@<bdi>imbiplaza-ASUS</bdi></a> 谢谢指点！感谢<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f64f.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--pray" style="height:23px;width:auto;vertical-align:middle" title="🙏" alt="🙏" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f3fb.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--skin-tone-2" style="height:23px;width:auto;vertical-align:middle" title="🏻" alt="🏻" /></p>
]]></description><link>https://lcz.me/post/16761</link><guid isPermaLink="true">https://lcz.me/post/16761</guid><dc:creator><![CDATA[Magic629]]></dc:creator><pubDate>Tue, 08 Sep 2026 16:35:15 GMT</pubDate></item><item><title><![CDATA[Reply to 本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。 on Tue, 08 Sep 2026 14:19:42 GMT]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/101f096c-78c5-44e8-86fa-f03ffe0c7f08.jpeg" alt="2523be19-2cda-486c-85d4-52438877d5f1-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">单单sglang 这个理由。。。没有理由不用linux</p>
]]></description><link>https://lcz.me/post/16708</link><guid isPermaLink="true">https://lcz.me/post/16708</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Tue, 08 Sep 2026 14:19:42 GMT</pubDate></item><item><title><![CDATA[Reply to 本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。 on Tue, 08 Sep 2026 14:07:27 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/williamlouis" aria-label="Profile: williamlouis">@<bdi>williamlouis</bdi></a> 我换成Ubuntu24.04以后，Token一般可以稳定在35-45之间。除非上下文用到100K后会下降到32左右。处理一般任务足够了，短上下文可以在43左右。</p>
]]></description><link>https://lcz.me/post/16700</link><guid isPermaLink="true">https://lcz.me/post/16700</guid><dc:creator><![CDATA[Magic629]]></dc:creator><pubDate>Tue, 08 Sep 2026 14:07:27 GMT</pubDate></item><item><title><![CDATA[Reply to 本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。 on Wed, 02 Sep 2026 15:30:26 GMT]]></title><description><![CDATA[<p dir="auto">我在用这张卡。用的VLLM。主机配置太垃圾。但是也能跑50T/s.<br />
你可以换个 在线AI 配置试试。30-20这个速度是有点LOW。</p>
]]></description><link>https://lcz.me/post/15527</link><guid isPermaLink="true">https://lcz.me/post/15527</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Wed, 02 Sep 2026 15:30:26 GMT</pubDate></item><item><title><![CDATA[Reply to 本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。 on Wed, 02 Sep 2026 08:30:49 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 谢谢特哥</p>
]]></description><link>https://lcz.me/post/15459</link><guid isPermaLink="true">https://lcz.me/post/15459</guid><dc:creator><![CDATA[Magic629]]></dc:creator><pubDate>Wed, 02 Sep 2026 08:30:49 GMT</pubDate></item><item><title><![CDATA[Reply to 本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。 on Wed, 02 Sep 2026 08:28:43 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/kop-wang" aria-label="Profile: kop-wang">@<bdi>kop-wang</bdi></a> 感谢<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f64f.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--pray" style="height:23px;width:auto;vertical-align:middle" title="🙏" alt="🙏" /></p>
]]></description><link>https://lcz.me/post/15457</link><guid isPermaLink="true">https://lcz.me/post/15457</guid><dc:creator><![CDATA[Magic629]]></dc:creator><pubDate>Wed, 02 Sep 2026 08:28:43 GMT</pubDate></item><item><title><![CDATA[Reply to 本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。 on Wed, 02 Sep 2026 07:12:06 GMT]]></title><description><![CDATA[<p dir="auto">简单说，Linux是为服务而生的，它长期运行稳定性是第一考量，windows的UI设计从一开始就耦合严重，一坨狗屎。Win10本来有机会抢救下，但是三哥接管了win11，直接凉凉。</p>
]]></description><link>https://lcz.me/post/15438</link><guid isPermaLink="true">https://lcz.me/post/15438</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Wed, 02 Sep 2026 07:12:06 GMT</pubDate></item><item><title><![CDATA[Reply to 本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。 on Wed, 02 Sep 2026 03:16:11 GMT]]></title><description><![CDATA[<p dir="auto">我现在只是设定 51200 而已，因为我观察过每一次的处理都是 1万左右</p>
]]></description><link>https://lcz.me/post/15408</link><guid isPermaLink="true">https://lcz.me/post/15408</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Wed, 02 Sep 2026 03:16:11 GMT</pubDate></item><item><title><![CDATA[Reply to 本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。 on Wed, 02 Sep 2026 03:17:43 GMT]]></title><description><![CDATA[<p dir="auto">Linux系统的优势主要在兼容性和生态选择性上。<br />
完全一致的生态的前提下，尤其是你选用的是llama.cpp，win和linux在工具，或者说运行层面基本上可以说没有性能差距。</p>
<p dir="auto">但是系统环境上是有差距的。比如冷启动后的ram占用，linux可以压到4GB以下，但是win一般而言会直接占总内存的20%~30%。</p>
<p dir="auto">“使用几天后，我注意到一个现象：在上下文长度设为 256K 的情况下，token 生成速度从原来的 30+ 降到了 20+ Tokens/s，性能有一定回落。”</p>
<p dir="auto">这个是正常的。越往后概率推演，每个轮次需要统计的上文就越多，必然会越慢</p>
]]></description><link>https://lcz.me/post/15407</link><guid isPermaLink="true">https://lcz.me/post/15407</guid><dc:creator><![CDATA[kop wang]]></dc:creator><pubDate>Wed, 02 Sep 2026 03:17:43 GMT</pubDate></item><item><title><![CDATA[Reply to 本人小白，希望得到论坛大神指点，在win系统和Ubuntu系统里部署本地大模型运行验证资料。 on Tue, 01 Sep 2026 22:03:10 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/magic629" aria-label="Profile: Magic629">@<bdi>Magic629</bdi></a> 这个掉速是正常现象，不是配置问题，先放心。</p>
<p dir="auto"><strong>为什么 30+ 变 20+</strong>：解码时每生成一个 token，都要把整个 KV Cache 读一遍做 attention，而 KV 是随上下文长度线性增长的。Qwen3.8-27B 的 q8_0 KV 大约 37KB/token，256K 上下文就是约 9.5GB。上下文越长，每个 token 的注意力计算量越大，速度就按这条曲线回落。30→20 这个幅度是正常的线性衰减，换任何卡、任何系统都一样。</p>
<p dir="auto"><strong>先确认没溢出</strong>：R9700 是 32G。Q4_K_M 权重约 19GB + 256K 的 q8 KV 约 9.5GB ≈ 28.5GB，勉强塞得下；如果用的是 Q8_0 权重（约 28.6GB）再加 KV 就超了，会 spill 到内存，掉速会比现在狠得多。可以看 llama-server 日志里的 offloaded 层数，确认 -ngl 是满的、没走内存。</p>
<p dir="auto"><strong>Ubuntu 是不是更快</strong>：这个说法一半对一半错。</p>
<ul>
<li>llama.cpp 的解码速度主要由显存带宽决定，跟操作系统关系不大，Linux 不会天生快 30%。</li>
<li>但 AMD 卡有个特例：Windows 上没有官方 ROCm 驱动（只能用 Vulkan，或慢很多的 DirectML），Linux 才有官方 ROCm/HIP 后端。所以 AMD 卡在 Linux 上 prefill 和部分 kernel 确实会略快，量级大概 5-15%，不是质变。</li>
<li>你已经在 Windows 上跑到 30+ t/s，说明 Vulkan 配置没问题，纯小白不建议为这点提升折腾换系统。真想试，WSL2 + ROCm 是 AMD 官方支持的低摩擦路径，不用动主系统。</li>
</ul>
<p dir="auto"><strong>更务实的做法</strong>：256K 是给"一次性塞长文档"用的，日常对话/实验把上下文设 32-64K，速度立刻回到 30+。想要 256K 保持全速，只能靠更大显存——这就是论坛里常说"大显存才是王道"的原因。</p>
<p dir="auto">想验证掉速是否健康：固定一个 prompt，测 8K/32K/128K/256K 几个档位的 t/s，画出来应该是平滑线性下降；如果某个点突然断崖式跳水，那才是溢出/offload 的问题，到时候把 llama-server 日志贴上来我再帮你看。</p>
<p dir="auto">PDF 资料整理得挺工整，欢迎发出来给大家参考 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f44d.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--+1" style="height:23px;width:auto;vertical-align:middle" title="👍" alt="👍" /></p>
]]></description><link>https://lcz.me/post/15385</link><guid isPermaLink="true">https://lcz.me/post/15385</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Tue, 01 Sep 2026 22:03:10 GMT</pubDate></item></channel></rss>