<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[小白熬夜瞎折腾、瞎写，后期补齐验收报告，请各位大神指正。同时感谢特哥提供的交流平台🙏🏻🙏🏻🙏🏻]]></title><description><![CDATA[<p dir="auto">一、部署<br />
1、硬件与系统环境<br />
<img src="https://upload.lcz.me/uploads/7e487e71-1cb3-42bd-b473-c970e27780ea.jpeg" alt="9b4d56d2-e412-4b8c-9490-6c36da8c9683-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">2、部署基础资料<br />
<img src="https://upload.lcz.me/uploads/b97c1498-b993-44c0-bab3-b82e86c9b068.jpeg" alt="97149613-2e17-4542-aa70-6be8842dfbdd-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">3、显存依据<br />
<img src="https://upload.lcz.me/uploads/35074a4e-002e-482e-bfd0-971fea14d830.jpeg" alt="ce8f5c7f-b882-4cf3-b273-8afed14bbc30-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">4、部署方案<br />
1.）Docker方式（首选，完全不懂系统ROCm7.2.4）<br />
<img src="https://upload.lcz.me/uploads/16943233-abd1-4b7e-bb2e-1f62be06c9d2.jpeg" alt="4b7fb593-9b4f-4e31-98ab-2e3c06b959d2-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">pip方式（备选：需Python3.14虚拟环境）<br />
<img src="https://upload.lcz.me/uploads/149b0dbe-2531-43b1-8173-375f1c4023d4.jpeg" alt="b1d0d2a6-8ac2-4e23-8bcd-ae67fc5ad30a-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">2.）Ollama / llama.cpp（单用户 / 桌面体验）<br />
<img src="https://upload.lcz.me/uploads/bcb725c3-aa6e-4a55-82c3-42eb6cfe168e.jpeg" alt="fc268483-159b-4b1f-bf3d-b54d66be4289-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">3.）LM Studio（图形界面速开）<br />
<img src="https://upload.lcz.me/uploads/98633d5f-7f66-40c6-8913-d2db6dcee872.jpeg" alt="c527e89e-06a9-4d59-806b-a581ea682574-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">5、 性能预期<br />
<img src="https://upload.lcz.me/uploads/f187c738-0f9d-4d5e-9d0a-ddb7384deaab.jpeg" alt="7b604f5b-9ef7-42ad-b8a5-b99a26aa1e95-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">6、本机的特定事项<br />
<img src="https://upload.lcz.me/uploads/72d908b1-d391-4300-8d99-843a9b0735dd.jpeg" alt="e34020d6-8d0a-4d6c-9a52-e42e51aedac2-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">二、本机四项硬指标定制的最终方案</p>
<p dir="auto">1、 单用户使用：单用户 decode 是纯显存带宽瓶颈，正是 llama.cpp 系最擅长的场景。</p>
<p dir="auto">2、 128K+ 上下文：32GB 正好是社区公认「长上下文 + MTP + 视觉」全都要的起点档。</p>
<p dir="auto">3、 ≥30 t/s：短/中上下文（≤64K）轻松 40~55 t/s；128K 全程填满时约 25~35 t/s，属R9700 的 640 GB/s 带宽物理上限决定的临界区，须靠 MTP 与量化压线。</p>
<p dir="auto">4、稳定 + 准确：关键在量化档位 + reasoning effort + 采样温度三个设置</p>
<p dir="auto">三、 关键数字分析<br />
<img src="https://upload.lcz.me/uploads/b5c295db-24af-491b-a9d7-b1deca26e7d0.jpeg" alt="310954d5-e44c-40bd-8e90-24a2c4c543bb-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">四、搭建步骤</p>
<p dir="auto">① 环境保持</p>
<h1>保持 amdgpu.runpm=0（已修复的 SMU 挂起问题，是长期稳定运行的命根子）</h1>
<p dir="auto">rocm-smi --showproductname # 确认显示 gfx1201</p>
<p dir="auto">② 编译 llama.cpp（ROCm 7.2.4 直接可用）<br />
git clone <a href="https://github.com/ggml-org/llama.cpp" rel="nofollow ugc">https://github.com/ggml-org/llama.cpp</a> &amp;&amp; cd llama.cpp<br />
cmake -B build -DGGML_HIP=ON -DAMDGPU_TARGETS=gfx1201 -DCMAKE_BUILD_TYPE=Release<br />
cmake --build build -j20</p>
<p dir="auto">兜底：官方 AMD 实测 51.8 t/s 就是用 Vulkan 后端跑的；HIP 编译遇阻时，直接下官方预编译 Vulkan 版二进制同样达标。</p>
<p dir="auto">③ 下载模型<br />
huggingface-cli download unsloth/Qwen3.8-27B-GGUF UD-Q5_K_XL.gguf <br />
--local-dir /home/magicz890/models/qwen3.8 （我的部署文件夹）</p>
<h1>备选：AtomicChat/Qwen3.8-27B-GGUF 的 AD-Q5_K_M（20.2GB，质量再高半档）</h1>
<h1>需视觉：加下 DhruvalLabs 的 mmproj</h1>
<p dir="auto">④ 启动服务（核心参数全在这条命令里）</p>
<p dir="auto">./build/bin/llama-server <br />
-m /home/magicz890/models/qwen3.8/Qwen3.8-27B-UD-Q5_K_XL.gguf <br />
-c 131072 \ # 128K 上下文<br />
-ctk q8_0 -ctv q8_0 \ # KV 缓存量化：省一半显存+提速，质量几乎无损<br />
--spec-type draft-mtp \ # ★ MTP 投机解码（对应 LM Studio 的 MTP=2），必开<br />
-fa on \ # FlashAttention：长上下文提速关键<br />
-lm none \ # 对应 LM Studio 的「取消勾选 Try mmap」，权重钉死显存<br />
--reasoning-effort medium \ # ★ 控制思考链长度，省上下文+提速+不掉质量<br />
-ngl all \ # 全部层进显存<br />
-np 1 \ # 单用户 1 个槽位，KV 池全归你<br />
--temp 0.4 --top-p 0.9 \ # 低温采样：准确度↑ + MTP 草稿接受率↑（双重提速）<br />
--host 127.0.0.1 --port 8080</p>
<p dir="auto">⑤ 网页前端 + 开机自启<br />
docker run -d --name open-webui --restart unless-stopped -p 3000:8080 <br />
-e OPENAI_API_BASE_URL=<a href="http://127.0.0.1:8080/v1" rel="nofollow ugc">http://127.0.0.1:8080/v1</a> <br />
-e OPENAI_API_KEY=dummy <br />
-v open-webui:/app/backend/data <br />
<a href="http://ghcr.io/open-webui/open-webui:main" rel="nofollow ugc">ghcr.io/open-webui/open-webui:main</a></p>
<p dir="auto">systemd 单元（ /etc/systemd/system/qwen38.service ）要点： User=magicz890 、 ExecStart=上述完整命令 、Restart=on-failure 、 RestartSec=5 。</p>
<p dir="auto">⑥ 部署后验收<br />
./build/bin/llama-bench -m 模型路径 -c 8192 -n 64 # 先看短上下文速度<br />
rocm-smi # 跑推理时盯着 GPU 频率，确认没卡在 idle 时钟</p>
<p dir="auto">五、速度预期<br />
<img src="https://upload.lcz.me/uploads/4b158347-aa4b-4587-b3cb-8d6406d0a573.jpeg" alt="9e68a1c6-1ec8-4d27-bdcb-e2aa5b1b9f2f-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">六、 准确度保障清单（按重要性排序）<br />
<img src="https://upload.lcz.me/uploads/0f6e9254-b9a2-491b-8cc6-86713b97d29f.jpeg" alt="a6ddf4b3-4b74-42cb-a67e-9845e38c1b5c-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">七、7 稳定性保障清单（RDNA4 两个已知坑均已规避）<br />
<img src="https://upload.lcz.me/uploads/3ef7c775-9e1e-4632-bae4-ff0938097009.jpeg" alt="a155efd9-9eb3-49e0-8845-c75ba2e4f278-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">八、关于 256K 上下文的说明<br />
<img src="https://upload.lcz.me/uploads/44d1a01b-2f43-4a62-b5ac-5dea97d71d40.jpeg" alt="917f61d3-a138-4db7-8cc9-5e1c6b4bbeb6-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">九、注意事项<br />
<img src="https://upload.lcz.me/uploads/efe80f28-51e5-4c93-952d-549b81e92610.jpeg" alt="bb71f757-8da3-4fe6-9401-648ff43fd8e1-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">三、 多模态（视觉）方案<br />
1、知识点<br />
<img src="https://upload.lcz.me/uploads/585966d9-fc33-4c88-8433-7c88853311bb.jpeg" alt="9ec83683-849a-43a9-800c-a3a7f8d36ebf-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">2、工作原理与显存账<br />
<img src="https://upload.lcz.me/uploads/1b2ed396-c96f-415b-9c94-32013b401483.jpeg" alt="7d933919-34f5-4ef1-930f-17ca59fb404c-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">结论：视觉不用降量化档，Q5_K_M 主力地位不变；只有 Q6_K 因余量不足被排除。</p>
<p dir="auto">3、下载</p>
<h1>DhruvalLabs 的 VLM 版 GGUF 仓库（主权重 + mmproj 配套，官方架构同源）</h1>
<p dir="auto">huggingface-cli download DhruvalLabs/Qwen3.8-27B-GGUF <br />
Qwen3.8-27B-Q5_K_M.gguf Qwen3.8-27B-mmproj-f16.gguf <br />
--local-dir /home/magicz890/models/qwen3.8<br />
mmproj 必须与主权重配套（同一仓库、同一架构），不同作者混用会导致图像输出乱码或崩溃。</p>
<p dir="auto">4、 最终启动命令<br />
./build/bin/llama-server <br />
-m /home/magicz890/models/qwen3.8/Qwen3.8-27B-Q5_K_M.gguf <br />
--mmproj /home/magicz890/models/qwen3.8/Qwen3.8-27B-mmproj-f16.gguf \ # ★ 视觉投影<br />
-c 131072 \ # 128K 上下文<br />
-ctk q8_0 -ctv q8_0 \ # KV 缓存量化<br />
--spec-type draft-mtp \ # MTP 投机解码（必开）<br />
-fa on \ # FlashAttention<br />
-lm none \ # 权重钉死显存<br />
--reasoning-effort medium \ # ★ 思考强度（默认 xhigh，必须压）<br />
-ngl all -np 1 \ # 全层进显存、单槽位<br />
--temp 0.4 --top-p 0.9 \ # 低温采样（图像 OCR/图表理解也受益）<br />
--host 127.0.0.1 --port 8080<br />
懒人方式： --hf-repo DhruvalLabs/Qwen3.8-27B-GGUF:Q5_K_M 会自动下载主权重和 mmproj（llama-server 内置支持）。</p>
<p dir="auto">5、使用方式<br />
① Open WebUI（推荐，零成本）<br />
OpenAI 兼容接口原生支持 image_url ，对话框直接拖图上传即可：OCR、图表分析、截图问 bug 都能用。</p>
<p dir="auto">② 直接调 API<br />
curl <a href="http://127.0.0.1:8080/v1/chat/completions" rel="nofollow ugc">http://127.0.0.1:8080/v1/chat/completions</a> <br />
-H "Content-Type: application/json" <br />
-d '{<br />
"model": "qwen3.8",<br />
"messages": [{<br />
"role": "user",<br />
"content": [<br />
{"type": "text", "text": "这张电路图里有什么问题？"},<br />
{"type": "image_url", "image_url": {"url": "data:image/png;base64,&lt;BASE64&gt;"}}<br />
]<br />
}]<br />
}'</p>
<p dir="auto">③ 视频<br />
模型本身支持小时级长视频，但 llama.cpp 对该模型的视频采样支持属于前沿（官方长视频建议走 vLLM/<br />
SGLang 调 video_preprocessor_config ）。建议：图片路线先用 llama.cpp 主力，有长视频刚需再单独起官方vLLM 容器。</p>
<p dir="auto">6、 多模态场景注意事项<br />
1）图像 tokens 计入 128K 预算：连续贴图的长对话比纯文本更快填满上下文，控制单轮贴图数量；<br />
reasoning-effort medium 在此更重要（省下的思考长度就是图像空间）。<br />
2）默认思考强度是 xhigh：不设 --reasoning-effort 会「雷霆大思考」烧掉几十 K 上下文；medium 是底<br />
线，图多时用 low；也可透传 chat_template_kwargs: {"enable_thinking": true, "reasoning_effort":"medium"} 。<br />
3）低温采样对视觉任务同样重要：OCR/图表/数学题在 temp 0.3~0.5 下准确率明显更高，还顺带提高 MTP 草稿接受率。<br />
4）别上 Q6_K 开视觉：余量只有 ~2GB，多图并发容易 OOM；Q5_K_M 是视觉场景的天花板档。<br />
5）KV 缓存保持 q8_0：图像 tokens 会进 KV，q4_0 对长文档/图表问答有可测退化。<br />
6）MTP 与视觉无冲突：32GB 档验证过「视觉+MTP+128K」同开；个别版本 mmproj 报错时优先升级最新llama.cpp（RDNA4 修复一直在进）。</p>
<p dir="auto">7、最终档位表<br />
<img src="https://upload.lcz.me/uploads/f0968fb3-4118-433c-8d17-1e25ebcbaa69.jpeg" alt="051a2133-c927-42bd-9fd1-4ff94b2d3ed7-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">8、本机硬件参考<br />
<img src="https://upload.lcz.me/uploads/8dd69827-2b42-42e3-b916-07bb2cac197e.jpeg" alt="93675211-6a6c-43ba-a78d-789c188a50b3-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">四、验收</p>
<p dir="auto">1、总结：直接走「llama.cpp HIP 自编译 + DhruvalLabs Q5_K_M + mmproj + MTP(=2) + KVq8_0 + FlashAttention + 128K + reasoning-effort medium + 低温采样(temp<br />
0.3)」， 前端 Open WebUI，systemd 常驻——这是针对「单用户、128K+、≥30 t/<br />
s、稳定准确、多模态」全部需求、 在 R9700 32GB 上经过社区实测验证并已在本机实<br />
测复核的最优组合； 128K 填满时的速度临界点按「压线四招」处理。</p>
<p dir="auto">2、需求对标<br />
<img src="https://upload.lcz.me/uploads/3f477ce2-5d6a-4f1d-90fa-1a896cc21c35.jpeg" alt="02110a97-69e6-41c4-8e7f-50ad4d4055a6-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">3、快照<br />
<img src="https://upload.lcz.me/uploads/fb4731c3-d8b5-4a60-8513-bec562b64196.jpeg" alt="a366aefd-998e-4956-bcc0-1ee86aafbf65-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/1562</link><generator>RSS for Node</generator><lastBuildDate>Wed, 09 Sep 2026 22:54:45 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1562.rss" rel="self" type="application/rss+xml"/><pubDate>Tue, 08 Sep 2026 13:58:23 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 小白熬夜瞎折腾、瞎写，后期补齐验收报告，请各位大神指正。同时感谢特哥提供的交流平台🙏🏻🙏🏻🙏🏻 on Tue, 08 Sep 2026 18:09:56 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/johnnybegood" aria-label="Profile: johnnybegood">@<bdi>johnnybegood</bdi></a> 时区卡BUG了。</p>
]]></description><link>https://lcz.me/post/16769</link><guid isPermaLink="true">https://lcz.me/post/16769</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Tue, 08 Sep 2026 18:09:56 GMT</pubDate></item><item><title><![CDATA[Reply to 小白熬夜瞎折腾、瞎写，后期补齐验收报告，请各位大神指正。同时感谢特哥提供的交流平台🙏🏻🙏🏻🙏🏻 on Tue, 08 Sep 2026 17:34:14 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/johnnybegood" aria-label="Profile: johnnybegood">@<bdi>johnnybegood</bdi></a> <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f91d.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--handshake" style="height:23px;width:auto;vertical-align:middle" title=":handshake:" alt="🤝" /> <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f91d.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--handshake" style="height:23px;width:auto;vertical-align:middle" title=":handshake:" alt="🤝" /> <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f91d.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--handshake" style="height:23px;width:auto;vertical-align:middle" title=":handshake:" alt="🤝" /></p>
]]></description><link>https://lcz.me/post/16766</link><guid isPermaLink="true">https://lcz.me/post/16766</guid><dc:creator><![CDATA[Magic629]]></dc:creator><pubDate>Tue, 08 Sep 2026 17:34:14 GMT</pubDate></item><item><title><![CDATA[Reply to 小白熬夜瞎折腾、瞎写，后期补齐验收报告，请各位大神指正。同时感谢特哥提供的交流平台🙏🏻🙏🏻🙏🏻 on Tue, 08 Sep 2026 17:00:59 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 这位道友可能碰到了跟我一样的问题， 发帖后我的时间显示是“<strong>8小时后</strong>”， 不知道为啥， 应该是时区的问题， 所以刚发完贴， 只能等8小时之后才能修改帖子， 因为“不能修改还未发表的帖子” （未来的帖子）。</p>
]]></description><link>https://lcz.me/post/16764</link><guid isPermaLink="true">https://lcz.me/post/16764</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Tue, 08 Sep 2026 17:00:59 GMT</pubDate></item><item><title><![CDATA[Reply to 小白熬夜瞎折腾、瞎写，后期补齐验收报告，请各位大神指正。同时感谢特哥提供的交流平台🙏🏻🙏🏻🙏🏻 on Tue, 08 Sep 2026 16:41:44 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 好的特哥，我在研究研究，后期补图。</p>
]]></description><link>https://lcz.me/post/16763</link><guid isPermaLink="true">https://lcz.me/post/16763</guid><dc:creator><![CDATA[Magic629]]></dc:creator><pubDate>Tue, 08 Sep 2026 16:41:44 GMT</pubDate></item><item><title><![CDATA[Reply to 小白熬夜瞎折腾、瞎写，后期补齐验收报告，请各位大神指正。同时感谢特哥提供的交流平台🙏🏻🙏🏻🙏🏻 on Tue, 08 Sep 2026 16:09:39 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 好的，我慢慢学习补充，感谢特哥指正。</p>
]]></description><link>https://lcz.me/post/16752</link><guid isPermaLink="true">https://lcz.me/post/16752</guid><dc:creator><![CDATA[Magic629]]></dc:creator><pubDate>Tue, 08 Sep 2026 16:09:39 GMT</pubDate></item><item><title><![CDATA[Reply to 小白熬夜瞎折腾、瞎写，后期补齐验收报告，请各位大神指正。同时感谢特哥提供的交流平台🙏🏻🙏🏻🙏🏻 on Tue, 08 Sep 2026 14:50:03 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/magic629" aria-label="Profile: Magic629">@<bdi>Magic629</bdi></a> 自己的帖子不能修改吗？发帖之后可以修改的吧。只要没超时。另外你不用赌钱拿不发截图啊，你复制让AI整理成markdown就可以了。跑的时候有些日志，实拍显卡之类的，才需要图片。</p>
]]></description><link>https://lcz.me/post/16730</link><guid isPermaLink="true">https://lcz.me/post/16730</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Tue, 08 Sep 2026 14:50:03 GMT</pubDate></item><item><title><![CDATA[Reply to 小白熬夜瞎折腾、瞎写，后期补齐验收报告，请各位大神指正。同时感谢特哥提供的交流平台🙏🏻🙏🏻🙏🏻 on Tue, 08 Sep 2026 14:14:36 GMT]]></title><description><![CDATA[<p dir="auto">第一张图贴错了，我现在用的系统是Ubuntu24.04，不好意思，现在不知道还能修改不？目前使用比Win11运行中Token输出快10%-15%。</p>
]]></description><link>https://lcz.me/post/16702</link><guid isPermaLink="true">https://lcz.me/post/16702</guid><dc:creator><![CDATA[Magic629]]></dc:creator><pubDate>Tue, 08 Sep 2026 14:14:36 GMT</pubDate></item></channel></rss>