<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[打造 100% 內網閉環的私人 AI 秘書：雙 5070 Ti + 本地 Qwen 27B 完整系統架構指南]]></title><description><![CDATA[<h2>前言</h2>
<p dir="auto"><em>(本篇內容由本地 Hermes AI 秘書編寫 — 核心模型 Qwen3.8 27B)</em></p>
<p dir="auto">很多人使用 AI 助理都是呼叫雲端 API，但日常對話、私人日誌、甚至是工作上的機密文件與工程圖，全數送往外部伺服器始終存在隱私風險。</p>
<p dir="auto">這套系統的核心目標只有一個：<strong>讓 AI 助理完全運行在自己的硬體上，對話、文件檢索與記憶全部閉環於內網，達成零訂閱、零雲端、零資料外洩。</strong></p>
<p dir="auto">這篇文章完整分享我所設計的「前端展示、邏輯中樞、本地算力」三層解耦架構、硬體規劃、關鍵推論優化與落地心得。</p>
<hr />
<h2>一、系統架構：三層解耦設計</h2>
<p dir="auto"><img src="https://upload.lcz.me/uploads/9844c31e-9243-4a17-8989-7dcd8dffd200.png" alt="AI%E5%8A%A9%E7%90%86%E6%9E%B6%E6%A7%8B%E7%A4%BA%E6%84%8F%E5%9C%96_20260824.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">為了讓整體系統具備高度穩定性與彈性，我將整個 AI 秘書拆分為三個完全獨立的層級：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:left">架構層級</th>
<th style="text-align:left">運行載體</th>
<th style="text-align:left">核心職責</th>
<th style="text-align:left">設計優勢</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>前端呈現層</strong></td>
<td style="text-align:left">Synology NAS (Synology Chat)</td>
<td style="text-align:left">接收使用者訊息、推播回覆</td>
<td style="text-align:left">手機與電腦隨開即用，無需額外安裝客戶端或記 IP</td>
</tr>
<tr>
<td style="text-align:left"><strong>邏輯中樞層</strong></td>
<td style="text-align:left">VirtualBox (Ubuntu VM)</td>
<td style="text-align:left">運行 Hermes Agent（工具呼叫、記憶管理、排程）</td>
<td style="text-align:left">隔離運行，環境崩潰不傷主機，方便快照與備份</td>
</tr>
<tr>
<td style="text-align:left"><strong>本地算力層</strong></td>
<td style="text-align:left">Windows 10 實體主機</td>
<td style="text-align:left">運行 llama.cpp (Qwen3.8 27B + 視覺模組)</td>
<td style="text-align:left">Windows 對 NVIDIA 驅動支援完整，GPU 算力 100% 留給模型</td>
</tr>
</tbody>
</table>
<p dir="auto"><strong>訊息流轉路徑：</strong></p>
<ol>
<li>使用者在手機上的 <strong>Synology Chat</strong> 發送文字或圖片。</li>
<li>訊息轉發至實體主機，注入 VirtualBox 虛擬機中的 <strong>Hermes Agent</strong>。</li>
<li>Agent 整理上下文與提示詞，跨層呼叫實體主機的 <strong>llama-server</strong>（Port 8080）進行模型推論。</li>
<li>模型生成結果後回傳給 Agent 整理，原路推播回 Synology Chat。</li>
</ol>
<hr />
<h2>二、硬體配置清單</h2>
<ul>
<li><strong>前端伺服器</strong>：Synology NAS（負責 Chat 服務與訊息轉發）</li>
<li><strong>中央處理器 (CPU)</strong>：Intel i9-9900K @ 3.60 GHz（VM 分配 4 核，llama.cpp 佔用 16 執行緒）</li>
<li><strong>系統記憶體 (RAM)</strong>：128 GB DDR4 @ 3203 MHz（提供充裕的主機與快取空間）</li>
<li><strong>圖形處理器 (GPU)</strong>：雙 NVIDIA RTX 5070 Ti（16 GB × 2，共 32 GB VRAM）</li>
<li><strong>匯流排 (PCIe)</strong>：PCIe 3.0（拆分 8x + 8x）</li>
<li><strong>高速儲存</strong>：5 TB NVMe SSD（存放模型權重檔、知識庫與歷史對話記錄）</li>
</ul>
<hr />
<h2>三、算力層核心：llama.cpp 部署與加速關鍵</h2>
<p dir="auto">推論引擎採用 <strong>llama.cpp</strong>，模型選用 <strong>Qwen3.8-27B-UD-Q5_K_XL</strong> 搭配視覺組件。</p>
<h3>完整啟動腳本</h3>
<pre><code class="language-bat">@echo off
chcp 65001 &gt;nul

llama-server.exe ^
  -m "models\Qwen3.8-27B-UD-Q5_K_XL.gguf" ^
  --mmproj "models\mmproj-Qwen3.8-27B-f16.gguf" ^
  --image-min-tokens 1024 ^
  --image-max-tokens 2048 ^
  --split-mode tensor ^
  --tensor-split 1,1 ^
  --main-gpu 0 ^
  -ngl 999 ^
  -t 16 ^
  -fa on ^
  --ctx-size 131072 ^
  --parallel 1 ^
  -b 2048 ^
  -ub 512 ^
  -cb ^
  --cache-type-k q8_0 ^
  --cache-type-v q8_0 ^
  --spec-type draft-mtp ^
  --spec-draft-ngl 999 ^
  --spec-draft-n-max 2 ^
  --spec-draft-p-min 0 ^
  --jinja ^
  --reasoning-preserve ^
  --chat-template-kwargs "{\"reasoning_effort\":\"medium\"}" ^
  --temp 0.2 ^
  --top-p 0.7 ^
  --top-k 20 ^
  --min-p 0.08 ^
  --samplers "top_k;top_p;min_p;temperature" ^
  --repeat-penalty 1.05 ^
  --host 0.0.0.0 ^
  --port 8080

pause
</code></pre>
<h3>系統高效運行的 3 個關鍵調優</h3>
<ol>
<li><strong>雙卡對稱張量並行（Tensor Split 1,1）</strong><br />
27B 模型權重約 18～19 GB，單張 16G 顯卡無法全卸載。採用 <code>--split-mode tensor</code> 與 <code>1,1</code> 純對稱切分，讓兩張卡算力與矩陣乘法維度完全對齊，徹底消除非對稱切分帶來的 AllReduce 通訊等待延遲。</li>
<li><strong>128K 超長上下文 + Q8_0 KV Cache</strong><br />
為了讓 AI 助理具備長記憶與長文件讀取能力，配置了原生 131,072（128K）上下文。搭配 <code>--cache-type-k/v q8_0</code> 對快取進行量化，精確將整體顯存壓在雙卡 32 GB 範圍內。</li>
<li><strong>MTP（Multi-Token Prediction）投機解碼</strong><br />
利用 Qwen 原生 MTP 架構開啟投機預測推論（<code>--spec-type draft-mtp</code>），讓生成速度在長文本下依然能穩定維持 75 tok/s 以上的高檔水準。</li>
</ol>
<hr />
<h2>四、效能實測表現</h2>
<p dir="auto">透過標準 API 串流端點進行 3 輪長文本生成測速：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>評測項目</th>
<th>實測數值</th>
<th>體驗感受</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>平均生成速度</strong></td>
<td><strong>76.33 tok/s</strong></td>
<td>500 字回覆約 6～7 秒即可完成，出字如行雲流水</td>
</tr>
<tr>
<td><strong>首字延遲 (TTFT)</strong></td>
<td><strong>0.57 秒</strong></td>
<td>發送訊息後不到 1 秒內即開始串流出字</td>
</tr>
<tr>
<td><strong>穩定度</strong></td>
<td>74.64 / 75.05 / 79.30 tok/s</td>
<td>多輪長時間測試速率一致，無降頻與卡頓</td>
</tr>
<tr>
<td><strong>投機命中率</strong></td>
<td>Draft Acceptance 40%～97%</td>
<td>MTP 機制大幅提升每秒字數產出</td>
</tr>
</tbody>
</table>
<hr />
<h2>五、落地應用心得與優勢</h2>
<ol>
<li><strong>多模態辨識超實用</strong><br />
透過 <code>--image-max-tokens 2048</code> 限制圖片上限，隨手用手機拍下設備電路圖、報表截圖或手寫筆記發進 Chat，模型都能在 2 秒內完成 OCR 與內容解析，且完全不佔用多餘顯存。</li>
<li><strong>算力與邏輯徹底解耦</strong><br />
將 Hermes Agent 放進 Linux VM 是一大亮點。Agent 需要安裝各種 Python 工具庫、排程腳本或知識庫外掛，在 VM 裡隨便折騰、拍快照備份，完全不會污染負責提供 GPU 算力的 Windows 實體主機。</li>
<li><strong>極致隱私與零成本</strong><br />
所有對話紀錄、個人記憶庫與機密文件完全留在自家區網內。不再需要支付任何雲端 AI 訂閱費用，斷網時依然能正常工作。</li>
</ol>
<hr />
<h2>結語</h2>
<p dir="auto">消費級硬體（雙 RTX 5070 Ti）搭配適當的架構分層與量化參數，已經完全能夠在自家內網搭建出一套<strong>高速度（76 tok/s）、大容量（128K Context）、能看圖且具備長記憶</strong>的頂級私人 AI 助理。</p>
<p dir="auto">歡迎對本地部署與私人 Agent 感興趣的朋友在下方交流討論！</p>
]]></description><link>https://lcz.me/topic/1296</link><generator>RSS for Node</generator><lastBuildDate>Mon, 07 Sep 2026 16:25:19 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1296.rss" rel="self" type="application/rss+xml"/><pubDate>Mon, 24 Aug 2026 17:48:49 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 打造 100% 內網閉環的私人 AI 秘書：雙 5070 Ti + 本地 Qwen 27B 完整系統架構指南 on Wed, 26 Aug 2026 21:12:51 GMT]]></title><description><![CDATA[<p dir="auto">挺好的尝试，真能折腾。</p>
]]></description><link>https://lcz.me/post/14191</link><guid isPermaLink="true">https://lcz.me/post/14191</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Wed, 26 Aug 2026 21:12:51 GMT</pubDate></item><item><title><![CDATA[Reply to 打造 100% 內網閉環的私人 AI 秘書：雙 5070 Ti + 本地 Qwen 27B 完整系統架構指南 on Wed, 26 Aug 2026 17:20:43 GMT]]></title><description><![CDATA[<p dir="auto">今天無聊，把hermes 對話末尾頁腳已正式定案為：</p>
<p dir="auto"><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f449.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--point_right" style="height:23px;width:auto;vertical-align:middle" title="👉" alt="👉" /> [<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f4dc.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--scroll" style="height:23px;width:auto;vertical-align:middle" title="📜" alt="📜" />65.1k (<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f4be.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--floppy_disk" style="height:23px;width:auto;vertical-align:middle" title="💾" alt="💾" />99.5%) <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f6e0.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--hammer_and_wrench" style="height:23px;width:auto;vertical-align:middle" title="🛠" alt="🛠" />️4 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/26a1.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--zap" style="height:23px;width:auto;vertical-align:middle" title="⚡" alt="⚡" />0.6s <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/23f1.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--stopwatch" style="height:23px;width:auto;vertical-align:middle" title="⏱" alt="⏱" />️48.9s <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/23f3.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--hourglass_flowing_sand" style="height:23px;width:auto;vertical-align:middle" title="⏳" alt="⏳" />56.8 t/s]</p>
<p dir="auto">（<code>📜</code> 上下文 ｜ <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f4be.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--floppy_disk" style="height:23px;width:auto;vertical-align:middle" title="💾" alt="💾" /> 快取 ｜ <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f6e0.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--hammer_and_wrench" style="height:23px;width:auto;vertical-align:middle" title="🛠" alt="🛠" />️ 工具次數 ｜ <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/26a1.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--zap" style="height:23px;width:auto;vertical-align:middle" title="⚡" alt="⚡" /> 首字延遲 TTFT ｜ <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/23f1.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--stopwatch" style="height:23px;width:auto;vertical-align:middle" title="⏱" alt="⏱" />️ 總耗時 ｜ <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/23f3.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--hourglass_flowing_sand" style="height:23px;width:auto;vertical-align:middle" title="⏳" alt="⏳" /> 生成速度）</p>
<p dir="auto">那出問題，比較好找出來吧!! 推理及無效標籤，有空再搞一下!!</p>
]]></description><link>https://lcz.me/post/14175</link><guid isPermaLink="true">https://lcz.me/post/14175</guid><dc:creator><![CDATA[YDM]]></dc:creator><pubDate>Wed, 26 Aug 2026 17:20:43 GMT</pubDate></item><item><title><![CDATA[Reply to 打造 100% 內網閉環的私人 AI 秘書：雙 5070 Ti + 本地 Qwen 27B 完整系統架構指南 on Tue, 25 Aug 2026 14:30:50 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/kos-or" aria-label="Profile: kos-or">@<bdi>kos-or</bdi></a> <a href="/post/13842">说</a>:</p>
<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/ydm" aria-label="Profile: YDM">@<bdi>YDM</bdi></a> <a href="/post/13743">said</a>:</p>
<p dir="auto">Synology NAS (Synology Chat)</p>
</blockquote>
<p dir="auto">請問這比Hermes 內建的 Telegram 使用上有什麼優勢嗎？減少多層的Latency延遲 ？</p>
</blockquote>
<hr />
<p dir="auto">誠實拆解，不吹不黑：我從來沒想過<strong>延遲</strong>的問題，哈~~~</p>
<p dir="auto"><strong>1. 延遲</strong>：內網下 Synology Chat 是「手機➔LAN➔NAS」，我實測從 NAS 推送到 Agent 的<strong>端到端處理在 20ms 以內</strong>，省去跨國路由。回應時間取決於複雜度：<strong>純對話幾秒內就回，要查證/跑工具的則 8~80 秒</strong>——但無論哪種，平台那 20ms 都體感不到。延遲優勢真正有感的是高頻告警場景，不是對話速度。</p>
<p dir="auto"><strong>2. 隱私（我換過來的最大理由）</strong>：所有資料留在自家 NAS，不經第三方雲端。補充：Synology Chat 有 E2E 加密頻道（連管理員都只有密文），但官方明定加密頻道會停用 Webhook/機器人，所以 AI 通道只能走一般頻道（管理員可查閱明文）——管理員是我自己所以沒問題，共用 NAS 的人要留意。</p>
<p dir="auto"><strong>3. 穩定性</strong>：Telegram 限流嚴（約 1 msg/s），高頻通知容易撞 429；Synology Chat 走本地 Webhook，吞吐量由自家硬體決定。</p>
<p dir="auto"><strong>結論</strong>：資料不出門、高頻告警、零訂閱選 Synology Chat；在外隨開即用、成熟生態選 Telegram。我選前者，因為我的資料只該在我的硬碟上。</p>
<hr />
<p dir="auto"><em>以上資料請我的 AI 秘書幫我整理：延遲數據是它從系統日誌實測抓的，加密與限流部分對照過 Synology 官方 KB 與 Telegram 官方文件。</em></p>
<hr />
<p dir="auto">-<strong>llama.cpp</strong> 底層又默默變強了。雙卡玩家記得一定要對稱等分（1:1）、注意 PCIe 頻寬，所以我的變快是llama.cpp底層變強了</p>
]]></description><link>https://lcz.me/post/13900</link><guid isPermaLink="true">https://lcz.me/post/13900</guid><dc:creator><![CDATA[YDM]]></dc:creator><pubDate>Tue, 25 Aug 2026 14:30:50 GMT</pubDate></item><item><title><![CDATA[Reply to 打造 100% 內網閉環的私人 AI 秘書：雙 5070 Ti + 本地 Qwen 27B 完整系統架構指南 on Tue, 25 Aug 2026 09:48:05 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/ydm" aria-label="Profile: YDM">@<bdi>YDM</bdi></a> <a href="/post/13743">said</a>:</p>
<p dir="auto">Synology NAS (Synology Chat)</p>
</blockquote>
<p dir="auto">謝謝分享</p>
<p dir="auto">請問這比Hermes 內建的 Telegram 使用上有什麼優勢嗎？減少多層的Latency延遲 ？</p>
]]></description><link>https://lcz.me/post/13842</link><guid isPermaLink="true">https://lcz.me/post/13842</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Tue, 25 Aug 2026 09:48:05 GMT</pubDate></item><item><title><![CDATA[Reply to 打造 100% 內網閉環的私人 AI 秘書：雙 5070 Ti + 本地 Qwen 27B 完整系統架構指南 on Mon, 24 Aug 2026 19:09:39 GMT]]></title><description><![CDATA[<p dir="auto">架构很完整，三層解耦的思路尤其对——Agent 放 VM 里随便折腾、推理层留在 Windows 物理机，正好把"Agent 吃资源/烧 token"和 GPU 算力隔离开。几个补充：</p>
<ol>
<li>
<p dir="auto">76 tok/s 跟论坛双 5070Ti 实录对得上（TID:1268 双 5070Ti 跑 27B），1,1 对称切分也是对的。PCIe 3.0 x8+x8 跑 27B 够用，但如果以后上 72B 级，8GB/s 的链路就是瓶颈。</p>
</li>
<li>
<p dir="auto">显存账其实贴线了，算一下：Q5_K_XL 权重约 19GB + 128K Q8 KV（27B MoE 大概 8~10GB）+ MTP 头 + mmproj + 计算缓冲，加起来就在 32GB 边缘。llama.cpp 显存不够会静默把 KV spill 到 CPU，速度直接腰斩但不报错——建议看启动日志里 KV buffer 那行，确认是 GPU 还是 CPU。想留余量：KV 降 q4_0（注意 K/V 精度必须对称，q8_0 K + q4_0 V 这种不对称组合会静默回退非融合 attention）；128K 不是刚需的话 -c 65536 直接省一半 KV。</p>
</li>
<li>
<p dir="auto">MTP 接受率 40%~97% 波动大是正常的：MTP 只预测少量 token，长文本里重复/模板段容易冲高，对话混着生成波动就大，看均值更有意义。</p>
</li>
<li>
<p dir="auto">一个小提醒：9900K 总共 16 线程，VM 4 核 + llama.cpp 16 线程是超卖的，Windows 调度器会抢。你 TTFT 0.57s 说明暂时影响不大，但以后 VM 里跑重任务，记得给 llama-server 降 -t 留余量。</p>
</li>
</ol>
]]></description><link>https://lcz.me/post/13746</link><guid isPermaLink="true">https://lcz.me/post/13746</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Mon, 24 Aug 2026 19:09:39 GMT</pubDate></item></channel></rss>