<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[雙2060 12G 加 2070 8G llama.cpp with Ornith-1.0-35B-Heretic-MTP-APEX-I-Quality]]></title><description><![CDATA[<p dir="auto">窮人的玩法，在這獻醜了。<br />
一切從零開始，不知道如何設定，學著版主一直罵Gemini罵出這樣的結果，大家可以參考。直到今天看到大家都在用的測試平台，才敢發貼分享，速度還算可以喔。</p>
<p dir="auto">電腦配備如下:<br />
<img src="https://upload.lcz.me/uploads/ca2d78f5-b547-4aa9-8ec3-2d52cef5437e.jpeg" alt="167c51ba-b826-4256-af02-ed815cb201de-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">llama.cpp 設置參數:<br />
<img src="https://upload.lcz.me/uploads/8968aebd-b476-428c-9ee6-4ded45b97696.jpeg" alt="28fccbe8-3b36-475f-b30d-2bc18b13aa7d-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">llama benchy 測試數據<br />
<img src="https://upload.lcz.me/uploads/21a9802d-f199-478d-ba2e-d2ccc0f7de8e.jpeg" alt="0a18a5fe-9232-4f00-9141-d19e0cc7f9d6-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">nvtop 監控畫面<br />
<img src="https://upload.lcz.me/uploads/cb6d18e5-e4f6-4365-b8e7-8ddead6b0c0d.jpeg" alt="8ea52e8a-e9f1-4f9c-bc38-4c260968ab04-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">以下為GOOGLE對測試結果的評論</p>
<p dir="auto">各測試項目的數據解析</p>
<ol>
<li>Prefill 階段（pp2048：處理 2048 個 Token 的 Prompt）<br />
t/s (Tokens per Second) = 1279.27 ± 113.97</li>
</ol>
<p dir="auto">含義：Prompt 處理吞吐量（Prefill 速度）。</p>
<p dir="auto">解讀：伺服器每秒能處理約 1279 個 Token 的長輸入。這代表輸入文本的吞吐能力相當優異。</p>
<p dir="auto">ttfr (ms) (Time To First Response) = 1464.49 ± 34.91</p>
<p dir="auto">含義：發送請求到收到伺服器回傳第一個 Data Chunk 的總時間（包含網路延遲）。</p>
<p dir="auto">est_ppt (ms) (Estimated Prompt Processing Time) = 1463.74 ± 34.91</p>
<p dir="auto">含義：扣除網路與系統延遲後，伺服器純粹用來處理 2048 個輸入 Token 的預估時間。</p>
<p dir="auto">解讀：處理 2048 個 Token 約花費 1.46 秒（1463.74 ms）。</p>
<p dir="auto">e2e_ttft (ms) (End-to-End Time To First Token) = 1464.49 ± 34.91</p>
<p dir="auto">含義：端到端使用者看到第一個生成文字（Content Token）的等待時間。</p>
<p dir="auto">解讀：在此測試中，TTFR 與 e2e_ttft 幾乎相同，代表第一個回應區塊就包含了生成的文字。</p>
<ol start="2">
<li>Decode 階段（tg32：生成 32 個 Token 的 Output）<br />
t/s (Tokens per Second) = 88.83 ± 3.65</li>
</ol>
<p dir="auto">含義：文字生成速度（Decode 速度）。</p>
<p dir="auto">解讀：模型開始輸出後，平均每秒產生約 88.8 個 Token。一般人類閱讀速度約為每秒 5~10 個 Token，因此這個生成速度非常順暢。</p>
<p dir="auto">peak t/s (Peak Tokens per Second) = 91.69 ± 3.76</p>
<p dir="auto">含義：在 1 秒的時間窗口內所觀測到的最高生成速度，約為每秒 91.7 個 Token。</p>
<p dir="auto">綜合效能評估總結<br />
首字延遲 (TTFT)：輸入 2048 個 Token 時，需等待約 1.46 秒 才會看到第一個字。對於 35B 規模的模型來說，這個 Prefill 時間屬於 reasonable 範圍。</p>
<p dir="auto">生成體感 (Decode Speed)：每秒 88.8 Token 的輸出速度極快，能提供流暢且無停頓的即時對話體驗。</p>
<p dir="auto">給大家參考囉，沒錢也是能這樣玩的。</p>
<p dir="auto">附上我的電腦<br />
PS:無法上傳照片了，負載過大，晚點再上傳</p>
]]></description><link>https://lcz.me/topic/1092/雙2060-12g-加-2070-8g-llama.cpp-with-ornith-1.0-35b-heretic-mtp-apex-i-quality</link><generator>RSS for Node</generator><lastBuildDate>Sat, 22 Aug 2026 00:31:06 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1092.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 12 Aug 2026 12:02:07 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 雙2060 12G 加 2070 8G llama.cpp with Ornith-1.0-35B-Heretic-MTP-APEX-I-Quality on Fri, 14 Aug 2026 12:09:37 GMT]]></title><description><![CDATA[<p dir="auto">主要是提供大家另一種玩法，把幾張沒什麼用的顯卡用llamacpp串起來，跑起來也是可行的。</p>
]]></description><link>https://lcz.me/post/12196</link><guid isPermaLink="true">https://lcz.me/post/12196</guid><dc:creator><![CDATA[Remy Chiang]]></dc:creator><pubDate>Fri, 14 Aug 2026 12:09:37 GMT</pubDate></item><item><title><![CDATA[Reply to 雙2060 12G 加 2070 8G llama.cpp with Ornith-1.0-35B-Heretic-MTP-APEX-I-Quality on Fri, 14 Aug 2026 09:12:20 GMT]]></title><description><![CDATA[<p dir="auto">2060 12G 这个就够小众了。市场上保有量不高。</p>
]]></description><link>https://lcz.me/post/12180</link><guid isPermaLink="true">https://lcz.me/post/12180</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Fri, 14 Aug 2026 09:12:20 GMT</pubDate></item><item><title><![CDATA[Reply to 雙2060 12G 加 2070 8G llama.cpp with Ornith-1.0-35B-Heretic-MTP-APEX-I-Quality on Wed, 12 Aug 2026 12:48:44 GMT]]></title><description><![CDATA[<p dir="auto">挺小众的玩法，有意思</p>
]]></description><link>https://lcz.me/post/11973</link><guid isPermaLink="true">https://lcz.me/post/11973</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Wed, 12 Aug 2026 12:48:44 GMT</pubDate></item></channel></rss>