<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[【GTX 1070 8G】NVIDIA GeForce GTX 1070 (8G 华硕) 跑Qwen3.6-35B-A3B ，14~19 token/s ,【补论坛显卡数据库，需要生产力的不用看】]]></title><description><![CDATA[<p dir="auto">先定性，本帖只给想尝试自己搭建大模型，还没有升级、购买设备的朋友做个参考，顺便补充一下论坛硬件数据库的资料。</p>
<p dir="auto">8G显存显卡，两个月前<em>不具备生产力</em>，搭配Hermes蠢得要死，勉强能作为玩具，尝尝鲜，感受一下自动化Agent是啥，但是编程，复杂任务很难完成，多轮后，容易陷入一直调用工具的循环，Hermes超时没了反应。</p>
<p dir="auto">但是现在，搭配Deepseek Harness，竟然能够干一些简单的活了，编写个小游戏，写个文章啥的，已经有模有样。至少是真的可以干活了。</p>
<p dir="auto">harness真牛逼，他的任务约束能力，至少让这个傻缺模型智能上了两个档次，从学前班成长为初中生的级别。</p>
<p dir="auto">因为不是玩AI主力配置，就大概展示一下数据，作为一个参考。</p>
<p dir="auto"><strong>硬件</strong></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/e35b875a-168d-4175-b3ec-b84ea1f2c167.png" alt="01.png" class=" img-fluid img-markdown" /></p>
<p dir="auto"><strong>软件</strong></p>
<p dir="auto">llama-b9310-bin-win-cuda-12.4-x64</p>
<p dir="auto">我懒，具体看图</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/b4dbce4f-2901-4e38-9c45-ef6a4353ecbc.png" alt="02.png" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/76100881-459f-416b-bd5f-239efc76ad6d.png" alt="03.png" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/a3027abc-8b7d-45f0-b172-a8b23e6a4a15.png" alt="04.png" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/72b623a9-b8e9-4d93-bce4-95ebedafd8da.png" alt="05.png" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/31ec49f9-f671-4025-ba4f-63c87e7ec6f0.png" alt="06.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">上面是运行了一下 Deepseek harness 的日志。下面是直接用网页版，直接访问llama.cpp 模型的截图。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/c087549c-70ba-4ffa-aee9-d702a0e7f7b5.png" alt="07.png" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/f0ecb258-bb0c-44f7-8fc0-270b2d70f278.png" alt="08.png" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/a6ece5ed-ba64-4d11-af85-d1706afe9e1b.png" alt="09.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">启动设置：</p>
<pre><code>@echo off
chcp 65001 &gt;nul
title Qwen3.6-35B-A3B 越狱版

cd /d "%~dp0"

:menu
cls
echo ==========================================
echo      Qwen3.6-35B-A3B 越狱版+多模态模型
echo              
echo ==========================================
echo.
echo 1. Qwen3.6-35B-A3B-Uncensored-Q4_K_M (20G、多模态、综合最优）
echo.
echo ==========================================

set /p choice=请输入数字：

if "%choice%"=="1" (
    llama-server.exe ^
    -m "models\Qwen3.6-35B-A3B-Uncensored-Q4_K_M.gguf" ^
    --mmproj "models\mmproj-Qwen3.6-35B-A3B-Uncensored-f16.gguf" ^
    -ngl 999 ^
    --n-cpu-moe 99 ^
    --flash-attn on ^
    --jinja ^
    --api-key 123123 ^
    -c 131072 ^
    -n 8192 ^
    -t 12 ^
    -b 512 ^
    --cache-type-k q4_0 ^
    --cache-type-v q4_0 ^
    --mlock ^
    --no-mmap ^
    --image-min-tokens 1024 ^
    --host 0.0.0.0 ^
    --port 8080
)

pause
</code></pre>
<p dir="auto">我需要比较长的上下文，开了131072上下文。如果调小一点，速度还会提高。我最大调262144，也能跑的动，速度有所下降。调小了能提高，但是最高也就到19 token/s，再也上不去了。我感觉15 token/s 勉强能接受，写个东西阅读能跟的上，可以调用Hermes，做一些小任务，编程不行。编程还得用DSH调用，勉强能做一些东西，智力还是稍微差一点。另外就是上下文用了超过60%，速度会慢，有时候不给他任务，他后台大模型还会自己调用工具循环，不知道什么原因，我现在强制他不循环调用工具，会好一点，很少像死机一样没反应了。</p>
<p dir="auto">本文就是就是给没来得及上车的游戏党玩家做个参考，利用手中的工具，看看大概能跑个什么数值。这显卡做生产力还是差的有点多。</p>
<p dir="auto">另外就是不用去试其他大模型了，9B及以下的模型，速度可能比较快一点，但真的智力更堪忧，千问Qwen3.6-35B-A3B，应该是综合性价比最高的，其他厂家的模型，各种量化版本也都试过几十个，输出token速度大多是个位数，8G显存档基本上可以不用试了。这个基本就是8G档的最优模型。</p>
]]></description><link>https://lcz.me/topic/1605</link><generator>RSS for Node</generator><lastBuildDate>Thu, 10 Sep 2026 17:27:16 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1605.rss" rel="self" type="application/rss+xml"/><pubDate>Thu, 10 Sep 2026 08:36:44 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 【GTX 1070 8G】NVIDIA GeForce GTX 1070 (8G 华硕) 跑Qwen3.6-35B-A3B ，14~19 token/s ,【补论坛显卡数据库，需要生产力的不用看】 on Thu, 10 Sep 2026 16:40:53 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/kos-or" aria-label="Profile: kos-or">@<bdi>kos-or</bdi></a> <a href="/post/17161">说</a>:</p>
<p dir="auto">聽說這個小模型很強 MiniCpm5-2B<br />
有機會可試試看</p>
</blockquote>
<p dir="auto">好滴，周末下载个玩玩看。不知道能干活不。我以前下过2B级别的小模型，除了吐字快，其他的似乎没啥用，都不行。驱动Agent有点傻，写文章很生硬，甚至英文插在仙侠文中蹦出来，还有给你凑字数，不停的复制粘贴相同段落，总之挺傻缺的。</p>
]]></description><link>https://lcz.me/post/17178</link><guid isPermaLink="true">https://lcz.me/post/17178</guid><dc:creator><![CDATA[jason an]]></dc:creator><pubDate>Thu, 10 Sep 2026 16:40:53 GMT</pubDate></item><item><title><![CDATA[Reply to 【GTX 1070 8G】NVIDIA GeForce GTX 1070 (8G 华硕) 跑Qwen3.6-35B-A3B ，14~19 token/s ,【补论坛显卡数据库，需要生产力的不用看】 on Thu, 10 Sep 2026 14:12:40 GMT]]></title><description><![CDATA[<p dir="auto">聽說這個小模型很強 MiniCpm5-2B<br />
有機會可試試看</p>
]]></description><link>https://lcz.me/post/17161</link><guid isPermaLink="true">https://lcz.me/post/17161</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Thu, 10 Sep 2026 14:12:40 GMT</pubDate></item><item><title><![CDATA[Reply to 【GTX 1070 8G】NVIDIA GeForce GTX 1070 (8G 华硕) 跑Qwen3.6-35B-A3B ，14~19 token/s ,【补论坛显卡数据库，需要生产力的不用看】 on Thu, 10 Sep 2026 12:13:40 GMT]]></title><description><![CDATA[<p dir="auto">我弟牛逼，这个玩意都能测试，看来我家里的老古董，也要拿出来看看了<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f602.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--joy" style="height:23px;width:auto;vertical-align:middle" title="😂" alt="😂" /></p>
]]></description><link>https://lcz.me/post/17137</link><guid isPermaLink="true">https://lcz.me/post/17137</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Thu, 10 Sep 2026 12:13:40 GMT</pubDate></item><item><title><![CDATA[Reply to 【GTX 1070 8G】NVIDIA GeForce GTX 1070 (8G 华硕) 跑Qwen3.6-35B-A3B ，14~19 token/s ,【补论坛显卡数据库，需要生产力的不用看】 on Thu, 10 Sep 2026 09:10:41 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/dardeaw-feng" aria-label="Profile: dardeaw-feng">@<bdi>dardeaw-feng</bdi></a> <a href="/post/17093">说</a>:</p>
<p dir="auto">Ornith 1.5 35B可以試試看，同樣是Qwen 3.5用新的COT模式訓練上來的，體驗上可靠度比四個月前的Qwen 3.6 35B好一點</p>
</blockquote>
<p dir="auto">好滴，你这个建议我试试。非常感谢！</p>
]]></description><link>https://lcz.me/post/17097</link><guid isPermaLink="true">https://lcz.me/post/17097</guid><dc:creator><![CDATA[jason an]]></dc:creator><pubDate>Thu, 10 Sep 2026 09:10:41 GMT</pubDate></item><item><title><![CDATA[Reply to 【GTX 1070 8G】NVIDIA GeForce GTX 1070 (8G 华硕) 跑Qwen3.6-35B-A3B ，14~19 token/s ,【补论坛显卡数据库，需要生产力的不用看】 on Thu, 10 Sep 2026 08:43:47 GMT]]></title><description><![CDATA[<p dir="auto">Ornith 1.5 35B可以試試看，同樣是Qwen 3.5用新的COT模式訓練上來的，體驗上可靠度比四個月前的Qwen 3.6 35B好一點</p>
]]></description><link>https://lcz.me/post/17093</link><guid isPermaLink="true">https://lcz.me/post/17093</guid><dc:creator><![CDATA[dardeaw feng]]></dc:creator><pubDate>Thu, 10 Sep 2026 08:43:47 GMT</pubDate></item><item><title><![CDATA[Reply to 【GTX 1070 8G】NVIDIA GeForce GTX 1070 (8G 华硕) 跑Qwen3.6-35B-A3B ，14~19 token/s ,【补论坛显卡数据库，需要生产力的不用看】 on Thu, 10 Sep 2026 08:42:11 GMT]]></title><description><![CDATA[<p dir="auto">忘了说了，这个是大力飞砖，配置卸载的层数不对，是按照3060 12G，64G内存写的，在这个机器上也能跑，只是都放内存里让cpu跑了。3060 12G那个机器能跑37 token/s .</p>
]]></description><link>https://lcz.me/post/17092</link><guid isPermaLink="true">https://lcz.me/post/17092</guid><dc:creator><![CDATA[jason an]]></dc:creator><pubDate>Thu, 10 Sep 2026 08:42:11 GMT</pubDate></item></channel></rss>