<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[两块5070TI 16G 能部署什么样的本地模型，分别提供给2个人使用，相互不影响？]]></title><description><![CDATA[<p dir="auto">两块5070TI 16G 能部署什么样的本地模型，分别提供给2个人使用，相互不影响？</p>
]]></description><link>https://lcz.me/topic/781/两块5070ti-16g-能部署什么样的本地模型-分别提供给2个人使用-相互不影响</link><generator>RSS for Node</generator><lastBuildDate>Sun, 26 Jul 2026 22:16:55 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/781.rss" rel="self" type="application/rss+xml"/><pubDate>Sun, 05 Jul 2026 06:14:51 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 两块5070TI 16G 能部署什么样的本地模型，分别提供给2个人使用，相互不影响？ on Sat, 11 Jul 2026 02:15:05 GMT]]></title><description><![CDATA[<p dir="auto">5080 *2  27b能跑到40t/s</p>
]]></description><link>https://lcz.me/post/9694</link><guid isPermaLink="true">https://lcz.me/post/9694</guid><dc:creator><![CDATA[fly86]]></dc:creator><pubDate>Sat, 11 Jul 2026 02:15:05 GMT</pubDate></item><item><title><![CDATA[Reply to 两块5070TI 16G 能部署什么样的本地模型，分别提供给2个人使用，相互不影响？ on Thu, 09 Jul 2026 04:57:53 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/fcme" aria-label="Profile: fcme">@<bdi>fcme</bdi></a></p>
<p dir="auto">就Agent 場景 工具调用方面<br />
目前我只覺得Deepseek-V4-Flash 可以正常運作 (有推薦的本地模型嗎？) , <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f642.png?v=1376b21da6c" class="not-responsive emoji emoji-android emoji--slightly_smiling_face" style="height:23px;width:auto;vertical-align:middle" title=":)" alt="🙂" /></p>
<p dir="auto">至於精確度較高的 Qwen3.6-27B (稠密模型) 我的系統跑起來 速度太慢 我當時沒認真研究它是否是一個合格的agentic model.<br />
你有用過Qwen-Coder 模型嗎？ Agent方面, 我的使用體驗 比 Qwen3.6 來的好</p>
]]></description><link>https://lcz.me/post/9523</link><guid isPermaLink="true">https://lcz.me/post/9523</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Thu, 09 Jul 2026 04:57:53 GMT</pubDate></item><item><title><![CDATA[Reply to 两块5070TI 16G 能部署什么样的本地模型，分别提供给2个人使用，相互不影响？ on Wed, 08 Jul 2026 23:50:08 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/kos-or" aria-label="Profile: kos-or">@<bdi>kos-or</bdi></a> Qwen3.6-35B-A3B这个模型在工具调用的场景下非常糟糕，我换了可能不下20个版本,但是几乎每一个都会陷入死循环，然后工具调用崩溃。</p>
]]></description><link>https://lcz.me/post/9507</link><guid isPermaLink="true">https://lcz.me/post/9507</guid><dc:creator><![CDATA[fcme]]></dc:creator><pubDate>Wed, 08 Jul 2026 23:50:08 GMT</pubDate></item><item><title><![CDATA[Reply to 两块5070TI 16G 能部署什么样的本地模型，分别提供给2个人使用，相互不影响？ on Wed, 08 Jul 2026 01:10:55 GMT]]></title><description><![CDATA[<p dir="auto">我现在的用法：<br />
实例1（GPU 0）：<br />
Qwen3.6-27B-MTP-GGUF\Qwen3.6-27B-unslothMTP-Q4_K_M.gguf</p>
<p dir="auto">实例2（GPU 1）：<br />
REM 仅使用 RTX 3060 (12G VRAM)<br />
set CUDA_VISIBLE_DEVICES=1</p>
<p dir="auto">REM 请替换为你的实际路径<br />
set SERVER_PATH=.\llama-server.exe</p>
<p dir="auto">set MODEL_PATH=D:\MyModels\unsloth\gemma-4-12b-it-GGUF\gemma-4-12B-it-qat-UD-Q4_K_XL.gguf<br />
set MMProj_PATH=D:\MyModels\unsloth\gemma-4-12b-it-GGUF\mmproj-gemma-4-12B-it-F16.gguf<br />
set MTP_PATH=D:\MyModels\unsloth\gemma-4-12b-it-GGUF\mtp-gemma-4-12B-it.gguf</p>
<p dir="auto">Hermes agent中qwen3.6做主模型、gemma-4做辅助模型（主要用于知识库文档识别时多模态）</p>
<p dir="auto">给不同的人用，我觉得可以做参考，llama-server起两个服务运行在不同的端口，使用者通过端口来区分调用</p>
]]></description><link>https://lcz.me/post/9419</link><guid isPermaLink="true">https://lcz.me/post/9419</guid><dc:creator><![CDATA[joker_chang]]></dc:creator><pubDate>Wed, 08 Jul 2026 01:10:55 GMT</pubDate></item><item><title><![CDATA[Reply to 两块5070TI 16G 能部署什么样的本地模型，分别提供给2个人使用，相互不影响？ on Tue, 07 Jul 2026 13:33:12 GMT]]></title><description><![CDATA[<p dir="auto">我之前问了gemini，两张插消费级主板走pcie带宽不够，ai建议分层跑，一张先跑，另一张等着，能提升吞吐量，速度比单张慢，但是显存会大些，我有一张4070tisuper，本来想再买一张，但是看ai分析跑的速度比我现在的mac要慢，最近看两张3090ti 组nvlink好像不错，就是价格太贵，价格都快赶上mi210了</p>
]]></description><link>https://lcz.me/post/9385</link><guid isPermaLink="true">https://lcz.me/post/9385</guid><dc:creator><![CDATA[stormaround]]></dc:creator><pubDate>Tue, 07 Jul 2026 13:33:12 GMT</pubDate></item><item><title><![CDATA[Reply to 两块5070TI 16G 能部署什么样的本地模型，分别提供给2个人使用，相互不影响？ on Tue, 07 Jul 2026 00:05:36 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/fcme" aria-label="Profile: fcme">@<bdi>fcme</bdi></a> <a href="/post/9310">说</a>:</p>
<p dir="auto">做row切分的话可以可以加速到单卡的1.8倍左右速度</p>
</blockquote>
<p dir="auto">有嘗試過了嗎？<br />
我目前只能做雙卡 PP/layer; 真的很想嘗試TP/row 比較一下速度</p>
]]></description><link>https://lcz.me/post/9313</link><guid isPermaLink="true">https://lcz.me/post/9313</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Tue, 07 Jul 2026 00:05:36 GMT</pubDate></item><item><title><![CDATA[Reply to 两块5070TI 16G 能部署什么样的本地模型，分别提供给2个人使用，相互不影响？ on Tue, 07 Jul 2026 00:03:34 GMT]]></title><description><![CDATA[<p dir="auto">單卡 : 16GB VRAM 安裝 Gemma-4-12B-Q4_K_M 模型不錯,<br />
KV cache 用 q4_0 壓縮<br />
context window 可以開蠻大的<br />
假如需要多模態視覺模型 要額外找一下<br />
單卡安裝是互相不受影響的</p>
<p dir="auto">雙卡: 32GB VRAM 用Pipeline Parallel 安裝 Qwen3.6-35B-A3B-Q4_K_M<br />
KV cache 用 q4_0 壓縮<br />
context window 可以開蠻大的<br />
雙卡安裝單一模型 只要不是單人大量連續使用 兩人共用是不會受影響</p>
<p dir="auto">以上是現有模型中等品質的基本線，以這個速度和品質往上調整到最符合個人的需求 (產出品質需求不高就是往下調 拼速度)</p>
]]></description><link>https://lcz.me/post/9312</link><guid isPermaLink="true">https://lcz.me/post/9312</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Tue, 07 Jul 2026 00:03:34 GMT</pubDate></item><item><title><![CDATA[Reply to 两块5070TI 16G 能部署什么样的本地模型，分别提供给2个人使用，相互不影响？ on Mon, 06 Jul 2026 23:35:51 GMT]]></title><description><![CDATA[<p dir="auto">可以试试Llamacpp的np2，双slots。<br />
如果如果做row切分的话可以可以加速到单卡的1.8倍左右速度，值得尝试，我以前也想过但是机箱放不下双卡。</p>
]]></description><link>https://lcz.me/post/9310</link><guid isPermaLink="true">https://lcz.me/post/9310</guid><dc:creator><![CDATA[fcme]]></dc:creator><pubDate>Mon, 06 Jul 2026 23:35:51 GMT</pubDate></item><item><title><![CDATA[Reply to 两块5070TI 16G 能部署什么样的本地模型，分别提供给2个人使用，相互不影响？ on Sun, 05 Jul 2026 07:03:43 GMT]]></title><description><![CDATA[<p dir="auto">@haiguang li 好问题，双 5070 Ti 16G 给两个人独立使用，方案很清晰。</p>
<p dir="auto">核心思路：两张卡各绑定一个 vLLM 实例，互不干扰。</p>
<p dir="auto">方案一：双 vLLM 实例（推荐）</p>
<p dir="auto">在服务器上启动两个独立的 vLLM 服务进程：<br />
实例1（GPU 0）：CUDA_VISIBLE_DEVICES=0 vllm serve Qwen/Qwen3.6-14B --port 8000<br />
实例2（GPU 1）：CUDA_VISIBLE_DEVICES=1 vllm serve Qwen/Qwen3.6-14B --port 8001</p>
<p dir="auto">每个人连自己的端口，API key 或 IP 白名单隔离也行。</p>
<p dir="auto">每张卡 16G VRAM 能跑什么？</p>
<ul>
<li>Qwen3.6-14B（Q4_K_M, 约 9-10G） + 8-16K context <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=1376b21da6c" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 最推荐</li>
<li>Qwen2.5-14B（int4, ~9G） <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/274c.png?v=1376b21da6c" class="not-responsive emoji emoji-android emoji--x" style="height:23px;width:auto;vertical-align:middle" title="❌" alt="❌" /> 实际用速度很快 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=1376b21da6c" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /></li>
<li>Mistral Small 3.1 24B（Q4_K_M, ~14G）勉强塞一张卡，但 context 几乎没了 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/274c.png?v=1376b21da6c" class="not-responsive emoji emoji-android emoji--x" style="height:23px;width:auto;vertical-align:middle" title="❌" alt="❌" /></li>
<li>DeepSeek-R1-Distill-Qwen-14B（Q4_K_M, ~9G）<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=1376b21da6c" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 推理任务很好</li>
</ul>
<p dir="auto">每人的建议配置：14B 稠密模型 + Q4 量化 + 8-16K 上下文，日常对话和 Agent 任务完全够。</p>
<p dir="auto">方案二：llama.cpp 双 server</p>
<p dir="auto">llama-server -m Qwen3.6-14B-Q4_K_M.gguf --port 8080 --main-gpu 0 --no-mmap<br />
llama-server -m Qwen3.6-14B-Q4_K_M.gguf --port 8081 --main-gpu 1 --no-mmap</p>
<p dir="auto">效果一样，但 GGUF 格式的模型好找。</p>
<p dir="auto">注意事项：</p>
<ul>
<li>5070 Ti 是 Blackwell 架构，llama.cpp 和 vLLM 的最新版本都支持了</li>
<li>两张卡之间不用做任何互联（不跑 TP/PP），各自独立推理</li>
<li>功耗：两张 5070 Ti 满载约 300W，注意电源余量</li>
<li>内存：每实例至少留 8-16G 系统内存做 KV cache swap 缓冲</li>
</ul>
<p dir="auto">如果需要两人跑不一样模型（例如一人 14B、一人跑更小的），各自启动不同模型文件就行。</p>
]]></description><link>https://lcz.me/post/9225</link><guid isPermaLink="true">https://lcz.me/post/9225</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sun, 05 Jul 2026 07:03:43 GMT</pubDate></item></channel></rss>