<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[怎么去理解,双卡3090调用sglang/llama.cpp, 配置 QWEN3.8 27B-Q4_K_M]]></title><description><![CDATA[<p dir="auto">双卡3090ti，基本结束在vast.ai上出租服务，现在打算自用。<br />
现在手里的Hermes用的是deepseek v4-Pro，价格还可以，用的没有特别频繁时，总共没花多少钱。现在跑了2个月才花了20刀。<br />
但是打算用完100刀的储值后，转战QWEN 3.8 27B_K_M。<br />
现在问题是，如果安装了新的API，那Hermes肯定直接调用本地的服务器，那我自己怎么控制各个服务器之间的授权呢？自己不会ssh。<br />
还有一个问题，我的小服务器，只有32GB的内存。有nvlink的双卡3090ti，都48GB的vram了。是不是需要增加RAM的大小？<br />
最最后，我用qwen 3.8 27b_k_m，是不是需要安装sglang，现在有更好的解决方案，可以协调双卡的GPU吗？<br />
谢谢各位大佬。</p>
]]></description><link>https://lcz.me/topic/1348</link><generator>RSS for Node</generator><lastBuildDate>Wed, 09 Sep 2026 22:53:31 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1348.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 26 Aug 2026 23:41:51 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 怎么去理解,双卡3090调用sglang/llama.cpp, 配置 QWEN3.8 27B-Q4_K_M on Thu, 27 Aug 2026 01:24:36 GMT]]></title><description><![CDATA[<p dir="auto">先给结论：你的需求（27B Q4_K_M 双卡本地）<strong>不用会 SSH，也不用急着加内存，装 llama.cpp 就够了</strong>。逐个说：</p>
<p dir="auto"><strong>1. 授权/调用怎么控制（不需要 SSH）</strong></p>
<ul>
<li>本地跑一个 llama-server，它就是 OpenAI 兼容的 HTTP 服务。监听 127.0.0.1（只本机可访问）再设一个 --api-key 就行。</li>
<li>Hermes 里加一个 provider：base_url 填 <a href="http://127.0.0.1:8080/v1%EF%BC%8Capi_key" rel="nofollow ugc">http://127.0.0.1:8080/v1，api_key</a> 填你设的那个。之后 Hermes 调本地服务跟调 DeepSeek 完全一样，只是换了地址——你担心的"装个新 API 就自动调本地"就是这个意思，配置好之后确实优先走本地。</li>
<li>"控制各个服务器之间的授权"：每个服务各设各的 key，Hermes 每个 provider 配一套 base_url+key，互不干扰。本机用绑定 127.0.0.1 最安全，压根不碰 SSH；将来要远程访问再研究隧道，那是后话。</li>
</ul>
<p dir="auto"><strong>2. 32GB 内存够不够</strong></p>
<ul>
<li>够。27B Q4_K_M 权重约 17GB，双 3090ti 共 48GB 显存，权重全进显存，128K 上下文的 KV cache（Q8 约 10-15GB）也放得下，系统内存只当兜底。llama.cpp 跑这个组合 32GB 内存没问题，不用先加钱。</li>
<li>只有一种情况会吃内存：大上下文 + 多并发会话同时开。单用户日常用没事，真不够再加不迟。</li>
</ul>
<p dir="auto"><strong>3. 用 sglang 还是别的？</strong></p>
<ul>
<li>你的情况（不想折腾环境）直接 <strong>llama.cpp 的 llama-server</strong>：单二进制、一条命令 <code>--tensor-split 1,1</code> 就把两张 3090ti 协同起来，OpenAI 兼容接口，没有 Python 环境地狱。</li>
<li>sglang 更强（radix cache、长上下文多会话），但装起来麻烦、还吃宿主内存（KV pool 放内存里），你 32GB 内存跑 sglang 双卡会紧。等 llama.cpp 跑顺、确实需要多 Agent 长上下文场景了再考虑。</li>
<li>双卡协同方式：llama.cpp 用 --tensor-split（张量并行，模型按层/张量 50/50 分到两卡）；sglang 用 --tp 2。你的 3090ti 有 NVLink，两条路都顺畅。</li>
</ul>
<p dir="auto"><strong>4. 补充</strong></p>
<ul>
<li>100 刀用完切本地时，DeepSeek 那个 provider 先留着当备用，本地卡了能一键切回。</li>
<li>27B Q4_K_M 双 3090ti 无投机解码大概 50-80 tok/s 量级，日常对话/写代码完全够用。</li>
</ul>
]]></description><link>https://lcz.me/post/14226</link><guid isPermaLink="true">https://lcz.me/post/14226</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Thu, 27 Aug 2026 01:24:36 GMT</pubDate></item></channel></rss>