<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[新手救助]]></title><description><![CDATA[<p dir="auto">近期想部署本地千问3.8，看了锤总几个月视频，目前较为钟意偏向的是本地部署两台dgx spark，部署1台怕token慢，另外还想侧端同时跑h3，请各位大神鞭策</p>
]]></description><link>https://lcz.me/topic/1890</link><generator>RSS for Node</generator><lastBuildDate>Fri, 25 Sep 2026 20:36:00 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1890.rss" rel="self" type="application/rss+xml"/><pubDate>Tue, 22 Sep 2026 08:52:14 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 新手救助 on Thu, 24 Sep 2026 03:05:20 GMT]]></title><description><![CDATA[<p dir="auto">标题明确<br />
带上要问的内容的简要描述。</p>
]]></description><link>https://lcz.me/post/20410</link><guid isPermaLink="true">https://lcz.me/post/20410</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Thu, 24 Sep 2026 03:05:20 GMT</pubDate></item><item><title><![CDATA[Reply to 新手救助 on Thu, 24 Sep 2026 02:41:32 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/densha" aria-label="Profile: densha">@<bdi>densha</bdi></a> <a href="/post/20398">说</a>:</p>
<p dir="auto">2台DGX可以吃下的:<br />
DeepSeek-V4-Flash-Vision-Exp<br />
Qwen3.8-flash-next<br />
GLM-5.3-flash<br />
缺點:速度很普，用起來沒雲端的舒暢<br />
優點:是可以跑未審查、數據不出門、自己擁有的爽度</p>
</blockquote>
<p dir="auto">DGX 的舒适圈还是 MOE模型</p>
]]></description><link>https://lcz.me/post/20401</link><guid isPermaLink="true">https://lcz.me/post/20401</guid><dc:creator><![CDATA[张光璞]]></dc:creator><pubDate>Thu, 24 Sep 2026 02:41:32 GMT</pubDate></item><item><title><![CDATA[Reply to 新手救助 on Thu, 24 Sep 2026 02:31:48 GMT]]></title><description><![CDATA[<p dir="auto">2台DGX可以吃下的:<br />
DeepSeek-V4-Flash-Vision-Exp<br />
Qwen3.8-flash-next<br />
GLM-5.3-flash<br />
缺點:速度很普，用起來沒雲端的舒暢<br />
優點:是可以跑未審查、數據不出門、自己擁有的爽度</p>
]]></description><link>https://lcz.me/post/20398</link><guid isPermaLink="true">https://lcz.me/post/20398</guid><dc:creator><![CDATA[densha]]></dc:creator><pubDate>Thu, 24 Sep 2026 02:31:48 GMT</pubDate></item><item><title><![CDATA[Reply to 新手救助 on Wed, 23 Sep 2026 16:02:33 GMT]]></title><description><![CDATA[<p dir="auto">先买一台是对的。补一句你提到的两个附加场景：</p>
<ul>
<li>「给几个朋友一起用」：Spark 的瓶颈是单机约 273GB/s 内存带宽，并发请求是分带宽的——27B Q4 单请求 10–15 t/s，2–3 个人同时用就会明显排队变慢，长上下文更明显。要多人稳定用，单台 Spark 不够，要么上更高带宽的独显，要么第二台做分工（一台专跑 agent、一台跑模型）。</li>
<li>「喂给 agent 一起用」：agent 的长上下文 prefill 是 Spark 的弱项，尽量开 prefix cache，把 system prompt 和工具描述固定下来复用，别每次全量重算 prefill。</li>
</ul>
<p dir="auto">买回来先做两件事：单请求 pp/tg 基线，再用真实 coding 负载做一轮 2 并发压测；数据出来再决定要不要第二台。</p>
]]></description><link>https://lcz.me/post/20344</link><guid isPermaLink="true">https://lcz.me/post/20344</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Wed, 23 Sep 2026 16:02:33 GMT</pubDate></item><item><title><![CDATA[Reply to 新手救助 on Wed, 23 Sep 2026 15:11:27 GMT]]></title><description><![CDATA[<p dir="auto">主场景是量化的策略Coding和做回测，如果本地部署完善后，我可以在代码中加入实施AI轮询，应该对策略代码有所帮助。<br />
再次感谢各位的帮助</p>
]]></description><link>https://lcz.me/post/20333</link><guid isPermaLink="true">https://lcz.me/post/20333</guid><dc:creator><![CDATA[Vincnet Hu]]></dc:creator><pubDate>Wed, 23 Sep 2026 15:11:27 GMT</pubDate></item><item><title><![CDATA[Reply to 新手救助 on Wed, 23 Sep 2026 15:08:36 GMT]]></title><description><![CDATA[<p dir="auto">感谢各位，主打听劝，那我先买一台先跑起来，昨天在路上用手机码字的，所以写的比较仓促，我目前主要使用场景是Codex-ASTRA写文案构架，然后给Sol进行实施方案，但是200的PRO不够用，前几天用过智普，感觉可行，所以想本地部署一台做牛马机，智普的国产AI我这速度写下来，有点小贵，所以想本地部署QWen，都说3.8可以堪比optus4.6了，我主要使用的是想本地coding的时候可以自由度高一点，同时可以给自己几个朋友一起用下，然后可以喂给我的接agent一起使用。至于H3不是重度使用，或者可以说目前还不怎么涉及，只是有兴趣。再次感谢各位大爷</p>
]]></description><link>https://lcz.me/post/20332</link><guid isPermaLink="true">https://lcz.me/post/20332</guid><dc:creator><![CDATA[Vincnet Hu]]></dc:creator><pubDate>Wed, 23 Sep 2026 15:08:36 GMT</pubDate></item><item><title><![CDATA[Reply to 新手救助 on Tue, 22 Sep 2026 13:11:53 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/vincnet-hu" aria-label="Profile: Vincnet-Hu">@<bdi>Vincnet-Hu</bdi></a> 如果只跑Qwen3.8-27B 1台Spark就够了，跑H3还是配一块5090输出速度才有一点的生产力。</p>
]]></description><link>https://lcz.me/post/20080</link><guid isPermaLink="true">https://lcz.me/post/20080</guid><dc:creator><![CDATA[perter]]></dc:creator><pubDate>Tue, 22 Sep 2026 13:11:53 GMT</pubDate></item><item><title><![CDATA[Reply to 新手救助 on Tue, 22 Sep 2026 12:45:25 GMT]]></title><description><![CDATA[<p dir="auto">1台千问3.8 27B，两台上DS 4 flash，三台上4.1<br />
慢慢上，不需要一步到胃（如果是从投资角度得另说，手动狗头）</p>
]]></description><link>https://lcz.me/post/20072</link><guid isPermaLink="true">https://lcz.me/post/20072</guid><dc:creator><![CDATA[xiongjie gao]]></dc:creator><pubDate>Tue, 22 Sep 2026 12:45:25 GMT</pubDate></item><item><title><![CDATA[Reply to 新手救助 on Tue, 22 Sep 2026 12:13:55 GMT]]></title><description><![CDATA[<p dir="auto">看过此设备的视频的实测，可以先买1台，如果慢就在增加一台。网上说推荐买两台。</p>
]]></description><link>https://lcz.me/post/20069</link><guid isPermaLink="true">https://lcz.me/post/20069</guid><dc:creator><![CDATA[懒人烘培]]></dc:creator><pubDate>Tue, 22 Sep 2026 12:13:55 GMT</pubDate></item><item><title><![CDATA[Reply to 新手救助 on Tue, 22 Sep 2026 10:03:02 GMT]]></title><description><![CDATA[<p dir="auto">结论先给：「1 台怕 token 慢」用第二台 Spark 只能部分缓解，而且要看你的负载类型——</p>
<ul>
<li><strong>单台 Spark 的瓶颈是单机内存带宽</strong>（GB10 这一档约 270 GB/s），不是算力。Qwen3.8-27B dense 在 Q4 下权重约 15–16GB，理论上限 ≈ 273/16 ≈ 17 t/s，实测通常 10–15 t/s；Q8 直接砍半。先接受这个量级，再决定要不要第二台。</li>
<li><strong>第二台能干嘛</strong>：Spark 之间只有 ConnectX-7 200Gb（约 25GB/s），比机内带宽低一个数量级。TP=2 在 batch=1 时确实有一点收益（第三方实测 120B 模型 TP=2 39.5 vs PP=2 28.8 t/s），但那是拿「120B 单台装不下」换来的；27B 单台就装得下，TP=2 每层 all-reduce 走 200Gb 会把收益吃掉大半，别指望 2 倍。<strong>第二台的主要价值是容量</strong>：256GB 统一内存跑更大 MoE、更长 KV，而不是让 27B 变快。</li>
<li><strong>所以分工</strong>：要单流速度 → 换高带宽单卡（5090 约 1.8TB/s / R9700 约 640GB/s 档）；要容量 → 两台 Spark。楼上说「两台更适合 DeepSeek Flash」也是这个道理——MoE 能靠容量装专家，但 expert-parallel 的 all-to-all 同样受 200Gb 制约，扩展性一般。</li>
<li><strong>侧端同时跑 H3 才是先要算的账</strong>：Spark 的 128GB 是 CPU/GPU 统一内存，LLM 常驻（27B + 长 KV）与 H3（DiT/VAE + offload）抢的是同一池。想并跑，先按 64K 上下文给 LLM 留约 20–24GB，其余给 H3；否则就是 OOM 或换页二选一。真要稳定并跑，<strong>两台分角色</strong>（一台专职 LLM、一台专职 H3）比一台硬塞合理。</li>
<li><strong>最小验证</strong>：先拿 1 台，Qwen3.8-27B Q4 + 128K 跑 <code>llama-bench</code> 出 pp/tg 曲线与峰值内存；同一台再出 H3 5s 样片、记录内存峰值。两份数据一摆，第二台买不买、放什么，就不用猜了。</li>
</ul>
]]></description><link>https://lcz.me/post/20056</link><guid isPermaLink="true">https://lcz.me/post/20056</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Tue, 22 Sep 2026 10:03:02 GMT</pubDate></item><item><title><![CDATA[Reply to 新手救助 on Tue, 22 Sep 2026 09:06:19 GMT]]></title><description><![CDATA[<p dir="auto">两台 dgx 最适配的不应该是deepseek flash 吗？   功课没做好哇 。</p>
]]></description><link>https://lcz.me/post/20049</link><guid isPermaLink="true">https://lcz.me/post/20049</guid><dc:creator><![CDATA[张光璞]]></dc:creator><pubDate>Tue, 22 Sep 2026 09:06:19 GMT</pubDate></item><item><title><![CDATA[Reply to 新手救助 on Tue, 22 Sep 2026 09:04:47 GMT]]></title><description><![CDATA[<p dir="auto">这样做的可行性可以吗</p>
]]></description><link>https://lcz.me/post/20048</link><guid isPermaLink="true">https://lcz.me/post/20048</guid><dc:creator><![CDATA[Vincnet Hu]]></dc:creator><pubDate>Tue, 22 Sep 2026 09:04:47 GMT</pubDate></item></channel></rss>