<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[Qwen3.8 27B AWQ  + SGLang + DFlash + 4090D 48G 长上下文多会话测试，Codex/DeepSeek Harness下体验良好！]]></title><description><![CDATA[<p dir="auto">几天前的视频中，我测试了一下 SGLang 加上 Qwen 3.8 27B FP8 的模型权重。当时我说这个模型权重太大了，将近 30G，再加上框架开销，最后可能只剩下 10G 给 KV 缓存。就算是用 FP8 KV 量化，它也支撑不了多个长上下文的会话。</p>
<p dir="auto">后来我就在论坛抄了一个帖子，大家可以去看一下那期视频。抄的是什么呢？用的是 HiCache，就是用内存、SSD 作为缓存。当时确实是可以支持一个长上下文，然后两个中等或者中等偏短长度的上下文，再加上一个短的上下文。有不少观众问说，你确实能够做到吗？你说的是真的吗？我觉得这些人真的是挺无聊的，就不要总有刁民想害朕。人家的帖子发在论坛上面，你到论坛上面去看、去抄作业就行了。我在我的视频下方也放了这个帖子的链接，而且在我的帖子中我也引用了主帖，就是发帖人的原始帖子。你们直接把地址复制给 AI，让 AI 去抄作业就行了。</p>
<p dir="auto">但是我也必须要说，HiCache 是有问题的，就是它对于内存的占用是比较严重的。另外，虽然我当时没有设置硬盘缓存，但是后来看它好像在硬盘中确实也搞了缓存，这个开销就有点大了。那么如果说我们不用 HiCache，像 4090 48G 又要多会话怎么办？论坛中其实也有人在几天之前就发了帖子，当时由于我太忙了，没时间抄作业。就在我的视频刚刚发布之后就发了帖子，因为我当时在视频中说，我希望有把 4 比特量化版本搞得比较顺畅的哥们可以发个帖子，我有时间抄作业。还真有哥们立刻就发了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/c65c2df3-3e03-4e74-a505-f58fa0cd11cc.jpeg" alt="Qwen3.8 27b sglang dflash.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">大家总是问这个论坛哪个地方有收藏，看到没有，这个书签，你点一下就进来了。这个主题工具也是可以收藏的，看到没有，这个地方是可以收藏的。如果说你没有收藏的话，这里会是一个收藏按钮。这位哥们的 ID 叫做“折腾”，也确实挺能折腾的。因为你让 AI 去帮你折腾 4 比特量化版本的 SGLang，它总会有这样那样的问题，最后你得到的结果就是很不好。但是这位哥们用 4090 48G 魔改卡，配置跟我一模一样，也是 64G 内存，他把它搞定了。</p>
<p dir="auto">首先说关键，模型权重肯定是关键，并不是所有的 4 比特模型在 SGLang 上都能够水土相容。这位哥们选的是 Qwen 27B W4A16 AWQ 这个模型。论坛还有另外一个帖子，它是用去对齐版本的，大家如果有抗审查、去对齐的需求，可以到论坛去找到另外一个帖子就行了，它也是实测。这个使用了 DFlash 技术。DFlash 是什么意思呢？它跟 DeepSeek 前一阵子发布的 DSpark 技术有点像，就是它这个主模型权重是 16G 到 20G 中间，我没有详细去记，大家可以去查一下。然后它还有一个草稿小模型，可能只有几个 G。它所有的推理都是用这个小草稿推理的，推理完之后，再把推理结果交给主模型去审核。那么这样子就可以降低负载，提升解码速度，也可以提升吞吐量。</p>
<p dir="auto">一般来说，我们 4090 这种卡的算力是比较够的，5090 就更强了，但是它主要的瓶颈可能还是在带宽上。如果说你能在推理的时候让小草稿模型来执行大量的推理任务，最后交给主模型去审核的话，可以极大地提升吞吐，提升解码速度。他说可以达到 110 tokens/s，短上下文可能是如此，长上下文应该是到不了的。</p>
<p dir="auto">怎么抄作业？看到没有，把这个<a href="https://lcz.me/topic/1340">地址复制</a>，打开你的 Codex，粘贴，我就是这么搞的。语言就是这么朴素无华，就是叫它抄作业，它很快自己就搞定了，就跑起来了。跑起来之后，它做了一些简单的测试，但是它配置 DSH 的时候，讲实话它没有搞对，还是配置错了。这两个模型就是 DeepSeek Harness 跟 Codex，我也正好简单地对比一下。我必须要说，如果说你接 Qwen 3.8 27B 的话，DeepSeek Harness 目前来说表现要更好一点。Codex 可能在编码任务中体验是不错的，但是在配置这种综合任务上，当然也可以把编码算在内，综合的体验，DeepSeek Harness 我认为是要明显好过 Codex 的。它执行任务的成功率要明显高过 Codex，而且它有一个好处，你看它可以把推理模式完全关掉，这个 Codex 是不能的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/642eb118-e4a3-46f7-9936-9eb10e58f748.jpeg" alt="Codex抄作业配置Qwen3.8 27b awq sglang" class=" img-fluid img-markdown" /></p>
<p dir="auto">有点扯岔了，我们再把这个话题收回来。这个模型配置好之后，你就让 Codex 自己把它接入到 Codex，让 DeepSeek Harness 把它接入到 DeepSeek Harness 上去就行了。我让它自己分析自己，它评估的数字是，MTP 投机解码的接收率只有 26%，但是就算这样，它的速度提升大概也有 2.83 倍。总体速度的提升，我不知道它是怎么评估的，是什么样的参数标准。然后我就一直跟它聊天，聊天的内容没有那么发散，但是肯定跟编程是不能比的。我主要是想把上下文给它堆上来。当然了，这样堆长上下文也不是法子，最终还是要用脚本进行批量请求。</p>
<p dir="auto">比如说我在 DeepSeek Harness 上，同时把这个上下文开着，然后后期我就是直接让它多开去请求，让它多开 3 个会话，而且我是让它两次多开。它基本上像这种任务，几十秒就搞定了，说明它的响应速度还是非常快的。它说投机解码稳定在 33% 的概率上，有效加速 3.3 倍。这不能这么算，只能说提升肯定是在 3 倍左右。然后我就说你上下文长度不够，你要给我模拟长上下文，120K 上下文，然后 32K 上下文同时模拟 3 路。它最后给出的结果还是非常稳定，有效加速大概还是在 3 倍左右。</p>
<p dir="auto">我没有办法给大家详细地实际录屏，因为这个显卡在工作的时候，我就坐在旁边。早期看过我以前老视频的人都知道，我的服务器就放在我的右手边，噪音非常大。然后我跟大家说一下体验，就是从聊天的流畅度来说，DeepSeek Harness 是非常流畅的。你如果跟它对话，基本上跟裸模型对话的效率是差不多的，非常快。上下文长了之后，它的响应速度也明显比 Codex 要更好。原帖用的是 FP16 的 KV 缓存，在没有改的情况下，哪怕是使用 Codex 跟它聊天，响应速度也是非常快的，非常夸张。</p>
<p dir="auto">有 110 tokens/s 我是相信的，但是到后期任务越来越复杂、会话越来越长之后，它的响应速度也会降下来。但是我怎么说呢，基本上跟在线模型的差距是不大的，跟 DeepSeek V4 Flash 在线模型差距并不大。如果说你要找一个在本地能够干活的，然后响应又比较快，能够同时执行一个长链任务，甚至我刚才是同时在执行两个长链任务。我另外一边 DeepSeek Harness 在进行三路会话请求的时候，这边这个长链任务也在工作，实际上是两长两中，它还是能搞得定的。但是它中间出现了排队。你不用担心请求多了之后怎么办，它可能处理不过来、死机，这个不用担心，因为算力或者带宽满了，它会排队的。你看这里是总体 tokens，我个人认为数据还是相当好看的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/61e64a60-369e-49be-adec-d8427c728efa.jpeg" alt="Codex Sglang qwen3.8 27b awq聊天" class=" img-fluid img-markdown" /></p>
<p dir="auto">关于它的编程我就不多说了。之前我在论坛 APP 开发的过程中，直接用 Qwen 3.8 27B 模型，当时我用的是 Q4、Q5、FP8，我全部测过，它是能搞得定的。这种难度的开发，它是能够搞得定的，完全没有问题。你看，开发的效果其实还是不错的。</p>
<p dir="auto">对比前几天 HiCache 的用法，这个玩法我个人感觉，如果说你的电脑配置相当强，比如说你是 DDR5 的内存，你的内存是 128G，你的 CPU 也够强劲，你的 SSD 配置也高，它的吞吐、容量都够，那么 DFlash 跟 HiCache 你可以尝试着同时开。但如果说你的需求没有那么夸张，就像我这样，最多就是两长两短，那我觉得载入一个 4 比特的量化模型，然后同时完成一路长会话、两三路短会话，我觉得就够了，完全够用了。</p>
<p dir="auto">但是前提是你最好找另外一个房间，把这个显卡放到另外一个房间。据说 RTX Pro 5000，包括 R9700 32G，它们的噪音可能会比 4090 48G 稍微小一点，但是应该是怼在脸上也接受不了。如果说你一定要把这个机器放在自己的房间里面，你没有第二个房间，那么 7900 XTX 是个非常不错的选择。它这个大风扇版本我是测试过的，哪怕是执行长链的编程任务，它的噪音虽然有，但是完全可控，跟 4090 48G 完全不在一个级别。</p>
<p dir="auto">然后我再说一下，大家如果觉得我哪些地方配置错误了，或者说你们有更好的方案，都可以到论坛跟我交流沟通。包括论坛其实有很多大神，新来的这些哥们有很多都是比较年轻的，他们发的很多帖子对我都有指导意义。并不是说你们一定要向我学习，向论坛的这些大神们学习，你也可以展现出来你自己的实力。你在某一个领域，三人行则必有我师，你可以展示一下你自己的长处。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/fe3ecb78-652f-4c24-9a3d-e5ab5cccb1c7.jpeg" alt="网友指出论坛BUG" class=" img-fluid img-markdown" /></p>
<p dir="auto">之前池川说我这个论坛有安全漏洞，然后我就写了一个安全插件叫 Hermes。写完之后，我的虚拟儿子小特就把它上线了，但是这玩意有 bug，它会导致国内的用户无法显示图片。那么这位哥们就发了个帖子，提出这个问题。你看现在的 AI 已经可以诡辩了，别人说它这个配置有问题，它还要反驳一下，死不承认。然后我介入了之后，后来我没办法，我自己去看了一下。我就说了，这个明显是个 bug，你必须要修复，它才去吭哧吭哧地干活，然后就把这个 bug 给解决了。</p>
<p dir="auto">并不是 AI 一定是对的，并不是一定我就是对的，也并不是论坛上的这些大神都是对的。你有什么正确的观点，你要自己坚持。一看这个头像也是个年轻小伙子，包括我前面提到的池川，我还以为是个老男人，结果人家是个高中生。兄弟们，你想一想，高中生啊，我们这些老头子饭碗不保啊。</p>
]]></description><link>https://lcz.me/topic/1444</link><generator>RSS for Node</generator><lastBuildDate>Wed, 09 Sep 2026 23:52:06 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1444.rss" rel="self" type="application/rss+xml"/><pubDate>Tue, 01 Sep 2026 02:00:00 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to Qwen3.8 27B AWQ  + SGLang + DFlash + 4090D 48G 长上下文多会话测试，Codex/DeepSeek Harness下体验良好！ on Tue, 01 Sep 2026 02:00:00 GMT]]></title><description><![CDATA[<p dir="auto"><a href="https://youtu.be/00sLtkFo41w" rel="nofollow ugc"><i class="fa fa-youtube" aria-hidden="true"></i> Youtube Video</a></p><div class="js-lazyYT lazyYT-container" data-youtube-id="00sLtkFo41w" data-width="640" data-height="360" data-parameters style="width:640px;padding-bottom:360px">
 <div class="ytp-thumbnail lazyYT-image-loaded" style="background-image:url(&quot;https://i.ytimg.com/vi/00sLtkFo41w/hqdefault.jpg&quot;)">
  <button class="ytp-large-play-button ytp-button" tabindex="23" aria-live="assertive" style="transform:scale(0.85)" onclick="$(this).lazyYT(this);return false;">
   <svg height="100%" version="1.1" viewbox="0 0 68 48" width="100%">
    <path class="ytp-large-play-button-bg" d="m .66,37.62 c 0,0 .66,4.70 2.70,6.77 2.58,2.71 5.98,2.63 7.49,2.91 5.43,.52 23.10,.68 23.12,.68 .00,-1.3e-5 14.29,-0.02 23.81,-0.71 1.32,-0.15 4.22,-0.17 6.81,-2.89 2.03,-2.07 2.70,-6.77 2.70,-6.77 0,0 .67,-5.52 .67,-11.04 l 0,-5.17 c 0,-5.52 -0.67,-11.04 -0.67,-11.04 0,0 -0.66,-4.70 -2.70,-6.77 C 62.03,.86 59.13,.84 57.80,.69 48.28,0 34.00,0 34.00,0 33.97,0 19.69,0 10.18,.69 8.85,.84 5.95,.86 3.36,3.58 1.32,5.65 .66,10.35 .66,10.35 c 0,0 -0.55,4.50 -0.66,9.45 l 0,8.36 c .10,4.94 .66,9.45 .66,9.45 z" fill="#1f1f1e" fill-opacity="0.9">
    </path>
    <path d="m 26.96,13.67 18.37,9.62 -18.37,9.55 -0.00,-19.17 z" fill="#fff">
    </path>
    <path d="M 45.02,23.46 45.32,23.28 26.96,13.67 43.32,24.34 45.02,23.46 z" fill="#ccc">
    </path>
   </svg>
  </button>
 </div>
</div><p></p>
]]></description><link>https://lcz.me/post/15232</link><guid isPermaLink="true">https://lcz.me/post/15232</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Tue, 01 Sep 2026 02:00:00 GMT</pubDate></item></channel></rss>