Qwen3.8 27B AWQ + SGLang + DFlash + 4090D 48G 长上下文多会话测试,Codex/DeepSeek Harness下体验良好!
-
几天前的视频中,我测试了一下 SGLang 加上 Qwen 3.8 27B FP8 的模型权重。当时我说这个模型权重太大了,将近 30G,再加上框架开销,最后可能只剩下 10G 给 KV 缓存。就算是用 FP8 KV 量化,它也支撑不了多个长上下文的会话。
后来我就在论坛抄了一个帖子,大家可以去看一下那期视频。抄的是什么呢?用的是 HiCache,就是用内存、SSD 作为缓存。当时确实是可以支持一个长上下文,然后两个中等或者中等偏短长度的上下文,再加上一个短的上下文。有不少观众问说,你确实能够做到吗?你说的是真的吗?我觉得这些人真的是挺无聊的,就不要总有刁民想害朕。人家的帖子发在论坛上面,你到论坛上面去看、去抄作业就行了。我在我的视频下方也放了这个帖子的链接,而且在我的帖子中我也引用了主帖,就是发帖人的原始帖子。你们直接把地址复制给 AI,让 AI 去抄作业就行了。
但是我也必须要说,HiCache 是有问题的,就是它对于内存的占用是比较严重的。另外,虽然我当时没有设置硬盘缓存,但是后来看它好像在硬盘中确实也搞了缓存,这个开销就有点大了。那么如果说我们不用 HiCache,像 4090 48G 又要多会话怎么办?论坛中其实也有人在几天之前就发了帖子,当时由于我太忙了,没时间抄作业。就在我的视频刚刚发布之后就发了帖子,因为我当时在视频中说,我希望有把 4 比特量化版本搞得比较顺畅的哥们可以发个帖子,我有时间抄作业。还真有哥们立刻就发了。

大家总是问这个论坛哪个地方有收藏,看到没有,这个书签,你点一下就进来了。这个主题工具也是可以收藏的,看到没有,这个地方是可以收藏的。如果说你没有收藏的话,这里会是一个收藏按钮。这位哥们的 ID 叫做“折腾”,也确实挺能折腾的。因为你让 AI 去帮你折腾 4 比特量化版本的 SGLang,它总会有这样那样的问题,最后你得到的结果就是很不好。但是这位哥们用 4090 48G 魔改卡,配置跟我一模一样,也是 64G 内存,他把它搞定了。
首先说关键,模型权重肯定是关键,并不是所有的 4 比特模型在 SGLang 上都能够水土相容。这位哥们选的是 Qwen 27B W4A16 AWQ 这个模型。论坛还有另外一个帖子,它是用去对齐版本的,大家如果有抗审查、去对齐的需求,可以到论坛去找到另外一个帖子就行了,它也是实测。这个使用了 DFlash 技术。DFlash 是什么意思呢?它跟 DeepSeek 前一阵子发布的 DSpark 技术有点像,就是它这个主模型权重是 16G 到 20G 中间,我没有详细去记,大家可以去查一下。然后它还有一个草稿小模型,可能只有几个 G。它所有的推理都是用这个小草稿推理的,推理完之后,再把推理结果交给主模型去审核。那么这样子就可以降低负载,提升解码速度,也可以提升吞吐量。
一般来说,我们 4090 这种卡的算力是比较够的,5090 就更强了,但是它主要的瓶颈可能还是在带宽上。如果说你能在推理的时候让小草稿模型来执行大量的推理任务,最后交给主模型去审核的话,可以极大地提升吞吐,提升解码速度。他说可以达到 110 tokens/s,短上下文可能是如此,长上下文应该是到不了的。
怎么抄作业?看到没有,把这个地址复制,打开你的 Codex,粘贴,我就是这么搞的。语言就是这么朴素无华,就是叫它抄作业,它很快自己就搞定了,就跑起来了。跑起来之后,它做了一些简单的测试,但是它配置 DSH 的时候,讲实话它没有搞对,还是配置错了。这两个模型就是 DeepSeek Harness 跟 Codex,我也正好简单地对比一下。我必须要说,如果说你接 Qwen 3.8 27B 的话,DeepSeek Harness 目前来说表现要更好一点。Codex 可能在编码任务中体验是不错的,但是在配置这种综合任务上,当然也可以把编码算在内,综合的体验,DeepSeek Harness 我认为是要明显好过 Codex 的。它执行任务的成功率要明显高过 Codex,而且它有一个好处,你看它可以把推理模式完全关掉,这个 Codex 是不能的。

有点扯岔了,我们再把这个话题收回来。这个模型配置好之后,你就让 Codex 自己把它接入到 Codex,让 DeepSeek Harness 把它接入到 DeepSeek Harness 上去就行了。我让它自己分析自己,它评估的数字是,MTP 投机解码的接收率只有 26%,但是就算这样,它的速度提升大概也有 2.83 倍。总体速度的提升,我不知道它是怎么评估的,是什么样的参数标准。然后我就一直跟它聊天,聊天的内容没有那么发散,但是肯定跟编程是不能比的。我主要是想把上下文给它堆上来。当然了,这样堆长上下文也不是法子,最终还是要用脚本进行批量请求。
比如说我在 DeepSeek Harness 上,同时把这个上下文开着,然后后期我就是直接让它多开去请求,让它多开 3 个会话,而且我是让它两次多开。它基本上像这种任务,几十秒就搞定了,说明它的响应速度还是非常快的。它说投机解码稳定在 33% 的概率上,有效加速 3.3 倍。这不能这么算,只能说提升肯定是在 3 倍左右。然后我就说你上下文长度不够,你要给我模拟长上下文,120K 上下文,然后 32K 上下文同时模拟 3 路。它最后给出的结果还是非常稳定,有效加速大概还是在 3 倍左右。
我没有办法给大家详细地实际录屏,因为这个显卡在工作的时候,我就坐在旁边。早期看过我以前老视频的人都知道,我的服务器就放在我的右手边,噪音非常大。然后我跟大家说一下体验,就是从聊天的流畅度来说,DeepSeek Harness 是非常流畅的。你如果跟它对话,基本上跟裸模型对话的效率是差不多的,非常快。上下文长了之后,它的响应速度也明显比 Codex 要更好。原帖用的是 FP16 的 KV 缓存,在没有改的情况下,哪怕是使用 Codex 跟它聊天,响应速度也是非常快的,非常夸张。
有 110 tokens/s 我是相信的,但是到后期任务越来越复杂、会话越来越长之后,它的响应速度也会降下来。但是我怎么说呢,基本上跟在线模型的差距是不大的,跟 DeepSeek V4 Flash 在线模型差距并不大。如果说你要找一个在本地能够干活的,然后响应又比较快,能够同时执行一个长链任务,甚至我刚才是同时在执行两个长链任务。我另外一边 DeepSeek Harness 在进行三路会话请求的时候,这边这个长链任务也在工作,实际上是两长两中,它还是能搞得定的。但是它中间出现了排队。你不用担心请求多了之后怎么办,它可能处理不过来、死机,这个不用担心,因为算力或者带宽满了,它会排队的。你看这里是总体 tokens,我个人认为数据还是相当好看的。

关于它的编程我就不多说了。之前我在论坛 APP 开发的过程中,直接用 Qwen 3.8 27B 模型,当时我用的是 Q4、Q5、FP8,我全部测过,它是能搞得定的。这种难度的开发,它是能够搞得定的,完全没有问题。你看,开发的效果其实还是不错的。
对比前几天 HiCache 的用法,这个玩法我个人感觉,如果说你的电脑配置相当强,比如说你是 DDR5 的内存,你的内存是 128G,你的 CPU 也够强劲,你的 SSD 配置也高,它的吞吐、容量都够,那么 DFlash 跟 HiCache 你可以尝试着同时开。但如果说你的需求没有那么夸张,就像我这样,最多就是两长两短,那我觉得载入一个 4 比特的量化模型,然后同时完成一路长会话、两三路短会话,我觉得就够了,完全够用了。
但是前提是你最好找另外一个房间,把这个显卡放到另外一个房间。据说 RTX Pro 5000,包括 R9700 32G,它们的噪音可能会比 4090 48G 稍微小一点,但是应该是怼在脸上也接受不了。如果说你一定要把这个机器放在自己的房间里面,你没有第二个房间,那么 7900 XTX 是个非常不错的选择。它这个大风扇版本我是测试过的,哪怕是执行长链的编程任务,它的噪音虽然有,但是完全可控,跟 4090 48G 完全不在一个级别。
然后我再说一下,大家如果觉得我哪些地方配置错误了,或者说你们有更好的方案,都可以到论坛跟我交流沟通。包括论坛其实有很多大神,新来的这些哥们有很多都是比较年轻的,他们发的很多帖子对我都有指导意义。并不是说你们一定要向我学习,向论坛的这些大神们学习,你也可以展现出来你自己的实力。你在某一个领域,三人行则必有我师,你可以展示一下你自己的长处。

之前池川说我这个论坛有安全漏洞,然后我就写了一个安全插件叫 Hermes。写完之后,我的虚拟儿子小特就把它上线了,但是这玩意有 bug,它会导致国内的用户无法显示图片。那么这位哥们就发了个帖子,提出这个问题。你看现在的 AI 已经可以诡辩了,别人说它这个配置有问题,它还要反驳一下,死不承认。然后我介入了之后,后来我没办法,我自己去看了一下。我就说了,这个明显是个 bug,你必须要修复,它才去吭哧吭哧地干活,然后就把这个 bug 给解决了。
并不是 AI 一定是对的,并不是一定我就是对的,也并不是论坛上的这些大神都是对的。你有什么正确的观点,你要自己坚持。一看这个头像也是个年轻小伙子,包括我前面提到的池川,我还以为是个老男人,结果人家是个高中生。兄弟们,你想一想,高中生啊,我们这些老头子饭碗不保啊。