Qwen3.8 27B + DeepSeek Harness实测:7900XTX本地跑Agent效率不错,忘掉SGLang?llama.cpp咸鱼翻身!
-
首先必须说,涨价是万恶之源啊。你看我前几天每天大概消耗十七八块钱,在8月17号,就昨天,我还出门办事了,实际上我只是修改了我的论坛 APP 一些小的 Bug,把功能给完善一下,然后它居然就消耗了我40块钱。就都是一些非常 SB 的功能啊,没有什么难度的功能,但是呢,由于这个 APP 它涉及到的东西太多了,所以说我不得不用 Pro。它在这个多轮长链任务中,能够比较准确地召回上下文,它的注意力机制是比 V4 Flash 要更好一点的。但是呢,你说值这么多钱吗?
如果说像我一样,只是说偶尔开发一个 APP,那么可能花个500块钱左右,能把这个事情给搞定,那么我认为还是有性价比的啊。用 V4 Flash 能不能做出这个 APP 呢?答案是应该是能做的,但是它有一些细节处理,就是会让你觉得没有用 V4 Pro 那么丝滑。因为 V4 Flash 如果说你迭代超过五六十轮,超过个五六百步,那它的注意力机制就比不上 V4 Pro 了。

有很多人说要用什么 GPT5.6 Luna 什么替代 DeepSeek V4 Pro,我也不知道这些人在我这个视频评论区留言的意义是什么,是不是在暴露自己的智商。就如果说你是做一些简单的任务,那么你用 DeepSeek V4 Flash,或者用小米 MIMO,像这个腾讯的混元3都可以完成。但如果说你真正开发过程序,你都不会说出这么傻的话。GPT5.6 Luna 在长链任务中可以说基本上就是智障,它完全不具备任何长链开发的价值。
但是呢,我是比较推荐大家去订阅 GPT 的 Coding Plan。因为你想一想,像这样子开发,你一个月1000块钱就是高频开发,你是挡不住的。有这1000块钱,可以去订阅什么字节跳动的 Trae,它的国内版是1000块钱每个月,国际版是100美金每个月,那个编程体验还是相当不错的。然后呢就是 GPT,你如果说愿意花100美金、200美金,你还怕找不到好的订阅计划吗?是吧,我觉得对于有这种编程需求的人来说,你这么实打实地消耗还是有点痛的。

当然了,还有一个好的方法,就是我们把我们的一些琐碎的工作给解放出来,大家就不要去拼这个在线 AI 了。那么我有两张显卡,我之前也介绍过,我有一张7900 XTX,一张4090D 48G。那么我这张4090我是不想拿出来去配置本地 AI 的。第一,因为它噪音比较大,我坐在旁边听着不舒服;第二,就是我要用它来做一些简单的视频。就我现在不是做了个自动剪辑器吗?我要用它来做 AI 视频。所以说我是不愿意把它拿出来,让这个什么 Qwen3.8 27B 占用了。
但是呢,我又知道,如果用 llama.cpp 去驱动 Qwen3.8 27B,然后用我的7900 XTX这个五六千块钱的老将来出战的话,我怕体验不好。最起码说,如果你要驱动 Hermes,驱动这个 OpenClaw 的话,你没有 SGLang,那基本上会慢成 SB。但是现在有了 DeepSeek Harness,一切就不同了。
我们论坛也来了一个新的大神,虽然现在还没有等级,叫 @exllm 这位兄弟的帖子呢,我看了一下。就是按照往常来讲的话,如果说发帖不截图,然后我基本上不可能给他置顶的,而且我也不太看得起这种帖子。但是他的帖子我看了,就是从一开始我就知道不一样啊。就我这人识人还是比较准的,然后我就想,不如抄他这个方案,我认为可信度是非常高的。
https://lcz.me/topic/1157/qwen3.8-27b-q5_k_m-7900xtx-deepseek-harness实战平均-52-t-s/9他说什么呢?他是 Ryzen 5 5600,32G 的内存,然后7900 XTX显卡,系统是 Ubuntu 26.04,软件是 llama.cpp 加上 Vulkan,就是 Vulkan 版本的。它能干什么呢?能开发一些小游戏,能驱动这个 DeepSeek Harness,并且能改几万行代码的这个 C++ 项目。哎,这个就有点牛逼了。平均52 tokens每秒,缓存命中98%,参数也给得非常明确,用了什么模型也写了,这个效果跑起来是非常夸张的。
但是呢,我就不太清楚,就是说这个速度怎么样。他就给我举了这个冷启动的例子,我看了一下,这样子就已经跟我喜欢的 SGLang 达到了一个水平。如果说 DeepSeek Harness 加上 llama.cpp 能够达到如此好的效果,那我在本地部署模型的时候,就完全没有必要去浪费我这张4090D 48G了。
而且你看,他是给了128K上下文的。这个128K上下文是能够干大事的,因为 Qwen3.8 27B,你就算是给它配256K上下文,它达到150K之后,到200K的样子,它也会变成智障,它的这个召回准确率是不够的。所以如果说这个24G的7900 XTX能够驱动 Q5 量化版本的 Qwen3.8 27B,我认为是非常好的。
那我就照抄了。经过我的详细测试,我就直接给大家汇报啊,今天我们完全不废话,就是完全可以用啊。比如说查查天气呀,聊聊什么代码呀,这些我这样跟你讲吧,DeepSeek Harness 它比 Hermes、比这个 OpenClaw 牛逼的地方就在于,你平时聊天的时候,它的响应速度是非常快的,它不会给你想半天。然后如果是执行什么长链任务,其实也是不错的。
你看看啊,16轮53步的聊天,它的首 Token 平均是5秒,46 tokens/s,缓存命中率96%。因为我跟它聊的话题是比较杂的啊,有哲学,有历史,什么都有,有这个服务器的配置、驱动,都有,还包括让它去网络上搜索东西。

那么回到我们以前的这个老三样呢,就是我也对它进行了一些测试。我让它生成一个网页,展示中国的传统八卦,然后生成一个 SVG,表达这个什么薛定谔的猫思想实验、阿基米德的原理,还有钍基熔盐堆的运行原理。
我看一下啊,这是它做的第一版八卦图。由于我是把推理给关了,否则它容易卡死,而且非常地慢。但是关了之后呢,我感觉它的编程智力是有所下降的啊。不过这个怎么说呢,给70分吧。我就跟它讲说这样不好,能不能给我改进一下,就改进出了这么个玩意,聊胜于无。我还是不满意,又让它给我改进一版,看来这个就是它上限了啊。并且它这个卦位,我感觉还是没搞对。这个就是 Qwen 家族一直的 Bug 啊,它始终没有办法把这个卦象的位置给搞对。
但是这个程序我认为审美是比 DeepSeek 家族要好多了啊,这个网页我给80分吧。在这个八卦这一方面,Qwen 家族是历来都被这个 DeepSeek 给秒杀,因为它总是画不对这个卦象图,这是知识面的问题啊,不是编程能力的问题。
下面就是钍基熔盐堆的运行原理。这一块它可以说是吊打 DeepSeek V4 Flash 或者是 Pro。第一,它画得非常详细;第二呢,就是它没有什么字体被遮盖,然后原理也非常清晰,并且分段啊都有,非常地好。但是呢,我不说了吗,我其实比较喜欢 DeepSeek V4 Pro 那种,就是你画原理图就没有必要画得这么详细啊。这个对于想深入了解的人来说是非常详细,但一般人看到这么多元素可能会懵逼。这个我给90分吧。
然后生成一个 SVG 表达薛定谔的猫思想实验,这一块我认为它画得也比那个什么 DeepSeek V4 Pro 要好一点。第一,没有字体叠加;第二,准确地把握了这个实验的原理,两种状态,是吧,叠加态,盖革计数器这些都有了。这个我给80分啊,主要是因为没有画得非常有逼格、非常漂亮。
那么下一个就是阿基米德原理啊。不提这个我才想起来,前天 DeepSeek V4 Pro 生成那个是错误的,就是它那个演示方法是不对的啊。我有点傻逼了,当时没反应过来。这个才是真正的阿基米德的原理,它讲的是浮力啊。那个 V4 Pro 好像把它搞成了什么杠杆原理,所以人有的时候脑子是抽风了。
这一块它还是胜过 V4 Pro 的。就说即便它是关了推理的情况下,在单轮编程中,Qwen 27B 的编程能力是非常强悍的,这一点是必须要承认的啊。它完全不输给 DeepSeek V4 Flash 或者 Pro。但是你也知道,我们不能光看单轮嘛,是吧?我们得看这个长线嘛。
大家知道我用这个 Chrome 浏览器来访问 DeepSeek Harness,它老是提醒这个证书有问题、不安全。就有的时候它弹框是弹不出来的,是有 Bug 的,我就必须把这个会话给终止掉。在这种情况下,我们就要进行一些长线任务了。
哦对了,刚才我们说长线任务,我们要看一下啊。就是它一共进行了14轮90步迭代,然后首 Token 平均2.6秒,这个是54 tokens每秒,缓存命中率99%。就是在编程这一块,它的缓存命中率可以变得非常地高。如果你聊天聊得比较杂的话,那么你的缓存命中率就不高。
还有就是它现在 llama.cpp 有一个问题,就是如果说你用时间长了,它会变得比较卡,就后面的平均 tokens 是不如前面的。不过我已经跑了好几个小时了,我感觉有这样的表现,能够跟 SGLang 叫板是没有问题的啊。最起码你可以通过一个什么脚本,来让它隔一段时间去把这个显存给清理一下,说不定效果会好一点。
就是如果你要多开的话,可能必须需要上 vLLM 或者 SGLang,但是它们就没有 llama.cpp 这么轻量了啊,我认为不值得。
我要去修正这个问题怎么办呢?我就要自己开发一个简单的播放器,简单的浏览器啊,就是这个样子。我把它关掉。这个事情就是让 Qwen 27B 自己开发的啊。你看,一共迭代14轮145步,花了31分钟时间,平均首 Token 是4.8秒,46 tokens/s,缓存命中率99%。
它做出个什么东西来呢?就现在点击它,它就可以跳过 HTTPS 证书的这个检查,直接给我载入到我指定的这个地址,这地址是可以改的。然后呢,我就可以直接跟它聊天。
后面呢,我会把我跟它聊天的一些片段发给大家看一下。就是你如果说纯粹聊天的话,它比起其他的框架真的是好太多了,你其他的 Agent 跟它的效率完全不能比。它就是相当于你跟大模型直接聊天,大模型是怎么延迟,它就是怎么延迟。
所以说 DeepSeek Harness 在这一块真的是一个极品,是一个非常牛逼的工具。要知道这还是 RC 版本啊,它不是正式版,它甚至都不是 Beta 版本。我觉得它未来的前途不可限量。

最起码说7900 XTX这张显卡,因为它的存在,大大升值了。就是它能够驱动 Qwen3.8 27B 这么一个重磅的模型,然后以一个非常不错的吐字速度,能够执行这种不能说叫太大的编程任务,但是起码它也是长链的、多轮迭代的编程任务,我认为有这样的能力就够了。
因为我们再复杂的项目,我们可以开发一个模块,开发一个框架,然后把它设计好之后,上传到这个 Git 服务器,然后我们一个模块一个模块来开发。你规划好的话,Qwen3.8 27B 目前的能力是完全够的啊。
这个东西讲实话,7900 XTX我当时买的时候是6000出头,已经很久了,它现在可能只需要5000块钱。兄弟们,5000块钱啊,能够用这个 Q5_K_M 版本的 Qwen3.8 27B,你还叫什么自行车?是吧,能玩 Agent,能跟这个大模型聊天,并且它还给你配备了这个搜索工具。兄弟们,这个性价比还不是拉满了?是吧,还考虑什么,抓紧造起来吧。
DeepSeek 涨价是 DeepSeek 的事,我们在本地有一些简单的任务都可以通过它来完成了。后面我还……对了,我后面把这个片段放上来,就是我自己也没有讲话啊,就是我使用它的时候的录像,大家就凑合着听一下,好吧。因为我这张老脸,我当时也忘记把这个摄像头给关掉了啊,希望我这张老脸不至于影响大家这个观看体验。
好吧,本期视频就到这里,我们下期再见。
-
Wang Wei 可以,WSL2 跑 llama.cpp 没问题,两条路:
- Vulkan 后端(最省事):WSL2 里装 Vulkan SDK,llama.cpp 用 -DGGML_VULKAN=ON 编译,7900XTX 通过 WSL2 的 GPU 直通直接用(Windows 侧装好 AMD 驱动即可)。
- ROCm 后端:AMD 官方支持 WSL2(ROCm 5.7+ 支持 gfx1100),WSL2 里装 ROCm 用户态,llama.cpp 用 -DGGML_HIP=ON 编译。性能略好但安装步骤多。
128K 上下文能不能做到,看显存账:Qwen3.8-27B Q4_K_M 约 16-17GB,128K 的 KV 缓存——
- Q8 KV:+8-10GB,总约 26GB,超 24GB 会 spill 到内存,速度掉到 30-40 tps(论坛实测参考:TID:1178 坤坤 110K ctx 就只剩 30-35 tps)
- Q4 KV:+4-5GB,总约 21-22GB,能塞进 24GB,128K 可以跑,但长文生成会慢
32G 内存是另一个约束:WSL2 默认只吃一半内存,建议在 .wslconfig 里把 memory 调大、给足 swap,避免 KV spill 时直接卡死。
实用建议:128K 用 Q4 KV 刚好能塞下;日常用不到那么长的话,64-96K + Q8 KV 更舒服,速度能保持 50+ t/s。短上下文下这卡能跑 60-73 t/s(论坛实测 TID:1164 73.4 t/s),瓶颈只在长上下文的显存,不在 WSL2 本身。
-
涨价确实是万恶之源,我本来中转搞了Deepseek免费让大家登。自己贴不了多少钱的成本,想拉点新用户。这一波涨价,直接把我的营销策略干躺了。从冒进主义变成了长期稳定。哈哈哈哈
-
2080ti*2 不好吗? 同样5000