DeepSeek V4 Flash + DSHarness 是目前最省心的AI Agent组合,长上下文,搞缓存命中,多模态。系统配置/网站管理/APP开发能力和体验拉满!
-
论坛的清风明月发帖说,使用 Hermes 部署 Cloudflare Workers and Pages,为了省点钱使用了小米的 MiMo V2.5,弄了半个小时,整得稀烂。没有办法,熬到6点钟之后切换 DeepSeek V4 Flash,5分钟不到搞定,差距有点大。说这个 DeepSeek 要能回到涨价之前就好了,这个模型实在好用。
botio kuo 说,有一说一,我也是用过 DeepSeek V4 之后,才觉得 AI 能够真正干点事,其他的要么太难用,要么就是太贵。wolf55 说,他也搞过 Cloudflare Workers and Pages,使用的是这个 PI Agent 加上 MiniMax M2.7,成功了,但是时间没有那么快。
这个是干什么?要怀念 DeepSeek V4 Flash 吗?其实这个模型涨价之后,说实话并不很贵。就我讲实话,我这几天都是白天开发居多,我没有刻意避开这个高峰期,但是这几天我选了一个比较好的策略。之前我不都是使用这个什么 Codex 来开发的吗?我觉得体验还可以吧,一开始它的体验肯定是要比刚刚出来的 DeepSeek Harness 要更好的,但是最近我都是使用 DeepSeek Harness 在进行主力的开发。

同样接 DeepSeek V4 Flash,包括接千问3.8 27B,我感觉 DeepSeek Harness 的体验已经完全超越 Codex 了。我的主要工作都已经迁移到 DeepSeek Harness 上来了,这个还只是 DeepSeek Harness 的 RC2 版本,它还不是 Alpha 版本。很快发布 Alpha,甚至 Beta 或者正式版之后,我觉得 DeepSeek Harness 这个 Agent 就可以作为大家的统一 Agent 了,你可能不再需要 Hermes,不再需要 Codex 了。
目前我管理这个论坛,使用的还是 Hermes,因为我那个 Ubuntu 笔记本是常年不关机,然后我的 Hermes 服务跑在上面,到目前为止它都非常稳定。就在 OpenClaw 被我抛弃之后,我毫不犹豫地选择了 Hermes,它也确实这么长时间从来没有辜负过我,就是一直运行,兢兢业业,非常稳定。帮我管理论坛,帮我开发安全插件,处理网络攻击,发这些资讯帖子,然后回复一些人的提问,再更新系统。基本上怎么讲呢,可能说即便以后我使用 DeepSeek Harness 作为主要的入口,那么在网络管理这一块,就是我的服务器管理这一块,我可能还会交给 Hermes。

然后就说一下 DeepSeek V4 Flash 这个模型。我们跟一些国产模型来对比,比如说我在视频中经常喷一些国产的模型,就是垃圾。最主要的是因为什么呢?因为它们的上下文标成1M,但是实际上没有,它们就是骗子,浪费你的时间。它们的上下文标成1M,但是你实际用起来可能过了256K它们就不行了,过了512K它们就会变成傻逼。包括国外的谷歌其实也都是这样,Grok 它们的上下文召回准确率都很垃圾。
真正长上下文这一方面做得比较好的,就是 OpenAI GPT 跟 Claude 的旗舰模型,就是 Anthropic 的旗舰模型,还有就是 DeepSeek。然后 DeepSeek 我为什么喜欢用呢?就是因为 V4 Flash 这个模型非常全能,它能部署脚本,能配置 ComfyUI,配置大模型,也能维护网络,开发 Web 插件,也能够进行 APP 的开发。
之前它最大的弱点就是没有多模态。像我必须要用到多模态能力,我就会使用小米的 V2.5,就是 MiMo V2.5。它这个模型做得我认为是可圈可点的,并不像这位哥们说的一无是处。当然了,它编程脚本确实是很烂,最起码它不算是一流的,只能说勉强及格。但是它的多模态能力,比如说生成 SVG 图像,它的逼格是要比 DeepSeek 家族强很多的,也要比千问家族更好。
在之前 V4 Flash 没有多模态能力之前,比如说我要做一些多模态的开发,那我就必须要用到它。你像如果说这个地方显示错了,我要把它移个位置,你说我怎么给这个大模型描述,怎么给 Agent 描述呢?我最好就是截个图。但如果说你不能识图,你要外挂就很麻烦,因为你的语义不是统一的,不是打通的。然后我要增加一个新的功能,比如说这个图片怎么处理,我就直接跟它讲,截个图给它,哪个位置哪个位置图片,点击之后它没有处理,你给我按照统一的逻辑处理一下,那么 Agent 很快就能够理解。
DeepSeek 的 V4 Flash,包括 V4 Pro,跟自家的 DeepSeek Harness 配合确实是非常好的。Codex 可能搞不定这么强的缓存命中,而且由于它不能把推理完全关掉,它最低的就是一个 Low 模式,它没有完全的 Off 模式,所以说它可能 Token 的消耗还是要更多一点,然后更贵一点。我们看一下首 Token 平均延迟是3.2秒,然后115 tokens/s,缓存命中率99.6%,总共进行了65轮1373步迭代,这是非常好了。

但是我必须说一下,这个前面30轮是千问3.8 27B。我当时截了图的,也给大家正好对比一下这两个模型到底体验差距有多大。我们看一下,如果说你是用 SGLang 部署的话,SGLang 原生是有视觉模块的,这个不需要你去额外部署,那么它就可以识别,而且它识别的速度还挺快的,并不耽误你理解,并不耽误你去执行其他的任务,就是它对系统资源的占用是可以接受的。
然后我使用千问3.8 27B,就是昨天的视频,大家可以去看一下。我在里面放了论坛帖子的链接,大家点击进去可以找到我的部署方案,也可以找到原帖的部署方案。你们去参考这个论坛大神的原帖,就直接复制给你的 Agent 就可以部署。选用的是千问3.8 27B 这个 W4A16 AWQ 加上 DFlash2 来部署。
这个体验比前几天我视频中讲的使用千问3.8 27B FP8 模型加上 HiCache 技术体验要更好一点,因为它不用占用大量的系统内存,不用占用你的硬盘空间。并且它运行的时候,我这个4090D 48G魔改卡的风扇噪音其实并不大,并不会呜呜地作响。如果说做单一的长链开发任务,它基本上风扇是不怎么启动的,是比较安静的。当然偶尔会启动一下,就那一点点时间噪音比较大。然后这个方案也是可以支持两个长会话、两个中等长度的会话,它负载4个会话是没什么问题的。
我在同一个开发任务中、同一个会话中是进行热切换,让千问3.8先来。千问3.8 27B 的体验是要略差于 DeepSeek V4 Flash,最主要的是什么呢?它如果是执行单一的 Bug 修改,是没有什么问题的,而且它的审美也是怎么讲呢,不比 V4 Flash 差的,虽然跟小米比起来都是垃圾了,但是它开发的 UI 界面还是比较漂亮的。
它比较大的缺点就是什么?就是它的上下文不行。实际上 Qwen 3.8 27B 的上下文如果超过150K,因为我是给它配的是160K,最主要的是我感觉超过160K之后它的召回准确率就不行了。实际上即便是在128K到160K之间,我感觉它还是会顾此失彼。经常你让它去开发一个页面,比如说你让它开发某个功能,我这里点一个链接进来,它这两个地方的显示就不统一,没有复用这个显示框架,就自己重新开发一个。
或者说,你看我们这里不是有这个帖子展示吗?我们在进入这个论坛板块的时候,这里也是有帖子展示,按理说是应该复用的,但是它并没有复用。用 DeepSeek V4 Flash 就能把它拉回来,除了说你这里加一个小背景之外,其他的是完全复用的,这个显示模块是复用的。也就是说,它的上下文长度实际上对这个模型进行长链开发是有限制的。

我为什么给它迭代到大概30轮左右?我看看我那个截图,我这个截图上是给它迭代了19轮321步,实际上我最终是给它迭代到30轮,它后面还进行了开发。这一次长链任务进行了20分钟左右的开发,然后我给它同时设置了6个目标,它还开了后台任务。就是它的体验极限可能就到这里了,大概30轮,大概四五百步。再多的话,由于上下文长度的限制,召回准确率不高,它就会顾此失彼,改了这个 Bug 可能会引起另外一个新的 Bug。
所以说,最好我们改这种论坛 APP 这样级别的程序,讲实话也不难,都不难。这个东西你还是让它一个功能一个功能地实现,比如说你用 V4 Pro 或者用 V4 Flash 把这个框架给它设计好,然后你让它实现某一个单一模块,实现完了之后就立刻让它提交,提交上去,提交到 Git 上,然后再执行下一个任务。
如果说它的上下文长度太长的话,Codex 是不行的。Codex 好像是暴力截断,有压缩,但是压缩后丢失信息明显,它这块处理得不好,体验不太好。但是如果说是 DeepSeek Harness,它是可以进行比较智能的截断,但是还是不如你自己把它完全关掉,重新开一个要好一点。
如果说你想用这个本地部署的 Qwen 27B 来替代 V4 Flash,我认为可能你的体验要打一点折扣,最主要的是多轮迭代之后。如果你能接受的话,那么每个月你是重度开发,你省个1000块钱,我觉得都是比较轻松的。因为我大部分时候并没有在开发程序,我都是在搞些小的脚本。偶尔我有空闲时间了,我就把这个东西给完善一下,可能准备到国庆节之后、过年之前给大家上线,给大家用。
当然了,我最后也提一下,最近一些国产模型,像什么 GLM-5.3-Flash,像什么千问3.8 Flash,像什么腾讯的 HY4 Preview,这些模型其实我都测了。就是我讲实话,每个模型有每个模型的特征,有每个模型的特长,但是也有它的弱点。如果说你真的是想省心,就没有必要这个也碰那个也碰,你就直接上来,除非你买到了什么 GLM,或者说 Kimi、MiniMax 这些 Coding Plan,你觉得非常划算,否则我建议大部分新手就不要东一榔头西一棒。
你们就按照论坛大多数人的经验,直接接入 DeepSeek V4 Flash 这个在线模型就行了,让它帮你总管一切。如果说你有比较好的显卡,比如说7900 XTX、R9700,就是 AMD 的 AI Pro R9700,或者说有4080S 32G魔改卡,有3090,有4090 48G、5090、RTX Pro 5000、4500、6000都可以,那你就让 DeepSeek V4 Flash 来帮你配置本地的 AI,你可以借助它来省钱。真的就不要再这个模型也试一下,那个模型也试一下。

当然了,如果说你不差钱,你去用一下什么国外的 GPT、Claude 都可以。对了,还有就是我在视频中多次强调的,OpenAI 的20美金 Plus 会员是非常非常值得的。虽然我不太喜欢 GPT-5.6 Luna 这个模型,我认为它怎么说呢,有点浪费时间,但是有很多人反映它的使用体验还不错。我这人主观意见,我是不建议大家去用它来做 Agent 任务,但是用它来聊天,用它来处理文档,干一些脏活,它是非常胜任的。而且这个订阅计划中还带大量的图片生成额度,如果说你有几个油管频道,你的网站需要配图,用它就足够了。
当然了,如果说你就是要用 GPT-5.6 Luna 来折腾一些本地的 AI 部署,或者说开发工作,那么也可以,因为这玩意说实话,千金难买我愿意。你就愿意这样搞,那也挺好的。大家在使用 AI 大模型的过程中有什么经验、心得、教训,都欢迎到这个论坛来发帖交流讨论。并不是说我说什么都是对的,就像有些傻叉在我的评论区留言说,主播的意见只代表他一家之言。是的,我的所有评论都是基于我个人的经验,只能代表我一家之言。我并不会像这些留言的这些大神一样,他们可能能够代表马云,能够代表马化腾,能够代表马斯克,我只能代表我自己。这个都是经验分享嘛,说白了都是非常主观的事情。