<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[DeepSeek V4 Flash + DSHarness 是目前最省心的AI Agent组合，长上下文，搞缓存命中，多模态。系统配置/网站管理/APP开发能力和体验拉满！]]></title><description><![CDATA[<p dir="auto">论坛的<a href="https://lcz.me/topic/1455">清风明月发帖</a>说，使用 Hermes 部署 Cloudflare Workers and Pages，为了省点钱使用了小米的 MiMo V2.5，弄了半个小时，整得稀烂。没有办法，熬到6点钟之后切换 DeepSeek V4 Flash，5分钟不到搞定，差距有点大。说这个 DeepSeek 要能回到涨价之前就好了，这个模型实在好用。</p>
<p dir="auto">botio kuo 说，有一说一，我也是用过 DeepSeek V4 之后，才觉得 AI 能够真正干点事，其他的要么太难用，要么就是太贵。wolf55 说，他也搞过 Cloudflare Workers and Pages，使用的是这个 PI Agent 加上 MiniMax M2.7，成功了，但是时间没有那么快。</p>
<p dir="auto">这个是干什么？要怀念 DeepSeek V4 Flash 吗？其实这个模型涨价之后，说实话并不很贵。就我讲实话，我这几天都是白天开发居多，我没有刻意避开这个高峰期，但是这几天我选了一个比较好的策略。之前我不都是使用这个什么 Codex 来开发的吗？我觉得体验还可以吧，一开始它的体验肯定是要比刚刚出来的 DeepSeek Harness 要更好的，但是最近我都是使用 DeepSeek Harness 在进行主力的开发。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/3c16c1d3-963b-4b7e-9e64-ff950cc0c3b0.jpeg" alt="DeepSeek V4 Flash + Harness组合.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">同样接 DeepSeek V4 Flash，包括接千问3.8 27B，我感觉 DeepSeek Harness 的体验已经完全超越 Codex 了。我的主要工作都已经迁移到 DeepSeek Harness 上来了，这个还只是 DeepSeek Harness 的 RC2 版本，它还不是 Alpha 版本。很快发布 Alpha，甚至 Beta 或者正式版之后，我觉得 DeepSeek Harness 这个 Agent 就可以作为大家的统一 Agent 了，你可能不再需要 Hermes，不再需要 Codex 了。</p>
<p dir="auto">目前我管理这个论坛，使用的还是 Hermes，因为我那个 Ubuntu 笔记本是常年不关机，然后我的 Hermes 服务跑在上面，到目前为止它都非常稳定。就在 OpenClaw 被我抛弃之后，我毫不犹豫地选择了 Hermes，它也确实这么长时间从来没有辜负过我，就是一直运行，兢兢业业，非常稳定。帮我管理论坛，帮我开发安全插件，处理网络攻击，发这些资讯帖子，然后回复一些人的提问，再更新系统。基本上怎么讲呢，可能说即便以后我使用 DeepSeek Harness 作为主要的入口，那么在网络管理这一块，就是我的服务器管理这一块，我可能还会交给 Hermes。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/0f038901-474a-4502-8c6a-617aff69620d.jpeg" alt="Hermes deepseek管理论坛" class=" img-fluid img-markdown" /></p>
<p dir="auto">然后就说一下 DeepSeek V4 Flash 这个模型。我们跟一些国产模型来对比，比如说我在视频中经常喷一些国产的模型，就是垃圾。最主要的是因为什么呢？因为它们的上下文标成1M，但是实际上没有，它们就是骗子，浪费你的时间。它们的上下文标成1M，但是你实际用起来可能过了256K它们就不行了，过了512K它们就会变成傻逼。包括国外的谷歌其实也都是这样，Grok 它们的上下文召回准确率都很垃圾。</p>
<p dir="auto">真正长上下文这一方面做得比较好的，就是 OpenAI GPT 跟 Claude 的旗舰模型，就是 Anthropic 的旗舰模型，还有就是 DeepSeek。然后 DeepSeek 我为什么喜欢用呢？就是因为 V4 Flash 这个模型非常全能，它能部署脚本，能配置 ComfyUI，配置大模型，也能维护网络，开发 Web 插件，也能够进行 APP 的开发。</p>
<p dir="auto">之前它最大的弱点就是没有多模态。像我必须要用到多模态能力，我就会使用小米的 V2.5，就是 MiMo V2.5。它这个模型做得我认为是可圈可点的，并不像这位哥们说的一无是处。当然了，它编程脚本确实是很烂，最起码它不算是一流的，只能说勉强及格。但是它的多模态能力，比如说生成 SVG 图像，它的逼格是要比 DeepSeek 家族强很多的，也要比千问家族更好。</p>
<p dir="auto">在之前 V4 Flash 没有多模态能力之前，比如说我要做一些多模态的开发，那我就必须要用到它。你像如果说这个地方显示错了，我要把它移个位置，你说我怎么给这个大模型描述，怎么给 Agent 描述呢？我最好就是截个图。但如果说你不能识图，你要外挂就很麻烦，因为你的语义不是统一的，不是打通的。然后我要增加一个新的功能，比如说这个图片怎么处理，我就直接跟它讲，截个图给它，哪个位置哪个位置图片，点击之后它没有处理，你给我按照统一的逻辑处理一下，那么 Agent 很快就能够理解。</p>
<p dir="auto">DeepSeek 的 V4 Flash，包括 V4 Pro，跟自家的 DeepSeek Harness 配合确实是非常好的。Codex 可能搞不定这么强的缓存命中，而且由于它不能把推理完全关掉，它最低的就是一个 Low 模式，它没有完全的 Off 模式，所以说它可能 Token 的消耗还是要更多一点，然后更贵一点。我们看一下首 Token 平均延迟是3.2秒，然后115 tokens/s，缓存命中率99.6%，总共进行了65轮1373步迭代，这是非常好了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/cee943ae-66fe-477e-96d2-08a8346ff2ed.jpeg" alt="DeepSeek V4 Flash长链开发任务迭代" class=" img-fluid img-markdown" /></p>
<p dir="auto">但是我必须说一下，这个前面30轮是千问3.8 27B。我当时截了图的，也给大家正好对比一下这两个模型到底体验差距有多大。我们看一下，如果说你是用 SGLang 部署的话，SGLang 原生是有视觉模块的，这个不需要你去额外部署，那么它就可以识别，而且它识别的速度还挺快的，并不耽误你理解，并不耽误你去执行其他的任务，就是它对系统资源的占用是可以接受的。</p>
<p dir="auto">然后我使用千问3.8 27B，就是昨天的视频，大家可以去看一下。我在里面放了论坛帖子的链接，大家点击进去可以找到我的部署方案，也可以找到原帖的部署方案。你们去参考这个论坛大神的原帖，就直接复制给你的 Agent 就可以部署。选用的是千问3.8 27B 这个 W4A16 AWQ 加上 DFlash2 来部署。</p>
<p dir="auto">这个体验比前几天我视频中讲的使用千问3.8 27B FP8 模型加上 HiCache 技术体验要更好一点，因为它不用占用大量的系统内存，不用占用你的硬盘空间。并且它运行的时候，我这个4090D 48G魔改卡的风扇噪音其实并不大，并不会呜呜地作响。如果说做单一的长链开发任务，它基本上风扇是不怎么启动的，是比较安静的。当然偶尔会启动一下，就那一点点时间噪音比较大。然后这个方案也是可以支持两个长会话、两个中等长度的会话，它负载4个会话是没什么问题的。</p>
<p dir="auto">我在同一个开发任务中、同一个会话中是进行热切换，让千问3.8先来。千问3.8 27B 的体验是要略差于 DeepSeek V4 Flash，最主要的是什么呢？它如果是执行单一的 Bug 修改，是没有什么问题的，而且它的审美也是怎么讲呢，不比 V4 Flash 差的，虽然跟小米比起来都是垃圾了，但是它开发的 UI 界面还是比较漂亮的。</p>
<p dir="auto">它比较大的缺点就是什么？就是它的上下文不行。实际上 Qwen 3.8 27B 的上下文如果超过150K，因为我是给它配的是160K，最主要的是我感觉超过160K之后它的召回准确率就不行了。实际上即便是在128K到160K之间，我感觉它还是会顾此失彼。经常你让它去开发一个页面，比如说你让它开发某个功能，我这里点一个链接进来，它这两个地方的显示就不统一，没有复用这个显示框架，就自己重新开发一个。</p>
<p dir="auto">或者说，你看我们这里不是有这个帖子展示吗？我们在进入这个论坛板块的时候，这里也是有帖子展示，按理说是应该复用的，但是它并没有复用。用 DeepSeek V4 Flash 就能把它拉回来，除了说你这里加一个小背景之外，其他的是完全复用的，这个显示模块是复用的。也就是说，它的上下文长度实际上对这个模型进行长链开发是有限制的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/e2dc5dc4-bd05-48e4-9d8a-c2660c7456e9.png" alt="SGLang AWQ 15分钟长任务 .png" class=" img-fluid img-markdown" /></p>
<p dir="auto">我为什么给它迭代到大概30轮左右？我看看我那个截图，我这个截图上是给它迭代了19轮321步，实际上我最终是给它迭代到30轮，它后面还进行了开发。这一次长链任务进行了20分钟左右的开发，然后我给它同时设置了6个目标，它还开了后台任务。就是它的体验极限可能就到这里了，大概30轮，大概四五百步。再多的话，由于上下文长度的限制，召回准确率不高，它就会顾此失彼，改了这个 Bug 可能会引起另外一个新的 Bug。</p>
<p dir="auto">所以说，最好我们改这种论坛 APP 这样级别的程序，讲实话也不难，都不难。这个东西你还是让它一个功能一个功能地实现，比如说你用 V4 Pro 或者用 V4 Flash 把这个框架给它设计好，然后你让它实现某一个单一模块，实现完了之后就立刻让它提交，提交上去，提交到 Git 上，然后再执行下一个任务。</p>
<p dir="auto">如果说它的上下文长度太长的话，Codex 是不行的。Codex 好像是暴力截断，有压缩，但是压缩后丢失信息明显，它这块处理得不好，体验不太好。但是如果说是 DeepSeek Harness，它是可以进行比较智能的截断，但是还是不如你自己把它完全关掉，重新开一个要好一点。</p>
<p dir="auto">如果说你想用这个本地部署的 Qwen 27B 来替代 V4 Flash，我认为可能你的体验要打一点折扣，最主要的是多轮迭代之后。如果你能接受的话，那么每个月你是重度开发，你省个1000块钱，我觉得都是比较轻松的。因为我大部分时候并没有在开发程序，我都是在搞些小的脚本。偶尔我有空闲时间了，我就把这个东西给完善一下，可能准备到国庆节之后、过年之前给大家上线，给大家用。</p>
<p dir="auto">当然了，我最后也提一下，最近一些国产模型，像什么 GLM-5.3-Flash，像什么千问3.8 Flash，像什么腾讯的 HY4 Preview，这些模型其实我都测了。就是我讲实话，每个模型有每个模型的特征，有每个模型的特长，但是也有它的弱点。如果说你真的是想省心，就没有必要这个也碰那个也碰，你就直接上来，除非你买到了什么 GLM，或者说 Kimi、MiniMax 这些 Coding Plan，你觉得非常划算，否则我建议大部分新手就不要东一榔头西一棒。</p>
<p dir="auto">你们就按照论坛大多数人的经验，直接接入 DeepSeek V4 Flash 这个在线模型就行了，让它帮你总管一切。如果说你有比较好的显卡，比如说7900 XTX、R9700，就是 AMD 的 AI Pro R9700，或者说有4080S 32G魔改卡，有3090，有4090 48G、5090、RTX Pro 5000、4500、6000都可以，那你就让 DeepSeek V4 Flash 来帮你配置本地的 AI，你可以借助它来省钱。真的就不要再这个模型也试一下，那个模型也试一下。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/5c936895-57fb-41ca-8f07-aded09a1626d.jpg" alt="中美AI战争.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto">当然了，如果说你不差钱，你去用一下什么国外的 GPT、Claude 都可以。对了，还有就是我在视频中多次强调的，OpenAI 的20美金 Plus 会员是非常非常值得的。虽然我不太喜欢 GPT-5.6 Luna 这个模型，我认为它怎么说呢，有点浪费时间，但是有很多人反映它的使用体验还不错。我这人主观意见，我是不建议大家去用它来做 Agent 任务，但是用它来聊天，用它来处理文档，干一些脏活，它是非常胜任的。而且这个订阅计划中还带大量的图片生成额度，如果说你有几个油管频道，你的网站需要配图，用它就足够了。</p>
<p dir="auto">当然了，如果说你就是要用 GPT-5.6 Luna 来折腾一些本地的 AI 部署，或者说开发工作，那么也可以，因为这玩意说实话，千金难买我愿意。你就愿意这样搞，那也挺好的。大家在使用 AI 大模型的过程中有什么经验、心得、教训，都欢迎到这个论坛来发帖交流讨论。并不是说我说什么都是对的，就像有些傻叉在我的评论区留言说，主播的意见只代表他一家之言。是的，我的所有评论都是基于我个人的经验，只能代表我一家之言。我并不会像这些留言的这些大神一样，他们可能能够代表马云，能够代表马化腾，能够代表马斯克，我只能代表我自己。这个都是经验分享嘛，说白了都是非常主观的事情。</p>
]]></description><link>https://lcz.me/topic/1463</link><generator>RSS for Node</generator><lastBuildDate>Wed, 09 Sep 2026 22:53:31 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1463.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 02 Sep 2026 08:00:00 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to DeepSeek V4 Flash + DSHarness 是目前最省心的AI Agent组合，长上下文，搞缓存命中，多模态。系统配置/网站管理/APP开发能力和体验拉满！ on Wed, 02 Sep 2026 08:00:00 GMT]]></title><description><![CDATA[<p dir="auto"><a href="https://youtu.be/IJw8IGV9ozU" rel="nofollow ugc"><i class="fa fa-youtube" aria-hidden="true"></i> Youtube Video</a></p><div class="js-lazyYT lazyYT-container" data-youtube-id="IJw8IGV9ozU" data-width="640" data-height="360" data-parameters style="width:640px;padding-bottom:360px">
 <div class="ytp-thumbnail lazyYT-image-loaded" style="background-image:url(&quot;https://i.ytimg.com/vi/IJw8IGV9ozU/hqdefault.jpg&quot;)">
  <button class="ytp-large-play-button ytp-button" tabindex="23" aria-live="assertive" style="transform:scale(0.85)" onclick="$(this).lazyYT(this);return false;">
   <svg height="100%" version="1.1" viewbox="0 0 68 48" width="100%">
    <path class="ytp-large-play-button-bg" d="m .66,37.62 c 0,0 .66,4.70 2.70,6.77 2.58,2.71 5.98,2.63 7.49,2.91 5.43,.52 23.10,.68 23.12,.68 .00,-1.3e-5 14.29,-0.02 23.81,-0.71 1.32,-0.15 4.22,-0.17 6.81,-2.89 2.03,-2.07 2.70,-6.77 2.70,-6.77 0,0 .67,-5.52 .67,-11.04 l 0,-5.17 c 0,-5.52 -0.67,-11.04 -0.67,-11.04 0,0 -0.66,-4.70 -2.70,-6.77 C 62.03,.86 59.13,.84 57.80,.69 48.28,0 34.00,0 34.00,0 33.97,0 19.69,0 10.18,.69 8.85,.84 5.95,.86 3.36,3.58 1.32,5.65 .66,10.35 .66,10.35 c 0,0 -0.55,4.50 -0.66,9.45 l 0,8.36 c .10,4.94 .66,9.45 .66,9.45 z" fill="#1f1f1e" fill-opacity="0.9">
    </path>
    <path d="m 26.96,13.67 18.37,9.62 -18.37,9.55 -0.00,-19.17 z" fill="#fff">
    </path>
    <path d="M 45.02,23.46 45.32,23.28 26.96,13.67 43.32,24.34 45.02,23.46 z" fill="#ccc">
    </path>
   </svg>
  </button>
 </div>
</div><p></p>
]]></description><link>https://lcz.me/post/15406</link><guid isPermaLink="true">https://lcz.me/post/15406</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Wed, 02 Sep 2026 08:00:00 GMT</pubDate></item></channel></rss>