<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[DeepSeek V4.1 Flash 内测，DSH 14亿Tokens长链任务顺利完成，有小缺点但瑕不掩瑜，平替V4 Pro，降价后会很香！]]></title><description><![CDATA[<p dir="auto">论坛的超级版主王池川发帖说，DeepSeek V4.1 Flash 0910 开始内测了，实际上就给了两天时间。他说首 Token 1.1 秒，生成速度最高 329 tokens/s。经过我的长期实测，就是长时间工作的实测，这个数字是差不多的，是能够达到的。他就说这个模型非常好用，超级屌，问我要不要发一个测试视频。其实他当时发这个帖子的时候，我已经在干活了，而且给它规划了一个大任务。</p>
<p dir="auto">Skynight 说，好消息就是 Flash 明天中午降价，也就是今天中午降价了。但是当时我是想早一点把这个任务跑完，早一点测试，我也不想省那一点钱。我当时估计这个任务可能花个 50 块钱左右就差不多了。你说我省那个，就算降价一半，我省个 25 块钱，有什么意义呢？但是最终还是有点超出我的预料。这个任务一共花了我 83.4 块钱，比我想象的要贵不少。它消耗的 Tokens 一共是 13.6 亿，输出是 980K，基本上就相当于是 14 亿总 Token 的消耗。我相信在这样的价格下，尤其是在降价之前，它能有这样的表现，我觉得已经非常便宜了。因为降价之后，可能最高能降 60%。我们按照降一半来算的话，做这个庞大的任务也达到了我的预期。我的心理承受价格是 50 块钱，它如果 40 块钱能完成的话，那我觉得就非常划算了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/4deba2bd-3990-4a34-90de-ee2051999053.jpeg" alt="DeepSeek V4.1 Flash内测.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">这个任务是什么呢？我的论坛不是有硬件页面吗？我就想，老是把用户的帖子直接这样展现给大家，也有点太粗糙了。那么我要给英伟达、AMD、英特尔、苹果不同的小主机、不同的芯片、不同的显卡，它们的 AI 算力怎么样，给大家做一个推荐和归纳总结。像这些内容，要跟我论坛实测的数据、实测的帖子互动，进行初步的总结。总结完了之后，还要把比较相关的一些帖子列出来，然后有更多相关的信息，再把链接放到下面。像这些 Tag 什么的，就直接链到论坛的帖子上来，这样的效果就会好很多。当然了，我现在在本地，由于 Firefox 我限制了它不能翻墙，所以显示有的时候可能会有一些问题，在正常的论坛中是没有问题的。</p>
<p dir="auto">做这个工作实际上工作量是非常大的。首先，它要从我的云端把数据库同步到本地，在本地完全复现，然后它要理解每一个帖子。因为做这个工作之前，我要它重新把所有的 Tag 打一遍，把漏掉的补上。像苹果的 M4、M5 都没有，那都要加上。之前很多标签，像 B70 这些标签都没有，都要补上，5080 这些也一样。现在都给它补上了，包括 7800、7900。把这些标签重新打一遍，并且要它接手 Hermes 以后的工作，因为以后我可能要全面转换到 DeepSeek Harness 上来，要提前做准备。所以整个论坛的所有帖子让它通读，规则让它通读，Hermes 是怎么管理这个论坛的，也要让它准备接手。</p>
<p dir="auto">总体上这个工作量还是比较大的，毕竟消耗了那么多 Tokens。但是它执行任务的时候，我感觉它的优点就非常明显。你说能不能平替 DeepSeek V4 Pro？我觉得可能要稍微差一点意思，但是基本上能够替代。它的长任务规划能力是非常强的，一共生成了 65 个页面，这里面还包含了大量的在线校验。我要求它每一条数据一定要与官方数据、与维基百科的数据进行校验之后才能采用，这本身就涉及很多网络查询的工作，还有一些图片识别。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/d2359c50-b0d8-463a-b35d-d709ab04c778.jpeg" alt="lcz论坛nvidia硬件信息" class=" img-fluid img-markdown" /></p>
<p dir="auto">当然了，它这个图片识别我必须要说，比起 GPT-5 或者 GPT-6 自带的图片识别，我觉得要差远了。因为它本身不能生图，有的时候它找到的图片不好的话，实际上自己是看不太出来的。像有些图片，说实话其实是非常垃圾的。但是如果用 GPT 来搞的话，它可能自己就直接画一个图，也是比较准的。但是我们也要说，毕竟我消耗了 14 亿 Tokens，如果是用 GPT-6 的价格，我现在已经破产了。哪怕用 GPT-5.6 Sol，我也扛不住。可能用 Terra 能把我的信用卡刷爆，但我不至于破产。</p>
<p dir="auto">另外一个优点我们必须说，它搭配自家的 Harness 干活是相当爽的。首 Token 平均是 1.7 秒，平均生成速度是 385 tokens/s，一共迭代了 183 轮、2832 步，缓存命中率 99.8%，输入 13.6 亿 Token，输出 980K Token。我说实话，这个数据是相当漂亮的。第一是缓存命中率达到了 99.8%，绝大部分 Tokens 都是用白菜价来计算的。你换其他任何的 AI，这个价格都扛不住。然后 183 轮、2800 多步的迭代，我相信这个任务还是相当强大的，这是一个比较复杂的任务，它最终还是准确地交货了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/3c669ee3-9709-47a7-9205-d3a52b3e5f4f.jpeg" alt="lcz dsh 多轮对话" class=" img-fluid img-markdown" /></p>
<p dir="auto">虽然过程中有些图片找得不太好，讲实话我不太满意，然后我又自己找了一些图片来替代它，就因为这个被我骂得像狗一样。但是凭良心讲，它总体上任务完成得还是相当漂亮的。当然了，具体怎么样，还要把它再放到网上面，让大家参考的时候自己去核对，因为我自己没有时间去核对这么多数据。</p>
<p dir="auto">它本次任务中还有一个比较重大的缺陷，刚才我忘记说了。任务开始的时候，我明确跟它讲了，你还是要自己当监工，把主要干脏活的事情交给 Sub-agent。这个 Sub-agent 用什么来驱动呢？用 Qwen3.8 27B AWQ + DFlash 2，就是我本地 SGLang 驱动的模型。而且我这个模型给它放三四个会话、四五个会话，是完全没有问题的。我有信心是因为 DeepSeek Harness 已经跟进到了 1.2 正式版，好像是这样，它已经不是什么 Alpha 或者 Beta 版本了。早期我用 R1 版本的时候，它工作都是正常的。那么现在我想，它这个 Sub-agent 的能力应该得到了比较大幅的提升，结果证明它的 Sub-agent 还是一坨狗屎，就跟以前 R1 版本的时候没有任何区别。</p>
<p dir="auto">当然了，我也不得不说，像 Hermes 也好，Codex 也好，它们的 Sub-agent 都是狗屎，做得都不好。可能只有 Claude Code 的 Sub-agent 做得比较好。那你说在这种情况下应该怎么搞呢？根据我之前用 DeepSeek 的经验，就是你要把任务分拆为不同的阶段，每个阶段让不同的 Agent 通过同一个目录来沟通，给这些目录上锁、上队列，让它们排队，相互校验、相互协作，那么这个效率是比较高的。这样就可以把大部分的 Tokens 给省下来。</p>
<p dir="auto">但是我想，最多降价之后也就能省个 40 块钱，总体效率还会降低很多。是否有必要，要看大家自己的感受。毕竟这种大活不是每天都有的，就算每天都有，一个月也就 1000 多块钱。这个钱要不要省，就见仁见智。因为 Qwen3.8 27B 做这种任务的能力，包括它修复字幕，我说实话，它的能力是非常非常强大的。虽然它的知识库很小，但是它积极地上网去搜索，完成任务的质量非常高，完全不输给 DeepSeek V4.1。</p>
<p dir="auto">之前我长期用 V4 Flash 来修字幕的时候，我感觉它并不比 Qwen3.8 27B 强什么。编码也是编程，它修复论坛的插件，包括修复 App 的一些小 Bug，都不差。它唯一差的地方就是长上下文不行，它干不了长任务。你如果要它执行一个复杂的任务，必须要给它拆解到位，然后监控的话，就用 V4.1，或者用 V4.1 Flash 来监控。</p>
<p dir="auto">这个模型是个多模态模型。昨天你看我发这些东西给它，它都看得懂，图片它还是看得懂的，它是个多模态模型。这个价格，包括它的响应速度，还有它的长任务规划，我觉得是比 V4 Flash 要更好的。这个模型如果测试通过上线的话，我觉得 DeepSeek 短期内没有必要再折腾 V4 Pro 了，可以把 V4 Pro 给下架了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/75628f7a-fec8-46d7-9c17-021d9546a5df.jpeg" alt="DeepSeek API消耗" class=" img-fluid img-markdown" /></p>
<p dir="auto">V4 Pro，我感觉，就是我个人的体感，这个东西是比较玄乎的，它没有什么硬性的数据来证实。因为之前我用 V4 Pro 来开发自动剪辑器、视频自动生成器，它也是迭代了 200 多轮、3000 多步。我感觉它在长任务中的表现还是比 V4.1 Flash 要好一点点。这个感觉就非常主观了，但是最终都是完成了任务。那个任务的难度，我认为要稍高一点点。</p>
<p dir="auto">总之，DeepSeek V4 Flash 降价之后，尤其是后期如果很快能够推出 V4.1 Flash，我觉得大家真的就没有必要去折腾其他的一些 Coding Plan，或者去折腾其他的 AI 了。短时间之内，牢梁又变成了梁子，甚至马上又有可能变成梁圣，这个是有可能的。DeepSeek 现在用起来还是非常香。</p>
<p dir="auto">今天这个高峰期过去，等夜间我让 DeepSeek Harness 把我本地的这些 Tags、本地的这些页面都同步到云端，大家明天就可以在手机和电脑上看到这些东西了。自己去看一下，帮我检查一下，看看里面有没有什么重大的错漏。小毛病就自己在论坛中发帖来提就行了，千万不要给我发私信。</p>
<p dir="auto">最后跟大家交流一下，欢迎大家来论坛发帖交流讨论，但是要有点公德心，要遵守秩序。论坛因为有各位有价值的帖子，才会变得越来越好。像这种帖子，图文并茂，自己愿意去尝试新的东西，然后尝试完之后分享给大家，实际上他的帖子影响了好几个人。我们论坛的大神有好几个人都发了帖子、都测试了，非常好，非常感谢他。</p>
<p dir="auto">不要学那种毫无公德心的人，什么正面贡献都不做，就知道在那里酸。让我看到一次骂一次，该封号就封号。</p>
]]></description><link>https://lcz.me/topic/1580</link><generator>RSS for Node</generator><lastBuildDate>Wed, 09 Sep 2026 22:54:20 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1580.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 09 Sep 2026 08:30:00 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to DeepSeek V4.1 Flash 内测，DSH 14亿Tokens长链任务顺利完成，有小缺点但瑕不掩瑜，平替V4 Pro，降价后会很香！ on Wed, 09 Sep 2026 08:30:00 GMT]]></title><description><![CDATA[<p dir="auto"><a href="https://youtu.be/RY7WltkO90E" rel="nofollow ugc"><i class="fa fa-youtube" aria-hidden="true"></i> Youtube Video</a></p><div class="js-lazyYT lazyYT-container" data-youtube-id="RY7WltkO90E" data-width="640" data-height="360" data-parameters style="width:640px;padding-bottom:360px">
 <div class="ytp-thumbnail lazyYT-image-loaded" style="background-image:url(&quot;https://i.ytimg.com/vi/RY7WltkO90E/hqdefault.jpg&quot;)">
  <button class="ytp-large-play-button ytp-button" tabindex="23" aria-live="assertive" style="transform:scale(0.85)" onclick="$(this).lazyYT(this);return false;">
   <svg height="100%" version="1.1" viewbox="0 0 68 48" width="100%">
    <path class="ytp-large-play-button-bg" d="m .66,37.62 c 0,0 .66,4.70 2.70,6.77 2.58,2.71 5.98,2.63 7.49,2.91 5.43,.52 23.10,.68 23.12,.68 .00,-1.3e-5 14.29,-0.02 23.81,-0.71 1.32,-0.15 4.22,-0.17 6.81,-2.89 2.03,-2.07 2.70,-6.77 2.70,-6.77 0,0 .67,-5.52 .67,-11.04 l 0,-5.17 c 0,-5.52 -0.67,-11.04 -0.67,-11.04 0,0 -0.66,-4.70 -2.70,-6.77 C 62.03,.86 59.13,.84 57.80,.69 48.28,0 34.00,0 34.00,0 33.97,0 19.69,0 10.18,.69 8.85,.84 5.95,.86 3.36,3.58 1.32,5.65 .66,10.35 .66,10.35 c 0,0 -0.55,4.50 -0.66,9.45 l 0,8.36 c .10,4.94 .66,9.45 .66,9.45 z" fill="#1f1f1e" fill-opacity="0.9">
    </path>
    <path d="m 26.96,13.67 18.37,9.62 -18.37,9.55 -0.00,-19.17 z" fill="#fff">
    </path>
    <path d="M 45.02,23.46 45.32,23.28 26.96,13.67 43.32,24.34 45.02,23.46 z" fill="#ccc">
    </path>
   </svg>
  </button>
 </div>
</div><p></p>
]]></description><link>https://lcz.me/post/16856</link><guid isPermaLink="true">https://lcz.me/post/16856</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Wed, 09 Sep 2026 08:30:00 GMT</pubDate></item></channel></rss>