DeepSeek V4 Flash正式版+Hermes编程实测:进步巨大,成本降低,自动化编程很快会成为普通人用得起的工具!
-
今天周末,本来想休息下的,Deepseek V4 Flash正式版在昨天发布,英语频道又有重大事件发生,不得不评论,搞完英语视频都中午了,累的很。但是作为DeepSeek V4 Flash的忠实粉丝、深度用户,不第一时间测试说不过去。首先看跑分,毋庸置疑,已经很接近Claude Opus4.8,这可都是高富帅们用的模型,价差差几十倍。实际体验也先给结论,方便迫切想要知道结果,然后划走刷美女视频的人知道。就是它进步很大,我30号还在深度编程,中间31号在忙其他的事,1号正好使用正式版,体验好多了。它聪明了,具体来说就是代码理解能力爆棚,Harness工程优化明显,不再是简单的指令遵循机器,也有一点高级助手的味道了。500k上下文它一样不掉智力,速度也没掉,就问你强不强。

简单说下两次执行的任务,就是我的NodeBB论坛需要定制聚合页面,复用NodeBB的各种基础导航功能、登录信息,但是主显示区域内容要完全自定义。之前让DeepSeek V4 Flash的预览版来做,它一共花了10块钱。它开发了一个页面定制插件,可以很好地利用NodeBB的开源框架,实现我想要的功能。
可是后来我发现,有些页面主题的布局不错,但是在手机上显示很不舒服。比如我喜欢的Brite主题,它在手机浏览器上会一直显示粗粗的按钮边框效果,如果回复的文字很少,就显得很笨重。我想做一个按钮,点击之后才显示这么多功能按键,这样会清爽很多。

可是如果直接修改NodeBB的主题和皮肤,一旦系统版本升级,会被Git覆盖掉。最好的解决方案就是自定义主题和皮肤,继承官方原版的基础功能和配色,然后在外部目录中增加自定义部分,通过软链接的方式和公共源码协同工作。
这个任务比较复杂,涉及到很多代码理解,就是光看API肯定是不行的,实际操作中修改个小东西很容易搞乱整体功能。之前的DeepSeek V4 Flash预览版搞了整整一天,花了20块钱,还是有BUG。今天API升级之后,我直接让它去理解项目源码,完成我想要的定制功能。我也彻底甩手,只关注结果。
它选择了理解项目代码,彻底重构,直接把前天积累的所有BUG给清理完毕,然后用最少的代码量完成了新的架构。目前为止新架构已经可以完美工作,正在调一些细微的小BUG,但是以后我如果想要修改现有主题,就方便多了,可以爱怎么改怎么改,同时还不影响Git更新,可以完美同步新版本的所有功能。
我看了下tokens消耗量,其实两天差不多,但是为什么今天的价格只有前天的1/2呢?原因也很简单,前天它的缓存命中率是95.46%,今天是99.11%。


也就是说,在今天阅读代码量更大的情况下,它实现了更高的缓存命中率,这对编程、Agent以及大型稳定处理绝对是个重大利好。就是DeepSeek V4 Flash在提升Harness的时候,也没有忘记降本增效。由于实现这些任务的同时,我在做其他事,并不是一直跟着的,所以这样的结果我非常满意。
我在后期可以考虑通过定时任务检查的方式让它独立工作。今天我工作的时候,大部分在高峰期,也就是说,和前天一样,是要贵50%的。如果在夜间工作,那会更便宜,6块钱搞定。这个价格给程序员买一杯奶茶的钱都不够,但是它确实比中等程序员厉害多了。即便是编程高手,要折腾这玩意,也要花点时间。就说难度不会有多大,但工作量还真不小。
对了,需要特别强调,它今天大多数时候都工作在300K上下文以上,所以最近表现很好的HY3,我是认为不如DeepSeek V4 Flash的。

小米的Mimo我一直比较推崇,多模态很好用,但我这方面需求不大,它在编程和做复杂Agent任务时还是不如DeepSeek。总体上,正式版V4 Flash的跑分达到了GLM5.2、Claude Opus 4.8的层级,它对于新手而言也已经相当友善了,非常值得折腾。
我从DeepSeek V3时期用到现在,一直当作主力模型。我不仅自己用,也给客户接入,它到目前为止的表现是越来越好。中间有一段时间它确实被GPT和Claude在使用体验下拉开了差距,但是性价比依然是最好的。现在它在跑分和实际体验上再度发力,我感觉诚意十足。
我对V4 Pro的期待不大,因为我的绝大部分工作,都可以用V4 Flash完成,再好的模型对于我而言没啥意义。毕竟咱干着开滴滴的体力活,总想着换一辆法拉利不现实。即便是换一辆小米SU7,那也是浪费,开最便宜的比亚迪秦就好。
我会稍带着更新论坛的UI,为大家提供更好的访问体验,尤其是加强手机端的开发工作,有空的时候我会写个APP,因为现在小特已经完全吃透了NodeBB的代码,做个客户端不难。只不过我暂时没多少时间测试,让它自己测试估计多半会跑歪掉,这样的工作或许在DeepSeek推出原生多模态之后,就可以独立完成了。现在Claude应该可以做到基本半独立完成,kimi也差不多,但都太贵了。小米Mimo的编码能力还是弱了一点。

当下AI技术发展这么快,很多知识拖着拖着就不用学了,这不是开玩笑。当年OpenClaw推出的时候,大家拼命研究各种skills,人人都想成为大师。可我当时在视频里明确说了,这种Agent不能独立总结,自我成长的东西最终都会是玩具,市场很快就会出现能够自动化完成这一切的Agent。果然很快Hermes横空出世,热度超越OpenClaw。对于模型也是如此,再有智力上的明显进步很难了,但是在工程方面,也就是做事的能力方面,还是有很大进步空间的。
最近几天密集发布了各种国产模型,比如Minimax的H3,字节跳动的Seedance2.5,可以说目不暇接,国产AI好起来了,朋友们。我目前最大的期待就是阿里能够早点回到开源的路线上来,发布Qwen3.6 27b的后续模型,发布更新的Wan,让我们玩起来。
写完稿子做视频,3个小时就没了,大家看的过瘾的话点个赞,想要吹牛逼的到论坛发帖。
