DeepSeek Harness初步测试:工具属性优秀,反应极快,编程能力强,但是小BUG不少。总体上是非常优秀的产品,值得尝试!
-
测完DeepSeek V4 Pro我有点累了,不想做Harness的测试视频,因为我同时还在快速推进播放器的开发,晚上做事之前我还做了个十几分钟的英语视频,可是累成狗了。但是这个重磅产品晚点做,晚点发,确实就错过流量了。为了赚点生活费,我想还是拼一把吧,做完这个视频可以休息一天。
首先说下,DeepSeek harness这个名字真的很土,但表达了DeepSeek的重视程度。我在之前的视频里提到过和多次,OpenAI,Cluade长期把harness工程放入模型API内部,尤其是Anthrpopic,它的模型并不比其他AI强太多,但是通过提示词美化,过渡推理,消耗了巨量的上下文,得到了一个几个不错的结果,再用算法挑选最好的答案。这样做的好处就是模型看起来变聪明了,也很容易针对跑分进行针对性优化。

但是这样做的代价也很大,那就是模型响应速度很慢,而且推理成本很高。Fable5比DeepSeek V4 Flash贵100多倍,不过它在大部分任务中比V4 Flash慢很多,而V4 Flash可以完成90%以上的工作,只有到了少数高端任务中,AO两家的高端模型才会显示出优势。不过V4 Pro正式版,也就是0813版本发布之后,它的多项跑分也接近了Fable5这样的期间模型,更重要的是,它的响应速度并没有变慢,而且上一个视频里我说了,它执行复杂任务的成功率大大提升。Anthropioc和OpenAI的优势场景可能会从10% 压缩到5%甚至更少,这对两家企业扩大业务和营收而言,确实是个坏消息。
我不止一次说过,DeepSeek是个非常牛逼的公司,它的工作重点长期在框架改革,底层算子优化上,这是为了提升效率,降低成本,它的模型跑分不高,不带表生产力不强。优化效率,降低成本,提升模型性价比的难度,要远远高于harness工程,如果DeepSeek哪一天搞定了底层,发力Harness,那会再次震撼世界。但是我的观点很显然遭到了很多所谓高手的嘲讽,他们不断在我的评论区表达对国产模型的鄙夷,然而不到半年的时间,DeepSeek就用接二连三的好产品,打脸了这些人。

我使用Codex+DeepSeek V4 Flash/ Pro两个版本的编程体验都很好,但是问题就是,太慢了,比使用Hermes还慢,虽然挺省Tokens的,但真的挺耽误事的,你挂着让它跑,它做完了,在空等,你看着它跑,它又慢,迟迟看不到结果。对于不着急的项目来说,这样挺好的,对于着急看到效果的项目,这就是煎熬了。所以DeepSeek发布自家的Harness产品,那必须支持,
安装方法很简单,让Hermes或者Codex去安装就行了,我是Hermes+DeepSeek V4 Flash自己安装的,宿主机是Macbook,这个Agent代码质量极高,所以它的安装也简单,很快就搞定了。它是网页交互,说真的舒服多了,我厌倦了电报,也厌倦了Hermes那个屎黄色的CLI。Codex的界面也是简陋的一逼。有这个WEBUI,我甚至可以自己定制一个主题,看起来会舒服很多。

后来我又测试,给DeepSeek Harness接入V4 Flash API,让它在Ubuntu服务器上安装另一个实例,它也非常快就搞定了。就是这个Agent完成度很高,不是一个玩具,装上后立刻就能干活。对比下它和hermes,它响应极快,任务完成能力也很强,不会像Codex,执行配置任务时想半天。总体速度是DeepSeek Harness 快于Hermes快于Codex。
DeepSeek Harness有个问题,就是不能把思考模式调高,否则它会很容卡死,尤其是在接入DeepSeek V4 Pro的情况下。我都是把思考直接关掉的。另外就是V4 Pro的缓存效率比V4 Flash更好复杂任务时Flash并不省很多钱,没有价差那么夸张。需要注意的是,它也可以接入本地的Qwen或者其他OpenAI兼容格式API,但是它的大部分优化,比如Engram缓存体系,是为DeepSeek量身定制的,早期我们最好还是接Deepseek API使用,其他的API就等开源社区大神们迭代之后再用,或许也会有更完善的分支版本。因为这它的完成度相比于PI等极客Agent好太多了,值得二次开发。

接下来用老三样测试下它的编程能力,第一个例子,让它生成一个网页表达中国的传统八卦。由于我给思考直接关闭了,所以相比于Codex和Hermes的作品,它显得更加简单,也继承了V4 Pro一贯的审美,屎黄色配色。它画对了太极,也没有漏掉鱼眼,动画也对,卦象位次分布都对,这就是高级模型和初级模型的鸿沟。其他工具和模型生成的效果,大家可以看我过往的视频,或者访问论坛,我在视频描述栏放了帖子链接,里面放了HMTL和SVG图像,可以直接点击观看。
第二个任务是生成SVG表达钍基熔盐堆运行原理,它的审美稍为有所提升,作品完成的也比较简单清爽。还是因为思考关闭的原因,它的图只画了要点,不过我更喜欢这样。
第三个任务是生成SGV表达薛定谔的猫思想实验,它也很快完成了。审美完全碾压了Codex,实验的要点也get到了。代码的生成速度,这玩意基本和裸模型一样,速度极快。
可能需要负载长链任务才能测出这个Harness产品的极限。但是我的复杂任务已经被Codex+DeepSeek V4 Pro搞定了,就在我打字写稿子的时候,它完成了播放器的技术难点的开发,后面就是收尾工作了。有了这个玩意,我以后的英语视频剪辑效率会大大提升,我只需要专注于构思和写稿就好了。
总结下,DeepSeek涨价幅度不小,我再一次预测准确,评论区很多说涨价50%,我估计算在100%起步,很有可能会到以前的2.5甚至3倍。这才几天又验证了我的看法,我不是想装逼,我是想说,我很懂人性。地球上有小便宜占,但是没有天上掉馅饼的好事。这么好用的模型,一直白菜价,给你当老板,你愿意吗?我还是会用,但是会分流一些给HY3测试下。