DeepSeek V4 Pro 0813实测:简单任务没优势,长线编程/重度任务吊打V4 Flash!Codex、Hermes接入效果全面对比!
-
讲实话,这几天我根本忙不过来,各种大模型相机发布,Agent也频繁更新迭代,前几天我刚发现用Codex+DeepSeek V4 Flash编程听不错的,执行长线任务Tokens消耗很低。而且Codex在Windows上安装很方便,适合小白用户入门。做完视频我挺有成就感,可是很快DeepSeek宣布要涨价,然后就是发布V4 Pro的0813版本,我还没有反应过来DeepSeek Harness这个重磅软件就发布了。加上我要测试Qwen3.8 27b这个重磅模型,我又把AMD,英伟达的各种大模型推理环境,配套的框架给测试了下。完全忙不过来,我同同时开着七八个终端,运行着不通的Agent,让它们行我干活,这还算不算电报上挂着的3个运维Agent。可以说,如果没有AI,我现在的工作已经处于瘫痪状态了。

说实话,基础能力测试是非常无聊的,但是你必须走。打字写文稿的时候,我的Macmini上的Codex正在接入DeepSeek V4 Pro,推进之前一个视频自动剪辑项目的重构工作。当时我开发的时候用的是DeepSeek V3.2和Google Gemini 2.5聊天,我复制下来修改的方式写的,总有一些怪怪的感觉。就是说效果不好,我就没用了。今天接入DeepSeek V4 Pro正式版之后,我必须说,它展现出了非常牛逼的编程能力,项目推进非常顺利。这里面当然也有Codex这个Agent做的比较好的原因。
因为我之前测试V4 Flash的时候,包括昨天测试Meta Glimmer 这个逗比模型的时候,Codex的编码能力就表现的比Hermes更好。hermes则是展现出了作为全能Agent的统治能力。说实话,此刻我已经测试过了DeepSeek harness,它是非常好用的尖刀利器,不过还不成熟,需要时间打磨,目前最好用的还是Hermes。那么本期视频就不过展开,我们从最简单的测试案例,经典老三样测试开始,看下DeepSeek V4 Pro 0813的实力。轻不要反复问为什么用简单例子测试,也不要问为什么测试偏僻项目,就是实际开发中我已经有了明确的结论,这是个非常强大的模型,顶级能打,而且很便宜,但是再好的车,测试下基础驾驶,刹车等功能也是必须的。

第一个是生成网页表达中国的传统八卦,我们看下hermes的生成效果,应该说这个网页还是非常全面反映了八卦的各方面信息,该有的都有了。太极图画对了,还做了个简单的动画,鱼眼也画对了。总体上审美不保守,就是Pro版本能够理解传统文化的字样了,用了屎黄色作为配色,中规中矩。它在过往的测试中,审美是不是V4 Flash的,改版后依然如此,主打实用。它对每一个卦象做了超链接,点击会刷新相关信息,还是比较准确的,卦象的位置也是对的。
接下来看Codex的生成案例,布局,文档的全面性比hermes的更好,太极图也画对了,但是没有画鱼眼,加分项是它的背景加了光晕。其实在它思考的时候我看到它特地要把六十个复卦全部显示完整,这个思考过程是单独的步骤,可能是Codex的Harness工程主动控制的,在这点上它比Hermess做的更好。这句Codex微微胜出。
Hermes_deepSeek V4 Pro八卦.html
Codex_deepseek_vrpro_bagua.html第二个是生成SVG表达钍基熔盐堆工作原理,Hermes终于放弃了屎黄色配色的执着,用了科技配色,而且审美是真的做的不错,原理画的非常详细。无论是知识点理解,还是代码能力都是顶尖的。对了说下,无论是hermes还是Codex,虽然DeepSeek原生不支持图片输入,但是这两个框架都有工具,帮助模型看懂UI,哪个地方画错了,包括网页哪里有问题,它们是看得到的。因此不要反复问多模态是否重要,比起模型性价比,一点也不重要。
接下来看下Codex的表现,它和屎黄色配色杠上了,审美被hermes吊打,其他的也没什么错误,总之就是过关了。这一局Hermes胜出。
第三个任务,生成SVG表达薛定谔的猫思想实验,这一轮很奇怪,又是Hermes胜出,它的配色更好。
Codex可能有思维惯性,全部沿用屎黄色配色,导致偶部分字体显示不清楚。但是对于实验原理和要点,二者都准确把控了。
这些任务太简单,对于Qwen 27B来说都不在话下,只是Qwen的小模型会把卦象的位置画错,其他的差距不大。这些应该是模型知识库尺寸导致的,而不是模型推理能力导致的。需要说明的是,在这样级别的人物中,V4 Pro对V4 Flash毫无优势,甚至经常不如V4 FLash。而且DeepSeek做的效果也不如小米和HY3,略输一点点,模型审美逼格不高,比较土,这是家族硬伤。但是执行复杂任务,长期使用,DeepSeek家族综合实力属于吊打HY3,小米MIMO V2.5,性价比也更高。HY3的性价比高于小米。其他的国产AI就稍微差点意思。
在改论坛代码这种中等难度级别中,DeepSeek V4 Flash和V4 Pro的差距也不大,但是在今天执行的自动剪辑长线任务中,V4 Pro展现出了统治力,彻底甩开V4 FLash,这就是行和不行的问题。虽然编辑器我还没写完,但是V4 FLash推不动,它推得动,这个主管感觉是十分明显的。
两个模型的上下文极限我也摸到了,500k没问题,700k之后会有问题,所以让Hermes的做法比较讨巧,到了500k就强行压缩截断,所以它在长线复杂编码中,干不过Codex。对了,今天的Pro在Codex和Hermes下做了这6个demo,一共花了1.5元,这还是有点多的。比起大项目长线任务,它性价比不高。这可能是codex的特点。

我本来还想测试下它在DeepSeek Harness上的表现,但是这个Agent有很多BUG,它的特性我才摸熟练,比如思考一定要调低甚至关掉,不然它会卡工具调用。但是我修改设置之后,它的能力也挺我震惊的,就是我用V4 Flash让它在服务器上复制配置,也安装一个DeepSeek Harness,说实话,它比hermes快多了。我想这个工具单独坐一期,也可以等它成熟了再说。总之这玩意入门门槛很低,你让Hermes去安装它就好了,未来它绝对是个大杀器。这是我到目前为止见过读最优雅,底盘最好的Agent,简直像个艺术品。
本期视频生成的网页和图像,视频的文字稿我放在论坛帖子里,大家点击视频说明栏的链接可以直接访问,有什么问题可以到论坛发帖提问,论坛大神很多,各种装备也多,信息更全。想要交流讨论的,会吹牛逼的,可以关注老特说哪个频道,我会在近期开直播和大家通论科技话题。好的本期视频就到这里,我们下期再见!
-
flash目前来看是真的爽 我有个微调的任务 挂了一天才3块钱 而且完成的比我自己搞好不少