<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[DeepSeek V4 Pro 0813实测：简单任务没优势，长线编程/重度任务吊打V4 Flash！Codex、Hermes接入效果全面对比!]]></title><description><![CDATA[<p dir="auto">讲实话，这几天我根本忙不过来，各种大模型相机发布，Agent也频繁更新迭代，前几天我刚发现用Codex+DeepSeek V4 Flash编程听不错的，执行长线任务Tokens消耗很低。而且Codex在Windows上安装很方便，适合小白用户入门。做完视频我挺有成就感，可是很快DeepSeek宣布要涨价，然后就是发布V4 Pro的0813版本，我还没有反应过来DeepSeek Harness这个重磅软件就发布了。加上我要测试Qwen3.8 27b这个重磅模型，我又把AMD，英伟达的各种大模型推理环境，配套的框架给测试了下。完全忙不过来，我同同时开着七八个终端，运行着不通的Agent，让它们行我干活，这还算不算电报上挂着的3个运维Agent。可以说，如果没有AI，我现在的工作已经处于瘫痪状态了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/8050e644-3e38-44c8-bd22-cb68d56fcbc5.jpeg" alt="DeepSeek V4 Pro 0813实测.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">说实话，基础能力测试是非常无聊的，但是你必须走。打字写文稿的时候，我的Macmini上的Codex正在接入DeepSeek V4 Pro，推进之前一个视频自动剪辑项目的重构工作。当时我开发的时候用的是DeepSeek V3.2和Google Gemini 2.5聊天，我复制下来修改的方式写的，总有一些怪怪的感觉。就是说效果不好，我就没用了。今天接入DeepSeek V4 Pro正式版之后，我必须说，它展现出了非常牛逼的编程能力，项目推进非常顺利。这里面当然也有Codex这个Agent做的比较好的原因。</p>
<p dir="auto">因为我之前测试V4 Flash的时候，包括昨天测试Meta Glimmer 这个逗比模型的时候，Codex的编码能力就表现的比Hermes更好。hermes则是展现出了作为全能Agent的统治能力。说实话，此刻我已经测试过了DeepSeek harness，它是非常好用的尖刀利器，不过还不成熟，需要时间打磨，目前最好用的还是Hermes。那么本期视频就不过展开，我们从最简单的测试案例，经典老三样测试开始，看下DeepSeek V4 Pro 0813的实力。轻不要反复问为什么用简单例子测试，也不要问为什么测试偏僻项目，就是实际开发中我已经有了明确的结论，这是个非常强大的模型，顶级能打，而且很便宜，但是再好的车，测试下基础驾驶，刹车等功能也是必须的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/99ad2953-bbbb-4b63-bde1-b094048a221f.jpeg" alt="DeepSeek V4 Pro codex视频剪辑.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">第一个是生成网页表达中国的传统八卦，我们看下hermes的生成效果，应该说这个网页还是非常全面反映了八卦的各方面信息，该有的都有了。太极图画对了，还做了个简单的动画，鱼眼也画对了。总体上审美不保守，就是Pro版本能够理解传统文化的字样了，用了屎黄色作为配色，中规中矩。它在过往的测试中，审美是不是V4 Flash的，改版后依然如此，主打实用。它对每一个卦象做了超链接，点击会刷新相关信息，还是比较准确的，卦象的位置也是对的。</p>
<p dir="auto">接下来看Codex的生成案例，布局，文档的全面性比hermes的更好，太极图也画对了，但是没有画鱼眼，加分项是它的背景加了光晕。其实在它思考的时候我看到它特地要把六十个复卦全部显示完整，这个思考过程是单独的步骤，可能是Codex的Harness工程主动控制的，在这点上它比Hermess做的更好。这句Codex微微胜出。</p>
<p dir="auto"><a href="https://upload.lcz.me/uploads/ef7958a4-bf26-4056-8c13-9c2cbecb641e.html" rel="nofollow ugc">Hermes_deepSeek V4 Pro八卦.html</a><br />
<a href="https://upload.lcz.me/uploads/ff639b5d-89e6-41c9-8ab0-6326b2a4f4a2.html" rel="nofollow ugc">Codex_deepseek_vrpro_bagua.html</a></p>
<p dir="auto">第二个是生成SVG表达钍基熔盐堆工作原理，Hermes终于放弃了屎黄色配色的执着，用了科技配色，而且审美是真的做的不错，原理画的非常详细。无论是知识点理解，还是代码能力都是顶尖的。对了说下，无论是hermes还是Codex，虽然DeepSeek原生不支持图片输入，但是这两个框架都有工具，帮助模型看懂UI，哪个地方画错了，包括网页哪里有问题，它们是看得到的。因此不要反复问多模态是否重要，比起模型性价比，一点也不重要。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/e062116d-2118-4a7f-879e-cbc92f43477f.svg" alt="tmsr-principle.svg" class=" img-fluid img-markdown" /></p>
<p dir="auto">接下来看下Codex的表现，它和屎黄色配色杠上了，审美被hermes吊打，其他的也没什么错误，总之就是过关了。这一局Hermes胜出。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/17e81b26-6fdb-4a3f-9e6f-66660623f1b2.svg" alt="thorium-molten-salt-reactor.svg" class=" img-fluid img-markdown" /></p>
<p dir="auto">第三个任务，生成SVG表达薛定谔的猫思想实验，这一轮很奇怪，又是Hermes胜出，它的配色更好。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/23fecf31-4a63-46fc-a4a9-b620be8b56b2.svg" alt="schrodinger-cat.svg" class=" img-fluid img-markdown" /></p>
<p dir="auto">Codex可能有思维惯性，全部沿用屎黄色配色，导致偶部分字体显示不清楚。但是对于实验原理和要点，二者都准确把控了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/c2aeca78-6f10-46cd-8cf2-3da11f5d4632.svg" alt="schrodingers-cat.svg" class=" img-fluid img-markdown" /></p>
<p dir="auto">这些任务太简单，对于Qwen 27B来说都不在话下，只是Qwen的小模型会把卦象的位置画错，其他的差距不大。这些应该是模型知识库尺寸导致的，而不是模型推理能力导致的。需要说明的是，在这样级别的人物中，V4 Pro对V4 Flash毫无优势，甚至经常不如V4 FLash。而且DeepSeek做的效果也不如小米和HY3，略输一点点，模型审美逼格不高，比较土，这是家族硬伤。但是执行复杂任务，长期使用，DeepSeek家族综合实力属于吊打HY3，小米MIMO V2.5，性价比也更高。HY3的性价比高于小米。其他的国产AI就稍微差点意思。</p>
<p dir="auto">在改论坛代码这种中等难度级别中，DeepSeek V4 Flash和V4 Pro的差距也不大，但是在今天执行的自动剪辑长线任务中，V4 Pro展现出了统治力，彻底甩开V4 FLash，这就是行和不行的问题。虽然编辑器我还没写完，但是V4 FLash推不动，它推得动，这个主管感觉是十分明显的。</p>
<p dir="auto">两个模型的上下文极限我也摸到了，500k没问题，700k之后会有问题，所以让Hermes的做法比较讨巧，到了500k就强行压缩截断，所以它在长线复杂编码中，干不过Codex。对了，今天的Pro在Codex和Hermes下做了这6个demo，一共花了1.5元，这还是有点多的。比起大项目长线任务，它性价比不高。这可能是codex的特点。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/fca2faab-f49d-4bb5-8e44-0ef43644cfa5.png" alt="DeepSeek 500k上下文警告.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">我本来还想测试下它在DeepSeek Harness上的表现，但是这个Agent有很多BUG，它的特性我才摸熟练，比如思考一定要调低甚至关掉，不然它会卡工具调用。但是我修改设置之后，它的能力也挺我震惊的，就是我用V4 Flash让它在服务器上复制配置，也安装一个DeepSeek Harness，说实话，它比hermes快多了。我想这个工具单独坐一期，也可以等它成熟了再说。总之这玩意入门门槛很低，你让Hermes去安装它就好了，未来它绝对是个大杀器。这是我到目前为止见过读最优雅，底盘最好的Agent，简直像个艺术品。</p>
<p dir="auto">本期视频生成的网页和图像，视频的文字稿我放在论坛帖子里，大家点击视频说明栏的链接可以直接访问，有什么问题可以到论坛发帖提问，论坛大神很多，各种装备也多，信息更全。想要交流讨论的，会吹牛逼的，可以关注老特说哪个频道，我会在近期开直播和大家通论科技话题。好的本期视频就到这里，我们下期再见！</p>
]]></description><link>https://lcz.me/topic/1107/deepseek-v4-pro-0813实测-简单任务没优势-长线编程-重度任务吊打v4-flash-codex-hermes接入效果全面对比</link><generator>RSS for Node</generator><lastBuildDate>Sat, 22 Aug 2026 00:49:02 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1107.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 14 Aug 2026 02:00:00 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to DeepSeek V4 Pro 0813实测：简单任务没优势，长线编程/重度任务吊打V4 Flash！Codex、Hermes接入效果全面对比! on Fri, 14 Aug 2026 04:41:27 GMT]]></title><description><![CDATA[<p dir="auto">flash目前来看是真的爽 我有个微调的任务 挂了一天才3块钱 而且完成的比我自己搞好不少</p>
]]></description><link>https://lcz.me/post/12132</link><guid isPermaLink="true">https://lcz.me/post/12132</guid><dc:creator><![CDATA[bingqin wang]]></dc:creator><pubDate>Fri, 14 Aug 2026 04:41:27 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek V4 Pro 0813实测：简单任务没优势，长线编程/重度任务吊打V4 Flash！Codex、Hermes接入效果全面对比! on Fri, 14 Aug 2026 02:46:01 GMT]]></title><description><![CDATA[<p dir="auto">学习了， 就是现在还不确定涨价后多少钱， 性价比如何</p>
]]></description><link>https://lcz.me/post/12116</link><guid isPermaLink="true">https://lcz.me/post/12116</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Fri, 14 Aug 2026 02:46:01 GMT</pubDate></item></channel></rss>