<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[DeepSeek V4 Flash Vision实测：识图白菜价，DeepSeek Harness开发App真能放手干了？]]></title><description><![CDATA[<p dir="auto">昨天在老特说那个频道直播科技话题的时候，有朋友说 DeepSeek 发布了 V4 Flash Vision Experiment，就是这个视觉模型。我就把它接到 DeepSeek Harness 上，让它继续我论坛的 App 开发。</p>
<p dir="auto">在此之前，我肯定是做过对比的。最后一次提交也是用 V4 Flash Vision Experiment 在 Codex 上开发。在之前，我使用了 AMD 的 Qwen3.8-27B Q4_K_M，跟英伟达的 Qwen3.8-27B FP8 SGLang 都做了对比。体验总体来说，就是 Qwen3.8-27B 这两个没有什么实质性差距，但是它们有一个坎过不了。</p>
<p dir="auto">就是我当时修一个图片上传的 Bug，它就是过不了，处理了很多轮。然后换成 DeepSeek V4 Flash Vision Experiment 这个新的模型，它一步就把它搞定了。但是在这个上面，我没有配置截图检查，我也不知道它是怎么搞定的，反正它一下子就搞定了。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/7f2986cd-6cf8-4e04-84ea-8f6fc20df269.jpeg" alt="161850de-ee03-4ca5-9c68-509b91700cad-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">接下来我就是把它转到 DeepSeek Harness 上来了。DeepSeek Harness 升级之后，我怎么讲，我感觉它现在进步了很多，体验好了很多。以前你看它这个地方，本地都不能访问，除非你给它配置 HTTPS 证书。然后就像个憨批一样，弹框的时候老是弹不出来，我都不得不使用 Firefox，反正体验不好。</p>
<p dir="auto">这次升级之后，这个毛病没了。记不记得我前几期视频里讲过，我自己开发了一个简单的浏览器，现在那个浏览器就不用了，直接用 Chrome，体验非常好。然后它接手之后，对于代码的理解还是非常快的。这个怎么讲，就是属于入门了。</p>
<p dir="auto">不过它也有一个地方非常不爽，有一个地方卡了很久。我传一个图片给它，叫它去改论坛 App 图标的时候，它老是改不对。它就告诉我说，要我把这个图片的路径告诉它。在我几次疯狂辱骂之后，它自己在这个服务器上找到了我给它上传的图片。</p>
<p dir="auto">我只是直接把图片给它，用鼠标按住给它拖进来的，不知道为什么这么傻。现在反正不会了，因为骂过一次它就记得了。它现在在调试，我就不截图了，因为之前有很多 App 的截图了，这个后期我放一个上去。</p>
<p dir="auto">你看，就是调这个图片的时候，它可以很清楚地认识这个图片，但是它要我告诉它这个图片的路径，很难理解。然后现在它确实加了这个视觉模块之后，正好出来了，它自己正在调。加了视觉模块之后，它有什么布局上的 Bug，就不需要我告诉它了，它自己直接能搞定，自己截图自己看，就挺好的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/7c775577-889a-4f97-9dd1-d41eb30730b9.png" alt="APP错误截图.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">这个还得骂它，就越改越败类。本来这个超凡大师的标志非常好看的，不知道为什么被它改成傻逼了。</p>
<p dir="auto">然后现在什么图片上传、Markdown 的解析、代码解析、图表解析，全部都做完了，都没什么 Bug 了。你看列表页，总体上这个东西已经接近完成了，就没有什么技术上的难点了。</p>
<p dir="auto">最起码可以说明，Qwen3.8-27B 也好，还是 DeepSeek V4 Flash 也好，来开发这种 App 是非常轻松的。但是千问刚才我讲了，这里又出 Bug 了，又得疯狂地输出一顿。本来这个地方是好的。</p>
<p dir="auto">千问它是有些地方 Bug 是过不去的，这个必须要承认。它不能够独立完成开发，有的时候还是要切在线的模型。但是 DeepSeek V4 Flash，它最起码现在来改这些东西是非常轻松的。后面我会想办法自己起一个全新的项目，用这个 DeepSeek V4 Flash 来搞。</p>
<p dir="auto">做 App 的话，我最近是没有什么连续的时间，因为要做英语视频，要做中文视频，还有直播。然后等国庆节我看看，如果说有连续的时间，我就把它给密集测试一下，然后把它上架。无论如何，它比手机的网页版体验还是好一些的。</p>
<p dir="auto">然后关于今天的这个模型，我们来测试一下它的能力。看图，一个编程的外部控制台界面、iPhone 模拟器，中文资讯界面正在调试开发，这个识别还是准确的。</p>
<p dir="auto">找一下其他的图片，上点有难度的。这个图片还是有难度的，这个字体很好识别，但是这个地方是个小图，它不怎么清晰，里面的内容还是非常复杂的，我们给它识别一下。</p>
<p dir="auto">字识别错了，“抡锤者”它识别成了“拾锤者”。具体排版是这样的，深蓝色调，略带做旧纹理质感，立体带阴影效果，对的。中间偏左的插图，一条横向挖掘出隧道的空间，一个人拿着手电筒、提着灯，往下看，脚下是一块石板，对的。撬开地面上井盖的东西，旁边立着灯柱。旁边这个不是灯柱，旁边这个是一个锤子，但是确实有点像灯。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/9d3d75cd-2a32-4be8-9d33-3ba511d3479e.jpeg" alt="fb9ba8cd-23ec-4a4b-9312-1bdb374db351-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">这个识图的准确率还是可以的，给大家看一下，速度也是非常快。更重要的是，官方给的价格好像是非常低，非常低。反正就是会把它强行压缩成 800×800 以内的图，然后每一张图片好像几分钱都不到，就非常便宜。</p>
<p dir="auto">它说是每一张图给它算 300 个 Token，好像是这样说的。这个就是白菜价了，用来批量识图，就没有必要在本地搭建什么识图模型。即便你是用千问来开发项目，你识图的时候也不要用它自己的多模态，要不然它那个识图就慢得一逼。让它用 DeepSeek 的 API 来识图，又非常便宜。</p>
<p dir="auto">看论坛，它改得怎么样了。后面我就疯狂辱骂它，叫它不要请示我，就自己开发，然后我看结果。哪里改不好，我就对它进行言语上的输出。我打开来看一看，看一下，这个叫疯狂辱骂。这功能刚才都测过了，我就问它，直接发图给它，看它怎么说。</p>
<p dir="auto">你看，它还是能非常准确地识别错误的，就是要它自己来慢慢修改吧。晚上睡觉了，我就不录制了，我叫它自己制定一个计划，对着论坛自己改，我起来看效果。</p>
<p dir="auto">现在我都让它自己干活，也懒得一项一项去跟。因为你把每一个错误告诉它，也没什么鸟用，你就让它自己检查。然后任务呢，你就给它一个锚定点，也不要自己去规划了，就让它自己去对比论坛上的各项功能，让它自己去搞，它能搞得定的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/971fa649-c0e3-4619-b5de-e06666d439d2.jpeg" alt="DeepSeek V4 Flash识图模式.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">今天实际上有很多功能我根本都没有说，都是它自己对比了之后，它就把它搞定了。就像这些功能都是它自己加的，我都没跟它说，包括你看这些标签。代码高亮这些都是之前开发的，就是有什么 Bug，它现在有这个视觉模块之后能截图，就基本上不需要我们参与了。哪个地方不好看，它是能知道的。</p>
<p dir="auto">关于价格，跟 V4 Flash 的价格是一模一样的，能力也是一模一样的，只是多了一个识图模块。哎，我们看看这里面，这肯定不是实时的，还是比较贵的。</p>
<p dir="auto">像以前这种开发，我做一个大致的对比，就估算个量，我看看大致相当于什么水平。大致相当于今天做的，这两天做的，就是 10 块钱的水平。你别看它现在才显示这个 13 块钱，因为这个有延迟。刚才还在密集开发，有延迟的，我估计现在这个价格应该到达 20 多了，20 几块钱。</p>
<p dir="auto">总之，这个模型更新之后，最大的变化是什么？是 DeepSeek Harness。然后 Codex 好像它本身有这个识图框架，好像并不需要你模型本身有这个能力。因为之前我改 App 的时候，有什么问题，我直接跟它说，它立马就知道了。其实大多数 Bug 不需要识图。</p>
<p dir="auto">后面我还是会把 DeepSeek Harness 再接入 Qwen3.8-27B，再测一下，看看体验有没有提升。就是这个 Harness 本身自己更新了，千问模型是没有更新的。</p>
<p dir="auto">好吧，本期视频就到这里，我们下期再见。</p>
]]></description><link>https://lcz.me/topic/1259</link><generator>RSS for Node</generator><lastBuildDate>Thu, 10 Sep 2026 03:25:31 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1259.rss" rel="self" type="application/rss+xml"/><pubDate>Sat, 22 Aug 2026 02:00:00 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to DeepSeek V4 Flash Vision实测：识图白菜价，DeepSeek Harness开发App真能放手干了？ on Sat, 22 Aug 2026 07:35:39 GMT]]></title><description><![CDATA[<p dir="auto">我用 agent 开发 C++ 遇到个问题, 编译之后 跑起来 agent 没办法自己测试.<br />
具体表现为, 能截图看到界面, 但是没有好的工具模拟点击.<br />
准确地说, Agent 说是找到了一个现成的 linux 工具, 但是实际效果并不行. 总是出现 Agent 说 点击xxx, 然后说没生效没点到.</p>
<p dir="auto">我用 agent 给 forkgram 增强开发小功能.<br />
<a href="https://zelikk.blogspot.com/2026/08/forkgramtdesktop-by-hermes.html" rel="nofollow ugc">修改 forkgram/tdesktop 实现 屏蔽音频/视频按钮功能</a></p>
]]></description><link>https://lcz.me/post/13450</link><guid isPermaLink="true">https://lcz.me/post/13450</guid><dc:creator><![CDATA[crazypeace]]></dc:creator><pubDate>Sat, 22 Aug 2026 07:35:39 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek V4 Flash Vision实测：识图白菜价，DeepSeek Harness开发App真能放手干了？ on Sat, 22 Aug 2026 03:26:04 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E4%B9%9D%E9%BE%99%E6%9D%A8%E7%94%9F" aria-label="Profile: 九龙杨生">@<bdi>九龙杨生</bdi></a> 它是做量的，批量检测，我觉得大部分强劲够用，而且高清图细节，它还是看得懂的，视频里我的横幅长度是4096。更高分辨率的应该会和V4 Pro一起发布。最重要的是它的识图是Tokens化的， DeepSeek还有一个Tokens化生图的模型，这个以后会成为颠覆行业的利器。字节也在押tokens路线，这绝不是巧合。</p>
]]></description><link>https://lcz.me/post/13425</link><guid isPermaLink="true">https://lcz.me/post/13425</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Sat, 22 Aug 2026 03:26:04 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek V4 Flash Vision实测：识图白菜价，DeepSeek Harness开发App真能放手干了？ on Sat, 22 Aug 2026 02:52:09 GMT]]></title><description><![CDATA[<p dir="auto">主要是他这个强行压缩成 800×800 以内的图太伤了，很多细致活干不了，只是要能达到4K分辨率才算完美；QWEN 3.8 27B设置识别分辨率之后在识别大图上面配合OCR的校正基本上不会出什么问题了；</p>
<p dir="auto">典型应用场景就是我需要把EXCEL手机照片转化成表格，这个V4 Flash在压缩之后应该就识别不清楚了；</p>
]]></description><link>https://lcz.me/post/13420</link><guid isPermaLink="true">https://lcz.me/post/13420</guid><dc:creator><![CDATA[九龙杨生]]></dc:creator><pubDate>Sat, 22 Aug 2026 02:52:09 GMT</pubDate></item><item><title><![CDATA[Reply to DeepSeek V4 Flash Vision实测：识图白菜价，DeepSeek Harness开发App真能放手干了？ on Sat, 22 Aug 2026 02:00:00 GMT]]></title><description><![CDATA[<p dir="auto"><a href="https://youtu.be/GuJcn_z72CY" rel="nofollow ugc"><i class="fa fa-youtube" aria-hidden="true"></i> Youtube Video</a></p><div class="js-lazyYT lazyYT-container" data-youtube-id="GuJcn_z72CY" data-width="640" data-height="360" data-parameters style="width:640px;padding-bottom:360px">
 <div class="ytp-thumbnail lazyYT-image-loaded" style="background-image:url(&quot;https://i.ytimg.com/vi/GuJcn_z72CY/hqdefault.jpg&quot;)">
  <button class="ytp-large-play-button ytp-button" tabindex="23" aria-live="assertive" style="transform:scale(0.85)" onclick="$(this).lazyYT(this);return false;">
   <svg height="100%" version="1.1" viewbox="0 0 68 48" width="100%">
    <path class="ytp-large-play-button-bg" d="m .66,37.62 c 0,0 .66,4.70 2.70,6.77 2.58,2.71 5.98,2.63 7.49,2.91 5.43,.52 23.10,.68 23.12,.68 .00,-1.3e-5 14.29,-0.02 23.81,-0.71 1.32,-0.15 4.22,-0.17 6.81,-2.89 2.03,-2.07 2.70,-6.77 2.70,-6.77 0,0 .67,-5.52 .67,-11.04 l 0,-5.17 c 0,-5.52 -0.67,-11.04 -0.67,-11.04 0,0 -0.66,-4.70 -2.70,-6.77 C 62.03,.86 59.13,.84 57.80,.69 48.28,0 34.00,0 34.00,0 33.97,0 19.69,0 10.18,.69 8.85,.84 5.95,.86 3.36,3.58 1.32,5.65 .66,10.35 .66,10.35 c 0,0 -0.55,4.50 -0.66,9.45 l 0,8.36 c .10,4.94 .66,9.45 .66,9.45 z" fill="#1f1f1e" fill-opacity="0.9">
    </path>
    <path d="m 26.96,13.67 18.37,9.62 -18.37,9.55 -0.00,-19.17 z" fill="#fff">
    </path>
    <path d="M 45.02,23.46 45.32,23.28 26.96,13.67 43.32,24.34 45.02,23.46 z" fill="#ccc">
    </path>
   </svg>
  </button>
 </div>
</div><p></p>
]]></description><link>https://lcz.me/post/13407</link><guid isPermaLink="true">https://lcz.me/post/13407</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Sat, 22 Aug 2026 02:00:00 GMT</pubDate></item></channel></rss>