DeepSeek V4 Flash Vision实测:识图白菜价,DeepSeek Harness开发App真能放手干了?
-
昨天在老特说那个频道直播科技话题的时候,有朋友说 DeepSeek 发布了 V4 Flash Vision Experiment,就是这个视觉模型。我就把它接到 DeepSeek Harness 上,让它继续我论坛的 App 开发。
在此之前,我肯定是做过对比的。最后一次提交也是用 V4 Flash Vision Experiment 在 Codex 上开发。在之前,我使用了 AMD 的 Qwen3.8-27B Q4_K_M,跟英伟达的 Qwen3.8-27B FP8 SGLang 都做了对比。体验总体来说,就是 Qwen3.8-27B 这两个没有什么实质性差距,但是它们有一个坎过不了。
就是我当时修一个图片上传的 Bug,它就是过不了,处理了很多轮。然后换成 DeepSeek V4 Flash Vision Experiment 这个新的模型,它一步就把它搞定了。但是在这个上面,我没有配置截图检查,我也不知道它是怎么搞定的,反正它一下子就搞定了。

接下来我就是把它转到 DeepSeek Harness 上来了。DeepSeek Harness 升级之后,我怎么讲,我感觉它现在进步了很多,体验好了很多。以前你看它这个地方,本地都不能访问,除非你给它配置 HTTPS 证书。然后就像个憨批一样,弹框的时候老是弹不出来,我都不得不使用 Firefox,反正体验不好。
这次升级之后,这个毛病没了。记不记得我前几期视频里讲过,我自己开发了一个简单的浏览器,现在那个浏览器就不用了,直接用 Chrome,体验非常好。然后它接手之后,对于代码的理解还是非常快的。这个怎么讲,就是属于入门了。
不过它也有一个地方非常不爽,有一个地方卡了很久。我传一个图片给它,叫它去改论坛 App 图标的时候,它老是改不对。它就告诉我说,要我把这个图片的路径告诉它。在我几次疯狂辱骂之后,它自己在这个服务器上找到了我给它上传的图片。
我只是直接把图片给它,用鼠标按住给它拖进来的,不知道为什么这么傻。现在反正不会了,因为骂过一次它就记得了。它现在在调试,我就不截图了,因为之前有很多 App 的截图了,这个后期我放一个上去。
你看,就是调这个图片的时候,它可以很清楚地认识这个图片,但是它要我告诉它这个图片的路径,很难理解。然后现在它确实加了这个视觉模块之后,正好出来了,它自己正在调。加了视觉模块之后,它有什么布局上的 Bug,就不需要我告诉它了,它自己直接能搞定,自己截图自己看,就挺好的。

这个还得骂它,就越改越败类。本来这个超凡大师的标志非常好看的,不知道为什么被它改成傻逼了。
然后现在什么图片上传、Markdown 的解析、代码解析、图表解析,全部都做完了,都没什么 Bug 了。你看列表页,总体上这个东西已经接近完成了,就没有什么技术上的难点了。
最起码可以说明,Qwen3.8-27B 也好,还是 DeepSeek V4 Flash 也好,来开发这种 App 是非常轻松的。但是千问刚才我讲了,这里又出 Bug 了,又得疯狂地输出一顿。本来这个地方是好的。
千问它是有些地方 Bug 是过不去的,这个必须要承认。它不能够独立完成开发,有的时候还是要切在线的模型。但是 DeepSeek V4 Flash,它最起码现在来改这些东西是非常轻松的。后面我会想办法自己起一个全新的项目,用这个 DeepSeek V4 Flash 来搞。
做 App 的话,我最近是没有什么连续的时间,因为要做英语视频,要做中文视频,还有直播。然后等国庆节我看看,如果说有连续的时间,我就把它给密集测试一下,然后把它上架。无论如何,它比手机的网页版体验还是好一些的。
然后关于今天的这个模型,我们来测试一下它的能力。看图,一个编程的外部控制台界面、iPhone 模拟器,中文资讯界面正在调试开发,这个识别还是准确的。
找一下其他的图片,上点有难度的。这个图片还是有难度的,这个字体很好识别,但是这个地方是个小图,它不怎么清晰,里面的内容还是非常复杂的,我们给它识别一下。
字识别错了,“抡锤者”它识别成了“拾锤者”。具体排版是这样的,深蓝色调,略带做旧纹理质感,立体带阴影效果,对的。中间偏左的插图,一条横向挖掘出隧道的空间,一个人拿着手电筒、提着灯,往下看,脚下是一块石板,对的。撬开地面上井盖的东西,旁边立着灯柱。旁边这个不是灯柱,旁边这个是一个锤子,但是确实有点像灯。

这个识图的准确率还是可以的,给大家看一下,速度也是非常快。更重要的是,官方给的价格好像是非常低,非常低。反正就是会把它强行压缩成 800×800 以内的图,然后每一张图片好像几分钱都不到,就非常便宜。
它说是每一张图给它算 300 个 Token,好像是这样说的。这个就是白菜价了,用来批量识图,就没有必要在本地搭建什么识图模型。即便你是用千问来开发项目,你识图的时候也不要用它自己的多模态,要不然它那个识图就慢得一逼。让它用 DeepSeek 的 API 来识图,又非常便宜。
看论坛,它改得怎么样了。后面我就疯狂辱骂它,叫它不要请示我,就自己开发,然后我看结果。哪里改不好,我就对它进行言语上的输出。我打开来看一看,看一下,这个叫疯狂辱骂。这功能刚才都测过了,我就问它,直接发图给它,看它怎么说。
你看,它还是能非常准确地识别错误的,就是要它自己来慢慢修改吧。晚上睡觉了,我就不录制了,我叫它自己制定一个计划,对着论坛自己改,我起来看效果。
现在我都让它自己干活,也懒得一项一项去跟。因为你把每一个错误告诉它,也没什么鸟用,你就让它自己检查。然后任务呢,你就给它一个锚定点,也不要自己去规划了,就让它自己去对比论坛上的各项功能,让它自己去搞,它能搞得定的。

今天实际上有很多功能我根本都没有说,都是它自己对比了之后,它就把它搞定了。就像这些功能都是它自己加的,我都没跟它说,包括你看这些标签。代码高亮这些都是之前开发的,就是有什么 Bug,它现在有这个视觉模块之后能截图,就基本上不需要我们参与了。哪个地方不好看,它是能知道的。
关于价格,跟 V4 Flash 的价格是一模一样的,能力也是一模一样的,只是多了一个识图模块。哎,我们看看这里面,这肯定不是实时的,还是比较贵的。
像以前这种开发,我做一个大致的对比,就估算个量,我看看大致相当于什么水平。大致相当于今天做的,这两天做的,就是 10 块钱的水平。你别看它现在才显示这个 13 块钱,因为这个有延迟。刚才还在密集开发,有延迟的,我估计现在这个价格应该到达 20 多了,20 几块钱。
总之,这个模型更新之后,最大的变化是什么?是 DeepSeek Harness。然后 Codex 好像它本身有这个识图框架,好像并不需要你模型本身有这个能力。因为之前我改 App 的时候,有什么问题,我直接跟它说,它立马就知道了。其实大多数 Bug 不需要识图。
后面我还是会把 DeepSeek Harness 再接入 Qwen3.8-27B,再测一下,看看体验有没有提升。就是这个 Harness 本身自己更新了,千问模型是没有更新的。
好吧,本期视频就到这里,我们下期再见。
-
主要是他这个强行压缩成 800×800 以内的图太伤了,很多细致活干不了,只是要能达到4K分辨率才算完美;QWEN 3.8 27B设置识别分辨率之后在识别大图上面配合OCR的校正基本上不会出什么问题了;
典型应用场景就是我需要把EXCEL手机照片转化成表格,这个V4 Flash在压缩之后应该就识别不清楚了;
-
我用 agent 开发 C++ 遇到个问题, 编译之后 跑起来 agent 没办法自己测试.
具体表现为, 能截图看到界面, 但是没有好的工具模拟点击.
准确地说, Agent 说是找到了一个现成的 linux 工具, 但是实际效果并不行. 总是出现 Agent 说 点击xxx, 然后说没生效没点到.我用 agent 给 forkgram 增强开发小功能.
修改 forkgram/tdesktop 实现 屏蔽音频/视频按钮功能