跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. DeepSeek V4 Flash Vision实测:识图白菜价,DeepSeek Harness开发App真能放手干了?

DeepSeek V4 Flash Vision实测:识图白菜价,DeepSeek Harness开发App真能放手干了?

已定时 已固定 已锁定 已移动 LLM讨论区
deepseekdsharness
5 帖子 3 发布者 243 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT 在线
    terryT 在线
    terry
    超级版主
    编写于 最后由 编辑
    #1

    昨天在老特说那个频道直播科技话题的时候,有朋友说 DeepSeek 发布了 V4 Flash Vision Experiment,就是这个视觉模型。我就把它接到 DeepSeek Harness 上,让它继续我论坛的 App 开发。

    在此之前,我肯定是做过对比的。最后一次提交也是用 V4 Flash Vision Experiment 在 Codex 上开发。在之前,我使用了 AMD 的 Qwen3.8-27B Q4_K_M,跟英伟达的 Qwen3.8-27B FP8 SGLang 都做了对比。体验总体来说,就是 Qwen3.8-27B 这两个没有什么实质性差距,但是它们有一个坎过不了。

    就是我当时修一个图片上传的 Bug,它就是过不了,处理了很多轮。然后换成 DeepSeek V4 Flash Vision Experiment 这个新的模型,它一步就把它搞定了。但是在这个上面,我没有配置截图检查,我也不知道它是怎么搞定的,反正它一下子就搞定了。

    161850de-ee03-4ca5-9c68-509b91700cad-image.jpeg

    接下来我就是把它转到 DeepSeek Harness 上来了。DeepSeek Harness 升级之后,我怎么讲,我感觉它现在进步了很多,体验好了很多。以前你看它这个地方,本地都不能访问,除非你给它配置 HTTPS 证书。然后就像个憨批一样,弹框的时候老是弹不出来,我都不得不使用 Firefox,反正体验不好。

    这次升级之后,这个毛病没了。记不记得我前几期视频里讲过,我自己开发了一个简单的浏览器,现在那个浏览器就不用了,直接用 Chrome,体验非常好。然后它接手之后,对于代码的理解还是非常快的。这个怎么讲,就是属于入门了。

    不过它也有一个地方非常不爽,有一个地方卡了很久。我传一个图片给它,叫它去改论坛 App 图标的时候,它老是改不对。它就告诉我说,要我把这个图片的路径告诉它。在我几次疯狂辱骂之后,它自己在这个服务器上找到了我给它上传的图片。

    我只是直接把图片给它,用鼠标按住给它拖进来的,不知道为什么这么傻。现在反正不会了,因为骂过一次它就记得了。它现在在调试,我就不截图了,因为之前有很多 App 的截图了,这个后期我放一个上去。

    你看,就是调这个图片的时候,它可以很清楚地认识这个图片,但是它要我告诉它这个图片的路径,很难理解。然后现在它确实加了这个视觉模块之后,正好出来了,它自己正在调。加了视觉模块之后,它有什么布局上的 Bug,就不需要我告诉它了,它自己直接能搞定,自己截图自己看,就挺好的。

    APP错误截图.png

    这个还得骂它,就越改越败类。本来这个超凡大师的标志非常好看的,不知道为什么被它改成傻逼了。

    然后现在什么图片上传、Markdown 的解析、代码解析、图表解析,全部都做完了,都没什么 Bug 了。你看列表页,总体上这个东西已经接近完成了,就没有什么技术上的难点了。

    最起码可以说明,Qwen3.8-27B 也好,还是 DeepSeek V4 Flash 也好,来开发这种 App 是非常轻松的。但是千问刚才我讲了,这里又出 Bug 了,又得疯狂地输出一顿。本来这个地方是好的。

    千问它是有些地方 Bug 是过不去的,这个必须要承认。它不能够独立完成开发,有的时候还是要切在线的模型。但是 DeepSeek V4 Flash,它最起码现在来改这些东西是非常轻松的。后面我会想办法自己起一个全新的项目,用这个 DeepSeek V4 Flash 来搞。

    做 App 的话,我最近是没有什么连续的时间,因为要做英语视频,要做中文视频,还有直播。然后等国庆节我看看,如果说有连续的时间,我就把它给密集测试一下,然后把它上架。无论如何,它比手机的网页版体验还是好一些的。

    然后关于今天的这个模型,我们来测试一下它的能力。看图,一个编程的外部控制台界面、iPhone 模拟器,中文资讯界面正在调试开发,这个识别还是准确的。

    找一下其他的图片,上点有难度的。这个图片还是有难度的,这个字体很好识别,但是这个地方是个小图,它不怎么清晰,里面的内容还是非常复杂的,我们给它识别一下。

    字识别错了,“抡锤者”它识别成了“拾锤者”。具体排版是这样的,深蓝色调,略带做旧纹理质感,立体带阴影效果,对的。中间偏左的插图,一条横向挖掘出隧道的空间,一个人拿着手电筒、提着灯,往下看,脚下是一块石板,对的。撬开地面上井盖的东西,旁边立着灯柱。旁边这个不是灯柱,旁边这个是一个锤子,但是确实有点像灯。

    fb9ba8cd-23ec-4a4b-9312-1bdb374db351-image.jpeg

    这个识图的准确率还是可以的,给大家看一下,速度也是非常快。更重要的是,官方给的价格好像是非常低,非常低。反正就是会把它强行压缩成 800×800 以内的图,然后每一张图片好像几分钱都不到,就非常便宜。

    它说是每一张图给它算 300 个 Token,好像是这样说的。这个就是白菜价了,用来批量识图,就没有必要在本地搭建什么识图模型。即便你是用千问来开发项目,你识图的时候也不要用它自己的多模态,要不然它那个识图就慢得一逼。让它用 DeepSeek 的 API 来识图,又非常便宜。

    看论坛,它改得怎么样了。后面我就疯狂辱骂它,叫它不要请示我,就自己开发,然后我看结果。哪里改不好,我就对它进行言语上的输出。我打开来看一看,看一下,这个叫疯狂辱骂。这功能刚才都测过了,我就问它,直接发图给它,看它怎么说。

    你看,它还是能非常准确地识别错误的,就是要它自己来慢慢修改吧。晚上睡觉了,我就不录制了,我叫它自己制定一个计划,对着论坛自己改,我起来看效果。

    现在我都让它自己干活,也懒得一项一项去跟。因为你把每一个错误告诉它,也没什么鸟用,你就让它自己检查。然后任务呢,你就给它一个锚定点,也不要自己去规划了,就让它自己去对比论坛上的各项功能,让它自己去搞,它能搞得定的。

    DeepSeek V4 Flash识图模式.jpeg

    今天实际上有很多功能我根本都没有说,都是它自己对比了之后,它就把它搞定了。就像这些功能都是它自己加的,我都没跟它说,包括你看这些标签。代码高亮这些都是之前开发的,就是有什么 Bug,它现在有这个视觉模块之后能截图,就基本上不需要我们参与了。哪个地方不好看,它是能知道的。

    关于价格,跟 V4 Flash 的价格是一模一样的,能力也是一模一样的,只是多了一个识图模块。哎,我们看看这里面,这肯定不是实时的,还是比较贵的。

    像以前这种开发,我做一个大致的对比,就估算个量,我看看大致相当于什么水平。大致相当于今天做的,这两天做的,就是 10 块钱的水平。你别看它现在才显示这个 13 块钱,因为这个有延迟。刚才还在密集开发,有延迟的,我估计现在这个价格应该到达 20 多了,20 几块钱。

    总之,这个模型更新之后,最大的变化是什么?是 DeepSeek Harness。然后 Codex 好像它本身有这个识图框架,好像并不需要你模型本身有这个能力。因为之前我改 App 的时候,有什么问题,我直接跟它说,它立马就知道了。其实大多数 Bug 不需要识图。

    后面我还是会把 DeepSeek Harness 再接入 Qwen3.8-27B,再测一下,看看体验有没有提升。就是这个 Harness 本身自己更新了,千问模型是没有更新的。

    好吧,本期视频就到这里,我们下期再见。

    油管:https://www.youtube.com/@抡锤者

    1 条回复 最后回复
    1
    • terryT 在线
      terryT 在线
      terry
      超级版主
      编写于 最后由 编辑
      #2

      Youtube Video

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      1
      • 九龙杨生九 离线
        九龙杨生九 离线
        九龙杨生
        技术大牛 劳动模范
        编写于 最后由 编辑
        #3

        主要是他这个强行压缩成 800×800 以内的图太伤了,很多细致活干不了,只是要能达到4K分辨率才算完美;QWEN 3.8 27B设置识别分辨率之后在识别大图上面配合OCR的校正基本上不会出什么问题了;

        典型应用场景就是我需要把EXCEL手机照片转化成表格,这个V4 Flash在压缩之后应该就识别不清楚了;

        欢迎访问亿量科技官网
        欢迎访问亿量科技油管频道

        terryT 1 条回复 最后回复
        0
        • 九龙杨生九 九龙杨生

          主要是他这个强行压缩成 800×800 以内的图太伤了,很多细致活干不了,只是要能达到4K分辨率才算完美;QWEN 3.8 27B设置识别分辨率之后在识别大图上面配合OCR的校正基本上不会出什么问题了;

          典型应用场景就是我需要把EXCEL手机照片转化成表格,这个V4 Flash在压缩之后应该就识别不清楚了;

          terryT 在线
          terryT 在线
          terry
          超级版主
          编写于 最后由 编辑
          #4

          @九龙杨生 它是做量的,批量检测,我觉得大部分强劲够用,而且高清图细节,它还是看得懂的,视频里我的横幅长度是4096。更高分辨率的应该会和V4 Pro一起发布。最重要的是它的识图是Tokens化的, DeepSeek还有一个Tokens化生图的模型,这个以后会成为颠覆行业的利器。字节也在押tokens路线,这绝不是巧合。

          油管:https://www.youtube.com/@抡锤者

          1 条回复 最后回复
          0
          • crazypeaceC 离线
            crazypeaceC 离线
            crazypeace
            编写于 最后由 crazypeace 编辑
            #5

            我用 agent 开发 C++ 遇到个问题, 编译之后 跑起来 agent 没办法自己测试.
            具体表现为, 能截图看到界面, 但是没有好的工具模拟点击.
            准确地说, Agent 说是找到了一个现成的 linux 工具, 但是实际效果并不行. 总是出现 Agent 说 点击xxx, 然后说没生效没点到.

            我用 agent 给 forkgram 增强开发小功能.
            修改 forkgram/tdesktop 实现 屏蔽音频/视频按钮功能

            1 条回复 最后回复
            1

            你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

            厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

            有了你的建议,这篇帖子会更精彩哦 💗

            注册 登录
            回复
            • 在新帖中回复
            登录后回复
            • 从旧到新
            • 从新到旧
            • 最多赞同


            • 登录

            • 登录或注册以进行搜索。
            • 第一个帖子
              最后一个帖子
            0
            • 版块
            • 最新
            • 标签
            • 热门
            • 用户
            • 群组