跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. DeepSeek V4.1 Flash 内测,DSH 14亿Tokens长链任务顺利完成,有小缺点但瑕不掩瑜,平替V4 Pro,降价后会很香!

DeepSeek V4.1 Flash 内测,DSH 14亿Tokens长链任务顺利完成,有小缺点但瑕不掩瑜,平替V4 Pro,降价后会很香!

已定时 已固定 已锁定 已移动 LLM讨论区
deepseekdsharness
2 帖子 1 发布者 190 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT 离线
    terryT 离线
    terry
    超级版主
    编写于 最后由 terry 编辑
    #1

    论坛的超级版主王池川发帖说,DeepSeek V4.1 Flash 0910 开始内测了,实际上就给了两天时间。他说首 Token 1.1 秒,生成速度最高 329 tokens/s。经过我的长期实测,就是长时间工作的实测,这个数字是差不多的,是能够达到的。他就说这个模型非常好用,超级屌,问我要不要发一个测试视频。其实他当时发这个帖子的时候,我已经在干活了,而且给它规划了一个大任务。

    Skynight 说,好消息就是 Flash 明天中午降价,也就是今天中午降价了。但是当时我是想早一点把这个任务跑完,早一点测试,我也不想省那一点钱。我当时估计这个任务可能花个 50 块钱左右就差不多了。你说我省那个,就算降价一半,我省个 25 块钱,有什么意义呢?但是最终还是有点超出我的预料。这个任务一共花了我 83.4 块钱,比我想象的要贵不少。它消耗的 Tokens 一共是 13.6 亿,输出是 980K,基本上就相当于是 14 亿总 Token 的消耗。我相信在这样的价格下,尤其是在降价之前,它能有这样的表现,我觉得已经非常便宜了。因为降价之后,可能最高能降 60%。我们按照降一半来算的话,做这个庞大的任务也达到了我的预期。我的心理承受价格是 50 块钱,它如果 40 块钱能完成的话,那我觉得就非常划算了。

    DeepSeek V4.1 Flash内测.jpeg

    这个任务是什么呢?我的论坛不是有硬件页面吗?我就想,老是把用户的帖子直接这样展现给大家,也有点太粗糙了。那么我要给英伟达、AMD、英特尔、苹果不同的小主机、不同的芯片、不同的显卡,它们的 AI 算力怎么样,给大家做一个推荐和归纳总结。像这些内容,要跟我论坛实测的数据、实测的帖子互动,进行初步的总结。总结完了之后,还要把比较相关的一些帖子列出来,然后有更多相关的信息,再把链接放到下面。像这些 Tag 什么的,就直接链到论坛的帖子上来,这样的效果就会好很多。当然了,我现在在本地,由于 Firefox 我限制了它不能翻墙,所以显示有的时候可能会有一些问题,在正常的论坛中是没有问题的。

    做这个工作实际上工作量是非常大的。首先,它要从我的云端把数据库同步到本地,在本地完全复现,然后它要理解每一个帖子。因为做这个工作之前,我要它重新把所有的 Tag 打一遍,把漏掉的补上。像苹果的 M4、M5 都没有,那都要加上。之前很多标签,像 B70 这些标签都没有,都要补上,5080 这些也一样。现在都给它补上了,包括 7800、7900。把这些标签重新打一遍,并且要它接手 Hermes 以后的工作,因为以后我可能要全面转换到 DeepSeek Harness 上来,要提前做准备。所以整个论坛的所有帖子让它通读,规则让它通读,Hermes 是怎么管理这个论坛的,也要让它准备接手。

    总体上这个工作量还是比较大的,毕竟消耗了那么多 Tokens。但是它执行任务的时候,我感觉它的优点就非常明显。你说能不能平替 DeepSeek V4 Pro?我觉得可能要稍微差一点意思,但是基本上能够替代。它的长任务规划能力是非常强的,一共生成了 65 个页面,这里面还包含了大量的在线校验。我要求它每一条数据一定要与官方数据、与维基百科的数据进行校验之后才能采用,这本身就涉及很多网络查询的工作,还有一些图片识别。

    lcz论坛nvidia硬件信息

    当然了,它这个图片识别我必须要说,比起 GPT-5 或者 GPT-6 自带的图片识别,我觉得要差远了。因为它本身不能生图,有的时候它找到的图片不好的话,实际上自己是看不太出来的。像有些图片,说实话其实是非常垃圾的。但是如果用 GPT 来搞的话,它可能自己就直接画一个图,也是比较准的。但是我们也要说,毕竟我消耗了 14 亿 Tokens,如果是用 GPT-6 的价格,我现在已经破产了。哪怕用 GPT-5.6 Sol,我也扛不住。可能用 Terra 能把我的信用卡刷爆,但我不至于破产。

    另外一个优点我们必须说,它搭配自家的 Harness 干活是相当爽的。首 Token 平均是 1.7 秒,平均生成速度是 385 tokens/s,一共迭代了 183 轮、2832 步,缓存命中率 99.8%,输入 13.6 亿 Token,输出 980K Token。我说实话,这个数据是相当漂亮的。第一是缓存命中率达到了 99.8%,绝大部分 Tokens 都是用白菜价来计算的。你换其他任何的 AI,这个价格都扛不住。然后 183 轮、2800 多步的迭代,我相信这个任务还是相当强大的,这是一个比较复杂的任务,它最终还是准确地交货了。

    lcz dsh 多轮对话

    虽然过程中有些图片找得不太好,讲实话我不太满意,然后我又自己找了一些图片来替代它,就因为这个被我骂得像狗一样。但是凭良心讲,它总体上任务完成得还是相当漂亮的。当然了,具体怎么样,还要把它再放到网上面,让大家参考的时候自己去核对,因为我自己没有时间去核对这么多数据。

    它本次任务中还有一个比较重大的缺陷,刚才我忘记说了。任务开始的时候,我明确跟它讲了,你还是要自己当监工,把主要干脏活的事情交给 Sub-agent。这个 Sub-agent 用什么来驱动呢?用 Qwen3.8 27B AWQ + DFlash 2,就是我本地 SGLang 驱动的模型。而且我这个模型给它放三四个会话、四五个会话,是完全没有问题的。我有信心是因为 DeepSeek Harness 已经跟进到了 1.2 正式版,好像是这样,它已经不是什么 Alpha 或者 Beta 版本了。早期我用 R1 版本的时候,它工作都是正常的。那么现在我想,它这个 Sub-agent 的能力应该得到了比较大幅的提升,结果证明它的 Sub-agent 还是一坨狗屎,就跟以前 R1 版本的时候没有任何区别。

    当然了,我也不得不说,像 Hermes 也好,Codex 也好,它们的 Sub-agent 都是狗屎,做得都不好。可能只有 Claude Code 的 Sub-agent 做得比较好。那你说在这种情况下应该怎么搞呢?根据我之前用 DeepSeek 的经验,就是你要把任务分拆为不同的阶段,每个阶段让不同的 Agent 通过同一个目录来沟通,给这些目录上锁、上队列,让它们排队,相互校验、相互协作,那么这个效率是比较高的。这样就可以把大部分的 Tokens 给省下来。

    但是我想,最多降价之后也就能省个 40 块钱,总体效率还会降低很多。是否有必要,要看大家自己的感受。毕竟这种大活不是每天都有的,就算每天都有,一个月也就 1000 多块钱。这个钱要不要省,就见仁见智。因为 Qwen3.8 27B 做这种任务的能力,包括它修复字幕,我说实话,它的能力是非常非常强大的。虽然它的知识库很小,但是它积极地上网去搜索,完成任务的质量非常高,完全不输给 DeepSeek V4.1。

    之前我长期用 V4 Flash 来修字幕的时候,我感觉它并不比 Qwen3.8 27B 强什么。编码也是编程,它修复论坛的插件,包括修复 App 的一些小 Bug,都不差。它唯一差的地方就是长上下文不行,它干不了长任务。你如果要它执行一个复杂的任务,必须要给它拆解到位,然后监控的话,就用 V4.1,或者用 V4.1 Flash 来监控。

    这个模型是个多模态模型。昨天你看我发这些东西给它,它都看得懂,图片它还是看得懂的,它是个多模态模型。这个价格,包括它的响应速度,还有它的长任务规划,我觉得是比 V4 Flash 要更好的。这个模型如果测试通过上线的话,我觉得 DeepSeek 短期内没有必要再折腾 V4 Pro 了,可以把 V4 Pro 给下架了。

    DeepSeek API消耗

    V4 Pro,我感觉,就是我个人的体感,这个东西是比较玄乎的,它没有什么硬性的数据来证实。因为之前我用 V4 Pro 来开发自动剪辑器、视频自动生成器,它也是迭代了 200 多轮、3000 多步。我感觉它在长任务中的表现还是比 V4.1 Flash 要好一点点。这个感觉就非常主观了,但是最终都是完成了任务。那个任务的难度,我认为要稍高一点点。

    总之,DeepSeek V4 Flash 降价之后,尤其是后期如果很快能够推出 V4.1 Flash,我觉得大家真的就没有必要去折腾其他的一些 Coding Plan,或者去折腾其他的 AI 了。短时间之内,牢梁又变成了梁子,甚至马上又有可能变成梁圣,这个是有可能的。DeepSeek 现在用起来还是非常香。

    今天这个高峰期过去,等夜间我让 DeepSeek Harness 把我本地的这些 Tags、本地的这些页面都同步到云端,大家明天就可以在手机和电脑上看到这些东西了。自己去看一下,帮我检查一下,看看里面有没有什么重大的错漏。小毛病就自己在论坛中发帖来提就行了,千万不要给我发私信。

    最后跟大家交流一下,欢迎大家来论坛发帖交流讨论,但是要有点公德心,要遵守秩序。论坛因为有各位有价值的帖子,才会变得越来越好。像这种帖子,图文并茂,自己愿意去尝试新的东西,然后尝试完之后分享给大家,实际上他的帖子影响了好几个人。我们论坛的大神有好几个人都发了帖子、都测试了,非常好,非常感谢他。

    不要学那种毫无公德心的人,什么正面贡献都不做,就知道在那里酸。让我看到一次骂一次,该封号就封号。

    油管:https://www.youtube.com/@抡锤者

    1 条回复 最后回复
    0
    • terryT 离线
      terryT 离线
      terry
      超级版主
      编写于 最后由 编辑
      #2

      Youtube Video

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0

      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

      有了你的建议,这篇帖子会更精彩哦 💗

      注册 登录
      回复
      • 在新帖中回复
      登录后回复
      • 从旧到新
      • 从新到旧
      • 最多赞同


      • 登录

      • 登录或注册以进行搜索。
      • 第一个帖子
        最后一个帖子
      0
      • 版块
      • 最新
      • 标签
      • 热门
      • 用户
      • 群组