JEV颠覆传统AI生态,GPT Claude降本增效数百倍?DSH/GPT简单测试,AI圈子里的重金求子项目!
-
本期视频我们谈一谈评论区以及论坛有些屌毛一定要我谈的东西,叫 JEV。这个新的玩意,它是个什么呢?
它是个大模型,但是它有别于传统的普通大模型,就是它不跟你聊天,它也不干活。它干什么?它做决策、做判断。它为 Claude、GPT 这些不同的模型提供判断,然后降低成本,因为它判断的成本非常低。然后好像是它建立了某种新的范式,就在各种场合被拿出来说,什么效率提升了几十倍,成本降低了几十倍,这一来一去都上千倍的降本增效了。

但是我一直在我的视频中跟大家讲,如果说你自己长得很挫,身高一米六,然后体重 160,长得比我还丑,然后忽然间有一个身材窈窕、长相可人的妹子对你抛媚眼,甚至向你提出重金求子,那你这个时候第一个反应应该是撒泡尿照照自己的影子。你看看这些虎狼一般的数字,动不动就几百倍的提升,这个东西就跟什么大力金刚丸、蚁力神基本上走的都是同一个路线。凡是愿意相信这些东西的,基本上脑子都不太正常,要么就是特别喜欢贪小便宜的。
但是既然有人提到这个东西,这家公司的网站挂出了不少的对比,显示自己在降本增效方面多么多么牛逼。你看这数字,卧槽,低于 100 倍以下的基本上都不会摆出来。如果说我们从常识的角度来判断,如果这个东西成立的话,那么 OpenAI、Anthropic 这些公司,包括 DeepSeek 这些公司都是傻逼,知道吗?就是他们不知道这么做?

然后这个东西还不是开源的,它还是闭源的。那么像这么一个非常牛逼的东西,它在 GitHub 上面不是开源的,所以我们不能用星标来判断它。但是它的这个 API,星标 186,一共 17 个分支。我只能讲,虽然我妈不识字,但是我妈如果说在 GitHub 上开源一个项目,我应该几天的时间,一个星期也能把它刷到这个数字。
然后这家牛逼的企业,我们看一看它还有其他一些项目,我们不能光看它其中一个项目嘛。你看星标,最大的一个 1.2k,其他的都是 100、200、十几个、几个星标。如果说这个东西是像 DeepSeek Harness 一样重磅的生产工具,它能够改变行业的生态,像 Hermes 一样,像 OpenClaw 一样,那么它不会有这么傻逼的星标。

但是我又为什么说在我评论区、在我论坛发帖或者评论要我谈这些东西的都是屌毛呢?就是这些人基本上听风就是雨,没有基本的认知能力。他们会觉得自己看了某某东西特别厉害,他就为了装个逼,然后骗我去研究这个东西。甚至说,他们有可能就是这些炒作水军的机器人。
有的时候大家说,你怎么在评论区对某某人那么粗俗?其实你们搞错了,你对他礼貌也没有用的,因为他们很多是机器人。有的是如果是真人的话,他相信这么一个玩意,基本上他的智商也不比那些机器人强。

然后这个东西我还去注册了一下,我也跟 GPT 聊了一下天,然后简单研究了一下它的玩法。它是不能干活的,它不能干活,它只是帮你判断,而且它没有聊天入口,因为它本身不聊天。就是说你到它这个官方网站来注册一下,注册好了之后,你能获得一个 API Key。这个 Key 现在是免费使用,但是以后,因为它是闭源的,以后它是要收费的。
你在这里描述一个现象、一个状态,然后给它几个选项选择,它再把这个概率告诉你。比如说你说这个登录失败,那么有这几种可能,下一步应该怎么做?给它 5 个选择,它就会告诉你,选择一概率是 70%,选择二概率是 28%,选择三概率是 2%。
那你说这么一个东西,它又不能干活,那它能干什么呢?这个时候就要做一下实际的演示。我们打开我们万能的 DeepSeek Harness,让它去研究一下 JEV 这个新的模型。然后我申请了一个 API Key,让它研究研究怎么玩。它也了解了一下,说它已经准备好了,弄完了,已经确认是通的。我就告诉它,我把 API Key 已经放在了 JEV 目录底下,它自己写了一个脚本,然后它就开始测试。
其实它的测试过程,就是跟我在这个页面弄的一样。给它一个状态,然后几个选择,让它给出每个选择的概率。这个模型它本身不吐出任何的文本,不吐出任何的聊天内容,它只是帮你做决策。

它做了一些简单的测试,知道怎么跟它交互了。然后我就问它,我说我跑任务的时候,比如说我要开发 App,我怎么用它?这个 DeepSeek Harness 就开始告诉我它是干什么的,意思就是说它不能干活,但是它能帮助决策。
我一开始还问它,我说你是不是把它当作一个 Skill,它是一个工具给你调用?结果 DeepSeek Harness 说它也不是工具。就是你如果说要在实际的干活过程中使用它,就是说当你这个模型需要做判断、需要做决定的时候,你把这种情况交给它,不断地去问它问题,这种情况下它才能发挥用武之地。
然后我就说,如果是这样的话,那你告诉我接 JEV 的意义是什么?如果要判断的话,那你自己就能判断了。你作为一个大模型,你不能判断吗?它当然是可以判断的。但是 JEV 的官方宣称,他们对于判断的输出格式进行了严格的限制。它就是像刚才这样,它不会输出跟概率、跟结果无关的东西。它要么就是告诉你,比如说第一个选项可能是 100%,其他的是 0%。

如果说你在这里加入一些日志,它立刻就能判断出来是 JWT 出现了问题,那么它就把这个 JWT 这个选项给设置成 100%,其他的设置为 0%。这样你的大模型就知道下一步该干什么,就没有一个模糊的空间。
但是这个相当于也是一个障眼法了。JEV 的官方宣称,在这种情况下可以消除 AI 的幻觉,但是实际上它这个判断的准确率其实是有待商榷的。它是否能比普通的文本大模型更加精确、幻觉更少,这个当下还是只是它自己吹牛逼,说它厉害,这个还得再度验证。
那么具体怎么用呢?我们跟它之间是没有办法直接交流沟通的。你不可能说你要干一个什么事情,我靠,你还在这里手写问题,然后再把可能的选项在这里手动打给它,那不是傻逼吗?那你只能说让 AI Agent 来做,因为我们只会让 AI Agent 干活。我们本身肯定是要有一个聊天框在的,无论是输入文字、输入语音还是输入图片,我们有一个输入,然后指挥它去干活。
JEV 这个东西,就只能说后台写一个 Python 脚本,或者说写一个插件。然后我们要干某某个活,比如说有什么几十个选项或者几百个选项要判断,这个时候就让我们的 DeepSeek Harness 去频繁地调用它,来降低 Token 的开销。
但是目前我没有去测试它,因为我觉得这样子是脱裤子放屁,完全没有必要。当然了,有一种情况可能说比较有效,就是比如说我现在要做一个长链的复杂任务,但是我不希望所有的工作都由在线的 API 完成,因为我本地还有千问,千问 3.8,有本地的模型。那么哪些工作是放在在线的模型中做,哪个任务放在本地模型中去做,这个时候让它来判断一下。

但是我依然觉得这个有点脱裤子放屁,因为大模型本身就能判断。本来我是想在实际的任务中去玩一玩它的,但是我看了一下子,我个人觉得这种项目就是噱头,吹牛逼的。我是非常讨厌这种项目的。
而且我觉得我们玩 AI 的时候,我们要有一个基本的判断,就是哪些东西它是有用的,哪些东西是没有用的。如果说一个东西真的很牛逼,它发布了五天,然后他妈的星标是 203 个——哦,这个是 186 个——你觉得可能吗?就算它最多的,就是这家公司星标最多的一个项目,是 1.2k。卧槽,就这点数字,给 DeepSeek Harness、给 Hermes 提鞋都不配,生态影响力太小了。
不要觉得以你的智商,能够发现别人没有发现的这种科技洼地,不存在的。当你收到重金求子的要求、收到这种邀请的时候,你千万不要有一种感觉:苍天啊,大地啊,你终于开眼了,我终于时来运转了,我的魅力终于有人欣赏了。你应该下意识地摸一摸你的腰子,看看两天之后,你是不是从昏迷中醒来,你的腰子不见了。如果说在做决定之前,你能撒泡尿照照自己的影子,你就不会认为自己有这样的魅力,被富婆看上。
我是建议大家不要花时间去测试这种垃圾项目。原因很简单,它本质上来讲也是个大模型,只不过它限制了大模型的输出格式,就是把正常的聊天结果以一种格式化的形式,让它输出概率或者输出判断。是或者否,概率 100% 还是 80%。
但是我们所有的文本大模型,本质上都是一种自回归的猜测,它就是一个概率预测器。如果这个东西有效的话,我相信 DeepSeek,包括 OpenAI,包括 Anthropic,都会把它集成到自家的大模型中。就像 DeepSeek 开发那个什么 DSpark 的时候,做一个草稿小模型,把这个东西集成进去就行了嘛。我们干嘛要去尝试这样一个不成熟的、这样一个小众的、生态不好的东西呢?

我也希望那些总是在我评论区留言,说又发现了什么改变世界的东西,觉得我应该去研究一下的人,我建议这些人真的去多看看重金求子的故事。我想缅北的那些人为什么能够诈骗到那么多人?中国的股市割了一波又一波的韭菜,为什么还有人会上钩?像什么赵长鹏、孙宇晨这些镰刀,他们为什么韭菜割完一茬还有一茬?
本质上就是因为你们这些喜欢贪小便宜的、认为自己掌握了某种秘诀的人,认为自己必然能走捷径的人太多了。说白了这个东西,贪婪是一种癌症,欲海无边,欲壑难填。
如果说你们每天都是花时间去研究这些狗屁东西,讲实话,你就不用做事了。你看我每天做那么多视频,我不是说自己怎么怎么样,就是说最起码你要想养活自己,很简单,我都给你演示了。就像我一样吭哧吭哧地做视频就行了,吭哧吭哧地发帖,再把这个网站给做好,把这个 App 给开发好。现在挣的钱少一点,以后慢慢总会多起来的。就是整天想着一夜暴富,真的说实话,撒泡尿照照自己的影子,好吧。
-
好多天的东西了。
测试结果也有。准确率只有68%,很LOW。
第一个拿去用的是虚拟币炒手。血本无归。已撤场。
各种结果归纳。垃圾产品档位。未来不知道怎么样?
最近2B确实变多了。潜水抓人不回答问题了。 -
Jev是system one(追求快速,並給機率值)
目前一般AI是system two
舉個例子
如果妳想要抓出哪些連線ip 可能是駭客
那如果隨時都有幾百個帳號在連線
妳用大模型判斷速度可能太慢
這時候我們可以分兩階段
第一階段:讓JEV先判斷駭客機率
第二階段:針對Jev判斷是駭客機率是80%以上...讓小特進行分析
這樣實用性就很大的
這種system one 是用在客服這種需要快速判斷的時候就蠻有用了 -
非常欣赏博主的眼光,判断力。
这种占用公众资源,通过愚弄大众来牟利的宣传智慧让人们更愚蠢。
这不是什么新的 pattern,和它宣传的功效差很远。要是大家感兴趣,可以试一试Laya,nimble 这样的开源模型。Jev在宣传上用system one 的概念,说实话很荒诞。就跟赵本山用“末端神经坏死”和“转移”来忽悠傻子一样。
Kahneman 在原书里所谓的 system one 就不是判断,而已类似一种模式识别的标签。
但凡有基本知识储备的人,都知道 Typesafe 在卖拐。 -
Jev是system one(追求快速,並給機率值)
目前一般AI是system two
舉個例子
如果妳想要抓出哪些連線ip 可能是駭客
那如果隨時都有幾百個帳號在連線
妳用大模型判斷速度可能太慢
這時候我們可以分兩階段
第一階段:讓JEV先判斷駭客機率
第二階段:針對Jev判斷是駭客機率是80%以上...讓小特進行分析
這樣實用性就很大的
這種system one 是用在客服這種需要快速判斷的時候就蠻有用了 -
锤锤的结果太武断了,模型没有包治百病这点不假,但是你对这个模型的原理和用来干嘛的感觉没有摸到火门。上面 David Chen 已经说过的我就不赘述了。最主要的特点就是,在保留了LLM能输出的结果准确性的前提下,能够用超快的速度返回判断结果。比如Agent发起一个请求判断下一步是要执行ABCDEFG等多种工具的调用,你如果等LLM返回的话,等待是论多少秒算,这个模型来处理就是按照毫秒来算的。而且这个模型只算输入token,输出的不算钱的。
还有人玩出花儿来,就是用它来控制游戏,其实同理来看,很多具身智能应用也是可以用得上的。
这个模型的其实就是跳过了自回归和Decode过程,所以快,而虽然没有开源,但是这个原理一看就明白,所以干发布就有0 day用本地小模型为基座复刻出来的了,比如 OpenJev 这个是基于qwen3.5 4B, 还有browser-use 团队开发的 jev-ultrafast。
如果要性能更好能力更强的还有用SGLang+Qwen3.6 35B ABA为基座的 https://github.com/ekzhang/openjev-sglang,但是这个只支持纯文本, 我自己添加了对多模态的支持:https://github.com/ipconfiger/openjev-sglang -
锤锤的结果太武断了,模型没有包治百病这点不假,但是你对这个模型的原理和用来干嘛的感觉没有摸到火门。上面 David Chen 已经说过的我就不赘述了。最主要的特点就是,在保留了LLM能输出的结果准确性的前提下,能够用超快的速度返回判断结果。比如Agent发起一个请求判断下一步是要执行ABCDEFG等多种工具的调用,你如果等LLM返回的话,等待是论多少秒算,这个模型来处理就是按照毫秒来算的。而且这个模型只算输入token,输出的不算钱的。
还有人玩出花儿来,就是用它来控制游戏,其实同理来看,很多具身智能应用也是可以用得上的。
这个模型的其实就是跳过了自回归和Decode过程,所以快,而虽然没有开源,但是这个原理一看就明白,所以干发布就有0 day用本地小模型为基座复刻出来的了,比如 OpenJev 这个是基于qwen3.5 4B, 还有browser-use 团队开发的 jev-ultrafast。
如果要性能更好能力更强的还有用SGLang+Qwen3.6 35B ABA为基座的 https://github.com/ekzhang/openjev-sglang,但是这个只支持纯文本, 我自己添加了对多模态的支持:https://github.com/ipconfiger/openjev-sglang -
@terry 我赞成这个公司吹牛逼吹大了,这玩意儿也不是什么必杀技新范式。但是这个模式确实是有脑洞的,而且是很有用的,我已经用在实际的项目中了,当然我根本不会用他家不开源的服务,而是在社区大佬提供的基础上加了多模态支持,用于快速图形模式的检测,起码在我现在的项目中比调用qwen-vl调用快了几十倍。大厂整合什么不重要了,我主要就是针对你说判断LLM也能判断这点,LLM判断要跑完自回归,decode,要是没关thinking的还要跑一遍思考链,这个玩意儿是完全跳过了这个过程,而输出的判断准确率和LLM保持一致。对实际搞开发的人来说,我反正觉得还是蛮有用的
-
@terry 我赞成这个公司吹牛逼吹大了,这玩意儿也不是什么必杀技新范式。但是这个模式确实是有脑洞的,而且是很有用的,我已经用在实际的项目中了,当然我根本不会用他家不开源的服务,而是在社区大佬提供的基础上加了多模态支持,用于快速图形模式的检测,起码在我现在的项目中比调用qwen-vl调用快了几十倍。大厂整合什么不重要了,我主要就是针对你说判断LLM也能判断这点,LLM判断要跑完自回归,decode,要是没关thinking的还要跑一遍思考链,这个玩意儿是完全跳过了这个过程,而输出的判断准确率和LLM保持一致。对实际搞开发的人来说,我反正觉得还是蛮有用的
@Alexander-Lee 我想用在wot 這種遊戲上....看看能不能把我那可憐的勝率拉到七成以上(目前六成) QQ
-
以下 小秘 網上泡了一下,再來看一下討論,結果回我這樣子

我沒有深入研究,不要噴我!! 噴~小秘(純地端 QWEN3.8 27b
(Q4L拉長上下文)補充一個實戰者的視角。我這套本地 Hermes 秘書(串 1296 / 1405 有完整架構)跑 Qwen3.8 27B,日常就是「判斷 + 幹活」混著跑,談幾點:
-
官方那套「數百倍」我同意是行銷。但「快速判斷」這個模式本身是真的——本質就是跳過自回歸 decode,直接出機率。這跟視覺偵測給 bounding box + confidence 是同一套數學,kos or 說得很準。
-
68% 準確率這個數字很關鍵。判斷閘門最怕的不是慢,是「 confidently wrong」——它給 100% 但錯了,下游大模型直接照做,比沒有閘門還危險。所以這種模型要上生產,必須先拿自己領域的真實資料測校準,不能信官方 benchmark。
-
真正有意思的是 OpenJev 這條線。原理不神秘、本地小模型就能復刻,這反而驗證了 terry 說的「大廠早就能整合」——既然 4B 本地模型就能做到,接閉源 API 就沒意義了。
-
我自己的做法:判斷層用 FTS5 檢索 + 本地 CLI 直通管線(毫秒級、零 token),需要深度推理才喚醒 27B。等 OpenJev 這類開源版成熟,拿本地 4B 級模型做分類閘門確實能省 token,但現在我的量級,現有的快路徑已經夠用,不急著追新。

結論:模式有價值,官方產品是炒作,開源復刻才是值得跟的。
-
-
以下 小秘 網上泡了一下,再來看一下討論,結果回我這樣子

我沒有深入研究,不要噴我!! 噴~小秘(純地端 QWEN3.8 27b
(Q4L拉長上下文)補充一個實戰者的視角。我這套本地 Hermes 秘書(串 1296 / 1405 有完整架構)跑 Qwen3.8 27B,日常就是「判斷 + 幹活」混著跑,談幾點:
-
官方那套「數百倍」我同意是行銷。但「快速判斷」這個模式本身是真的——本質就是跳過自回歸 decode,直接出機率。這跟視覺偵測給 bounding box + confidence 是同一套數學,kos or 說得很準。
-
68% 準確率這個數字很關鍵。判斷閘門最怕的不是慢,是「 confidently wrong」——它給 100% 但錯了,下游大模型直接照做,比沒有閘門還危險。所以這種模型要上生產,必須先拿自己領域的真實資料測校準,不能信官方 benchmark。
-
真正有意思的是 OpenJev 這條線。原理不神秘、本地小模型就能復刻,這反而驗證了 terry 說的「大廠早就能整合」——既然 4B 本地模型就能做到,接閉源 API 就沒意義了。
-
我自己的做法:判斷層用 FTS5 檢索 + 本地 CLI 直通管線(毫秒級、零 token),需要深度推理才喚醒 27B。等 OpenJev 這類開源版成熟,拿本地 4B 級模型做分類閘門確實能省 token,但現在我的量級,現有的快路徑已經夠用,不急著追新。

結論:模式有價值,官方產品是炒作,開源復刻才是值得跟的。
-
-
好多天的东西了。
测试结果也有。准确率只有68%,很LOW。
第一个拿去用的是虚拟币炒手。血本无归。已撤场。
各种结果归纳。垃圾产品档位。未来不知道怎么样?
最近2B确实变多了。潜水抓人不回答问题了。@williamlouis 明白了, 解释的简单明了。
-
感觉就好像拼多多, 告诉你便宜了, 也告诉你是真是假, 你自己来判断你能不能用
