GPT6 Astra编程实测,一个请求消耗10美金吓傻穷博主,泪流满面!轻度任务没有明显优势,重度任务用不起!
-
GPT-6 发布了,这个讲实话是近期非常重磅的一个发布,号称跑分非常牛逼,然后超越了 Claude 的 Fable 5.1,是吧?超越了它的 Mythos 5.1 模型,说 OpenAI 又咸鱼翻身了。那么评论区有人就留言让我测一下。
说实话,OpenAI 的模型跟 Anthropic 的模型一般我是不怎么测试的。我偶尔可能在 OpenRouter 上面,用网页聊天的方式去玩一玩,因为我一般充钱就充个 10 美金左右,就是轻度使用一下。或者像什么 GLM 这些模型可以免费使用的时候,我就测一下,我就是为了薅羊毛。因为一旦把它接入到 Codex、Hermes,或者接入到 DeepSeek Harness,那么它的消耗是非常惊人的,我是用不起的。
我平时不是订阅了一个 Plus 版本吗?很多人问我说,你为什么不用这个额度,就这个额度给它空着?这个讲实话,你看看,今天我用了一下,消耗了 6% 的额度,5 小时之内。它就干了一个什么任务呢?就这么简单的一个任务,花了我 4 分钟 5 秒,然后消耗了我 6% 的额度,使用的是 GPT-5.6 Terra。

当然有人问我为什么不用 Luna,我反正觉得 Luna 不好用。我也不知道他们说好用是基于什么样子的情况,说把什么思考模式给它开到高、开到最高。但是怎么讲呢,我个人感觉是没有什么卵用的。因为你把 GPT-5.6 Luna 的思考额度开高之后,它的 tokens 消耗、额度消耗,并不会比 GPT-5.6 Terra 用轻度要低。然后还有很多人说,他们订阅了 Plus 计划之后,用 Terra 或者 Sol 模型去布置任务,然后用 GPT-5.6 Luna 来执行任务。总之意思就是我不会用。
我说实话,20 美金一个月,我买来主要是用来生图的。我不是有几个 YouTube 频道嘛,我主要是用它来做封面。我就愿意花这 100 多块钱一个月去干这个事情,我也懒得去研究它。它不能用啊,你用它随便干个小活,额度就不够了,你说用它干什么?我不喜欢这样子。用一个 AI,我还要怎么去计算它?要么我用不起,我就不用。我就用 DeepSeek V4,还有我本地部署的千问 3.8 27B,我可以用得很舒爽,干嘛要强迫自己呢?
但是既然大家一定要我来测,那我也就勉为其难嘛。打开网页聊天界面,选择 GPT-6 Astra。第一个就是我们传统的老项目,让它生成一个网页表达中国的传统八卦文化。它的速度还是比较快的,很快就给我交货了。这个怎么说呢,比 DeepSeek V4 Flash 要慢一点,跟 DeepSeek V4 Pro 是差不多的速度。在线模型中能跟 DeepSeek V4 Flash 比响应速度的,可以说寥寥无几。

那么这个结果我们把它复制下来,看看它给出来的交付成果怎么样。就是非常好,简洁清爽。这个跟 DeepSeek V4 Flash 的效果差不多吧,跟 Pro 的效果也是差不多的,反正在这一方面没有什么明显的差距。它这个页面给得还是有点简单了,但是它把太极鱼眼都画对了,说明这个模型本身的智力是没有问题的。我给打 95 分,但是这个模型确实是有点贵,它消耗了我 0.28 美元。
bagua.html下面这个任务是生成一个 SVG,表达钍基熔盐堆运行原理图。这个交付也是比较快的,这个任务消耗了我 0.27 美元。看看这个效果,中规中矩吧。因为之前包括 GLM、Kimi、小米、DeepSeek V4 Pro、千问 3.8 27B,我都给出了类似的图。我可以说这个图是简单清爽,我可以打 90 分,但是比起小米,我觉得它是要差的。它也不比 V4 Flash 或者 V4 Pro 强什么,90 分吧,简单清爽,比较符合我的风格。可能对于有些特别喜欢效果的人来讲,这个可能只能达到 80 分甚至更低,但是我就喜欢这种。
下面就是生成一个 SVG,表达薛定谔的猫思想实验。这个任务也耗了我 0.27 美元,就三个任务耗了我一美金嘛。我知道其实是挺贵的,尤其是作为网页聊天。我看看这个效果,这个讲实话有点名不副实了。你老是简洁简洁,你也画得一点特效都没有。虽然比较符合我的这种审美,这个我给 80 分吧。讲实话,对它这样一个旗舰级的模型,交出这样的答卷,以它的价格,三个这样小小的聊天任务消耗了我一美金,我觉得这个就贵得离谱。
但是我低估了这个模型。其实我当时是在犹豫,要不要把它接入到我的 Codex 里面来。因为如果说我把它接入到 Codex,比如继续开发我的 APP,一次长上下文灌下去,对于这个 APP 的理解,我怀疑它就会把我这个任务给干翻。但是我想既然来都来了,咱怎么也得测一下吧。好吧,我这个账户上还有 7 美金左右,我就来测一下吧。
然后你们看到没有,我截了一个图,这是非常简单的任务。就是说这个帖子回复的时候,我希望它这个引用限制一下长度,然后这个格式修得好看一点,再把这个光标给停到最后一行的下方。这是个非常简单的任务,如果用 DeepSeek V4 Flash 来搞的话,我觉得可能一分钟左右,一分钟到两分钟之间可以搞定,然后消耗的钱绝对不会超过两毛钱的,反正两三毛钱它肯定是能搞定的。
然后它突然间提示我什么 402 Payment Required,就是额度不够了,需要支付。我当时就懵逼了,卧槽,我这刚刚才还有 7 美金啊!你这一个任务才理解了一下,还没开始做呢,你就把我 7 美金给干光了,这好歹 50 块钱啊。然后我就想来找一下看看是怎么回事。我们从这里看,我从 7 美金到负债 2.5 美金,我直接懵逼了。

看一下使用,这个要给大家证明。我今天就用了它一个,就这一个任务,一个请求 9 美金出头。因为刚才网页聊天还花了将近一美金嘛,就 10 美金,60 块钱就干了这么点活。卧槽,这个讲实话,都超出我用 DeepSeek 干脏活的时候了。干脏活、重活,疯狂开发的那一天,我才花了 40 块钱。而且那一天是一个 AI 视频生成器、剪辑器,加上我的论坛程序,就那两天在疯狂开发,我才耗了这么多钱。结果我就跟它一个简单的对话,它就干了我 10 美金。
我不知道这样的 AI 发布有什么意义。可能美国人能够用得起吧,我相信美国人平均收入比如说是我的 3 倍、5 倍,这个应该是正常的,这个可以理解。但是咱也是赚过钱的人,也是见过世面的人,我说实话,我也不相信美国人人都那么有钱。就算是比我有钱 5 倍,你们平均的这些 AI 使用者,收入都在我的 5 倍甚至 10 倍,你们真的能用得起吗?这个我觉得是要考虑一下的。
就这么傻逼的一个任务,它居然 10 美金就在一次请求中就被干掉了。我真的很难想象这样的 AI 有谁能用得起。你如果说你的 AI 做出来只是为了服务华尔街的那些头部富豪、那些高收入者,那 1%、2% 的人群,那是没有问题的。但是如果说要我们这些普罗大众来用,无论你怎么订阅,我觉得都没办法用。
你像我刚才就用 GPT-5.6 Terra 做了一个非常简单的接入任务,这个在 DeepSeek V4 上可能连一毛钱都花不了,它就消耗了我 6% 的额度。你说这样的 AI 它能有生产力吗?你说它能干什么吧?它对于我们普通人来说,它能干什么?

但是我们必须说,这个模型它本身贵,不是模型的问题,贵是我们这些人的问题,是我们自己的问题,因为我们穷嘛。所以说我在我的频道中,大家问我为什么不去测什么 GPT,测什么 Claude。讲实话,我努努力,我还是能用得起的,但是我可以说,我频道 90% 的观众,你们都用不起。我们既然穷,就坚守我们穷人的道路。我们把本地的千问 27B 给用好,到论坛看看大家是怎么部署的。
在这种情况下,你是不是忽然间觉得本地部署 AI 非常有意义呢?就像这么一个傻逼的开发要求,这么一个简单的开发要求,用千问 3.8 27B 可以非常轻松地把它搞定。但是你用在线的 AI,你确信你都用得起吗?
当然了,我们说用 DeepSeek V4 Flash,你就可着它花吧。一个月大概就按照我最高强度开发的时候,一个月花个 1000 块钱出头,你可以想怎么用怎么用。其实正常的话,一个月你能花个 500 块钱,就能够满足绝大部分人的需求了。我们国产的模型还是有我们国产的好处的。
就那些在我频道吹牛逼,说什么花 200 美金去订阅 Claude,或者订阅 GPT 顶级模型的人,然后他们就够用了,我觉得他们没有在真正干活。如果他们真正干活的话,他们那点狗屁额度,标 200 美金那点额度根本就不够用。因为之前我是订阅过那个 30 美金的 Super Grok,你看起来额度挺多的,实际上干不了什么活,很快就没了。你就算翻个 6 倍,你又能怎么样呢?
对于我们这样普通人,可能轻度开发的话,200 美金的订阅肯定是够了。但是对于程序员来说,你要说 200 美金一个月的订阅够你用,那纯粹就是扯淡。

但是不管怎么样,一会儿还要去充钱,再充个 15 美金。OpenRouter 这个平台我还是要用的,我还用它来测试一些我们国产的免费模型。它已经是一个 AI 发布的最重要的平台。比如像 OxAlpha、HY,它们都有长期免费的经历。薅一薅羊毛,它是非常划算的。我在这个平台还是没有亏的,我在这个平台唯一亏的一次就是被 GPT 给宰了。
哦,上一次是 Claude。Claude 也是。我为什么后来不做?我跟你讲,就是因为上一次我测 Claude 的时候,它也是一模一样的情况。所以这一次为什么我比较担心?我为什么要先在网页上把几个简单的小任务跑了,而不是上来就接入 Codex?因为就怕它把我额度一下子干光。上一次就是在测试 Claude 的时候,我当时是 25 美金还是多少,一个任务它把我给干光了。
我记得哪个网红曾经说过的:“你这么穷,为什么不反思一下自己呢?”是吧,哈哈。我们好好地反思一下自己,以后这种高端的模型就尽量少去测它。
