跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. GPT6 Astra编程实测,一个请求消耗10美金吓傻穷博主,泪流满面!轻度任务没有明显优势,重度任务用不起!

GPT6 Astra编程实测,一个请求消耗10美金吓傻穷博主,泪流满面!轻度任务没有明显优势,重度任务用不起!

已定时 已固定 已锁定 已移动 LLM讨论区
gpt
3 帖子 2 发布者 151 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT 离线
    terryT 离线
    terry
    超级版主
    编写于 最后由 terry 编辑
    #1

    GPT-6 发布了,这个讲实话是近期非常重磅的一个发布,号称跑分非常牛逼,然后超越了 Claude 的 Fable 5.1,是吧?超越了它的 Mythos 5.1 模型,说 OpenAI 又咸鱼翻身了。那么评论区有人就留言让我测一下。

    说实话,OpenAI 的模型跟 Anthropic 的模型一般我是不怎么测试的。我偶尔可能在 OpenRouter 上面,用网页聊天的方式去玩一玩,因为我一般充钱就充个 10 美金左右,就是轻度使用一下。或者像什么 GLM 这些模型可以免费使用的时候,我就测一下,我就是为了薅羊毛。因为一旦把它接入到 Codex、Hermes,或者接入到 DeepSeek Harness,那么它的消耗是非常惊人的,我是用不起的。

    我平时不是订阅了一个 Plus 版本吗?很多人问我说,你为什么不用这个额度,就这个额度给它空着?这个讲实话,你看看,今天我用了一下,消耗了 6% 的额度,5 小时之内。它就干了一个什么任务呢?就这么简单的一个任务,花了我 4 分钟 5 秒,然后消耗了我 6% 的额度,使用的是 GPT-5.6 Terra。

    GPT6实测太贵.jpeg

    当然有人问我为什么不用 Luna,我反正觉得 Luna 不好用。我也不知道他们说好用是基于什么样子的情况,说把什么思考模式给它开到高、开到最高。但是怎么讲呢,我个人感觉是没有什么卵用的。因为你把 GPT-5.6 Luna 的思考额度开高之后,它的 tokens 消耗、额度消耗,并不会比 GPT-5.6 Terra 用轻度要低。然后还有很多人说,他们订阅了 Plus 计划之后,用 Terra 或者 Sol 模型去布置任务,然后用 GPT-5.6 Luna 来执行任务。总之意思就是我不会用。

    我说实话,20 美金一个月,我买来主要是用来生图的。我不是有几个 YouTube 频道嘛,我主要是用它来做封面。我就愿意花这 100 多块钱一个月去干这个事情,我也懒得去研究它。它不能用啊,你用它随便干个小活,额度就不够了,你说用它干什么?我不喜欢这样子。用一个 AI,我还要怎么去计算它?要么我用不起,我就不用。我就用 DeepSeek V4,还有我本地部署的千问 3.8 27B,我可以用得很舒爽,干嘛要强迫自己呢?

    但是既然大家一定要我来测,那我也就勉为其难嘛。打开网页聊天界面,选择 GPT-6 Astra。第一个就是我们传统的老项目,让它生成一个网页表达中国的传统八卦文化。它的速度还是比较快的,很快就给我交货了。这个怎么说呢,比 DeepSeek V4 Flash 要慢一点,跟 DeepSeek V4 Pro 是差不多的速度。在线模型中能跟 DeepSeek V4 Flash 比响应速度的,可以说寥寥无几。

    1c133126-3318-42b6-a7ff-fb73de10d000-image.jpeg

    那么这个结果我们把它复制下来,看看它给出来的交付成果怎么样。就是非常好,简洁清爽。这个跟 DeepSeek V4 Flash 的效果差不多吧,跟 Pro 的效果也是差不多的,反正在这一方面没有什么明显的差距。它这个页面给得还是有点简单了,但是它把太极鱼眼都画对了,说明这个模型本身的智力是没有问题的。我给打 95 分,但是这个模型确实是有点贵,它消耗了我 0.28 美元。
    bagua.html

    下面这个任务是生成一个 SVG,表达钍基熔盐堆运行原理图。这个交付也是比较快的,这个任务消耗了我 0.27 美元。看看这个效果,中规中矩吧。因为之前包括 GLM、Kimi、小米、DeepSeek V4 Pro、千问 3.8 27B,我都给出了类似的图。我可以说这个图是简单清爽,我可以打 90 分,但是比起小米,我觉得它是要差的。它也不比 V4 Flash 或者 V4 Pro 强什么,90 分吧,简单清爽,比较符合我的风格。可能对于有些特别喜欢效果的人来讲,这个可能只能达到 80 分甚至更低,但是我就喜欢这种。

    tmsr.svg

    下面就是生成一个 SVG,表达薛定谔的猫思想实验。这个任务也耗了我 0.27 美元,就三个任务耗了我一美金嘛。我知道其实是挺贵的,尤其是作为网页聊天。我看看这个效果,这个讲实话有点名不副实了。你老是简洁简洁,你也画得一点特效都没有。虽然比较符合我的这种审美,这个我给 80 分吧。讲实话,对它这样一个旗舰级的模型,交出这样的答卷,以它的价格,三个这样小小的聊天任务消耗了我一美金,我觉得这个就贵得离谱。

    schrodingers-cat.svg

    但是我低估了这个模型。其实我当时是在犹豫,要不要把它接入到我的 Codex 里面来。因为如果说我把它接入到 Codex,比如继续开发我的 APP,一次长上下文灌下去,对于这个 APP 的理解,我怀疑它就会把我这个任务给干翻。但是我想既然来都来了,咱怎么也得测一下吧。好吧,我这个账户上还有 7 美金左右,我就来测一下吧。

    然后你们看到没有,我截了一个图,这是非常简单的任务。就是说这个帖子回复的时候,我希望它这个引用限制一下长度,然后这个格式修得好看一点,再把这个光标给停到最后一行的下方。这是个非常简单的任务,如果用 DeepSeek V4 Flash 来搞的话,我觉得可能一分钟左右,一分钟到两分钟之间可以搞定,然后消耗的钱绝对不会超过两毛钱的,反正两三毛钱它肯定是能搞定的。

    然后它突然间提示我什么 402 Payment Required,就是额度不够了,需要支付。我当时就懵逼了,卧槽,我这刚刚才还有 7 美金啊!你这一个任务才理解了一下,还没开始做呢,你就把我 7 美金给干光了,这好歹 50 块钱啊。然后我就想来找一下看看是怎么回事。我们从这里看,我从 7 美金到负债 2.5 美金,我直接懵逼了。

    GPT6一个任务耗光额度

    看一下使用,这个要给大家证明。我今天就用了它一个,就这一个任务,一个请求 9 美金出头。因为刚才网页聊天还花了将近一美金嘛,就 10 美金,60 块钱就干了这么点活。卧槽,这个讲实话,都超出我用 DeepSeek 干脏活的时候了。干脏活、重活,疯狂开发的那一天,我才花了 40 块钱。而且那一天是一个 AI 视频生成器、剪辑器,加上我的论坛程序,就那两天在疯狂开发,我才耗了这么多钱。结果我就跟它一个简单的对话,它就干了我 10 美金。

    我不知道这样的 AI 发布有什么意义。可能美国人能够用得起吧,我相信美国人平均收入比如说是我的 3 倍、5 倍,这个应该是正常的,这个可以理解。但是咱也是赚过钱的人,也是见过世面的人,我说实话,我也不相信美国人人都那么有钱。就算是比我有钱 5 倍,你们平均的这些 AI 使用者,收入都在我的 5 倍甚至 10 倍,你们真的能用得起吗?这个我觉得是要考虑一下的。

    就这么傻逼的一个任务,它居然 10 美金就在一次请求中就被干掉了。我真的很难想象这样的 AI 有谁能用得起。你如果说你的 AI 做出来只是为了服务华尔街的那些头部富豪、那些高收入者,那 1%、2% 的人群,那是没有问题的。但是如果说要我们这些普罗大众来用,无论你怎么订阅,我觉得都没办法用。

    你像我刚才就用 GPT-5.6 Terra 做了一个非常简单的接入任务,这个在 DeepSeek V4 上可能连一毛钱都花不了,它就消耗了我 6% 的额度。你说这样的 AI 它能有生产力吗?你说它能干什么吧?它对于我们普通人来说,它能干什么?

    GPT5.6 Terra Codex额度消耗

    但是我们必须说,这个模型它本身贵,不是模型的问题,贵是我们这些人的问题,是我们自己的问题,因为我们穷嘛。所以说我在我的频道中,大家问我为什么不去测什么 GPT,测什么 Claude。讲实话,我努努力,我还是能用得起的,但是我可以说,我频道 90% 的观众,你们都用不起。我们既然穷,就坚守我们穷人的道路。我们把本地的千问 27B 给用好,到论坛看看大家是怎么部署的。

    在这种情况下,你是不是忽然间觉得本地部署 AI 非常有意义呢?就像这么一个傻逼的开发要求,这么一个简单的开发要求,用千问 3.8 27B 可以非常轻松地把它搞定。但是你用在线的 AI,你确信你都用得起吗?

    当然了,我们说用 DeepSeek V4 Flash,你就可着它花吧。一个月大概就按照我最高强度开发的时候,一个月花个 1000 块钱出头,你可以想怎么用怎么用。其实正常的话,一个月你能花个 500 块钱,就能够满足绝大部分人的需求了。我们国产的模型还是有我们国产的好处的。

    就那些在我频道吹牛逼,说什么花 200 美金去订阅 Claude,或者订阅 GPT 顶级模型的人,然后他们就够用了,我觉得他们没有在真正干活。如果他们真正干活的话,他们那点狗屁额度,标 200 美金那点额度根本就不够用。因为之前我是订阅过那个 30 美金的 Super Grok,你看起来额度挺多的,实际上干不了什么活,很快就没了。你就算翻个 6 倍,你又能怎么样呢?

    对于我们这样普通人,可能轻度开发的话,200 美金的订阅肯定是够了。但是对于程序员来说,你要说 200 美金一个月的订阅够你用,那纯粹就是扯淡。

    Openrouter API消耗

    但是不管怎么样,一会儿还要去充钱,再充个 15 美金。OpenRouter 这个平台我还是要用的,我还用它来测试一些我们国产的免费模型。它已经是一个 AI 发布的最重要的平台。比如像 OxAlpha、HY,它们都有长期免费的经历。薅一薅羊毛,它是非常划算的。我在这个平台还是没有亏的,我在这个平台唯一亏的一次就是被 GPT 给宰了。

    哦,上一次是 Claude。Claude 也是。我为什么后来不做?我跟你讲,就是因为上一次我测 Claude 的时候,它也是一模一样的情况。所以这一次为什么我比较担心?我为什么要先在网页上把几个简单的小任务跑了,而不是上来就接入 Codex?因为就怕它把我额度一下子干光。上一次就是在测试 Claude 的时候,我当时是 25 美金还是多少,一个任务它把我给干光了。

    我记得哪个网红曾经说过的:“你这么穷,为什么不反思一下自己呢?”是吧,哈哈。我们好好地反思一下自己,以后这种高端的模型就尽量少去测它。

    油管:https://www.youtube.com/@抡锤者

    1 条回复 最后回复
    1
    • terryT 离线
      terryT 离线
      terry
      超级版主
      编写于 最后由 编辑
      #2

      Youtube Video

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      1
      • kos orK 离线
        kos orK 离线
        kos or
        超凡大师
        编写于 最后由 kos or 编辑
        #3

        Local LLM 不用錢呀 裝就是了 😁

        1 条回复 最后回复
        1

        你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

        厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

        有了你的建议,这篇帖子会更精彩哦 💗

        注册 登录
        回复
        • 在新帖中回复
        登录后回复
        • 从旧到新
        • 从新到旧
        • 最多赞同


        • 登录

        • 登录或注册以进行搜索。
        • 第一个帖子
          最后一个帖子
        0
        • 版块
        • 最新
        • 标签
        • 热门
        • 用户
        • 群组