OxAlpha是GLM5.3?实测编程很强,强于Qwen 27B和DeepSeek V4 Flash,不如V4 Pro! 1M上下文翻车,召回准确率不够!
-
谈一下大家关注的 OxAlpha。大家都把这个模型叫做“牛”来,也是蹭热点了,确实有这个意思。Alpha 是即将发布的版本,Ox 是牛。我们知道著名的牛津大学叫 Oxford,它那个地方 Oxford,Ford 就是渡口的意思,这个牛津就是牛的渡口,可能是那个地方集中贩牛,还是运输牛?
大家都说这个模型非常牛逼,普遍猜测是 GLM 5.3。由于之前我把小米的 MiMo 误认作 DeepSeek V4,所以我也就不装逼了,这次我们不瞎定论,就说大概率它是 GLM 5.3。大家说这个编程能力特别牛逼,一定要我测试一下。事实上我对 GLM 的尿性摸得比较准,你说这家模型不行吗?它的编程能力确实是不错的。但是你说它很牛逼吗?它比 DeepSeek V4 Pro 牛逼,我是打死都不信的。性价比那更不用说了,除非你在某些时间段买到了它的 Coding Plan,否则光 API 调用肯定是不能跟 DeepSeek 相比的。我就把结论先放在这里,那么我们带着这种主观偏见进入测试,看看能不能打脸。

从这个地方开始,就我开发这个 App 的会话,后期我就把它固定了,不切换会话了。我不管测试什么模型,无论是 DeepSeek V4 Pro,还是 GPT,还是千问 3.8-27B 的 Q4、Q5、FP8 版本,Q5 已经被我删了,没有必要了。它的驱动是 7900 XTX 还是 4090D 48G,它的框架是 llama.cpp 还是 SGLang,我都一视同仁。除了在这里,我还会在 DeepSeek Harness 或者 Hermes 上对它们进行比较详细的测试。
但是今天比较可惜,OpenRouter 上面给我开放的免费额度,按理说应该每天有 1000 次调用,但是我只调用了很少的几个任务,它就不让我调用了。其实我前面为什么不想测试,就是因为我白天让它给我干了三个任务,它就罢工了。我就觉得这个模型没有必要去测试,知道吗?就非常烦。你要么就不要开放免费,你要开放免费,就把量给足了。你又免费立牌坊,吸引别人过来用你,然后执行了几个任务之后,我操,额度就超了。你这不是浪费别人的时间吗?你都不值得我花配置的这点时间。
那么抛开这些主观偏见,它的能力如何呢?我个人感觉是在千问 3.8-27B、DeepSeek V4 Flash 之上,但是应该是不如 Pro 的,最起码它肯定不会比 Pro 强。那你说为什么在 DeepSeek V4 Flash 以上?就是当时它在实现一个功能的时候,App 里面有多处使用到同样的头像跳转功能,但是它们实现在不同的函数里面。它觉得应该把它封装到一起,然后在实现新功能的时候,就把这个问题统一了。这个东西如果你不跟千问去讲,不跟 V4 Flash 去讲的话,它是不会关心这些话题的,它就关心你当下的功能。

这个 GLM 有点像什么?有点像 Claude,有点像 GPT 5.6 Sol 里把 Thinking 给它开高一点,是比较像美国的模型的。这就说明它的基础能力是不会差的。但是我也必须说,它的响应速度真的是慢成狗屎。就这么一个简单的小功能,它给我花了 6 分钟时间搞定。如果是 V4 Flash 的话,两分钟之内肯定能搞定。如果是千问 3.8-27B,用 7900 XTX 在本地驱动的 128K 上下文 Q4_K_M 量化版本,它的时间应该跟这个差不多,或者说大概七八分钟,比 OxAlpha 要略慢一点。作为一个在线模型,我认为慢成这个鸟样,已经是没有什么意义了,这是一个非常大的短板。
然后它是有识图模式的,执行一些小的 Bug 修改,它都能搞得定。你还别说,现在开发这个 App 已经成为我的小乐趣了,我也不急于把它完成,但是每天把这些 Bug 完善一下,把这些小功能完善一下,都挺好的。这样子多好,是一个消遣,省得我测试模型就凭自己去瞎想,想一些大家不太认同的偏僻任务。那就在实际的开发中来完善这些小功能,它实际上现在已经基本上能用了,只有一点点地方需要再完善,慢慢来吧,不急。

我打算是在过年的时候再给它上线,因为现在网站的网页版本,其实在手机上适配已经非常好了,然后在 PC 端的适配也是非常漂亮,已经足够大家使用了。我看过阵子要么就抽点时间来把这个 App 完善一下,如果大家想用的话,把它提前发布也可以。就是不着急,这是我的一个消遣项目。
另外就要提一下,它号称是 1M 上下文,我个人感觉它的召回准确率是非常低的,它不行。它给我的感觉是,上下文长度最起码相比于千问 3.8-27B 在我本地给它开放的 128K 上下文,是没有什么明显优势的。怎么说呢?我打断它的指令,然后给它发一个新的消息,就像这样,它实际上会搞错我的意思。这个就是上下文召回准确率不够,用专业的术语来讲,就是大海捞针实验中它的得分不高。它的上下文是有这个长度,我说什么,它也能从这个上下文中去捞,但是它捞得不对,准确率不高。
要知道你跟 DeepSeek V4 Flash 或者 V4 Pro 沟通的话,尤其是 V4 Pro,它的上下文召回准确率,我可以说是非常高的。我之前多次展示过,这个上下文到 700K 之后它还没压缩,是实打实地给你跑 700K 的上下文,它也是标称 1M。OxAlpha 就这么几轮会话,我讲实话,它这个召回就出了问题,甚至我都怀疑它的上下文有没有千问稳,我都不好说。那些非常尬吹 GLM 特别牛逼的,我也只能说你们开发的项目可能还是简单了一点,或者说你们迭代的轮数、迭代的步数都不够。

真正实打实的项目,你只要把它拉进来,就很容易看出问题。讲实话,就这个项目,比起我做的那个剪辑器,难度要低很多,低不止一个级别。但是 DeepSeek V4 Pro 在我用 Harness 驱动它的时候,就 DeepSeek Harness 加 DeepSeek V4 Pro 去开发这个剪辑器的时候,它表现出来的那种在长上下文环境中的召回准确率,是令我印象非常深刻的。我其实在以前的视频中贴过图,大家可以去找一下。因为我现在用 OBS 录屏,我就不打算后期配图了,这样子我制作视频的成本比较低,但是之前我是明确发布过的。
就在 Hermes 上,当时我的设置是 512K 上下文,它在 Hermes 上跑 512K 的时候,这个召回准确率是一点问题都没有的。然后我在 DeepSeek Harness 上面是 700 多 K 上下文,它的召回准确率也是非常高的。这个东西是硬实力,再怎么样吹牛逼是没有用的。但是你说这个模型它本身不能用吗?我觉得它的编程能力,我个人认为对于代码的理解,它的能力是在 DeepSeek V4 Flash 之上的。它执行任务的成功率也是蛮高的,基本上一次就成功。
但是如果你打断它的会话,给它发的指令描述得不够详细,它捞取上下文的准确率,我认为甚至是不如千问 3.8-27B 的。你要用非常准确的语言给它描述你的目的。然后就是这个用量,就是我批评的,要么就不要免费,你要免费就拿出点诚意,这样子弄得挺不好的。就好比一个花枝招展的少妇,给你各种撩骚,各种姿势给你摆好了,结果你一进去,发现七八个彪形大汉在房子里,这不就仙人跳吗?就是这种感觉,非常不好。
然后就是关于 GLM,我谈一下我的看法,包括 Kimi,包括 MiniMax。你要明白这些公司,它们的模型并不是奔着要成为通用大模型的王者来的,它们都是主打一些细分领域。像 MiniMax 主打多模态,Kimi 就是主打这种长线复杂任务,把模型的规模做到跟 Anthropic、OpenAI 去对标。那么 GLM 它是主打编程,就是在各自的领域,我认为其实做得都挺不错的。但是它们的模型,我还是那句话,没有性价比。
如果你真的是赶巧买到它们有性价比的 Coding Plan,那你们偷着乐,用起来是没有问题的。但是不要到处宣传,说它们比 DeepSeek V4 Pro 强,说什么性价比又好,这个我觉得有点扯淡了。最后我们再回到 OpenRouter.AI 上,我们来看一下,现在排名第一的 DeepSeek Flash 0731,它的 04R3 排名第五,然后 V4 Pro 0423 排名第十。前十名中有三个是 DeepSeek,这个强悍的实力就不用我多吹了。
这个模型好不好,其实我们要相信大多数人的判断。OpenRouter.AI 是全世界最大的 AI 聚合网站,它这上面的用户绝大部分是外国人,甚至大部分是美国人,中国用户可能占 5% 左右。在这个平台上,除了偶尔搞活动的,或者像英伟达这种长期免费的模型,大家都是要掏真金白银来投票的,要刷信用卡来投票的。这些模型好不好,其实来这里参考,就很容易看出来。

然后关于它的免费模型,我要说一下,就是它每天应该是有 1000 次的调用额度,不过可能有些模型它给得不够。像小米 MiMo,为什么我给它的评分很高?就是我一直觉得这个模型是非常不错的,就是因为雷布斯在测试这个模型的时候,人家给的用量是非常足的,你放开用,用量非常足。现在人家上线了,你看,也得到了整个市场的认可,能排名到跟 DeepSeek 比一比,这也是非常牛逼。像英伟达这些免费的模型,就属于聊胜于无,虽然是免费的,但是我基本上也不用它。总之这个平台挺好玩的,大家没事可以上来玩一玩。
以后我有空可能会做一些第三方的算力租赁、托管平台,这种算力租赁平台有什么特色的服务,到时候做一些视频跟大家评论一下。反正现在有了 OBS,我只要对着镜头瞎 BB,也不用写稿子,弄完之后丢给 AI 去剪辑,这视频就出来了。而且这种视频不会被平台判为 AI Slop,因为我有一张脸,虽然这张脸不太帅气、不太好看,在右下角可以被平台检测作为真人,那我的视频生产成本就大大降低了。
大家有什么问题,可以到论坛跟我交流沟通。有的时候你们在评论区发评论,我可能并没有回复,并不是说我装逼,而是我的时间真的是比较紧张。因为我也给你们讲过,提到过很多次,我要挣钱,我比较穷,我同时做好多个频道,就没有那些时间。如果你们去论坛发帖,我有空一定会回你们;如果没有空的话,论坛有很多大神,这些人的实力都不在我之下,而且他们分享的各种方案都非常非常好。
有各种各样的,你看 5070 Ti 双卡,什么千问 3.8、Q2、Q6、SGLang,这些部署方案都有,各种卡实际上都有,各种主板、各种显卡、各种搭配方案。我们的这些大神、管理团队都是非常不错的,你的问题一定会得到解答。
-
终于等到OxAlpha出来了,我以为老特会用他来测试那个太极图。。。
-
终于等到OxAlpha出来了,我以为老特会用他来测试那个太极图。。。