Meta Muse Glimmer 30B实测:4090D 48G + Hermes + Codex Agent/编程测试,挑战Qwen 27B?请原谅我被逗笑了!速度飞快,编程一塌糊涂!
-
Meta再次开源,发布了重磅模型,30B的多模态Muse Glimmer,号称在多个评分测试上吊打Qwen3.6 27B。Qwen3.8 27B夜间发布,我做视频的时候还没看到权重,可能要明天白天才能尝试。但是这不妨碍我先测试下Glimmer,因为论坛有大神在讨论这个话题。我当时给的回复就是,Meta喜欢吹牛逼,和谷歌一样,它的模型就当个乐子,千万别较真,认真你就输了。刷分是美国公司最近统一的恶习,就像谷歌的Gemma和Gemini,跑分一条龙,实战一条虫。不过说完评论我有点心虚,因为问了下GPT,说这个模型还是有两把刷子的,我还是实战下吧。

首先这个模型有多个版本,全量BF16版需要60G显存,FP8需要34.4G,我有4090D 48G,可以跑FP8版本,但是考虑到大家都是24G显存为主,决定测试4比特量化版本。NVFP4版本我的显卡不支持硬件加速,载入之后也是用FP16推理,所以意义不大。我下载的是 muse-glimmer-30B-kquant-17gb,16.8G权重,24G显卡刚好可以跑。不过这个模型只有在llama.cpp上才能走视觉功能,但是我不想测试llama.cpp,用它来跑下纯文本,主要是Agent和编码能力。如果它表现惊艳,生态成熟了自然会有人搞定兼容性问题,暂时不用那么着急。llama.cpp很好用,但是支撑Agent很痛苦,我如果需要本地多模态模型,还是首先依靠Qwen家族。
安装过程很简单,我让Codex登录我的本地服务器,下载SGLang Docker镜像和模型权重,然后用4090D 48G跑起来,测试好之后喊我来验收。过程就是这么简单,没有任何多余的废话,安排好工作之后我就去睡觉了。等我起来之后,它已经搞完了。最近我用Codex搞复杂任务成功率很高,而且tokens消耗比Hermes更少。不过必须说,它在配置系统方面是不如Hermes的,经常它把自己搞死了,或者搞不下去,我让Hermes接手。就是主力Agent,还得是Hermes靠谱一点。

我看到安装完成,就让Codex配置我MacBook上的Hermes,给它增加一个Profile Cathy,专门用来测试本地的Glimmer。很快它就配置好了,然后我SSH到笔记本上,在终端敲击Cathy,它就出来了。交互体验非常好,SGLang有Radix缓存树,prefill非常丝滑,它自带MTP投机解码,Decode速度很快,就是一开始慢一点,跑两轮对话之后速度就起飞了。说实话,和在线的DeepSeek V4 Flash差不多,比GPT、Claude这些模型快多了。后面我接入了Codex,对比之下可以确认是模型快,而不是Agent调度好。
但是它的资源开销十分严重,居然占用了45G显存,具体原理我没去研究,128K的上下文比Qwen的256K上下文占用的资源还多,而且不支持多模态,我完全没Get到这个点。但如果它的智商足够,我能忍受,反正我这张卡就是用来干脏活的。

常规测试,老三样。第一,让它生成一个网页表达中国传统八卦,它很快给出了结果,但是可以看出来,这个效果只能说一般般,还有错误,太极图就没画对。如果是和Qwen3.5、Google Gemma4 31B比还行,但是和3.6比就有点碰瓷了,和在线的小米、Kimi、DeepSeek比,那更是差十万八千里。我过往的测试视频都在,大家可以自行翻看。
第二个测试,让它生成SVG表达钍基熔盐堆运行原理,它给的图让我笑了,我只有在英伟达的免费模型上见到过这么智障的输出,Meta不愧是吹牛逼第一大户,谷歌在它面前不值一提。就这么个水平,给谷歌的Gemma4提鞋都不配,更别提Qwen 27B了。Meta的脸皮是真厚,这么个玩意也能炒作。
第三个测试,让它生成SVG表达薛定谔的猫思想实验,它给出的结果大家可以看下,它真的是猴子请来的逗比,可以说它完全不能用来编程。如果说你想要用它写代码,还不如给你的狗报一个培训班,让它来干这个活。而且它的小尺寸模型还不支持多模态,就这么个玩意,Meta推出的目的究竟是什么?是要告诉开源社区,它们不想放弃开源领导地位,要和阿里干一架?不用Qwen3.8 27B上场,现在就能把广大网友笑死。
但是这玩意也不是一无是处,就是它真的快,驱动Agent体验不错,可是它太蠢了,会导致干不了活。比如让它去配置一个软件,它虽然能知道具体的执行指令,但是由于它无法精确理解任务的目标,所以它还是会失败。我必须说,Qwen3.6 27B真的能干活,它不是玩具,谷歌的Gemma4 31B也能玩玩,Glimmer纯属工业垃圾,玩的价值都没有。那些炒作它的人,不知道是用它做什么任务的。
为了防止是Hermes不行,拖累了这个被炒作上天的模型,我把它接入了Codex。这里必须再次强调下,配置脚本Codex性价比很高,但它配置自己的时候不知道为什么就是不行,还是要Hermes来收尾。在我的使用环境中,唯一能全方位自我配置、自我迭代的就是Hermes。接入了之后,我重复刚才的任务。
第一个:生成一个网页表达中国的传统八卦,大家看看效果,我特么直接给笑疯了。Codex这几天在编程中的表现能力是强过Hermes的,它在使用DeepSeek V4 Flash的时候展现出了高效的编程能力,我明天有空会把它接入Qwen3.8 27B,到时候大家可以看看效果。但是这么个玩意确实让我怀疑,Glimmer是猴子请来的逗比,它不是奔着干活来的,是要做大模型圈子的黄渤和范伟。
第二个任务,生成SVG表达钍基熔盐堆运行原理,在Codex的抢救下,比Hermes调用时表现好了一点,达到了幼儿园的水平。
蠢不是它的问题,蠢还被Meta拿来炒作,这是Meta的问题。关于最后一个任务,生成SVG表达薛定谔的猫思想实验,我想大家都知道效果了,你们看下,这特么是一个AI大模型应该干的事吗?真的,给你们家的狗报一个编程培训班,也不会得到这么差的结果。
不过我还是不死心,它总得有点东西吧,这好歹是Meta抛弃开源社区之后,自我救赎的力作啊。我想科学不行,哲学总可以吧。哎,你还别说,它这一块弄得挺好的。它对康德、笛卡尔的唯心主义,马克思的辩证唯物主义理解很到位,一些基本的痛点把握得很准。并且它是我最近聊过的所有模型中,唯一一个能让我感觉到真正理解了哲学本原论和策论区别的模型。它很明确知道辩证唯物主义的各种自相矛盾的地方,其他模型都会为此辩解,最后被迫承认。但是Glimmer在我提出观点之后,很快列举出了实证,我不知道是大智若愚,还是特么的它不懂辩论,直接顺从我的观点。
好吧,你如果能坚持看到这里,真的是做慈善了,这个模型除了浪费大家的时间一无是处。我想我的频道价值还会继续提升,因为互联网上充满了各种虚假信息,是个模型就有人吹,你花半天时间折腾,发现配置了一个智障、小丑。多看看我的视频,没准就能少走一点弯路。咱们不扯淡,还是等待Qwen3.8 27B的发布吧。
材料补充 Qwen3.6测试效果:
Qwen3.6 hermes八卦.html
qwen3.6 hermes薛定谔的猫.html
Qwen3.6 hermes钍基熔盐堆.html -
Meta再次开源,发布了重磅模型,30B的多模态Muse Glimmer,号称在多个评分测试上吊打Qwen3.6 27B。Qwen3.8 27B夜间发布,我做视频的时候还没看到权重,可能要明天白天才能尝试。但是这不妨碍我先测试下Glimmer,因为论坛有大神在讨论这个话题。我当时给的回复就是,Meta喜欢吹牛逼,和谷歌一样,它的模型就当个乐子,千万别较真,认真你就输了。刷分是美国公司最近统一的恶习,就像谷歌的Gemma和Gemini,跑分一条龙,实战一条虫。不过说完评论我有点心虚,因为问了下GPT,说这个模型还是有两把刷子的,我还是实战下吧。

首先这个模型有多个版本,全量BF16版需要60G显存,FP8需要34.4G,我有4090D 48G,可以跑FP8版本,但是考虑到大家都是24G显存为主,决定测试4比特量化版本。NVFP4版本我的显卡不支持硬件加速,载入之后也是用FP16推理,所以意义不大。我下载的是 muse-glimmer-30B-kquant-17gb,16.8G权重,24G显卡刚好可以跑。不过这个模型只有在llama.cpp上才能走视觉功能,但是我不想测试llama.cpp,用它来跑下纯文本,主要是Agent和编码能力。如果它表现惊艳,生态成熟了自然会有人搞定兼容性问题,暂时不用那么着急。llama.cpp很好用,但是支撑Agent很痛苦,我如果需要本地多模态模型,还是首先依靠Qwen家族。
安装过程很简单,我让Codex登录我的本地服务器,下载SGLang Docker镜像和模型权重,然后用4090D 48G跑起来,测试好之后喊我来验收。过程就是这么简单,没有任何多余的废话,安排好工作之后我就去睡觉了。等我起来之后,它已经搞完了。最近我用Codex搞复杂任务成功率很高,而且tokens消耗比Hermes更少。不过必须说,它在配置系统方面是不如Hermes的,经常它把自己搞死了,或者搞不下去,我让Hermes接手。就是主力Agent,还得是Hermes靠谱一点。

我看到安装完成,就让Codex配置我MacBook上的Hermes,给它增加一个Profile Cathy,专门用来测试本地的Glimmer。很快它就配置好了,然后我SSH到笔记本上,在终端敲击Cathy,它就出来了。交互体验非常好,SGLang有Radix缓存树,prefill非常丝滑,它自带MTP投机解码,Decode速度很快,就是一开始慢一点,跑两轮对话之后速度就起飞了。说实话,和在线的DeepSeek V4 Flash差不多,比GPT、Claude这些模型快多了。后面我接入了Codex,对比之下可以确认是模型快,而不是Agent调度好。
但是它的资源开销十分严重,居然占用了45G显存,具体原理我没去研究,128K的上下文比Qwen的256K上下文占用的资源还多,而且不支持多模态,我完全没Get到这个点。但如果它的智商足够,我能忍受,反正我这张卡就是用来干脏活的。

常规测试,老三样。第一,让它生成一个网页表达中国传统八卦,它很快给出了结果,但是可以看出来,这个效果只能说一般般,还有错误,太极图就没画对。如果是和Qwen3.5、Google Gemma4 31B比还行,但是和3.6比就有点碰瓷了,和在线的小米、Kimi、DeepSeek比,那更是差十万八千里。我过往的测试视频都在,大家可以自行翻看。
第二个测试,让它生成SVG表达钍基熔盐堆运行原理,它给的图让我笑了,我只有在英伟达的免费模型上见到过这么智障的输出,Meta不愧是吹牛逼第一大户,谷歌在它面前不值一提。就这么个水平,给谷歌的Gemma4提鞋都不配,更别提Qwen 27B了。Meta的脸皮是真厚,这么个玩意也能炒作。
第三个测试,让它生成SVG表达薛定谔的猫思想实验,它给出的结果大家可以看下,它真的是猴子请来的逗比,可以说它完全不能用来编程。如果说你想要用它写代码,还不如给你的狗报一个培训班,让它来干这个活。而且它的小尺寸模型还不支持多模态,就这么个玩意,Meta推出的目的究竟是什么?是要告诉开源社区,它们不想放弃开源领导地位,要和阿里干一架?不用Qwen3.8 27B上场,现在就能把广大网友笑死。
但是这玩意也不是一无是处,就是它真的快,驱动Agent体验不错,可是它太蠢了,会导致干不了活。比如让它去配置一个软件,它虽然能知道具体的执行指令,但是由于它无法精确理解任务的目标,所以它还是会失败。我必须说,Qwen3.6 27B真的能干活,它不是玩具,谷歌的Gemma4 31B也能玩玩,Glimmer纯属工业垃圾,玩的价值都没有。那些炒作它的人,不知道是用它做什么任务的。
为了防止是Hermes不行,拖累了这个被炒作上天的模型,我把它接入了Codex。这里必须再次强调下,配置脚本Codex性价比很高,但它配置自己的时候不知道为什么就是不行,还是要Hermes来收尾。在我的使用环境中,唯一能全方位自我配置、自我迭代的就是Hermes。接入了之后,我重复刚才的任务。
第一个:生成一个网页表达中国的传统八卦,大家看看效果,我特么直接给笑疯了。Codex这几天在编程中的表现能力是强过Hermes的,它在使用DeepSeek V4 Flash的时候展现出了高效的编程能力,我明天有空会把它接入Qwen3.8 27B,到时候大家可以看看效果。但是这么个玩意确实让我怀疑,Glimmer是猴子请来的逗比,它不是奔着干活来的,是要做大模型圈子的黄渤和范伟。
第二个任务,生成SVG表达钍基熔盐堆运行原理,在Codex的抢救下,比Hermes调用时表现好了一点,达到了幼儿园的水平。
蠢不是它的问题,蠢还被Meta拿来炒作,这是Meta的问题。关于最后一个任务,生成SVG表达薛定谔的猫思想实验,我想大家都知道效果了,你们看下,这特么是一个AI大模型应该干的事吗?真的,给你们家的狗报一个编程培训班,也不会得到这么差的结果。
不过我还是不死心,它总得有点东西吧,这好歹是Meta抛弃开源社区之后,自我救赎的力作啊。我想科学不行,哲学总可以吧。哎,你还别说,它这一块弄得挺好的。它对康德、笛卡尔的唯心主义,马克思的辩证唯物主义理解很到位,一些基本的痛点把握得很准。并且它是我最近聊过的所有模型中,唯一一个能让我感觉到真正理解了哲学本原论和策论区别的模型。它很明确知道辩证唯物主义的各种自相矛盾的地方,其他模型都会为此辩解,最后被迫承认。但是Glimmer在我提出观点之后,很快列举出了实证,我不知道是大智若愚,还是特么的它不懂辩论,直接顺从我的观点。
好吧,你如果能坚持看到这里,真的是做慈善了,这个模型除了浪费大家的时间一无是处。我想我的频道价值还会继续提升,因为互联网上充满了各种虚假信息,是个模型就有人吹,你花半天时间折腾,发现配置了一个智障、小丑。多看看我的视频,没准就能少走一点弯路。咱们不扯淡,还是等待Qwen3.8 27B的发布吧。
材料补充 Qwen3.6测试效果:
Qwen3.6 hermes八卦.html
qwen3.6 hermes薛定谔的猫.html
Qwen3.6 hermes钍基熔盐堆.html -
昨天拿了两段llama.cpp分别用vulkan和rocm跑相同模型的log,让Qwen3.6-27B和Muse Glimmer分别用svg把prefill速度随prompt增长而衰减的曲线画出来。
这是Qwen3.6-27B画的:

这是Muse Glimmer画的:

能说啥呢?meta棒棒的!
@Dan-Xia 經你這麼一說,的確真丑
這也是meta 30B的模型....還是 BF16(無損)的
哈哈哈
難怪大家都嫌棄

-
@Dan-Xia 經你這麼一說,的確真丑
這也是meta 30B的模型....還是 BF16(無損)的
哈哈哈
難怪大家都嫌棄

@David-Chen 丑一点我能忍,问题是它完全不能正确理解log的内容,画出来的曲线是prompt越长prefill越快,这能忍啊。。。

