跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. LLM讨论区
  4. Meta Muse Glimmer 30B实测:4090D 48G + Hermes + Codex Agent/编程测试,挑战Qwen 27B?请原谅我被逗笑了!速度飞快,编程一塌糊涂!

Meta Muse Glimmer 30B实测:4090D 48G + Hermes + Codex Agent/编程测试,挑战Qwen 27B?请原谅我被逗笑了!速度飞快,编程一塌糊涂!

已定时 已固定 已锁定 已移动 LLM讨论区
qwen-27bmetaglimmer本地模型rtx4090
8 帖子 5 发布者 282 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT 在线
    terryT 在线
    terry
    超级版主
    编写于 最后由 编辑
    #1

    Meta再次开源,发布了重磅模型,30B的多模态Muse Glimmer,号称在多个评分测试上吊打Qwen3.6 27B。Qwen3.8 27B夜间发布,我做视频的时候还没看到权重,可能要明天白天才能尝试。但是这不妨碍我先测试下Glimmer,因为论坛有大神在讨论这个话题。我当时给的回复就是,Meta喜欢吹牛逼,和谷歌一样,它的模型就当个乐子,千万别较真,认真你就输了。刷分是美国公司最近统一的恶习,就像谷歌的Gemma和Gemini,跑分一条龙,实战一条虫。不过说完评论我有点心虚,因为问了下GPT,说这个模型还是有两把刷子的,我还是实战下吧。

    Glimmer.j实测peg.jpeg

    首先这个模型有多个版本,全量BF16版需要60G显存,FP8需要34.4G,我有4090D 48G,可以跑FP8版本,但是考虑到大家都是24G显存为主,决定测试4比特量化版本。NVFP4版本我的显卡不支持硬件加速,载入之后也是用FP16推理,所以意义不大。我下载的是 muse-glimmer-30B-kquant-17gb,16.8G权重,24G显卡刚好可以跑。不过这个模型只有在llama.cpp上才能走视觉功能,但是我不想测试llama.cpp,用它来跑下纯文本,主要是Agent和编码能力。如果它表现惊艳,生态成熟了自然会有人搞定兼容性问题,暂时不用那么着急。llama.cpp很好用,但是支撑Agent很痛苦,我如果需要本地多模态模型,还是首先依靠Qwen家族。

    安装过程很简单,我让Codex登录我的本地服务器,下载SGLang Docker镜像和模型权重,然后用4090D 48G跑起来,测试好之后喊我来验收。过程就是这么简单,没有任何多余的废话,安排好工作之后我就去睡觉了。等我起来之后,它已经搞完了。最近我用Codex搞复杂任务成功率很高,而且tokens消耗比Hermes更少。不过必须说,它在配置系统方面是不如Hermes的,经常它把自己搞死了,或者搞不下去,我让Hermes接手。就是主力Agent,还得是Hermes靠谱一点。

    Codex安装配置Glimmer SGLang.png

    我看到安装完成,就让Codex配置我MacBook上的Hermes,给它增加一个Profile Cathy,专门用来测试本地的Glimmer。很快它就配置好了,然后我SSH到笔记本上,在终端敲击Cathy,它就出来了。交互体验非常好,SGLang有Radix缓存树,prefill非常丝滑,它自带MTP投机解码,Decode速度很快,就是一开始慢一点,跑两轮对话之后速度就起飞了。说实话,和在线的DeepSeek V4 Flash差不多,比GPT、Claude这些模型快多了。后面我接入了Codex,对比之下可以确认是模型快,而不是Agent调度好。

    但是它的资源开销十分严重,居然占用了45G显存,具体原理我没去研究,128K的上下文比Qwen的256K上下文占用的资源还多,而且不支持多模态,我完全没Get到这个点。但如果它的智商足够,我能忍受,反正我这张卡就是用来干脏活的。

    cathy生成八卦网页.png

    常规测试,老三样。第一,让它生成一个网页表达中国传统八卦,它很快给出了结果,但是可以看出来,这个效果只能说一般般,还有错误,太极图就没画对。如果是和Qwen3.5、Google Gemma4 31B比还行,但是和3.6比就有点碰瓷了,和在线的小米、Kimi、DeepSeek比,那更是差十万八千里。我过往的测试视频都在,大家可以自行翻看。

    index.html

    第二个测试,让它生成SVG表达钍基熔盐堆运行原理,它给的图让我笑了,我只有在英伟达的免费模型上见到过这么智障的输出,Meta不愧是吹牛逼第一大户,谷歌在它面前不值一提。就这么个水平,给谷歌的Gemma4提鞋都不配,更别提Qwen 27B了。Meta的脸皮是真厚,这么个玩意也能炒作。

    tmsr-concept.svg

    第三个测试,让它生成SVG表达薛定谔的猫思想实验,它给出的结果大家可以看下,它真的是猴子请来的逗比,可以说它完全不能用来编程。如果说你想要用它写代码,还不如给你的狗报一个培训班,让它来干这个活。而且它的小尺寸模型还不支持多模态,就这么个玩意,Meta推出的目的究竟是什么?是要告诉开源社区,它们不想放弃开源领导地位,要和阿里干一架?不用Qwen3.8 27B上场,现在就能把广大网友笑死。

    schrodinger-cat.svg

    但是这玩意也不是一无是处,就是它真的快,驱动Agent体验不错,可是它太蠢了,会导致干不了活。比如让它去配置一个软件,它虽然能知道具体的执行指令,但是由于它无法精确理解任务的目标,所以它还是会失败。我必须说,Qwen3.6 27B真的能干活,它不是玩具,谷歌的Gemma4 31B也能玩玩,Glimmer纯属工业垃圾,玩的价值都没有。那些炒作它的人,不知道是用它做什么任务的。

    为了防止是Hermes不行,拖累了这个被炒作上天的模型,我把它接入了Codex。这里必须再次强调下,配置脚本Codex性价比很高,但它配置自己的时候不知道为什么就是不行,还是要Hermes来收尾。在我的使用环境中,唯一能全方位自我配置、自我迭代的就是Hermes。接入了之后,我重复刚才的任务。

    第一个:生成一个网页表达中国的传统八卦,大家看看效果,我特么直接给笑疯了。Codex这几天在编程中的表现能力是强过Hermes的,它在使用DeepSeek V4 Flash的时候展现出了高效的编程能力,我明天有空会把它接入Qwen3.8 27B,到时候大家可以看看效果。但是这么个玩意确实让我怀疑,Glimmer是猴子请来的逗比,它不是奔着干活来的,是要做大模型圈子的黄渤和范伟。

    index.html

    第二个任务,生成SVG表达钍基熔盐堆运行原理,在Codex的抢救下,比Hermes调用时表现好了一点,达到了幼儿园的水平。

    thorium_msr.svg

    蠢不是它的问题,蠢还被Meta拿来炒作,这是Meta的问题。关于最后一个任务,生成SVG表达薛定谔的猫思想实验,我想大家都知道效果了,你们看下,这特么是一个AI大模型应该干的事吗?真的,给你们家的狗报一个编程培训班,也不会得到这么差的结果。

    schrodinger_cat.svg

    不过我还是不死心,它总得有点东西吧,这好歹是Meta抛弃开源社区之后,自我救赎的力作啊。我想科学不行,哲学总可以吧。哎,你还别说,它这一块弄得挺好的。它对康德、笛卡尔的唯心主义,马克思的辩证唯物主义理解很到位,一些基本的痛点把握得很准。并且它是我最近聊过的所有模型中,唯一一个能让我感觉到真正理解了哲学本原论和策论区别的模型。它很明确知道辩证唯物主义的各种自相矛盾的地方,其他模型都会为此辩解,最后被迫承认。但是Glimmer在我提出观点之后,很快列举出了实证,我不知道是大智若愚,还是特么的它不懂辩论,直接顺从我的观点。

    好吧,你如果能坚持看到这里,真的是做慈善了,这个模型除了浪费大家的时间一无是处。我想我的频道价值还会继续提升,因为互联网上充满了各种虚假信息,是个模型就有人吹,你花半天时间折腾,发现配置了一个智障、小丑。多看看我的视频,没准就能少走一点弯路。咱们不扯淡,还是等待Qwen3.8 27B的发布吧。

    材料补充 Qwen3.6测试效果:
    Qwen3.6 hermes八卦.html
    qwen3.6 hermes薛定谔的猫.html
    Qwen3.6 hermes钍基熔盐堆.html

    油管:https://www.youtube.com/@抡锤者

    kos orK 1 条回复 最后回复
    2
    • terryT 在线
      terryT 在线
      terry
      超级版主
      编写于 最后由 编辑
      #2

      Youtube Video

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0
      • Tony WangT 在线
        Tony WangT 在线
        Tony Wang
        超级版主
        编写于 最后由 编辑
        #3

        你趟了雷, 我们就不踩坑了 😄
        我老老实实等 Qwen3.8 27B.
        辛苦特老大了.

        terryT 1 条回复 最后回复
        1
        • Tony WangT Tony Wang

          你趟了雷, 我们就不踩坑了 😄
          我老老实实等 Qwen3.8 27B.
          辛苦特老大了.

          terryT 在线
          terryT 在线
          terry
          超级版主
          编写于 最后由 编辑
          #4

          @Tony-Wang 不参合是对的,严重浪费时间。

          油管:https://www.youtube.com/@抡锤者

          1 条回复 最后回复
          0
          • Dan XiaD 离线
            Dan XiaD 离线
            Dan Xia
            编写于 最后由 编辑
            #5

            昨天拿了两段llama.cpp分别用vulkan和rocm跑相同模型的log,让Qwen3.6-27B和Muse Glimmer分别用svg把prefill速度随prompt增长而衰减的曲线画出来。

            这是Qwen3.6-27B画的:

            f8ba601a-e2a2-4618-aa82-b26a0e880783-image.jpeg

            这是Muse Glimmer画的:

            9ac1f9b2-93f0-467b-a29c-db043c9f7c02-image.jpeg

            能说啥呢?meta棒棒的!

            David ChenD 1 条回复 最后回复
            1
            • terryT terry

              Meta再次开源,发布了重磅模型,30B的多模态Muse Glimmer,号称在多个评分测试上吊打Qwen3.6 27B。Qwen3.8 27B夜间发布,我做视频的时候还没看到权重,可能要明天白天才能尝试。但是这不妨碍我先测试下Glimmer,因为论坛有大神在讨论这个话题。我当时给的回复就是,Meta喜欢吹牛逼,和谷歌一样,它的模型就当个乐子,千万别较真,认真你就输了。刷分是美国公司最近统一的恶习,就像谷歌的Gemma和Gemini,跑分一条龙,实战一条虫。不过说完评论我有点心虚,因为问了下GPT,说这个模型还是有两把刷子的,我还是实战下吧。

              Glimmer.j实测peg.jpeg

              首先这个模型有多个版本,全量BF16版需要60G显存,FP8需要34.4G,我有4090D 48G,可以跑FP8版本,但是考虑到大家都是24G显存为主,决定测试4比特量化版本。NVFP4版本我的显卡不支持硬件加速,载入之后也是用FP16推理,所以意义不大。我下载的是 muse-glimmer-30B-kquant-17gb,16.8G权重,24G显卡刚好可以跑。不过这个模型只有在llama.cpp上才能走视觉功能,但是我不想测试llama.cpp,用它来跑下纯文本,主要是Agent和编码能力。如果它表现惊艳,生态成熟了自然会有人搞定兼容性问题,暂时不用那么着急。llama.cpp很好用,但是支撑Agent很痛苦,我如果需要本地多模态模型,还是首先依靠Qwen家族。

              安装过程很简单,我让Codex登录我的本地服务器,下载SGLang Docker镜像和模型权重,然后用4090D 48G跑起来,测试好之后喊我来验收。过程就是这么简单,没有任何多余的废话,安排好工作之后我就去睡觉了。等我起来之后,它已经搞完了。最近我用Codex搞复杂任务成功率很高,而且tokens消耗比Hermes更少。不过必须说,它在配置系统方面是不如Hermes的,经常它把自己搞死了,或者搞不下去,我让Hermes接手。就是主力Agent,还得是Hermes靠谱一点。

              Codex安装配置Glimmer SGLang.png

              我看到安装完成,就让Codex配置我MacBook上的Hermes,给它增加一个Profile Cathy,专门用来测试本地的Glimmer。很快它就配置好了,然后我SSH到笔记本上,在终端敲击Cathy,它就出来了。交互体验非常好,SGLang有Radix缓存树,prefill非常丝滑,它自带MTP投机解码,Decode速度很快,就是一开始慢一点,跑两轮对话之后速度就起飞了。说实话,和在线的DeepSeek V4 Flash差不多,比GPT、Claude这些模型快多了。后面我接入了Codex,对比之下可以确认是模型快,而不是Agent调度好。

              但是它的资源开销十分严重,居然占用了45G显存,具体原理我没去研究,128K的上下文比Qwen的256K上下文占用的资源还多,而且不支持多模态,我完全没Get到这个点。但如果它的智商足够,我能忍受,反正我这张卡就是用来干脏活的。

              cathy生成八卦网页.png

              常规测试,老三样。第一,让它生成一个网页表达中国传统八卦,它很快给出了结果,但是可以看出来,这个效果只能说一般般,还有错误,太极图就没画对。如果是和Qwen3.5、Google Gemma4 31B比还行,但是和3.6比就有点碰瓷了,和在线的小米、Kimi、DeepSeek比,那更是差十万八千里。我过往的测试视频都在,大家可以自行翻看。

              index.html

              第二个测试,让它生成SVG表达钍基熔盐堆运行原理,它给的图让我笑了,我只有在英伟达的免费模型上见到过这么智障的输出,Meta不愧是吹牛逼第一大户,谷歌在它面前不值一提。就这么个水平,给谷歌的Gemma4提鞋都不配,更别提Qwen 27B了。Meta的脸皮是真厚,这么个玩意也能炒作。

              tmsr-concept.svg

              第三个测试,让它生成SVG表达薛定谔的猫思想实验,它给出的结果大家可以看下,它真的是猴子请来的逗比,可以说它完全不能用来编程。如果说你想要用它写代码,还不如给你的狗报一个培训班,让它来干这个活。而且它的小尺寸模型还不支持多模态,就这么个玩意,Meta推出的目的究竟是什么?是要告诉开源社区,它们不想放弃开源领导地位,要和阿里干一架?不用Qwen3.8 27B上场,现在就能把广大网友笑死。

              schrodinger-cat.svg

              但是这玩意也不是一无是处,就是它真的快,驱动Agent体验不错,可是它太蠢了,会导致干不了活。比如让它去配置一个软件,它虽然能知道具体的执行指令,但是由于它无法精确理解任务的目标,所以它还是会失败。我必须说,Qwen3.6 27B真的能干活,它不是玩具,谷歌的Gemma4 31B也能玩玩,Glimmer纯属工业垃圾,玩的价值都没有。那些炒作它的人,不知道是用它做什么任务的。

              为了防止是Hermes不行,拖累了这个被炒作上天的模型,我把它接入了Codex。这里必须再次强调下,配置脚本Codex性价比很高,但它配置自己的时候不知道为什么就是不行,还是要Hermes来收尾。在我的使用环境中,唯一能全方位自我配置、自我迭代的就是Hermes。接入了之后,我重复刚才的任务。

              第一个:生成一个网页表达中国的传统八卦,大家看看效果,我特么直接给笑疯了。Codex这几天在编程中的表现能力是强过Hermes的,它在使用DeepSeek V4 Flash的时候展现出了高效的编程能力,我明天有空会把它接入Qwen3.8 27B,到时候大家可以看看效果。但是这么个玩意确实让我怀疑,Glimmer是猴子请来的逗比,它不是奔着干活来的,是要做大模型圈子的黄渤和范伟。

              index.html

              第二个任务,生成SVG表达钍基熔盐堆运行原理,在Codex的抢救下,比Hermes调用时表现好了一点,达到了幼儿园的水平。

              thorium_msr.svg

              蠢不是它的问题,蠢还被Meta拿来炒作,这是Meta的问题。关于最后一个任务,生成SVG表达薛定谔的猫思想实验,我想大家都知道效果了,你们看下,这特么是一个AI大模型应该干的事吗?真的,给你们家的狗报一个编程培训班,也不会得到这么差的结果。

              schrodinger_cat.svg

              不过我还是不死心,它总得有点东西吧,这好歹是Meta抛弃开源社区之后,自我救赎的力作啊。我想科学不行,哲学总可以吧。哎,你还别说,它这一块弄得挺好的。它对康德、笛卡尔的唯心主义,马克思的辩证唯物主义理解很到位,一些基本的痛点把握得很准。并且它是我最近聊过的所有模型中,唯一一个能让我感觉到真正理解了哲学本原论和策论区别的模型。它很明确知道辩证唯物主义的各种自相矛盾的地方,其他模型都会为此辩解,最后被迫承认。但是Glimmer在我提出观点之后,很快列举出了实证,我不知道是大智若愚,还是特么的它不懂辩论,直接顺从我的观点。

              好吧,你如果能坚持看到这里,真的是做慈善了,这个模型除了浪费大家的时间一无是处。我想我的频道价值还会继续提升,因为互联网上充满了各种虚假信息,是个模型就有人吹,你花半天时间折腾,发现配置了一个智障、小丑。多看看我的视频,没准就能少走一点弯路。咱们不扯淡,还是等待Qwen3.8 27B的发布吧。

              材料补充 Qwen3.6测试效果:
              Qwen3.6 hermes八卦.html
              qwen3.6 hermes薛定谔的猫.html
              Qwen3.6 hermes钍基熔盐堆.html

              kos orK 在线
              kos orK 在线
              kos or
              技术大牛 劳动模范
              编写于 最后由 编辑
              #6

              @terry said:

              这个模型除了浪费大家的时间一无是处

              太感謝 省了下載和測試時間 🙂

              1 条回复 最后回复
              0
              • Dan XiaD Dan Xia

                昨天拿了两段llama.cpp分别用vulkan和rocm跑相同模型的log,让Qwen3.6-27B和Muse Glimmer分别用svg把prefill速度随prompt增长而衰减的曲线画出来。

                这是Qwen3.6-27B画的:

                f8ba601a-e2a2-4618-aa82-b26a0e880783-image.jpeg

                这是Muse Glimmer画的:

                9ac1f9b2-93f0-467b-a29c-db043c9f7c02-image.jpeg

                能说啥呢?meta棒棒的!

                David ChenD 在线
                David ChenD 在线
                David Chen
                编写于 最后由 编辑
                #7

                @Dan-Xia 經你這麼一說,的確真丑
                這也是meta 30B的模型....還是 BF16(無損)的
                哈哈哈
                難怪大家都嫌棄
                ef60ac96-7e41-4520-95e3-63558c3147e7-image.jpeg

                Dan XiaD 1 条回复 最后回复
                0
                • David ChenD David Chen

                  @Dan-Xia 經你這麼一說,的確真丑
                  這也是meta 30B的模型....還是 BF16(無損)的
                  哈哈哈
                  難怪大家都嫌棄
                  ef60ac96-7e41-4520-95e3-63558c3147e7-image.jpeg

                  Dan XiaD 离线
                  Dan XiaD 离线
                  Dan Xia
                  编写于 最后由 编辑
                  #8

                  @David-Chen 丑一点我能忍,问题是它完全不能正确理解log的内容,画出来的曲线是prompt越长prefill越快,这能忍啊。。。

                  1 条回复 最后回复
                  0

                  你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                  厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                  有了你的建议,这篇帖子会更精彩哦 💗

                  注册 登录
                  回复
                  • 在新帖中回复
                  登录后回复
                  • 从旧到新
                  • 从新到旧
                  • 最多赞同


                  • 登录

                  • 没有帐号? 注册

                  • 登录或注册以进行搜索。
                  • 第一个帖子
                    最后一个帖子
                  0
                  • 版块
                  • 最新
                  • 标签
                  • 热门
                  • 用户
                  • 群组