跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. Qwen3.8 Flash实测:跑分吊打27B,压制DeepSeekFlash,现实慢成乌龟,无法有效执行Agent任务,有待打磨!

Qwen3.8 Flash实测:跑分吊打27B,压制DeepSeekFlash,现实慢成乌龟,无法有效执行Agent任务,有待打磨!

已定时 已固定 已锁定 已移动 LLM讨论区
qwendeepseek
9 帖子 8 发布者 501 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT 在线
    terryT 在线
    terry
    超级版主
    编写于 最后由 terry 编辑
    #1

    Qwen3.8 Flash 这个模型现在热度非常高,因为跑分吊打自家的 Qwen3.8 27B。它是 125B A6B 模型,也就是说总的尺寸是 125B,然后激活 6B。目前已经有不少人在小主机上,什么 AI Max 395、DGX Spark,包括苹果的小主机上都能跑起来。但是这些信息是 ChatGPT 告诉我的。我本人感觉它 4 比特量化之后,这些 128G 的小主机是能跑起来的,但是它不是还带一个叫 NGram 的模块吗?这个东西也要把它挂载到内存中去,或许也可以挂载到 SSD 吧。反正这些人都在小主机上跑起来了,说这个模型非常智能。

    如果从跑分上来说的话,它能够吊打、全方面压制 Qwen3.8 27B,那么应该也是比 DeepSeek V4 Flash 要强一点的。你看这是 V4 Flash 的评分,DeepSeek V4 Flash 就只有在两个领域能够跟 Qwen3.8 Flash 相比,而且它还宣称超过了 Claude Opus 4.6 Max,Opus 4.6 就只有一个跑分超过它。那么这个模型是不是很强大呢?关于 Opus 4.6 这个模型,我必须说这个模型非常特殊,因为我在之前的视频中讲过,这个模型是我第一次在 Agent 上感觉 AI Agent 有意义,它能真正地干活,能够智能,就是当时接入的 Claude Opus 4.6。

    Qwen3.8 Flash实测.jpeg

    半年时间过后,没想到这么多中国的模型都能够对标 Opus 4.6,我非常欣慰。其中毫无疑问,DeepSeek V4 Flash 是证明了它的实力,非常好用,而且很便宜,响应速度非常快。Qwen3.8 27B 有这样那样的问题,但是也在我的实际部署中证明了自己。今天我们来看一下 Qwen3.8 Flash,它是否像它标称的这么牛逼、这么厉害。

    首先把它接入到我的 DSH,就是 DeepSeek Harness 上。这个过程我是让 Qwen3.8 27B FP8 来完成的。这个怎么说呢,它本身在本地执行这些 Agent 的常规任务,响应速度是非常快的。我们看一下,这个缓存显示错误,平均首 Token 是 0.9 秒的延迟,24 Tokens/s。我没有给它加入 MTP,也没有加入 DeepFlash,我感觉这样已经够用了。我认为如果要多开的话,因为我昨天是同时开了两个长会话、两个短会话测试 Qwen3.8 27B FP8,SGLang 驱动的,后边是 4090D 48G。如果想要关注这个体验的,可以到论坛去看看相关的帖子,或者看我昨天的视频,今天我们就一笔带过。

    Qwen3.8 27b配置qwen 3.8 flash在线模型

    下面就进入漫长的实际测试。我必须说,自从上一次测试 Meta 的 Muse Glimmer 这个模型之后,我当时不是说了吗,我是第一次在测试中被一个模型给逗笑。我认为可能在我以后的测试生涯中,不会再遇到这样的模型了。但是对不起,我错怪了 Muse Glimmer,错怪了老黄的免费 Nemotron 模型。对不起,你们不是垃圾,你们不是狗屎,最起码你们不是最垃圾的狗屎。Qwen3.8 Flash 打破了我的认知,就是它基本上没有办法执行任何的 Agent 任务。

    你看,陷入了死循环。一开始我以为是思考模式的问题,后来我又把思考模式给它关了。让它生成一个八卦网页,目标是让它生成一个网页表达中国的传统八卦,最终实在是没有办法进行下去了,我把这个任务终止了。这个就是它生成的结果,这个审美我只能说及格了,好吧。太极图也画对了,但是这个卦象还是错了,卦位你看。就这么个玩意,我真的是被逗笑了。

    9c80df88-7aab-454a-86c6-5c51e92f9e21-image.jpeg

    好吧,我们不排除 DeepSeek Harness 可能跟它不兼容。但是我又测试了一下,这个通信是通的,协议是正常的,能够非常清楚地知道自己是谁、在干什么。下面让它生成一个钍基熔盐堆原理图,最终它没有办法完成任务。这个是它生成的中间产物,我实在是看不下去了。当然了,它并不是一开始就是这么乱的,因为它卡了十几分钟,我实在没有办法了,把它关掉了,这个是它的中间产物。

    e71cc3a4-7be9-4aaa-9076-c4bfef7e3102-image.jpeg

    好吧,我就不测试它复杂的功能了。我就说你去检查一下 2.9 的服务器的资源状况,这个任务它花了十几分钟,还在这里搜集信息。就这么傻逼的模型,我是从来没遇到过的。我想,我是不是错怪它了呀?万一在 Codex 上它可用呢?好吧,把它接入 Codex。

    问它问题,它是什么?Codex 问它是什么模型,就这么一个简单的问题,它花了 1 分钟 5 秒来回答我。我原谅它了。生成一个网页表达中国的传统八卦文化,你们猜它完成这个任务花了多长时间?19 分钟 37 秒。我们看看它完成的这个模型是什么样子。唉,还不错,这个也对了。

    2deee45a-5437-426b-be57-873317021e69-image.jpeg
    bagua.zip

    我想我需要给刚才 DSH 接的这个 Qwen3.8 做一个平反,它很有可能就是这个模型过度思考,它就是慢,这是很有可能的。它花了 20 分钟时间来完成这个网页的话,我就给比较高的分数了。这个鱼眼也只能说勉强画对了吧,得分是比较高的。有可能是刚才我把它中断了,导致它没有完成任务,要给它平反一下。但是我说实话,这个网页我给它 95 分,95 分,但是这个性价比我给它 5 分。如果说做这么一个简单的工作,它都需要这么长时间的话,那它本身就不具备实用性。

    继续看,后面我就让它生成一个 SVG,表达钍基熔盐堆运行原理图。你看中间我生气了:“你他妈的,抓紧完成任务。”最终是在我的敦促之下,花了 10 分 2 秒完成这个图。还不错吧,只能说还不错,审美也在线,但是性价比还是那句话,完全不具备任何的性价比。如果用这个东西来工作,就没办法工作。

    thorium-molten-salt-reactor.svg

    它不仅是在 DeepSeek Harness 上慢,在 Codex 上面也是慢得出奇。我跟你们讲,我给你们看的这个结果是经过我美化的,懂不懂?就是中间我用它来执行很多任务,它直接就是失败,很长时间没有响应,就直接完了,完全不具备可用性。

    那你说它在线版本怎么样?你看,在线版本就生成得非常快,速度非常快。生成的效果呢?我们来看一下,这个是它在非常快的情况下完成的网页。讲实话,老子真的是被逗笑了,真的是被逗笑了。如果说你指望这个玩意去帮你编程,指望它去帮你干活的话,你不如把你家的狗训练一下,让它去学一下 AI 怎么用,或者让它去学一下编程。反正你是不能指望这么个玩意干活的,真的我是被逗笑了。

    八卦.html

    钍基熔盐堆的运行原理图,这个就反映出它的智商本来就是这么高,就是它只能画出这么个水平的图。你看到的那些复杂的图,那个是什么?Harness 框架调度它进行长时间的思考、修正得到的结果。但是它本身在驱动 Agent 的时候,在驱动 Harness 的时候,它的工作时长是惊人的,完全不划算。

    tsmr.html

    生成一个 SVG 表达薛定谔的猫思想实验,这个应该就是它的真实水平。它可能会先生成一个草稿,草稿就是这个水平了,然后不断地去修正它。讲实话,老子真的是被逗笑了。就这玩意,把它归为我遇到过的最垃圾的模型,没有之一。我都不知道阿里巴巴为什么要把这样的模型放出来,为什么要吹这么大的牛逼。

    薛定谔.html

    当然了,我们不否认,如果说你在小主机上,然后你不那么急,你愿意跟它的官方 AI 直接聊天,或者说你愿意接入 Codex、DeepSeek Harness,让它无限制等,一个任务给你执行个十几分钟、二十分钟,那我觉得它也还是能用的。最起码它给的这个结果,我感觉可以的。还有动态效果,就交付的最后得分,我还是要给它 95 分的得分。但是,真的完全不具备生产的实用价值。

    然后就这么一摊子破事,它花了我多少钱?花了我 3 块钱,还需要加上送我的免费额度。兄弟们,我讲实话,这点钱去买点狗粮,把你的狗好好训练一下,让它学一下编程,这个可能是比较合适的使用它的方式。你如果要实现把你自己从日常的编程跟 Agent 任务中解放出来的话,那就养一条狗,知道吗?给它买点狗粮。就这玩意已经完全不具备性价比了,无论是在线还是它本地的配置。

    qwen3.8 flash 在线api开销

    不过我们也需要知道,Qwen 家族它历来是这样,它每发布一个模型,社区都要经过好一阵子的调教。但是我认为,如果说是对它进行重大 Bug 的修复,我认为交互方面的修复是可以做得到的,但是它这么慢,我认为很难修复。这个恐怕不是调度的问题,因为我是使用了两个框架,一个是 DeepSeek Harness,这个是公认的目前最快的框架,就连自家的 Qwen3.8 27B 在本地的模型都能跑得非常流畅。

    那我认为多半就是它这个模型自身,就是在内部,无论你关不关它思考,它都会过度思考,都会反复地尝试,很容易卡工具调用、卡死循环。这玩意我认为这个病不太容易治,可能需要再过一个月、两个月,到时候再看看。

    我给这个模型打分的话,这个模型打 40 分。它能够交出一些惊艳的答卷,但是这个代价太高了。我不知道你们在本地部署可能会有什么样的效果,但是我使用的是官方的 API,我想你们应该不至于比官方部署的效果还要好吧?这个东西等社区去慢慢修正嘛。总之非常失望,非常垃圾。

    油管:https://www.youtube.com/@抡锤者

    D 1 条回复 最后回复
    0
    • terryT 在线
      terryT 在线
      terry
      超级版主
      编写于 最后由 编辑
      #2

      Youtube Video

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0
      • zhenyu huangZ 在线
        zhenyu huangZ 在线
        zhenyu huang
        编写于 最后由 编辑
        #3

        我去 实测竟然那么蠢

        1 条回复 最后回复
        0
        • JayJ 离线
          JayJ 离线
          Jay
          编写于 最后由 编辑
          #4

          理论上6b的速度应该是27b的好几倍。这么慢的话是不是有一部分权重被offload到硬盘上去了?楼主有具体配置和启动参数吗

          David ChenD 1 条回复 最后回复
          0
          • JayJ Jay

            理论上6b的速度应该是27b的好几倍。这么慢的话是不是有一部分权重被offload到硬盘上去了?楼主有具体配置和启动参数吗

            David ChenD 在线
            David ChenD 在线
            David Chen
            编写于 最后由 编辑
            #5

            @Jay 他最後有說是用雲端API.....還抱怨浪費了3塊錢....這系統大概是為了跑分,加強思考....qwen3.8 大概都有相同的毛病,靜待下週神人優化

            1 条回复 最后回复
            0
            • Lee Lee 0L 离线
              Lee Lee 0L 离线
              Lee Lee 0
              编写于 最后由 编辑
              #6

              慢的离谱,消耗也大,实测是dsv4f好几倍。

              1 条回复 最后回复
              0
              • 老 离线
                老 离线
                老茶
                编写于 最后由 编辑
                #7

                一早看到,火速中止本地部署进程😂

                1 条回复 最后回复
                0
                • stxpnetS 离线
                  stxpnetS 离线
                  stxpnet
                  超凡大师
                  编写于 最后由 编辑
                  #8

                  这个NEXT代表的意思是下一代预览,使用的下一代架构,还是要给它一些时间等实测。我只有64G内存就不玩了。如果我有80G或者96G+内存都会试试。

                  26-08-19
                  双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
                  8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

                  1 条回复 最后回复
                  0
                  • terryT terry

                    Qwen3.8 Flash 这个模型现在热度非常高,因为跑分吊打自家的 Qwen3.8 27B。它是 125B A6B 模型,也就是说总的尺寸是 125B,然后激活 6B。目前已经有不少人在小主机上,什么 AI Max 395、DGX Spark,包括苹果的小主机上都能跑起来。但是这些信息是 ChatGPT 告诉我的。我本人感觉它 4 比特量化之后,这些 128G 的小主机是能跑起来的,但是它不是还带一个叫 NGram 的模块吗?这个东西也要把它挂载到内存中去,或许也可以挂载到 SSD 吧。反正这些人都在小主机上跑起来了,说这个模型非常智能。

                    如果从跑分上来说的话,它能够吊打、全方面压制 Qwen3.8 27B,那么应该也是比 DeepSeek V4 Flash 要强一点的。你看这是 V4 Flash 的评分,DeepSeek V4 Flash 就只有在两个领域能够跟 Qwen3.8 Flash 相比,而且它还宣称超过了 Claude Opus 4.6 Max,Opus 4.6 就只有一个跑分超过它。那么这个模型是不是很强大呢?关于 Opus 4.6 这个模型,我必须说这个模型非常特殊,因为我在之前的视频中讲过,这个模型是我第一次在 Agent 上感觉 AI Agent 有意义,它能真正地干活,能够智能,就是当时接入的 Claude Opus 4.6。

                    Qwen3.8 Flash实测.jpeg

                    半年时间过后,没想到这么多中国的模型都能够对标 Opus 4.6,我非常欣慰。其中毫无疑问,DeepSeek V4 Flash 是证明了它的实力,非常好用,而且很便宜,响应速度非常快。Qwen3.8 27B 有这样那样的问题,但是也在我的实际部署中证明了自己。今天我们来看一下 Qwen3.8 Flash,它是否像它标称的这么牛逼、这么厉害。

                    首先把它接入到我的 DSH,就是 DeepSeek Harness 上。这个过程我是让 Qwen3.8 27B FP8 来完成的。这个怎么说呢,它本身在本地执行这些 Agent 的常规任务,响应速度是非常快的。我们看一下,这个缓存显示错误,平均首 Token 是 0.9 秒的延迟,24 Tokens/s。我没有给它加入 MTP,也没有加入 DeepFlash,我感觉这样已经够用了。我认为如果要多开的话,因为我昨天是同时开了两个长会话、两个短会话测试 Qwen3.8 27B FP8,SGLang 驱动的,后边是 4090D 48G。如果想要关注这个体验的,可以到论坛去看看相关的帖子,或者看我昨天的视频,今天我们就一笔带过。

                    Qwen3.8 27b配置qwen 3.8 flash在线模型

                    下面就进入漫长的实际测试。我必须说,自从上一次测试 Meta 的 Muse Glimmer 这个模型之后,我当时不是说了吗,我是第一次在测试中被一个模型给逗笑。我认为可能在我以后的测试生涯中,不会再遇到这样的模型了。但是对不起,我错怪了 Muse Glimmer,错怪了老黄的免费 Nemotron 模型。对不起,你们不是垃圾,你们不是狗屎,最起码你们不是最垃圾的狗屎。Qwen3.8 Flash 打破了我的认知,就是它基本上没有办法执行任何的 Agent 任务。

                    你看,陷入了死循环。一开始我以为是思考模式的问题,后来我又把思考模式给它关了。让它生成一个八卦网页,目标是让它生成一个网页表达中国的传统八卦,最终实在是没有办法进行下去了,我把这个任务终止了。这个就是它生成的结果,这个审美我只能说及格了,好吧。太极图也画对了,但是这个卦象还是错了,卦位你看。就这么个玩意,我真的是被逗笑了。

                    9c80df88-7aab-454a-86c6-5c51e92f9e21-image.jpeg

                    好吧,我们不排除 DeepSeek Harness 可能跟它不兼容。但是我又测试了一下,这个通信是通的,协议是正常的,能够非常清楚地知道自己是谁、在干什么。下面让它生成一个钍基熔盐堆原理图,最终它没有办法完成任务。这个是它生成的中间产物,我实在是看不下去了。当然了,它并不是一开始就是这么乱的,因为它卡了十几分钟,我实在没有办法了,把它关掉了,这个是它的中间产物。

                    e71cc3a4-7be9-4aaa-9076-c4bfef7e3102-image.jpeg

                    好吧,我就不测试它复杂的功能了。我就说你去检查一下 2.9 的服务器的资源状况,这个任务它花了十几分钟,还在这里搜集信息。就这么傻逼的模型,我是从来没遇到过的。我想,我是不是错怪它了呀?万一在 Codex 上它可用呢?好吧,把它接入 Codex。

                    问它问题,它是什么?Codex 问它是什么模型,就这么一个简单的问题,它花了 1 分钟 5 秒来回答我。我原谅它了。生成一个网页表达中国的传统八卦文化,你们猜它完成这个任务花了多长时间?19 分钟 37 秒。我们看看它完成的这个模型是什么样子。唉,还不错,这个也对了。

                    2deee45a-5437-426b-be57-873317021e69-image.jpeg
                    bagua.zip

                    我想我需要给刚才 DSH 接的这个 Qwen3.8 做一个平反,它很有可能就是这个模型过度思考,它就是慢,这是很有可能的。它花了 20 分钟时间来完成这个网页的话,我就给比较高的分数了。这个鱼眼也只能说勉强画对了吧,得分是比较高的。有可能是刚才我把它中断了,导致它没有完成任务,要给它平反一下。但是我说实话,这个网页我给它 95 分,95 分,但是这个性价比我给它 5 分。如果说做这么一个简单的工作,它都需要这么长时间的话,那它本身就不具备实用性。

                    继续看,后面我就让它生成一个 SVG,表达钍基熔盐堆运行原理图。你看中间我生气了:“你他妈的,抓紧完成任务。”最终是在我的敦促之下,花了 10 分 2 秒完成这个图。还不错吧,只能说还不错,审美也在线,但是性价比还是那句话,完全不具备任何的性价比。如果用这个东西来工作,就没办法工作。

                    thorium-molten-salt-reactor.svg

                    它不仅是在 DeepSeek Harness 上慢,在 Codex 上面也是慢得出奇。我跟你们讲,我给你们看的这个结果是经过我美化的,懂不懂?就是中间我用它来执行很多任务,它直接就是失败,很长时间没有响应,就直接完了,完全不具备可用性。

                    那你说它在线版本怎么样?你看,在线版本就生成得非常快,速度非常快。生成的效果呢?我们来看一下,这个是它在非常快的情况下完成的网页。讲实话,老子真的是被逗笑了,真的是被逗笑了。如果说你指望这个玩意去帮你编程,指望它去帮你干活的话,你不如把你家的狗训练一下,让它去学一下 AI 怎么用,或者让它去学一下编程。反正你是不能指望这么个玩意干活的,真的我是被逗笑了。

                    八卦.html

                    钍基熔盐堆的运行原理图,这个就反映出它的智商本来就是这么高,就是它只能画出这么个水平的图。你看到的那些复杂的图,那个是什么?Harness 框架调度它进行长时间的思考、修正得到的结果。但是它本身在驱动 Agent 的时候,在驱动 Harness 的时候,它的工作时长是惊人的,完全不划算。

                    tsmr.html

                    生成一个 SVG 表达薛定谔的猫思想实验,这个应该就是它的真实水平。它可能会先生成一个草稿,草稿就是这个水平了,然后不断地去修正它。讲实话,老子真的是被逗笑了。就这玩意,把它归为我遇到过的最垃圾的模型,没有之一。我都不知道阿里巴巴为什么要把这样的模型放出来,为什么要吹这么大的牛逼。

                    薛定谔.html

                    当然了,我们不否认,如果说你在小主机上,然后你不那么急,你愿意跟它的官方 AI 直接聊天,或者说你愿意接入 Codex、DeepSeek Harness,让它无限制等,一个任务给你执行个十几分钟、二十分钟,那我觉得它也还是能用的。最起码它给的这个结果,我感觉可以的。还有动态效果,就交付的最后得分,我还是要给它 95 分的得分。但是,真的完全不具备生产的实用价值。

                    然后就这么一摊子破事,它花了我多少钱?花了我 3 块钱,还需要加上送我的免费额度。兄弟们,我讲实话,这点钱去买点狗粮,把你的狗好好训练一下,让它学一下编程,这个可能是比较合适的使用它的方式。你如果要实现把你自己从日常的编程跟 Agent 任务中解放出来的话,那就养一条狗,知道吗?给它买点狗粮。就这玩意已经完全不具备性价比了,无论是在线还是它本地的配置。

                    qwen3.8 flash 在线api开销

                    不过我们也需要知道,Qwen 家族它历来是这样,它每发布一个模型,社区都要经过好一阵子的调教。但是我认为,如果说是对它进行重大 Bug 的修复,我认为交互方面的修复是可以做得到的,但是它这么慢,我认为很难修复。这个恐怕不是调度的问题,因为我是使用了两个框架,一个是 DeepSeek Harness,这个是公认的目前最快的框架,就连自家的 Qwen3.8 27B 在本地的模型都能跑得非常流畅。

                    那我认为多半就是它这个模型自身,就是在内部,无论你关不关它思考,它都会过度思考,都会反复地尝试,很容易卡工具调用、卡死循环。这玩意我认为这个病不太容易治,可能需要再过一个月、两个月,到时候再看看。

                    我给这个模型打分的话,这个模型打 40 分。它能够交出一些惊艳的答卷,但是这个代价太高了。我不知道你们在本地部署可能会有什么样的效果,但是我使用的是官方的 API,我想你们应该不至于比官方部署的效果还要好吧?这个东西等社区去慢慢修正嘛。总之非常失望,非常垃圾。

                    D 离线
                    D 离线
                    deadnessking
                    编写于 最后由 编辑
                    #9

                    @terry 说:

                    但是我使用的是官方的 API,我想你们应该不至于比官方部署的效果还要好吧

                    难说,现在官方api量化到降智是日常

                    1 条回复 最后回复
                    0

                    你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                    厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                    有了你的建议,这篇帖子会更精彩哦 💗

                    注册 登录
                    回复
                    • 在新帖中回复
                    登录后回复
                    • 从旧到新
                    • 从新到旧
                    • 最多赞同


                    • 登录

                    • 登录或注册以进行搜索。
                    • 第一个帖子
                      最后一个帖子
                    0
                    • 版块
                    • 最新
                    • 标签
                    • 热门
                    • 用户
                    • 群组