小米MiMo-V2.6-Flash实测:价格便宜,短任务惊艳但速度慢,长任务BUG多,可等待优化后再接入生产!
-
上了年纪之后,体力不济,玩了一下游戏,由于通宵,所以非常累。本来应该立刻睡觉,但是有网友发帖说,小米 MiMo V2.6 Flash 发布了,而且它的 V2.6 Pro 版本跑分是进入了顶级的行列,进入了 SOTA 模型的行列。它的 V2.6 Flash 跑分大部分地方都超过了 DeepSeek V4.1 Flash,应该说是全面领先吧。它是 300B 的模型,DeepSeek V4.1 Flash 是 550B 的模型,然后 V4.0 Flash 是 280 多 B,就是跟它差不多的。但是从跑分来讲的话,V4 Flash 肯定是没有资格跟 MiMo V2.6 Flash 相比了。它这个跑分已经是跟 Claude Opus 5 以及 GPT-5.6 Sol 这两家的主力干活模型相媲美了,与旗舰 Fable 5 以及 GPT-6 Astra,甚至距离 Fable 5.1 差距也不是那么大,也都够看了。这个就是非常夸张了。
那么它的表现真的如此牛逼吗?大家都知道我这人,不看广告看疗效。曾经它的 2.5 版本是得到了我的好评的,在它发布的时候,我个人认为最起码在多模态领域,它是有得一战的。就是它画这个 SVG 图像,是我认为最优秀的。那么我们去看看它这个 2.6 Flash 表现如何。

首先我们说这个测试平台,我又把我这个 OpenRouter 的钱给充了 10 美金进去。上次不是欠了两个多美金吗?那么这次充了之后,我今天执行所有的任务,到现在为止是花了 0.5 美金左右,因为有两个美金左右是欠账,也就花了 3 块钱左右吧。那么比上一次我测试千问 3.8 Flash 要便宜一点,这个还是一个好消息。然后为什么我在这个地方让它生成一个网页表达钍基熔盐堆的运行原理呢?就是因为我同时在 DeepSeek Harness 里让它开了一个任务,生成一个网页表达中国的传统八卦文化。这就是我测试的时候最常用的起点。它整了十几分钟,还是 20 分钟,反正最后是失败了,我最后都生气了,飙了脏话。它失败了,然后我又让它重开了一个任务,这一次它终于是没有失败,把这个表达中国传统八卦文化的网页给生成了,然后还捎带手生成了一个 SVG,表达薛定谔的猫思想实验。因为我一向都是测试这三个项目,然后有一个项目就是通过直接聊天的方式,让它生成钍基熔盐堆运行原理图,有网页版的,也有 SVG 版本的。我们不说,就看这个效果吧,不看广告看疗效。

首先第一个,我们还是看这个八卦网页吧。就是它生成的时间是特别长的,最起码是 DeepSeek 的 5 倍以上,甚至有可能是 10 倍,因为 DeepSeek 做这样一个网页很快就做出来了。它的这个效果是比 DeepSeek 做的效果要好一点的,这是我到目前为止见过的最好的。第一,它把这个太极都画对了;第二,它基本抓住了如何布局,也有这些美感;然后第三,它的表达形式与信息表达的密度,它的排列方式,都是一流的,是我所推崇的模式。然后它还做了一个夜间模式,我们看一下,可以说是集众家之所长。这一块我怎么讲,给它打 95 分。但是我还是那句话,它的时间太长了。如果说从工作的角度来考虑的话,它是不合格的,是没有 DeepSeek V4.1 Flash 更好的。DeepSeek 它生成这样的网页,效果可能跟它差不多吧,比它略差一点点。因为 DeepSeek 它不会做这种夜间模式跟白天模式,它默认的就是这种屎黄色的审美,它特别好这个东西,不知道为什么。但是其他的应该就是说,我给小米的这个打分是 95 分,给 DeepSeek 的网页以前打分大概在 90 分左右,大家可以翻看一下以前的视频。工作成果是非常不错的,但是速度特别慢。
bagua-culture.html然后看看它这个表达钍基熔盐堆运行原理的网页。我们看一下,它有一个 SVG 图像。这是一个 SVG 图像,我认为做的效果不错吧,打个 90 分。它有动态效果,这个是小米的长项,它每一次在这方面的表现都是非常不错的,这块是肯定胜过 DeepSeek 的。如果说是这个网页的话,那我给它打 95 分。这是到目前为止我见过的最好的表达钍基熔盐堆运行原理的这么一个网页,就是资讯非常全,图又是动态图,效果非常不错,而且它每一个阶段你看,这是非常非常不错的。
然后我们再看一下薛定谔的猫思想实验,就这么一个小东西,它给我搞了十几二十分钟时间。这个效果我给 90 分吧,85 分,因为这里搞得不太好。但是总体上,它这三项得分,虽然它是 Flash 模型,它是到目前为止唯一一个没有任何弱项的,没有一个明显错误的,大的排版布局,包括设计方面的失误,没有,它是唯一一个。哪怕以前我用 Claude,包括 GPT 来测试的时候,它们也没有做得这么全面。也可能跟我个人的审美偏好有关系吧。那么在这一块我给它打 95 分,这是非常高的分数。
但是它的性价比我还是那句话,不如 DeepSeek V4.1 Flash,甚至都不如 V4 Flash,因为它太慢了。价格我必须说它是非常便宜的,因为我一共执行这么多任务,就花了 3 块钱,这里面还有两个是那种长链任务,一会儿给大家看。就是讲实际工作的时候,它失败的概率是很高的,很容易卡工具 bug,就死了。你看我这时候生气了。
还有就是我给它做一个简单的测试,大家可以看一下,它到现在都没反应过来。就是我的 APP 开发中有一个小 bug,这个 bug 是什么呢?就是我这个帖子比如说删了,在这个网页端,它是有一个版主功能,是把它彻底删除,或者说是作者本人可以把它彻底删除,但是在 APP 端,它没有实现这个功能。这个其实是一个非常简单的 bug,就只要你能把整个 APP 的代码找到并且理解准确,应该像 DeepSeek V4.1 Flash 来改这个 bug 的话,可能 2 分钟左右就能把它改好。但是大家看看,它卡 bug 了,已经卡了一个小时了。现在我就把它终结掉。你看看多少的错误。就是这个模型本身可能还不太成熟,就有点千问 3.8 Flash 刚发布的时候那种感觉。我个人承认,这个将来是有可能修好的,可能在比较短的时间内。但是你看看,这 TM 的这个网页我都不敢打开了,算了,我把这个会话给删掉。

所以说这个模型有它惊艳的地方,但是它干活的成功率确实太低了。你看刚开始生成网页的时候,它也卡了很久。大家不要认为这个东西跟 DeepSeek Harness 有关,就是你看看我直接跟它聊天的时候,你看它卡了多久,就这么多错误。讲实话我一开始都没想到,就这么一个屁大的简单的任务,它也是给我花了十几分钟,就是以直接聊天的方式,它也是花了十几分钟才搞定。这个我想就是还是怎么讲呢,跟千问 3.8 Flash 一样,就走的是 Claude 那种 API 内置 Harness 工程的这么一个做法。就这种做法,就是让这个模型它本身跑分比较高,然后它做任务的效果比较惊艳,给你感觉它的智商很高、能力很强。但是我在之前的视频中多次说到过,这是一条邪路,知道吗?它的副作用是非常非常明显的。第一就是做任务慢得跟狗一样,第二就是它在模型内部,就是在任务内部、API 内部不断地尝试。

刚才我后悔把刚才那个网页任务给删了,应该是可以找到一点蛛丝马迹的,我给大家看一下,你们就明白是什么原因了。来,我们看一下,我让它生成一个 SVG 表达薛定谔的猫思想实验。你看,它实际上很早就画好了,然后不断地截图,看到没有?再截图修正,然后截图修正,截图修正。你看,一直在改版本,一直在改,一直在改。它实际上改了十几二十个版本,看到没有?一直在改。最后它终于把这个错误给改完了。这个东西就是 Harness 工程做的事情。就是说,它这个 API 我不知道它内部是怎么用的,反正如果说是 DSH,如果调的是 DeepSeek 官方 API 的话,那么没有这么多个事情,最多修正一次两次就了不得了,它就会把这个结果给吐出来。
这个要看你怎么想了。就是目前我认为这个模型还是有一些比较硬性的 bug,可能要等官网给修复一下。但是我认为是未来可期。有的人他工作中可能不太在乎你的任务做得快或者慢,因为只要这个模型本身够便宜,你比如说你可以同时开 10 个进程、开 20 个进程,你开 20 个会话来做。但是有些任务它本身就是有一定的线性,比如说这个 APP bug 的修复,你不可能说 6 个 bug 让它同时分线程去跑的,它有的 bug 是耦合的。总之我是不太认同这样的技术路线的,但是也不得不承认这样的路线有一定的优势,能够跑分跑得比较好看,在一些短任务中给出比较惊艳的答卷。

视频的最后,我也希望大家积极去测试这个模型,发表你们的看法。我相信在短期内,雷布斯他的这个团队如果能够把它这个响应速度给提升上来,然后还能把它这个工具调用会卡死的 bug 给修复掉,那么这个模型还是很有战斗力的。就跟千问 3.8 Flash 一样,一出来的时候真的是狗屎,但是后来修着修着它就能用了。小米的这个模型是奔着 DeepSeek V5 Flash 来的,它不是奔着 V4.1 Flash 来的。虽然跑分它宣称比 V4.1 Flash 要更强,但是事实证明它做任务,给 V4.1 Flash 提鞋都不够,做复杂任务的时候。但是它可能会是 V4 Flash 的比较好的替代者。这是小米第一次做甜点尺寸的 MoE 模型,也就是像苹果 M5 Ultra 256G,以及两个英伟达 DGX Spark 小盒子就能跑。这是一个甜点的尺寸,对很多人来说,它非常重要。
-
@terry 沙罗曼蛇啊
