Qwen3.8 27B AA综合评分与 DeepSeek V4 Flash 持平
-
刚出炉的新鲜评分,Qwen3.8 27B 52 分,与 DSV4 Flash 0731 持平
不给上传图片了?大家自己看吧。
Artificial Analysis Intelligence Index
当然,评分对应的应该是参数无量化、kv cache 无量化的官方版本。
个人体感:3.8 更具主动性,做长任务的能力强了很多。分数或许略有水分,但比 DSV4 Flash Preview 好用是肯定的。和API 相比其实也就是速度慢了点,完全可以替代很多 API 模型了。
从 3.6 到 3.8 也才半年,官方已经敢拿它和 Opus 4.6 对比,而不久前 Opus 4.6 还是最好的编程模型。未来应该会超乎很多人想象。
-
@terry 这方面我就不专业了,最近有人跟我对接火山方舟的DeepSeek API资源,能够拿到折扣价;他这种抖音下面自建的和官方的模型能力是不是一样的呢?还是说在什么地方存在性能差距?
-
感谢提醒,大概看了下,还是老问题,小模型的认知水平太差了。

这就导致即便他的逻辑能力,长上下文推理能力不弱于flash-preview,甚至能和0731来回。但因为底层认知有巨大鸿沟,所以他更依赖外部数据源的质量。也会比v4-flash-0731有更多的loop和试错。知识量的差距就是这样。
如果以后小模型能再进一步,可能小模型+配套行业的数据源的套餐组合是一套新打法。
但话又说回来,即便如此,他的实际解决问题的能力依然出众,确实厉害。

对应的,在如此强的工具、Agent能力之下,256K的上下文其实已经有点瓶颈了。
上重一点的Agent就很有可能多次压缩,导致信息损失。
