Qwen3.8 27B AA综合评分与 DeepSeek V4 Flash 持平
-
@terry 这方面我就不专业了,最近有人跟我对接火山方舟的DeepSeek API资源,能够拿到折扣价;他这种抖音下面自建的和官方的模型能力是不是一样的呢?还是说在什么地方存在性能差距?
-
感谢提醒,大概看了下,还是老问题,小模型的认知水平太差了。

这就导致即便他的逻辑能力,长上下文推理能力不弱于flash-preview,甚至能和0731来回。但因为底层认知有巨大鸿沟,所以他更依赖外部数据源的质量。也会比v4-flash-0731有更多的loop和试错。知识量的差距就是这样。
如果以后小模型能再进一步,可能小模型+配套行业的数据源的套餐组合是一套新打法。
但话又说回来,即便如此,他的实际解决问题的能力依然出众,确实厉害。

对应的,在如此强的工具、Agent能力之下,256K的上下文其实已经有点瓶颈了。
上重一点的Agent就很有可能多次压缩,导致信息损失。
