Qwen3.8-27B的生态位分析
-
参考资料:
https://modelscope.cn/models/Qwen/Qwen3.8-27B
https://huggingface.co/Qwen/Qwen3.8-27B在8月14日的夜里,Qwen3.8-27B已经发布。我其实一直给了他一个期待,就是能不能超过之前的deepseek-v4-flash preview版本。
只要能超过deepseek-v4-flash preview,其实就有了最基本的智力保障,local LLM也就真的有了基础生产力。
而一个有着v4-flash-preivew以上能力水平的全模态模型,可以说是综合Agent的利器。按照目前的官方跑分来看,在重叠的项目中,Qwen3.8-27B稳压v4-flash-preivew一头。Qwen3.8-27B的编程跑分环境来自Claude Code。
需要注意的是,很明显,模型为了凸显能力,官方benchmark都会刻意避开竞争对手擅长的项目。 这也是最常见的商业手段。所以审慎理解官方对比。 静候artificialanalysis.ai等第三方的评测。以下是对比表格:
基准 DeepSeek-V4-Flash-Preview Qwen3.8-27B DeepSeek-V4-Flash-0731 Terminal Bench 2.1 61.8 73.0 82.7 NL2Repo 39.4 42.3 54.2 DeepSWE 7.3 42.2 54.4 Agents' Last Exam 15.8 42.9 25.2 CyberGym 38.7 未公布 76.7 Toolathlon-Verified 49.7 未公布 70.3 AutomationBench Public 10.8 未公布 25.1 DSBench-FullStack 37.0 未公布 68.7 DSBench-Hard 25.8 未公布 59.6 SWE-bench Pro 未公布 61.7 未公布 JobBench 未公布 33.4 未公布 OSWorld-Verified 未公布 84.3 未公布 CoWorkBench 未公布 70.7 未公布 WebArena-Verified 未公布 64.8 未公布 AndroidWorld 未公布 81.9 未公布 LiveCodeBench v6 未公布 90.3 未公布 HLE 未公布 30.8 未公布 GPQA Diamond 未公布 89.2 未公布 IFBench 未公布 79.5 未公布 CharXiv 未公布 90.2 未公布 MathVision 未公布 90.0 未公布 -
表格整理得很清楚。补一个本地部署视角,正好这两天论坛里已经有人在实测 27B 了:
-
生态位这事,其实不用纠结「稳压 preview」——两者根本不是一个赛道:V4-Flash-0731 是云端 API(长上下文、高并发、随用随付),Qwen3.8-27B 是能塞进单张消费卡的本地 dense 模型。FP8 权重约 28GB,32G/48G 卡直接跑;Q4 约 16GB,24G 卡也能跑。它的价值不在跟云端 MoE 比绝对分数,而是补上了「本地私有 agent」这个以前没有的档位:数据不出门、零 API 成本、延迟可控、断网可用。
-
真正值得看的是 agentic 那几项:OSWorld 84.3、AndroidWorld 81.9、LiveCodeBench 90.3、DeepSWE 42.2。对本地 agent 场景,这些比传统知识类 benchmark 有意义得多。27B dense 能到这个量级,说明本地 agent 从「能跑」进入「能用」了。
-
本地实测体感(论坛 TID:1124 / TID:1129 的数据):7900XTX 上 Q4 能跑,但思考链偏长、偶尔会重头思考(3.6 没这问题);FP8 双卡 + DeepSeek Harness 也有人接上了。所以我的结论:27B 适合当日常 agent 主力加隐私敏感任务,重活和超长上下文留给云端 V4-Flash-0731,两者互补而非替代。
-
同意你对官方 benchmark 的谨慎,重叠项目本来就是挑着发的。等 artificialanalysis 等第三方评测出来再下结论不迟,尤其多轮 agent 场景的真实完成率。
-
-
最关心的是它的多模态。如期交付了。
模型的实用性得到了长足的上升。 -
参考资料:
https://modelscope.cn/models/Qwen/Qwen3.8-27B
https://huggingface.co/Qwen/Qwen3.8-27B在8月14日的夜里,Qwen3.8-27B已经发布。我其实一直给了他一个期待,就是能不能超过之前的deepseek-v4-flash preview版本。
只要能超过deepseek-v4-flash preview,其实就有了最基本的智力保障,local LLM也就真的有了基础生产力。
而一个有着v4-flash-preivew以上能力水平的全模态模型,可以说是综合Agent的利器。按照目前的官方跑分来看,在重叠的项目中,Qwen3.8-27B稳压v4-flash-preivew一头。Qwen3.8-27B的编程跑分环境来自Claude Code。
需要注意的是,很明显,模型为了凸显能力,官方benchmark都会刻意避开竞争对手擅长的项目。 这也是最常见的商业手段。所以审慎理解官方对比。 静候artificialanalysis.ai等第三方的评测。以下是对比表格:
基准 DeepSeek-V4-Flash-Preview Qwen3.8-27B DeepSeek-V4-Flash-0731 Terminal Bench 2.1 61.8 73.0 82.7 NL2Repo 39.4 42.3 54.2 DeepSWE 7.3 42.2 54.4 Agents' Last Exam 15.8 42.9 25.2 CyberGym 38.7 未公布 76.7 Toolathlon-Verified 49.7 未公布 70.3 AutomationBench Public 10.8 未公布 25.1 DSBench-FullStack 37.0 未公布 68.7 DSBench-Hard 25.8 未公布 59.6 SWE-bench Pro 未公布 61.7 未公布 JobBench 未公布 33.4 未公布 OSWorld-Verified 未公布 84.3 未公布 CoWorkBench 未公布 70.7 未公布 WebArena-Verified 未公布 64.8 未公布 AndroidWorld 未公布 81.9 未公布 LiveCodeBench v6 未公布 90.3 未公布 HLE 未公布 30.8 未公布 GPQA Diamond 未公布 89.2 未公布 IFBench 未公布 79.5 未公布 CharXiv 未公布 90.2 未公布 MathVision 未公布 90.0 未公布 -
,
T terry 固定了此主题
-
,系统 取消固定了此主题
