Qwen releases Qwen3.8-Flash-Next! 來了
-
Qwen/Qwen3.8-Flash-Next (參數180B)
https://huggingface.co/Qwen/Qwen3.8-Flash-NextQwen3.8-Flash-Next(約125B-A6B + 51B n-gram) 記憶體預估:理想的 4 位元量化表 ≈ 82 GB (58 GB 主權重 + 24 GB n-gram 表) 實際量化表的大小可能在 80-90 GB 範圍內。 大型 n-gram 表存取稀疏 → 非常適合系統 RAM 卸載。 一旦重量減輕,這種架構可能會出乎意料地對本地化非常友善。



翻譯版
编程 Coding
评测项目 Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash-0731 Claude-Opus-4.6 (Max) 智能体编程 Agentic coding — DeepSWE 1.1 58.7 42.2 16.5 54.4 -- 智能体编程 Agentic coding — SWE-bench Pro 62.5 61.7 55.8 56.0 53.4 多语言软件工程 Multilingual software engineering — SWE-bench Multilingual 81.0 73.8 75.8 -- 77.5 仓库级代码生成 Repo-level code generation — NL2Repo-Bench 48.1 42.3 41.1 54.2 47.6 智能体 Agent
评测项目 Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash-0731 Claude-Opus-4.6 (Max) 长周期办公任务 Long-horizon office work — CoWorkBench 73.9 70.7 65.1 45.1 68.2 专业工作任务 Professional job tasks — JobBench 55.7 33.4 27.6 41.3 36.6 前沿智能体任务 Frontier agentic tasks — Agents' Last Exam Pass@1 24.3 / Score 51.2 Pass@1 20.4 / Score 42.9 Pass@1 13.2 / Score 33.6 Pass@1 25.2 / Score -- -- 真实世界工具使用 Real-world tool use — Toolathlon Verified (Pass@1) 73.5 67.1 50.6 70.3 -- 通用能力 General
评测项目 Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash-0731 Claude-Opus-4.6 (Max) 指令遵循 Instruction following — IFBench 81.3 79.5 79.1 79.2 62.5 科学推理 Scientific reasoning — GPQA Diamond 91.7 89.2 90.3 90.8 91.3 多学科推理 Multidisciplinary reasoning — HLE 35.9 30.8 34.7 33.8 40.0 竞技编程 Competitive coding — LiveCodeBench v6 91.9 90.3 89.6 90.6 88.8 注释
-
DeepSWE 1.1:使用 Claude Code 和 mini-SWE-agent 两套评测框架进行测试,
temp=1.0、top_p=0.95、上下文窗口为 256K。报告两套框架中的最高分;其中 Qwen3.8-Flash-Next 在 mini-SWE-agent 上表现最佳。 -
SWE-bench Pro:除 Claude-Opus-4.6 (Max) 使用官方公布成绩外,其余所有模型均使用 Claude Code 评测框架,
temp=1.0、top_p=0.95、256K 上下文窗口。存在问题的任务已被修正,并在改进后的 Benchmark 上重新评测所有基线模型。 -
SWE-bench Multilingual:使用 mini-SWE-agent 评测框架,
temp=1.0、top_p=0.95、256K 上下文窗口。 -
NL2Repo-Bench:使用 Claude Code 评测框架。为了防止“奖励黑客”(reward hacking),禁用了尝试访问指定代码仓库的 Bash 命令,例如
pip download、pip install和git clone。 -
CoWorkBench:内部开发的协作工作 Benchmark,用于评估计算机科学、金融、法律、医疗及其他生产力领域中的长周期办公与生产力智能体任务。
-
HLE:由 GPT-4o 进行判定评分。
-
每一行的最佳成绩以粗体显示。
-
空白单元格
--表示成绩尚未提供,或该项目不适用。
-
-
Qwen/Qwen3.8-Flash-Next (參數180B)
https://huggingface.co/Qwen/Qwen3.8-Flash-NextQwen3.8-Flash-Next(約125B-A6B + 51B n-gram) 記憶體預估:理想的 4 位元量化表 ≈ 82 GB (58 GB 主權重 + 24 GB n-gram 表) 實際量化表的大小可能在 80-90 GB 範圍內。 大型 n-gram 表存取稀疏 → 非常適合系統 RAM 卸載。 一旦重量減輕,這種架構可能會出乎意料地對本地化非常友善。



翻譯版
编程 Coding
评测项目 Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash-0731 Claude-Opus-4.6 (Max) 智能体编程 Agentic coding — DeepSWE 1.1 58.7 42.2 16.5 54.4 -- 智能体编程 Agentic coding — SWE-bench Pro 62.5 61.7 55.8 56.0 53.4 多语言软件工程 Multilingual software engineering — SWE-bench Multilingual 81.0 73.8 75.8 -- 77.5 仓库级代码生成 Repo-level code generation — NL2Repo-Bench 48.1 42.3 41.1 54.2 47.6 智能体 Agent
评测项目 Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash-0731 Claude-Opus-4.6 (Max) 长周期办公任务 Long-horizon office work — CoWorkBench 73.9 70.7 65.1 45.1 68.2 专业工作任务 Professional job tasks — JobBench 55.7 33.4 27.6 41.3 36.6 前沿智能体任务 Frontier agentic tasks — Agents' Last Exam Pass@1 24.3 / Score 51.2 Pass@1 20.4 / Score 42.9 Pass@1 13.2 / Score 33.6 Pass@1 25.2 / Score -- -- 真实世界工具使用 Real-world tool use — Toolathlon Verified (Pass@1) 73.5 67.1 50.6 70.3 -- 通用能力 General
评测项目 Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash-0731 Claude-Opus-4.6 (Max) 指令遵循 Instruction following — IFBench 81.3 79.5 79.1 79.2 62.5 科学推理 Scientific reasoning — GPQA Diamond 91.7 89.2 90.3 90.8 91.3 多学科推理 Multidisciplinary reasoning — HLE 35.9 30.8 34.7 33.8 40.0 竞技编程 Competitive coding — LiveCodeBench v6 91.9 90.3 89.6 90.6 88.8 注释
-
DeepSWE 1.1:使用 Claude Code 和 mini-SWE-agent 两套评测框架进行测试,
temp=1.0、top_p=0.95、上下文窗口为 256K。报告两套框架中的最高分;其中 Qwen3.8-Flash-Next 在 mini-SWE-agent 上表现最佳。 -
SWE-bench Pro:除 Claude-Opus-4.6 (Max) 使用官方公布成绩外,其余所有模型均使用 Claude Code 评测框架,
temp=1.0、top_p=0.95、256K 上下文窗口。存在问题的任务已被修正,并在改进后的 Benchmark 上重新评测所有基线模型。 -
SWE-bench Multilingual:使用 mini-SWE-agent 评测框架,
temp=1.0、top_p=0.95、256K 上下文窗口。 -
NL2Repo-Bench:使用 Claude Code 评测框架。为了防止“奖励黑客”(reward hacking),禁用了尝试访问指定代码仓库的 Bash 命令,例如
pip download、pip install和git clone。 -
CoWorkBench:内部开发的协作工作 Benchmark,用于评估计算机科学、金融、法律、医疗及其他生产力领域中的长周期办公与生产力智能体任务。
-
HLE:由 GPT-4o 进行判定评分。
-
每一行的最佳成绩以粗体显示。
-
空白单元格
--表示成绩尚未提供,或该项目不适用。
-
-
看起来与27b差距不算大,可以算是同一级别的能力吗?
-
不是同一级别,你看到的"差距不大"主要来自 SWE-bench Pro 单点(62.5 vs 61.7,几乎打平),但那是个快饱和的基准——27B 已经摸到天花板,两边都挤在 60 出头,才会给你"差不多"的错觉。看完整张表,Flash-Next 在绝大多数行都是领先的:
- DeepSWE 1.1:58.7 vs 42.2,差 16.5 分,代际差距
- JobBench:55.7 vs 33.4,差 22.3 分
- SWE-bench Multilingual:81.0 vs 73.8
- Toolathlon:73.5 vs 67.1
- ALE Pass@1:24.3 vs 20.4
- 通用能力也全面小幅领先:GPQA 91.7 vs 89.2、HLE 35.9 vs 30.8、LiveCodeBench 91.9 vs 90.3、IFBench 81.3 vs 79.5
真正拉开差距的是长链路 agentic 任务——DeepSWE/JobBench 这种多步工具调用,27B 掉得很快。横向看它更接近 DeepSeek-V4-Flash-0731 那一档(DeepSWE 58.7 vs 54.4、JobBench 55.7 vs 41.3、Toolathlon 73.5 vs 70.3,DS 只在 NL2Repo 54.2 和 ALE Pass@1 25.2 反超),比 27B 高整整一档。
但"能力高一档"不等于"值得本地部署":这货 180B 参数(HF 页面写的),Bunsei 说的"快 200G"就是这个意思——128G 内存都紧张,terry 也说要等优化。27B Q4 只要 16-17G 显存,24G 卡就能跑;Flash-Next 本地要么大内存硬扛,要么部分权重 RAM offload——kos or 之前试 122B A10B offload 最高才 18 tok/s,低于 25 tok/s 就没实用价值。结论:能力高一档,部署成本也高一档,没 128G+ 内存或双大显存卡的话,27B 依然是性价比最优解。
-
双GB10的场景又添一个极具说服力理由。社区生态拿主机游戏厂的生态打比方,真的就是
Intel从之前的Xbox生态正在朝PlayStation生态努力,而AMD已经爬到了Switch的生态位想要牢牢守住,怎奈nVidia已经是next level的Steam了…nVidia:你们骂我造的steamdeck垃圾?ok我现在就砸钱让游戏厂商每年做100个针对SteamDeck的优质游戏!
-
看起来与27b差距不算大,可以算是同一级别的能力吗?
等跑分 目前還沒出來
Artificial Analysis Intelligence Index
https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index -
双GB10的场景又添一个极具说服力理由
双GB10 13K美元的投資(之前8K美元), 接著看看實際跑的數據效果好不
-
@kos-or 单位应该是千美元吧,双GB10大概是从8千涨到13千。听说苹果上架m6mini和m5u的studio之后,DGX销量小幅度上涨,一些货源不充足的卖家已经接近断货,好在厂商能持续订到。昨晚连夜找朋友渠道下单拿了两台现货来玩玩,感觉又被资本做了局

-
-
@Tony-Wang 看我的帖子。









