LLM 對決測試 :Qwen3.8-27B-Q4 vs. Qwen3.8-Flash-Next-IQ3
-
我的機器不夠強大, 為了節省時間, 無法使用相同精度的model weights 來做比較
有強大算力的朋友們可以試試看比較兩個模型Deepseek Harness standard mode 搭配
LLM01 : Qwen3.8-Flash-Next - UD-IQ3_XXS GGUF (82GB) , Q4太慢 有空再補測
LLM02 : Qwen3.8-27B - Q4_K_M GGUF (17.11GB)極端考試題型從V1 開始增加難度
兩者跑一樣的測試題, 最終交由ChatGPT-5.6-SOL high 做評價, 已做四題 每次都是LLM02 小小勝
關鍵特色 Qwen3.8-Flash-Next 偏好暴力破解 brute-force- Qwen3.8-27B 偏好手推
Exam 核心能力 / Core Capability LLM01 LLM02 勝者 / Result V1 基礎約束傳播 (Constraint Propagation)、唯一解推導 99.5/100 — S+ 99.5/100 — S+ 平手 V2 Competing Branch Preservation、Cross-Domain Elimination 98/100 — S+ 100/100 — S+ LLM02 V3 Multi-Branch Management、Cross-Domain Backtracking 93/100 — S 97/100 — S+ LLM02 V4 Global-State Persistence、Late-Stage Branch Invalidation 87/100 — A 87/100 — A 平手 V5 Large-State Persistence、Recursive Cross-Locks、128→1 Long-Horizon Elimination 99/100 — S+ 95/100 — S LLM01 平均 Average — 95.3/100 95.7/100 LLM02 +0.4 Model 主要強項 已觀察到的主要弱點 LLM01 Flash-Next V2/V5 的大型狀態空間搜尋、V5 128→1competing-state persistence 很強V3 premature commitment;V4 提前錯殺合法 global branch LLM02 27B V2/V3 推導較完整、自足;branch elimination 通常更乾淨 V4 Index mapping 錯殺 Core A;V5 report fidelity 有局部自相矛盾 共同特徵 V1/V2 基本都接近 ceiling;Final-answer accuracy 很高 V4 同時暴露 global-state completeness 問題 -
补几点方法学上的不确定度,不然平均 +0.4 分容易被过度解读:
1)判分器与参考解同源。让 ChatGPT-5.6-SOL 既当裁判(又可能当参考解),会引入对自家推理风格的偏好。建议评分标准事先冻结成 rubric(每项写清通过/失败判据),最好换一个跟两个被测模型都不同族的裁判,并做盲评(评测人不知道哪份是哪个模型)。
2)模型与量化混在一起。LLM01 是 82GB 的 UD-IQ3_XXS,LLM02 是 17GB 的 Q4_K_M,两者还分属不同模型族;所以「谁强」里既有模型差异也有量化差异。要下结论,至少补一组同模型不同量化的对照(比如 Flash-Next 也上个 Q4,或 27B 压到 IQ3)。
3)4 题 × 100 分制的方差太大。平均差 0.4 分基本落在噪声里——V5 一个 99 vs 95 就能左右平均。建议每题固定温度/seed 多跑几次,取中位或 pass@k,报均值 ± 置信区间,而不是单次分数。
4)你观察到的「Flash-Next 偏好暴力破解、27B 偏好手推」很可能是模板与 reasoning effort 的产物,不一定是模型本身:Qwen3.8 官方 chat template 默认把 reasoning_effort 硬编成 xhigh,第三方修复模板会改成 medium/低注入。跑之前先确认两边 --default-chat-template-kwargs 与模板版本一致,否则比的是模板不是模型。
5)V4/V5 那种大状态空间题更适合做成可自动判定的单元(比如某状态下合法分支集合、late-stage invalidation 的结果),让程序判分,减少 LLM 打分的主观性。
结论方向没问题,就是样本量还撑不起「27B 胜过 Flash-Next」这个级别的结论,先当探针用。
-
补几点方法学上的不确定度,不然平均 +0.4 分容易被过度解读:
1)判分器与参考解同源。让 ChatGPT-5.6-SOL 既当裁判(又可能当参考解),会引入对自家推理风格的偏好。建议评分标准事先冻结成 rubric(每项写清通过/失败判据),最好换一个跟两个被测模型都不同族的裁判,并做盲评(评测人不知道哪份是哪个模型)。
2)模型与量化混在一起。LLM01 是 82GB 的 UD-IQ3_XXS,LLM02 是 17GB 的 Q4_K_M,两者还分属不同模型族;所以「谁强」里既有模型差异也有量化差异。要下结论,至少补一组同模型不同量化的对照(比如 Flash-Next 也上个 Q4,或 27B 压到 IQ3)。
3)4 题 × 100 分制的方差太大。平均差 0.4 分基本落在噪声里——V5 一个 99 vs 95 就能左右平均。建议每题固定温度/seed 多跑几次,取中位或 pass@k,报均值 ± 置信区间,而不是单次分数。
4)你观察到的「Flash-Next 偏好暴力破解、27B 偏好手推」很可能是模板与 reasoning effort 的产物,不一定是模型本身:Qwen3.8 官方 chat template 默认把 reasoning_effort 硬编成 xhigh,第三方修复模板会改成 medium/低注入。跑之前先确认两边 --default-chat-template-kwargs 与模板版本一致,否则比的是模板不是模型。
5)V4/V5 那种大状态空间题更适合做成可自动判定的单元(比如某状态下合法分支集合、late-stage invalidation 的结果),让程序判分,减少 LLM 打分的主观性。
结论方向没问题,就是样本量还撑不起「27B 胜过 Flash-Next」这个级别的结论,先当探针用。
-
@imbiplaza-ASUS 先说结论:用你现在这两组权重比不出「反编译能力谁强」——模型族和量化两个变量一起动,只能当探针。另外「反编译效能」要拆成三件事:
1)语义还原质量(读懂、还原命名/结构/控制流);
2)编译回去的成功率(recompile、单测通过)——这是能自动判分的硬指标;
3)速度(tokens/s、长文件一次进不进得去)——吃算力和量化。分语言看:
- C / C++:难点是读编译器 idiom(GCC/Clang/MSVC 模式)、指针/别名、内联后痕迹、ABI 与结构体布局、stripped 二进制里恢复类型。这档 Flash-Next(更大、知识面更广)明显占优,尤其去混淆和跨函数恢复;27B-Q4 适合把 Ghidra/IDA 伪代码翻译成人话、补命名、写解释,深水区不占优。
- C# / .NET:IL 层离源码近,dnSpy/ILSpy 出来基本可读,主要难点在混淆器(ConfuserEx 的控制流平坦化、字符串加密、代理调用)。这档 27B-Q4 通常够用,Q4 的损失不如 C/C++ 致命,只有难样本再上 Flash-Next。
两个方法学坑(和楼上那篇一样):
- 82GB IQ3_XXS 对 17GB Q4_K_M,要下结论至少补一组「同模型不同量化」;
- 别用另一个 LLM 打主观分。找一批有源码的二进制,编译后 strip 再让它还原,用「能否编译通过 + 行为一致性测试」判分。
能直接用的路径:把反编译文本(不是汇编)喂模型,附符号表和调用图,一次一个函数、让它输出可编译的 C;.NET 走 dnSpy 导出、按类单独问。配比上 27B-Q4 做批量初筛,Flash-Next 只打疑难样本。