Qwen3.6 27b dense vs Gemma4 31b dense
-
@applejuice 不是你的设置问题,Gemma4 在指令跟随和工具调用方面确实比 Qwen 3.6 弱不少。我测试下来几个关键区别:
-
训练数据差异:Gemma4 的预训练数据偏学术/代码,SFT 阶段的 tool-use 数据量不如 Qwen 3.6 丰富,所以"教它用 mermaid CLI 也不会"这个现象很常见。
-
指令跟随风格:Gemma 系列对 system prompt 的敏感度比 Qwen 低,同样的 skill 描述在 Qwen 上能严格执行,在 Gemma 上可能就理解成"参考一下"。
-
PDF 阅读:Qwen 3.6 的 long-context 能力更强(131K tokens 实测稳定),Gemma4 虽然支持 256K 但中间层 attention 容易丢失细节,尤其是多页 PDF 的结构化信息。
建议:如果你主要做 PDF 处理 + tool use,继续用 Qwen 3.6 27b 作为主力。Gemma4 可以留着做辅助判断(比如分类任务、简单 QA),它在这个场景下表现还不错。
-
-
有没有大佬测试过
我自己试了几次
感觉gemma4 很笨同一个任务 qwen 省心很多
读pdf ,还要教他怎样读
用mermaid cli, skill 已经有了 但是他说他不会我都怀疑是不是我的设置错了
@applejuice 展示你的配置。我们猜测不了你的配置。gamma4 我用了。智力尚可。
-
@applejuice 展示你的配置。我们猜测不了你的配置。gamma4 我用了。智力尚可。
@williamlouis
除了 Tool-call parser
其他的我觉得都没什么关系Setting Value Image vllm/vllm-openai:v0.22.0Container vllm-gemma-bf16Restart "no"(managed byvllm.service)Model Intel/gemma-4-31B-it-int4-AutoRound(mounted asgemma-4-31b-autoround-int4)Draft (MTP) google/gemma-4-31B-it-assistant(0.5B drafter)Served name gemma-4-31b-bf16Tensor parallel 2 (dual 3090) Max model len 131,072 GPU mem util 0.95 Max num seqs 4 (concurrent) Max batched tokens 4,096 (must fit vision tower's 2,496 mm tokens) KV cache default (BF16) — explicitly NOT fp8 (Ampere can't) Speculative decoding MTP n=4 (Google's official assistant) Reasoning parser gemma4(separates<channel>thoughtfrom content)Tool-call parser gemma4(+--enable-auto-tool-choice)Chat template tool_chat_template_gemma4.jinja(from vLLM image)Sampling override T=1.0, top_p=0.95, top_k=64, min_p=0, no rep penalty Overlays 1 only — PR #42006 (streaming multi-tool-call fix) -
各种benchmark也都支持你的结论。比如:https://artificialanalysis.ai/models/gemma-4-31b
而且他的benchmark很偏科,有的跑分可以跑到和qwen3.6-27B旗鼓相当,有的只在qwen3.6-35B-A3B的一半……
有一种说法是gemma4不针对benchmark优化
,但是这种东西谁知道呢……