Qwen3.8-Flash-Next M5 Max实测
-
直接说重点,好,但是需要优化。
因为明天要出差,就简短一点,给大家一点启发。
ngram 50b 左右的部分可以放到ssd里直接读,不需要进内存,实际上就是一个120b a6b的模型,4 bit也就50多gb,还只要a6b,潜力巨大。
M5 MAX 实测结果:
128k上下文 没有额外配置最快30 tokens,最慢降速到十几tokens。均值26.2
这部分感觉优化空间很大,理论上ngram应该属于秒读不会影响模型速度,30tokens对于a6b有点不正常了。另外补充:
这个模型的reasoning好像设置跟其他模型不太一样,想太多,设置一下应该会好很多。 -
这是Hermes给的 llama.cpp 的设置表,供参考。
llama.cpp 服务端 reasoning 相关 flag 全表(从 master 源码 common/arg.cpp 实读,非记忆):Flag: -rea / --reasoning
参数值: on / off / auto
默认: auto(从 chat template 自动检测)
环境变量: LLAMA_ARG_REASONING
作用: 总开关:thinking 开/关。on/off 会写入模板 kwarg enable_thinking
能否被请求级覆盖:
body 里 chat_template_kwargs.enable_thinking 或 reasoning_effort:"none" 可覆盖(实测确认)
────────────────────────────────────────
Flag: --reasoning-effort
参数值: default / minimal / low / medium / high / xhigh / max…
默认: default(保持模板默认)
环境变量: LLAMA_ARG_REASONING_EFFORT
作用: 把档位塞进 chat template kwarg reasoning_effort——是否生效取决于模型模板认不认(Qwen3 系只认 on/off 布尔,不认档位)
能否被请求级覆盖:
body 里 chat_template_kwargs.reasoning_effort
────────────────────────────────────────
Flag: --reasoning-budget
参数值: N:-1 不限 / 0 立即结束 / >0 思考 token 上限
默认: -1
环境变量: LLAMA_ARG_THINK_BUDGET
作用: 采样层的思考 token 预算——服务端硬截断,与模板无关,对不认 effort 的模型这是唯一有效的"限流"手段
能否被请求级覆盖:
️ body 有对应字段 thinking_budget_tokens(Anthropic 风格 thinking.budget_tokens 也会被翻译成它)
────────────────────────────────────────
Flag: --reasoning-budget-message
参数值: 任意文本
默认: 无
环境变量: LLAMA_ARG_THINK_BUDGET_MESSAGE
作用: 预算耗尽时,在 end-of-thinking 标签前注入的提示语(引导模型收尾)
能否被请求级覆盖:
仅启动级
────────────────────────────────────────
Flag: --reasoning-preserve / --no-reasoning-preserve
参数值: bool
默认: 模板默认
环境变量: —
作用: 是否把思考痕迹保留在完整历史里(而非只有最后一条 assistant 消息)。需要模板有 supports_preserve_reasoning 能力
能否被请求级覆盖:
body kwarg preserve_reasoning
────────────────────────────────────────
Flag: --reasoning-format
参数值: none / deepseek / deepseek-legacy / auto
默认: auto
环境变量: LLAMA_ARG_THINK
作用: 思考内容怎么交付:none=不解析留在 content;deepseek=放进 message.reasoning_content;legacy=两处都有
能否被请求级覆盖:
body 里 reasoning_format
────────────────────────────────────────
Flag: --chat-template-kwargs
参数值: JSON 对象
默认: {}
环境变量: LLAMA_ARG_CHAT_TEMPLATE_KWARGS
作用: 任意模板 kwargs(你现在进程里的 {"enable_thinking": true, "preserve_thinking": true} 就是它设的)。
️ 新版已弃用 enable_thinking
走这里,会打警告让你改用 --reasoning on/off
能否被请求级覆盖:
body 里 chat_template_kwargs 与之合并,请求值优先
────────────────────────────────────────
Flag: --no-reasoning-in-content(force_pure_content 相关)
参数值: bool
默认: disabled
环境变量: —
作用: 禁止工具调用/思考混进 content 块
能否被请求级覆盖: (随解析器配置,一般不用动) -
已经达到可用的程度了。
按 Mac的功耗。这个模型可用价值一下就上来了。 -
直接说重点,好,但是需要优化。
因为明天要出差,就简短一点,给大家一点启发。
ngram 50b 左右的部分可以放到ssd里直接读,不需要进内存,实际上就是一个120b a6b的模型,4 bit也就50多gb,还只要a6b,潜力巨大。
M5 MAX 实测结果:
128k上下文 没有额外配置最快30 tokens,最慢降速到十几tokens。均值26.2
这部分感觉优化空间很大,理论上ngram应该属于秒读不会影响模型速度,30tokens对于a6b有点不正常了。另外补充:
这个模型的reasoning好像设置跟其他模型不太一样,想太多,设置一下应该会好很多。 -
看了一下,心仪的UD Q4 XL是111GB啊: Qwen3.8-Flash-Next-GGUF
/UD-Q4_K_XL 111 GB 我的配置是48G显存 64G内存,我不想卸载到SSD还差得远。不过有条32G的想挪过来换掉 就刚刚踩线
Qwen3.8-Flash-Next-GGUF UD-IQ4_XS 93.7 GB 这个不换内存 似乎还刚好,有点心动了。不过我的决定是,死等 byteshape出 Qwen3.8-Flash-Next的GGUF ,这家的MOE模型调校非常好。同等体积下总是比别人的格式更均衡。
-
直接说重点,好,但是需要优化。
因为明天要出差,就简短一点,给大家一点启发。
ngram 50b 左右的部分可以放到ssd里直接读,不需要进内存,实际上就是一个120b a6b的模型,4 bit也就50多gb,还只要a6b,潜力巨大。
M5 MAX 实测结果:
128k上下文 没有额外配置最快30 tokens,最慢降速到十几tokens。均值26.2
这部分感觉优化空间很大,理论上ngram应该属于秒读不会影响模型速度,30tokens对于a6b有点不正常了。另外补充:
这个模型的reasoning好像设置跟其他模型不太一样,想太多,设置一下应该会好很多。 -
,
T terry 固定了此主题
-
直接说重点,好,但是需要优化。
因为明天要出差,就简短一点,给大家一点启发。
ngram 50b 左右的部分可以放到ssd里直接读,不需要进内存,实际上就是一个120b a6b的模型,4 bit也就50多gb,还只要a6b,潜力巨大。
M5 MAX 实测结果:
128k上下文 没有额外配置最快30 tokens,最慢降速到十几tokens。均值26.2
这部分感觉优化空间很大,理论上ngram应该属于秒读不会影响模型速度,30tokens对于a6b有点不正常了。另外补充:
这个模型的reasoning好像设置跟其他模型不太一样,想太多,设置一下应该会好很多。 -
@Gary-Pan 这么m5 max基本也就是3090的水平
-
,系统 取消固定了此主题
