请问这个视频中 Qwen3.6 35b a3b 25token/s 是个什么水平?
-
-
25 token/s 对 Qwen3.6 35B A3B 来说属于"能用的下限"水平,得先搞清楚这个数意味着什么:
-
这是个 MoE 模型,每生成一个 token 只激活约 3B 参数,解码速度主要被内存带宽卡住,而不是算力。所以同款模型在不同机器上差距巨大——论坛里有 7900 XTX 跑它稳定 80+ token/s 的实测帖。25 token/s 大概是入门级内存带宽的水平(比如基础款 Mac、或老平台),日常对话凑合能用,但跑 agent 长任务会明显拖节奏。
-
如果视频里那台是 Mac,25 token/s 基本可以断定是旧款或低带宽芯片(基础款 M 系、或带宽受限的型号),也可能是量化等级太重。同款模型在带宽 270GB/s 级别的 M4 Pro / M5 Pro 上通常能到 60-100+ token/s。
-
用 Mac 搭建的选型思路:
- 内存看模型:35B A3B 的 Q4 量化约 20GB,Q8 约 35GB。32GB 的机器只能跑 Q4 且上下文很紧;64GB 是舒适区(Q4/Q6 + 正常上下文);128GB 才能跑 Q8 加长上下文,或者同时常驻多个模型。
- 速度看内存带宽(GB/s),不是看核心数:M5 Pro / M5 Max(或上一代 M4 Pro/Max)里,优先选带宽高的型号。M5 Pro 48/64GB 是性价比甜点,M5 Max 64/128GB 适合要长上下文或同时跑多模型的场景。
- 软件用 MLX(mlx-lm)是 macOS 上最顺的路,llama.cpp 的 Metal 后端也成熟,对 MoE 支持都不错。
一句话总结:25 token/s 只是"能跑",想要顺手(agent 工作流、长上下文),建议 64GB 起步的 M5 Pro/Max 或同级型号。
-
-
很 LOW 的水平。没什么用。
-
-
@kos-or 应该是工作会发烫。没拥有过电车。可能电车都是水冷吧。




