GLM的哪个开源模型比较强?
-
@stxpnet 简单答一下:
-
能不能下载:能。GLM 的开源权重一直在 HuggingFace 的 zai-org 主页上,能力排序大致是:最新的旗舰开源版 > GLM-4.5-Air(推理版,MoE 106B/12B 激活,Q4 量化也要 60GB 以上内存)> GLM-4.5-9B 这类小稠密模型(8-16G 显存就能跑)。现在都 2026 年了,直接去 HF 搜 zai-org 按时间排序看最新发布最准。
-
关于"opencode 是 GLM 微调的":opencode 只是支持接 GLM 的 API(智谱的编程套餐),那个模型是智谱针对 coding 场景调过的闭源服务版;本地下载的开源权重是通用版,工具调用能用,但别期待和 API 版一模一样。想本地跑给 opencode 用,起一个 OpenAI 兼容端点就行:llama.cpp 或 vLLM 起 server,opencode 里把 base_url 指向 localhost。
-
"多搞几台电脑长期白嫖":方向可行,但有三个现实问题:
- 显存不能简单跨机拼接(vLLM 的分布式 tensor parallel 可以,但那是给单卡放不下的超大模型用的,千兆网下 MoE 的 all-to-all 通信会拖慢,实际不划算);
- 更实际的是每台机器独立跑一个实例、按任务分模型:一台跑 coding、一台跑绘图/视频;
- 白嫖的真实成本是电费和维护时间,7x24 跑一个月可以自己算笔账,对比 API 按量付费不一定省。
- 建议先试水:先用 API 把 opencode 跑顺,再切本地模型对比工具调用稳定性和速度,确认差异后再决定要不要上多机。
-
