真心求教Hermes agent运行本地oMLX的Qwen3.8-27B-MLX-4bit如何提速?
-
“该如何解决hermes调用本地模型严重降速的问题”
这就是统一内存的内存带宽太小导致prefill太慢导致的,无解。
hermes的冷启动提示词大概在10k token左右,1000t/s的prefill能力,就需要罚站10秒。更何况M5 MAX 彪不到1000t/s
而且prefill会随着上下文的占用线性变慢。 -
“该如何解决hermes调用本地模型严重降速的问题”
这就是统一内存的内存带宽太小导致prefill太慢导致的,无解。
hermes的冷启动提示词大概在10k token左右,1000t/s的prefill能力,就需要罚站10秒。更何况M5 MAX 彪不到1000t/s
而且prefill会随着上下文的占用线性变慢。 -
kop wang 说的根因是对的:统一内存带宽决定 prefill 速度,Mac 上跑 27B 的 prefill 就是慢。但"无解"太绝对了,有几个真实可用的杠杆,按性价比排序:
-
先分清慢在哪:Hermes 每轮请求都带一套固定系统提示词(约 8-10K token),新会话第一轮必须整体 prefill 一遍;agent 用法下工具调用结果不断拼进上下文,前缀一变又得重新 prefill——这才是"半天没反应"的真相。oMLX 对话页快,是因为单轮短输入、前缀稳定。
-
上下文配置:你有刚性需求——oMLX/Ollama 侧把 num_ctx 设到 65536(64K),Hermes 侧 context_length 也配 65536,两边对齐。Hermes 的 64K 是启动硬门槛,不能低于它;但也别开 128K+,KV cache 越大 prefill 越贵。32-64K 是本地 agent 的甜点区。
-
关思考(提速最狠的一步):Qwen3.8 默认开 thinking 会疯狂刷思考链,token 量直接翻几倍。装 froggeric/Qwen-Fixed-Chat-Templates 的新模板(论坛 TID:1151 有分享),思考档位锁 low/medium,简单任务直接 enable_thinking=false。agent 场景千万别用 xhigh。
-
模型保活:把 keep_alive 设长(或常驻),避免每轮重新加载——MLX 加载 27B Q4 也要十几秒,频繁加载等于白等。
-
务实路线:本地 27B 在 M5 MAX 上解码大概 25-35 t/s(带宽 ÷ 权重大小,量级跑不掉),日常问答、短任务完全够用;但"金融模型训练/量化编程"这种 agent 长任务,上下文反复重排,Mac 带宽就是硬伤。建议混合用:日常短对话走本地,复杂 agent 任务继续 DeepSeek API——涨价后的 Flash 在总成本上依然干不过官方(kop wang 引过 opencode Go 的原话:总成本没人能干过原厂)。别二选一,各干各擅长的。
-
-
现在才醒觉,会不会太晚了呢?当时用DS 4 flash的时候就没想过它会涨价吗?你觉得它那么便宜是合理的吗?能一直持续下去吗?现在能用得爽的卡 已经很贵很贵了,都买不起了
-
只能等 苹果官方搞定了。本身就是个闭源系统。
-
我的建议是,让AI上谷姐和REDDIT去帮你找 大本营,总有大神会和你用同款机器,然后他会精调一个专门针对这个机型的框架和模型,然后你接个deepseek v4,设计 好提示词,让梁文峰直接帮你抄作业就完事了。 我等了几天已经等到了。 以下给你一个HERMES可用的提示词:
去谷歌和reddit 帮我调研一下,最近7天内的,关于qwen 3.8 27b的模型比如(huggingface.co/zhnagchenchne/Qwen3.8-27B-GPTQ-W4A16 ),看看有哪些比较适合MacBook pro M5 MAX 128G 的,列最适合的10个,并用表格说明各自优劣势 ,我目前用的这个是 huggingface.co/twolven/Qwen3.8-27B-abliterated-AWQ-MTP ,感觉还行,但是离完美还有一些距离. 我比较喜欢【什么样的模型,用途主要是XXXX 】的。 如果reddit上找不到相关内容的话,可以从 huggingface.co/models?p=1&sort=created&search=qwen+3.8+27b 这个作为起点进去找找。 本会话可能要做为每日常规任务。主要目标是发掘一个适合 我本地 MacBook pro M5 MAX 128G 硬件的vllm或者sglang模型及框架 .
-
我的建议是,让AI上谷姐和REDDIT去帮你找 大本营,总有大神会和你用同款机器,然后他会精调一个专门针对这个机型的框架和模型,然后你接个deepseek v4,设计 好提示词,让梁文峰直接帮你抄作业就完事了。 我等了几天已经等到了。 以下给你一个HERMES可用的提示词:
去谷歌和reddit 帮我调研一下,最近7天内的,关于qwen 3.8 27b的模型比如(huggingface.co/zhnagchenchne/Qwen3.8-27B-GPTQ-W4A16 ),看看有哪些比较适合MacBook pro M5 MAX 128G 的,列最适合的10个,并用表格说明各自优劣势 ,我目前用的这个是 huggingface.co/twolven/Qwen3.8-27B-abliterated-AWQ-MTP ,感觉还行,但是离完美还有一些距离. 我比较喜欢【什么样的模型,用途主要是XXXX 】的。 如果reddit上找不到相关内容的话,可以从 huggingface.co/models?p=1&sort=created&search=qwen+3.8+27b 这个作为起点进去找找。 本会话可能要做为每日常规任务。主要目标是发掘一个适合 我本地 MacBook pro M5 MAX 128G 硬件的vllm或者sglang模型及框架 .
我的建议是,让AI上谷姐和REDDIT去帮你找 大本营,总有大神会和你用同款机器,然后他会精调一个专门针对这个机型的框架和模型,然后你接个deepseek v4,设计 好提示词,让梁文峰直接帮你抄作业就完事了。 我等了几天已经等到了。 以下给你一个HERMES可用的提示词:
去谷歌和reddit 帮我调研一下,最近7天内的,关于qwen 3.8 27b的模型比如(huggingface.co/zhnagchenchne/Qwen3.8-27B-GPTQ-W4A16 ),看看有哪些比较适合MacBook pro M5 MAX 128G 的,列最适合的10个,并用表格说明各自优劣势 ,我目前用的这个是 huggingface.co/twolven/Qwen3.8-27B-abliterated-AWQ-MTP ,感觉还行,但是离完美还有一些距离. 我比较喜欢【什么样的模型,用途主要是XXXX 】的。 如果reddit上找不到相关内容的话,可以从 huggingface.co/models?p=1&sort=created&search=qwen+3.8+27b 这个作为起点进去找找。 本会话可能要做为每日常规任务。主要目标是发掘一个适合 我本地 MacBook pro M5 MAX 128G 硬件的vllm或者sglang模型及框架 .
非常感谢,这个也很有帮助。。。马上办!
别指望太多