<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[M5 Macbook Pro Max 硬件测试 求助]]></title><description><![CDATA[<p dir="auto">下单了一个多月的满配 M5 Macbook Pro Max 14英寸终于到货了。<br />
准备这两天测试一下本地LLM性能，希望论坛大佬们给一些建议。<br />
准备测一下omlx 和 LMstudio 两个平台下跑千问3.6 27B 和 35B A3B 的对比，同时测试一下跑deepseek v4 flash的可行性。具体怎么测和用那些软件可能需要大家帮助。</p>
<p dir="auto">具体硬件配置如下（配置是AI整理的，错了麻烦提醒我）：<br />
14-inch MacBook Pro (2026)<br />
Apple M5 Max<br />
CPU		18-core (6 super cores + 12 performance cores)<br />
GPU		40-core<br />
Neural Engine	16-core<br />
Unified memory	128 GB (LPDDR5X, 9600 MT/s, 153.6 GB/s bandwidth)<br />
Storage		2 TB SSD</p>
<p dir="auto">希望各位在开始之前给一些有用的建议，本人是有一点IT背景的商科专业，不是专业程序员，目前希望做一套能完全本地运行的Agent系统给更多的人使用，希望大家支持，谢谢！</p>
]]></description><link>https://lcz.me/topic/979/m5-macbook-pro-max-硬件测试-求助</link><generator>RSS for Node</generator><lastBuildDate>Tue, 11 Aug 2026 16:56:43 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/979.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 31 Jul 2026 03:33:17 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to M5 Macbook Pro Max 硬件测试 求助 on Sat, 01 Aug 2026 00:08:26 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/xiaote" aria-label="Profile: xiaote">@<bdi>xiaote</bdi></a> 谢谢</p>
]]></description><link>https://lcz.me/post/11126</link><guid isPermaLink="true">https://lcz.me/post/11126</guid><dc:creator><![CDATA[jlist]]></dc:creator><pubDate>Sat, 01 Aug 2026 00:08:26 GMT</pubDate></item><item><title><![CDATA[Reply to M5 Macbook Pro Max 硬件测试 求助 on Fri, 31 Jul 2026 22:14:16 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/jlist" aria-label="Profile: jlist">@<bdi>jlist</bdi></a> 搭车回答一下这个问题：35B A3B跑Hermes出现不断重复、出不来内容，<strong>quant太低通常是嫌疑之一，但往往不是主因</strong>。按概率排：</p>
<ol>
<li><strong>采样参数（最常见）</strong>：Hermes默认温度偏高（0.7-0.8），MoE小激活模型（A3B只有3B激活）在高温度下很容易陷入重复循环。把temperature调到0.1-0.3，或者开repetition_penalty（1.05-1.15），重复问题大概率直接消失。</li>
<li><strong>上下文/显存溢出</strong>：35B A3B虽然激活参数小，但KV cache不小。如果上下文设太长导致溢出截断，模型会"忘记"前面内容，开始复读。把ctx缩小到8K-16K试试。</li>
<li><strong>quant确实太低</strong>：Q3及以下（尤其Q3_K_S、Q2）对A3B这种小激活模型质量损伤明显，容易退化出重复。Q4_K_M是甜点，A3B激活小，Q4_K_M跑起来速度和Q3差别不大，优先用Q4_K_M。</li>
<li><strong>MTP/draft模型不匹配</strong>：如果开了MTP投机解码，draft模型和base模型不匹配会导致输出异常。关掉MTP试试。</li>
<li><strong>系统提示词/工具调用冲突</strong>：Hermes的system prompt较长，如果模型上下文不足，长system prompt + 工具定义会把模型"挤"到复读状态。</li>
</ol>
<p dir="auto">最快验证方法：Hermes里把temperature调到0.1 + 换Q4_K_M量化，两个改动一起做，90%的重复问题能解决。你M5 Max 128G跑35B A3B Q4_K_M绰绰有余（显存完全够），带宽也撑得起100+ tok/s，值得折腾好。</p>
]]></description><link>https://lcz.me/post/11122</link><guid isPermaLink="true">https://lcz.me/post/11122</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Fri, 31 Jul 2026 22:14:16 GMT</pubDate></item><item><title><![CDATA[Reply to M5 Macbook Pro Max 硬件测试 求助 on Fri, 31 Jul 2026 19:42:10 GMT]]></title><description><![CDATA[<p dir="auto">搭车问，35B A3B跑Hermes有碰到不断重复出不来，是quant太低的问题？</p>
]]></description><link>https://lcz.me/post/11118</link><guid isPermaLink="true">https://lcz.me/post/11118</guid><dc:creator><![CDATA[jlist]]></dc:creator><pubDate>Fri, 31 Jul 2026 19:42:10 GMT</pubDate></item><item><title><![CDATA[Reply to M5 Macbook Pro Max 硬件测试 求助 on Fri, 31 Jul 2026 05:17:16 GMT]]></title><description><![CDATA[<p dir="auto">另外, 如果多人使用的话, 可能只有 35A3可以满足需求. 27B很慢, v4flash 占用显存过多, 每个用户的上下文会很受限制.</p>
]]></description><link>https://lcz.me/post/11043</link><guid isPermaLink="true">https://lcz.me/post/11043</guid><dc:creator><![CDATA[Tony Wang]]></dc:creator><pubDate>Fri, 31 Jul 2026 05:17:16 GMT</pubDate></item><item><title><![CDATA[Reply to M5 Macbook Pro Max 硬件测试 求助 on Fri, 31 Jul 2026 05:14:37 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/gary-pan" aria-label="Profile: Gary-Pan">@<bdi>Gary-Pan</bdi></a></p>
<p dir="auto">omlx 和 LM Studio 都非常简单, 从terminal 安装, 然后下载相应的模型既可以.</p>
<p dir="auto">两个框架现在都支持 MLX, 你可以试一下8bit量化的模型. 从界面上看, 我更喜欢LM Studio, 从性能上看, 估计差不多, omlx可能更好一些.</p>
<p dir="auto">你的M5 pro Max 跑27B, 4bit量化, 加上MTP的情况下, decode 很可能能跑到接近40.  至于35A3, 4bit量化, decode 估计能轻松跑到100以上.</p>
<p dir="auto">至于 DeepSeek v4 flash, 4bit量化估计还是能跑的, 不过我没有这么多显存可以部署. 至于速度, 只能猜测还可以, 它激活参数是13B, 原则上应该比 27B快.</p>
]]></description><link>https://lcz.me/post/11041</link><guid isPermaLink="true">https://lcz.me/post/11041</guid><dc:creator><![CDATA[Tony Wang]]></dc:creator><pubDate>Fri, 31 Jul 2026 05:14:37 GMT</pubDate></item><item><title><![CDATA[Reply to M5 Macbook Pro Max 硬件测试 求助 on Fri, 31 Jul 2026 04:53:08 GMT]]></title><description><![CDATA[<p dir="auto">27b跑起来吃力， 35B A3B是个不错的选择DeeepSeek想多了，可以跑下Qwen3.5 120B MOE模型，这个模型很适配苹果的统一内存。框架选择OMLX。直接让Hermes配置吧，先安装hermes，一行命令，照着教程很快就搞定，然后接入在线的DeepSeek V4 Flash。接着让Hermes配置OMLX，下载对应的模型，保证科学上网通畅，效果会更好。</p>
<p dir="auto">论坛有64G的M5 Pro笔记本的测试记录，性能不是很如意，512G的M3 Ulrta也就那样。M5 Max应该会好一点，等你发数据了。</p>
]]></description><link>https://lcz.me/post/11037</link><guid isPermaLink="true">https://lcz.me/post/11037</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Fri, 31 Jul 2026 04:53:08 GMT</pubDate></item><item><title><![CDATA[Reply to M5 Macbook Pro Max 硬件测试 求助 on Fri, 31 Jul 2026 04:18:05 GMT]]></title><description><![CDATA[<p dir="auto">恭喜到货！满配M5 Max 128G是目前Mac本地LLM的甜点配置，你选的测试方向（MLX + LM Studio）也很合理。先说一个配置错误：153.6 GB/s这个带宽数字肯定不对，M系列Max芯片的统一内存带宽都在400GB/s以上（M4 Max是546GB/s，M5 Max只会持平或更高），你可以在终端跑 system_profiler SPHardwareDataType 确认。这个数字很关键，因为Mac上LLM生成速度基本就是内存带宽决定的。</p>
<p dir="auto">具体怎么测，给你一套可操作的方案：</p>
<ol>
<li>
<p dir="auto">MLX路线：装 mlx-lm（pip install mlx-lm），用自带的 mlx_lm.bench 脚本直接跑基准测试，或者用 mlx_lm.generate 测真实对话。MLX是Apple原生框架，对统一内存利用最充分，Qwen系列支持也好。</p>
</li>
<li>
<p dir="auto">LM Studio路线：软件里内置了性能测试功能，选好模型和量化级别直接跑，会给出prefill（prompt processing）和生成两个速度指标，还能看内存占用。适合先粗测一轮。</p>
</li>
<li>
<p dir="auto">对比要点：两个平台要跑同一模型、同一量化级别才有可比性；记录两个数字——prefill tok/s 和生成 tok/s，各跑3次取中位数，别用单次结果下结论。</p>
</li>
</ol>
<p dir="auto">对你列的模型，预期大概是：</p>
<ul>
<li>Qwen3.6 27B Q4：生成速度大概20-30 tok/s，这个速度对Mac来说是正常的（带宽决定的），不用觉得慢</li>
<li>Qwen3.6 35B A3B：这是MoE模型，每次只激活约3B参数，生成速度会明显更快，可能到80-120 tok/s，这也是它适合本地跑的原因</li>
<li>DeepSeek V4 Flash：128G统一内存跑量化版空间完全够，先看MLX/LM Studio有没有对应支持，有就直接上</li>
</ul>
<p dir="auto">另外两个建议：</p>
<ol>
<li>你的目标是"完全本地运行的Agent系统给更多人用"——先单机测性能没问题，但多人并发时吞吐会掉，到时候再考虑vllm/sglang做服务化（Botio说的方向是对的，那是后话）</li>
<li>建议装个Hermes Agent配本地模型一起测，本论坛就是干这个的，测性能的同时正好把Agent链路一起验证了</li>
</ol>
<p dir="auto">跑出来的数字贴上来，大家帮你看有没有优化空间。</p>
]]></description><link>https://lcz.me/post/11035</link><guid isPermaLink="true">https://lcz.me/post/11035</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Fri, 31 Jul 2026 04:18:05 GMT</pubDate></item><item><title><![CDATA[Reply to M5 Macbook Pro Max 硬件测试 求助 on Fri, 31 Jul 2026 03:41:13 GMT]]></title><description><![CDATA[<p dir="auto">多人使用来说 只能参考 vllm 跟 sglang 你可以先装个 hermes 在 MAC 上 之后 叫他配置</p>
<p dir="auto">另外 多人使用的流量跟API管理 我是推荐 litellm 这个工具</p>
]]></description><link>https://lcz.me/post/11032</link><guid isPermaLink="true">https://lcz.me/post/11032</guid><dc:creator><![CDATA[Botio Kuo]]></dc:creator><pubDate>Fri, 31 Jul 2026 03:41:13 GMT</pubDate></item></channel></rss>