可以让 claude code 帮忙写 openscad 的代码,就可以建模了
主要是老特让我们测试发图,我们就发发图
这是老婆的任务,要在这个花箱下面垫一层架子,上面铺无纺布和颗粒土种多肉植物,下面方便排水

拍摄的图发了两次都是 413 负载压力大
可以让 claude code 帮忙写 openscad 的代码,就可以建模了
主要是老特让我们测试发图,我们就发发图
这是老婆的任务,要在这个花箱下面垫一层架子,上面铺无纺布和颗粒土种多肉植物,下面方便排水

拍摄的图发了两次都是 413 负载压力大
我现在手头的m4 max是2024年底第一批就买的,顶配128GB内存。
当时能够跑llama 90B,还是很开心的,虽然是个垃圾。
到了2026年现在,其实是本地模型的大年,尤其是qwen3.6-27B的发布,的确让人兴奋。老特其实也推荐了很多。
但是我第一次实际用来跑Hermes / OpenClaw,就发现不对劲,70K左右的上下文,在agent是很常见的。(Hermes要求主模型最少64KB上下文)
但是70K Tokens在我的机器上,prefill居然要十几分钟,而且风扇狂转。完全是一个不可用的状态。
我看着老特的视频那些7900XTX,心里那个恨啊,所以就想仔细测试一下到底如何。但是主流的测试工具,并不完全符合agent的上下文。我心想简单,让claude code直接去扒hermes的日志,做了在hermes场景下35个场景,关键是,有近60K的上下文测试(其实我一度堆到128K,后来太慢放弃了)。还顺便GPT image2画了十来张图,做了视觉理解的测试集。
https://github.com/tomcatzh/intelligence-gating-suite 代码放在这里,大家可以来指正。
还是直接来看图吧,首先是,证明我的测试有效性。拉了一些API模型来做对比,目前曲线是正常的,符合大家的预期:
然后才是性能数据,先看让人触目惊醒的,60K的长上下文,cold start prefill
注明一下,我的N卡是在runpod上找便宜的开的,所以有点随机,大家凑合看
但是M4 Max的速度真是让人吐血啊

相对来说,每秒token数,这个decode指标还能让人接受

当然哈,omlx框架的缓存能力还是可以的,热启动是不弱的

一些情况下缓存也比较弱,可能是那个模型太大,我的内存爆了一丢丢,用了点交换
反正就是避坑,当年觉得可以剑走偏锋的硬件,但其实还是不如四平八稳全面发展的传统显卡好啊。
现在我这台m4 max是食之无味弃之可惜。
但是呢,有一点稍稍安慰的是,在这个过程中,找到了一个宝藏模型,Libraxis 35B-A3B VMLX MXFP4 (oMLX)
他的hugging face原帖可以看这里:
https://huggingface.co/LibraxisAI/Huihui-Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-vmlx-mxfp4
首先这个模型已经abliterated,你懂的,前两天老特的视频也说了,本地模型不拒绝也是创作过程中一个重要的需求。
其次呢,他是一个35B-A3B的模型,本来他的智能应该是比较弱的,但是运行速度是比较好的(尤其在我的m4 max上)
大家可以看我上贴第一张图,大部分的35B-A3B都在下面。
但是呢,这个模型的发布机构使用opus 4.7给他整流校准过,效果极好,至少在我的测试集里,完全达到了27B的性能。当然仅对我的测试集负责,偏向tool call和编程,可能也是因为蒸馏的opus 4.7也是偏向这些方向的。
看看图中的智能表现,接近27B的水平:

但他的性能,在我的机器上总算能用了

结合老特的教程,只要harness环境够好,区分好上下文记忆,这样tool call准确的模型是可以干活的。
我现在在我的机器上配给了一个小的hermes,专门处理一些prompts润色啊等内容,他也能比较智能的自己总结经验,生成skill,目前感觉良好。关键是,终于找到一个我的机器能跑,智力还算正常的模型了。
推荐各位兄弟使用,尤其是小硬件的,可以试试看。有啥坑也欢迎过来踩我。
推荐一个很适合 macOS 跑的模型 https://huggingface.co/LibraxisAI/Huihui-Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-vmlx-mxfp4
我自己的 benchmark 和实测都完全有 27B bf16 mlx 版本的功力,但是速度快多了
关键是还越狱