跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

tomcatzhT

tomcatzh

@tomcatzh
取消关注 关注
关于
帖子
37
主题
6
分享
0
群组
0
粉丝
1
关注
3

帖子

最新 最佳 有争议的

  • 网络资讯。使用DeepSeek API 服务预计7月中旬开始采用峰谷定价策略
    tomcatzhT tomcatzh

    直接收到这封邮件了。

    v4第一天出来的时候,花了七十块钱测试他,觉得好亏。当时的价格还是比较贵的😂

    网络技术 deepseek

  • 才注意到,苏妈又发了个AMD官方的小盒子哦,Halo
    tomcatzhT tomcatzh

    不过也没啥新意,就是官方版的395盒子

    ac80fc69-9a0d-4a03-a1a1-a1e1f6f5c3c1-image.jpeg

    AI硬件 amd

  • qwen3.6 27b 35b 帮你们避个坑
    tomcatzhT tomcatzh

    @Kk-Hh 居然 gemma4 可以?没见过夸这个的

    这个在本地跑,比 27B 轻松

    LLM讨论区

  • 为了证明M4 Max真的不行,自己写了案例测试了几个模型
    tomcatzhT tomcatzh

    @Tony-Wang decode速度高,毕竟是满血的m4 max

    LLM讨论区 mac

  • 为了证明M4 Max真的不行,自己写了案例测试了几个模型
    tomcatzhT tomcatzh

    @Tony-Wang 我还有一个想测的,是DGX Spark,好像可以闲鱼租

    LLM讨论区 mac

  • 📡 AI日报 6/13 | Anthropic发布Claude Fable 5、Microsoft自研模型减少OpenAI依赖、SWE-bench最新排名
    tomcatzhT tomcatzh

    fable5今天被美国政府全网停了,实在搞笑

    资讯 claude gpt

  • 4080S 32G 魔改版 vast.ai 租借心得
    tomcatzhT tomcatzh

    https://lcz.me/topic/537 我测试runpod的方法。

    给楼主参考一下。我是觉得 vast.ai 和runpod,既然都给api,然后按秒调用。咱得用程序跑比较划算 😆

    AI硬件 rtx4080s

  • 对 M5 MAX 跑本地大模型有点失望
    tomcatzhT tomcatzh

    楼主可以看看我的帖子

    https://lcz.me/topic/546,不小心放到另一个区了

    AI硬件

  • 为了证明M4 Max真的不行,自己写了案例测试了几个模型
    tomcatzhT tomcatzh

    @566656661 说:

    @tomcatzh

    對了, 個人推薦是盡量避免Claude/GPT/Gemini的蒸餾模型, 因為成效很迷

    不是說蒸餾這個技術沒用, 是在指家用端的模型思考能力有限發揮不出來優勢

    而且更有可能會矯枉過正導致原本的模型CoT爆掉, 思考能力反而更差

    我其實更傾向相信在訓練途中Qwen團隊早已經加入有關這些模型的CoT訓練資料, Gemma 4反而可能沒有

    是的,的确,大部分的蒸馏模型都一般。

    我也是将信将疑的用。但是hugging face很多发布都喜欢越狱同时加蒸馏。

    当时也是看着热度比较高的这个mxfp4模型,本来纯打算测一把速度的。但没想到智能让我有惊喜。(至少在我的测试集里面有惊喜)

    LLM讨论区 mac

  • 为了证明M4 Max真的不行,自己写了案例测试了几个模型
    tomcatzhT tomcatzh

    @williamlouis 说:

    我局域网让 7900XTX 做本地算力了。

    在2026年的这一刻的确是最优解

    LLM讨论区 mac

  • 为了证明M4 Max真的不行,自己写了案例测试了几个模型
    tomcatzhT tomcatzh

    @williamlouis 说:

    M4 群众:盖版 32G 改版 24G 丐版 16G 围观下。大家偷乐,你也不比我们强多少哈。哈哈哈哈哈哈。😂

    的确啊,但是我找到那个模型,可能丐版的兄弟们真的可以试一下,32GB应该轻松跑

    LLM讨论区 mac

  • 为了证明M4 Max真的不行,自己写了案例测试了几个模型
    tomcatzhT tomcatzh

    @Xiaote 你也没真的去star啊,你爹没给你这个权限吧 😬

    LLM讨论区 mac

  • 为了证明M4 Max真的不行,自己写了案例测试了几个模型
    tomcatzhT tomcatzh

    但是呢,有一点稍稍安慰的是,在这个过程中,找到了一个宝藏模型,Libraxis 35B-A3B VMLX MXFP4 (oMLX)

    他的hugging face原帖可以看这里:
    https://huggingface.co/LibraxisAI/Huihui-Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-vmlx-mxfp4

    首先这个模型已经abliterated,你懂的,前两天老特的视频也说了,本地模型不拒绝也是创作过程中一个重要的需求。

    其次呢,他是一个35B-A3B的模型,本来他的智能应该是比较弱的,但是运行速度是比较好的(尤其在我的m4 max上)
    大家可以看我上贴第一张图,大部分的35B-A3B都在下面。

    但是呢,这个模型的发布机构使用opus 4.7给他整流校准过,效果极好,至少在我的测试集里,完全达到了27B的性能。当然仅对我的测试集负责,偏向tool call和编程,可能也是因为蒸馏的opus 4.7也是偏向这些方向的。

    看看图中的智能表现,接近27B的水平:
    51650405-9d3f-4a9f-93ec-15533454fedf-image.jpeg

    但他的性能,在我的机器上总算能用了
    445438a5-a31e-44bd-98e8-a26e4d42e873-image.jpeg

    结合老特的教程,只要harness环境够好,区分好上下文记忆,这样tool call准确的模型是可以干活的。

    我现在在我的机器上配给了一个小的hermes,专门处理一些prompts润色啊等内容,他也能比较智能的自己总结经验,生成skill,目前感觉良好。关键是,终于找到一个我的机器能跑,智力还算正常的模型了。

    推荐各位兄弟使用,尤其是小硬件的,可以试试看。有啥坑也欢迎过来踩我。

    LLM讨论区 mac

  • 为了证明M4 Max真的不行,自己写了案例测试了几个模型
    tomcatzhT tomcatzh

    我现在手头的m4 max是2024年底第一批就买的,顶配128GB内存。

    当时能够跑llama 90B,还是很开心的,虽然是个垃圾。

    到了2026年现在,其实是本地模型的大年,尤其是qwen3.6-27B的发布,的确让人兴奋。老特其实也推荐了很多。

    但是我第一次实际用来跑Hermes / OpenClaw,就发现不对劲,70K左右的上下文,在agent是很常见的。(Hermes要求主模型最少64KB上下文)
    但是70K Tokens在我的机器上,prefill居然要十几分钟,而且风扇狂转。完全是一个不可用的状态。

    我看着老特的视频那些7900XTX,心里那个恨啊,所以就想仔细测试一下到底如何。但是主流的测试工具,并不完全符合agent的上下文。我心想简单,让claude code直接去扒hermes的日志,做了在hermes场景下35个场景,关键是,有近60K的上下文测试(其实我一度堆到128K,后来太慢放弃了)。还顺便GPT image2画了十来张图,做了视觉理解的测试集。
    https://github.com/tomcatzh/intelligence-gating-suite 代码放在这里,大家可以来指正。

    还是直接来看图吧,首先是,证明我的测试有效性。拉了一些API模型来做对比,目前曲线是正常的,符合大家的预期:839aa378-a74f-4a97-bcf9-140ef5343577-image.jpeg

    然后才是性能数据,先看让人触目惊醒的,60K的长上下文,cold start prefill
    注明一下,我的N卡是在runpod上找便宜的开的,所以有点随机,大家凑合看
    但是M4 Max的速度真是让人吐血啊
    195bcd72-e776-45b4-bfd7-e3a1ae71db24-image.jpeg

    相对来说,每秒token数,这个decode指标还能让人接受
    eeecbffe-5b2e-4593-a542-787400c8ce0c-image.jpeg

    当然哈,omlx框架的缓存能力还是可以的,热启动是不弱的
    742a33ef-e6bb-4413-b7da-32b4562386e5-image.jpeg
    一些情况下缓存也比较弱,可能是那个模型太大,我的内存爆了一丢丢,用了点交换

    反正就是避坑,当年觉得可以剑走偏锋的硬件,但其实还是不如四平八稳全面发展的传统显卡好啊。

    现在我这台m4 max是食之无味弃之可惜。

    LLM讨论区 mac

  • 不买硬件,深入测试Comfy UI的一种方法😁
    tomcatzhT tomcatzh

    @terry 已改掉,这帖子只有官网链接,和我的 GitHub 项目链接了

    AI音视频画图 comfyui

  • 不买硬件,深入测试Comfy UI的一种方法😁
    tomcatzhT tomcatzh

    @Tony-Wang 谢谢版主,可以试用提意见哈

    AI音视频画图 comfyui

  • 不买硬件,深入测试Comfy UI的一种方法😁
    tomcatzhT tomcatzh

    @mark 是的呢,发帖子的时候才想起,不发白不发😂😂

    如果老特说违规,我就修改掉

    AI音视频画图 comfyui

  • HERMES运营亚马逊,google, meta 广告指教
    tomcatzhT tomcatzh

    用的什么模型?的确模型智力水平会一定程度导致你说的那些问题

    AI Agent hermes

  • 不买硬件,深入测试Comfy UI的一种方法😁
    tomcatzhT tomcatzh

    老特经常怼的一些兄弟们,天天问这个workflow要什么硬件。那个workflow要跑多久,出来的图能不能看。
    但买机器是几万的事情,实在不敢轻易下决定。

    我在这里推荐 runpod.io,这是海外比较大的一家GPU出租的公司了。基本上从3090到B200都有。按秒计费。
    画两个小时小姐姐,才花几美元哦。

    但是呢,如果每次去点击启动comfyui模板,然后才慢慢装节点,下载模型,很多时间就浪费在这些无聊的时间上了,也繁琐。

    因此,我开发了一个简单的控制工具,https://github.com/tomcatzh/runpod-comfyui-controller ,他的目标是,你提交一个comfyui的workflow,他就可以自动分析这个workflow,获取要安装哪些节点,要下载哪些模型。
    之后一键开始在多个机房尝试抢GPU资源,抢到以后,自动安装配置环境,大概几分钟后一键进入ComfyUI开始使用。

    output目录会自动同步回本地,保证回收资源

    适合有一定能力的兄弟试用,比如你已经安装好hermes,可以让hermes帮你下载配置这个环境。

    当你在runpod真的用了好几百上千美元了,可以考虑自己买硬件了。

    以下为截图
    2-overview.png
    4-wizard.png
    3-outputs.png
    1-history.png

    AI音视频画图 comfyui

  • 📡 AI日报 6/8 | Anthropic自改进AI研究、OpenAI ChatGPT记忆增强、NVIDIA RTX Spark重塑AI PC
    tomcatzhT tomcatzh

    从善如流啊,终于放链接了

    资讯 nvidia claude gpt
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组