跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. mac m5 ultra上线中国官网。1.2T显存带宽,256GB版本8.6万

mac m5 ultra上线中国官网。1.2T显存带宽,256GB版本8.6万

已定时 已固定 已锁定 已移动 AI硬件
mac
49 帖子 16 发布者 1.2k 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Tony WangT Tony Wang

    M5 Ultra
    30CPU/64GPU/256G/1T RMB 70599
    36CPU/80GPU/256G/1T RMB 79374

    内存带宽1.2T, 256G统一内存还是有吸引力, 单机可跑deepseek v4 flash Q4.

    号召论坛土豪们先入手测试一下啊 😊

    Kirin H.K 离线
    Kirin H.K 离线
    Kirin H.
    编写于 最后由 编辑
    #8

    @Tony-Wang 这个好像比两台dgx spark跑速度快不少是不是?

    Tony WangT 1 条回复 最后回复
    0
    • terryT terry

      @Tony-Wang 没啥卵用,意义不大,256G能跑DSV4 Flash,应该是最好的选择,没有之一。但是为了个大模型花这么多钱,我还是舍不得。ComfyUI能力等于残疾。

      Tony WangT 在线
      Tony WangT 在线
      Tony Wang
      超级版主
      编写于 最后由 编辑
      #9

      @terry

      对一些小型工作室, 个人. 主要处理文字, 文档和图片的, 应该还是不错的选择. 比如律所, 会所, 编辑部, 作家等等.

      1 条回复 最后回复
      0
      • Kirin H.K Kirin H.

        @Tony-Wang 这个好像比两台dgx spark跑速度快不少是不是?

        Tony WangT 在线
        Tony WangT 在线
        Tony Wang
        超级版主
        编写于 最后由 编辑
        #10

        @Kirin-H.

        dgx spark 内存带宽只有273G, 两台并行的话, 因为每层的计算结果都要交互, 速度肯定不能按X2 来计算. 而 M5 Ultra 内存带宽是1.2T.

        所以, 只看LLM decode 的话, M5 Ultra肯定是要快不少的. Prefill 阶段, 结论就不是很明确了. 等等测试结果吧.

        张光璞张 1 条回复 最后回复
        1
        • Tony WangT Tony Wang

          @Kirin-H.

          dgx spark 内存带宽只有273G, 两台并行的话, 因为每层的计算结果都要交互, 速度肯定不能按X2 来计算. 而 M5 Ultra 内存带宽是1.2T.

          所以, 只看LLM decode 的话, M5 Ultra肯定是要快不少的. Prefill 阶段, 结论就不是很明确了. 等等测试结果吧.

          张光璞张 离线
          张光璞张 离线
          张光璞
          劳动模范
          编写于 最后由 编辑
          #11

          @Tony-Wang 说:

          @Kirin-H.

          dgx spark 内存带宽只有273G, 两台并行的话, 因为每层的计算结果都要交互, 速度肯定不能按X2 来计算. 而 M5 Ultra 内存带宽是1.2T.

          所以, 只看LLM decode 的话, M5 Ultra肯定是要快不少的. Prefill 阶段, 结论就不是很明确了. 等等测试结果吧.

          以国内黄牛的尿性,这台机起码要到2027年下半年才能买到。

          1 条回复 最后回复
          0
          • kop wangK 离线
            kop wangK 离线
            kop wang
            超级版主
            编写于 最后由 编辑
            #12

            已更新性能推演,纯云,不对结果负责。

            虚心交流,一起进步

            1 条回复 最后回复
            0
            • terryT terry

              @Tony-Wang 没啥卵用,意义不大,256G能跑DSV4 Flash,应该是最好的选择,没有之一。但是为了个大模型花这么多钱,我还是舍不得。ComfyUI能力等于残疾。

              J 离线
              J 离线
              johnnybegood
              劳动模范 技术大牛
              编写于 最后由 编辑
              #13

              @terry 臣附议

              1 条回复 最后回复
              0
              • benton yiB 离线
                benton yiB 离线
                benton yi
                技术大牛
                编写于 最后由 benton yi 编辑
                #14

                e9113669-86ef-4ac2-8a03-ea18c7ae0a15-image.jpeg

                来自https://spark-arena.com/leaderboard
                2 nodes的gb10集群运行FP8量化的0731版dsv4-flash(实际是FP8和NVFP4混合量化)的榜单能到50t/s(极限调教科技与狠活,关闭GUI),且512K可用,1M上下文有衰减。
                GB10的社区在持续发力,而且大神不少,让这个小盒子从发布到现在的含金量持续缓缓上升。个人感觉这次苹果发布的macmini/macstudio系列在ai战场略显疲态。

                1 条回复 最后回复
                2
                • terryT terry

                  @Tony-Wang 没啥卵用,意义不大,256G能跑DSV4 Flash,应该是最好的选择,没有之一。但是为了个大模型花这么多钱,我还是舍不得。ComfyUI能力等于残疾。

                  Rex FanR 离线
                  Rex FanR 离线
                  Rex Fan
                  编写于 最后由 编辑
                  #15

                  @terry 硬件底子很好,框架拉了,512G 如果跑 GLM 如果能优化到 60tps 就是值的

                  terryT 1 条回复 最后回复
                  0
                  • Rex FanR Rex Fan

                    @terry 硬件底子很好,框架拉了,512G 如果跑 GLM 如果能优化到 60tps 就是值的

                    terryT 离线
                    terryT 离线
                    terry
                    超级版主
                    编写于 最后由 编辑
                    #16

                    @Rex-Fan 苹果出来了,但是似乎苹果很贵,还没有老黄的机器有性价比。

                    油管:https://www.youtube.com/@抡锤者

                    Rex FanR 1 条回复 最后回复
                    0
                    • terryT terry

                      @Rex-Fan 苹果出来了,但是似乎苹果很贵,还没有老黄的机器有性价比。

                      Rex FanR 离线
                      Rex FanR 离线
                      Rex Fan
                      编写于 最后由 编辑
                      #17

                      @terry 香港教育优惠 m5 ultra + 256g 人民币 58880 ,512g(如果不调整价格)差不多10w。性能保底能用和spark集群打平,之后生态起来了估计反超。缺点是 m5 设计的架构设计的太早了,精度还以 FP16/INT8 优化为主。估计要到 m7 才会给更实用的硬件原生 4-bit 张量优化

                      terryT 1 条回复 最后回复
                      0
                      • Rex FanR Rex Fan

                        @terry 香港教育优惠 m5 ultra + 256g 人民币 58880 ,512g(如果不调整价格)差不多10w。性能保底能用和spark集群打平,之后生态起来了估计反超。缺点是 m5 设计的架构设计的太早了,精度还以 FP16/INT8 优化为主。估计要到 m7 才会给更实用的硬件原生 4-bit 张量优化

                        terryT 离线
                        terryT 离线
                        terry
                        超级版主
                        编写于 最后由 编辑
                        #18

                        @Rex-Fan 现在的本地4比特也只是权重量化,推理还是BF16,苹果的问题是FP32卷积算力残疾,没有tensor core。跑LLM没问题,BF16抗打就行。

                        油管:https://www.youtube.com/@抡锤者

                        Rex FanR 1 条回复 最后回复
                        0
                        • ,terryT terry 固定了此主题
                        • terryT terry

                          @Rex-Fan 现在的本地4比特也只是权重量化,推理还是BF16,苹果的问题是FP32卷积算力残疾,没有tensor core。跑LLM没问题,BF16抗打就行。

                          Rex FanR 离线
                          Rex FanR 离线
                          Rex Fan
                          编写于 最后由 编辑
                          #19

                          @terry tensor core m5这一代加入了。苹果还有一个问题是没有类似SGLang、vllm之类的框架,投机解码也没有英伟达那边那么好用

                          1 条回复 最后回复
                          1
                          • williamlouisW 离线
                            williamlouisW 离线
                            williamlouis
                            超级版主
                            编写于 最后由 编辑
                            #20

                            还是得靠粉丝顶。如果买了做本地算力。我建议还是算了。
                            8.6W 搞了都不如 充值个订阅。爽玩还没噪音。
                            1W 上个 Mac mini M6 之后充值个 靠谱的在线订阅 或 直接充值 DeepSeek 是个更好的玩法。

                            个人主页:xlkj.org Telegram https://t.me/xlkjorg

                            Rex FanR C 2 条回复 最后回复
                            0
                            • williamlouisW williamlouis

                              还是得靠粉丝顶。如果买了做本地算力。我建议还是算了。
                              8.6W 搞了都不如 充值个订阅。爽玩还没噪音。
                              1W 上个 Mac mini M6 之后充值个 靠谱的在线订阅 或 直接充值 DeepSeek 是个更好的玩法。

                              Rex FanR 离线
                              Rex FanR 离线
                              Rex Fan
                              编写于 最后由 编辑
                              #21

                              @williamlouis 现在买的人想法是玩两年,白嫖算力,如果后期苹果拿不到足够的内存颗粒,没准还能加价卖

                              williamlouisW 1 条回复 最后回复
                              0
                              • Rex FanR Rex Fan

                                @williamlouis 现在买的人想法是玩两年,白嫖算力,如果后期苹果拿不到足够的内存颗粒,没准还能加价卖

                                williamlouisW 离线
                                williamlouisW 离线
                                williamlouis
                                超级版主
                                编写于 最后由 编辑
                                #22

                                @Rex-Fan 兄弟 投资8.6W 回报率能上20%就可以玩。加油

                                个人主页:xlkj.org Telegram https://t.me/xlkjorg

                                1 条回复 最后回复
                                0
                                • kop wangK kop wang
                                  编者注:此文完全是数字推演,不代表真实硬件能力。笔者不对信息准确度负责。
                                  信源会罗列在文章下方
                                  

                                  结合256GB统一内存来看,目前比较有价值的就是运行ds-v4-flash-0731,恰巧最近omlx有过一次版本更新,官方性能数据如下:信息来源
                                  f917c000-707f-43a1-b0a1-23bd464ed4e9-image.jpeg

                                  然后,M5 Ultra的内存带宽是M3 Ultra的接近1.5倍。又根据苹果官网数据,其prefill性能是M3 Ultra的4倍(ollama数据,框架不同,只能参考)

                                  所以大概预期,M5 Ultra运行ds-v4-flash-0731 Q4的大致性能是:

                                  prefill

                                  上下文 M3U(v0.5.4rc2) 3× 4×
                                  1K 531.0 ~1590 ~2120
                                  4K 486.5 ~1460 ~1950
                                  64K 468.5 ~1410 ~1870
                                  128K 438.6 ~1320 ~1750

                                  decode

                                  场景 M3 Ultra M5 Ultra 预计
                                  MTP 关,1K 27.6 ~40
                                  MTP 关,4K 25.8 ~38
                                  MTP 关,64K 22.8 ~33
                                  MTP 关,128K 21.3 ~31

                                  信息来源:
                                  https://newreleases.io/project/github/jundot/omlx/release/v0.5.4rc2
                                  https://www.apple.com.cn/mac-studio/
                                  https://omlx.ai/compare

                                  cc tgoC 离线
                                  cc tgoC 离线
                                  cc tgo
                                  编写于 最后由 编辑
                                  #23

                                  @kop-wang 已下单,要10月24日发货,等到货了实测一下。
                                  选的36核中央+80核图形,256GB内存,2TB存储空间
                                  小白一枚,看大佬YT视频找到的论坛,学习摸索中。
                                  应该能跑这两个模型吧。
                                  GLM-5.3-Flash 4bit
                                  DeepSeek-V4-Flash-0731 MXFP4

                                  J 1 条回复 最后回复
                                  1
                                  • cc tgoC cc tgo

                                    @kop-wang 已下单,要10月24日发货,等到货了实测一下。
                                    选的36核中央+80核图形,256GB内存,2TB存储空间
                                    小白一枚,看大佬YT视频找到的论坛,学习摸索中。
                                    应该能跑这两个模型吧。
                                    GLM-5.3-Flash 4bit
                                    DeepSeek-V4-Flash-0731 MXFP4

                                    J 离线
                                    J 离线
                                    johnnybegood
                                    劳动模范 技术大牛
                                    编写于 最后由 编辑
                                    #24

                                    @cc-tgo用学生认证可以怒省1万块?

                                    cc tgoC 1 条回复 最后回复
                                    0
                                    • J johnnybegood

                                      @cc-tgo用学生认证可以怒省1万块?

                                      cc tgoC 离线
                                      cc tgoC 离线
                                      cc tgo
                                      编写于 最后由 编辑
                                      #25

                                      @johnnybegood 用了教育优惠,原价90499,优惠后82749,怒省7750🤑

                                      J 1 条回复 最后回复
                                      0
                                      • cc tgoC cc tgo

                                        @johnnybegood 用了教育优惠,原价90499,优惠后82749,怒省7750🤑

                                        J 离线
                                        J 离线
                                        johnnybegood
                                        劳动模范 技术大牛
                                        编写于 最后由 编辑
                                        #26

                                        @cc-tgo 只是学生用的话, 确实有点浪费😲 😧

                                        cc tgoC 1 条回复 最后回复
                                        0
                                        • J johnnybegood

                                          @cc-tgo 只是学生用的话, 确实有点浪费😲 😧

                                          cc tgoC 离线
                                          cc tgoC 离线
                                          cc tgo
                                          编写于 最后由 编辑
                                          #27

                                          @johnnybegood 不懂代码的小白一枚😰 ,兴趣是最好的老师。😳

                                          张光璞张 1 条回复 最后回复
                                          0

                                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                          有了你的建议,这篇帖子会更精彩哦 💗

                                          注册 登录
                                          回复
                                          • 在新帖中回复
                                          登录后回复
                                          • 从旧到新
                                          • 从新到旧
                                          • 最多赞同


                                          • 登录

                                          • 登录或注册以进行搜索。
                                          • 第一个帖子
                                            最后一个帖子
                                          0
                                          • 版块
                                          • 最新
                                          • 标签
                                          • 热门
                                          • 用户
                                          • 群组