跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. mac m5 ultra上线中国官网。1.2T显存带宽,256GB版本8.6万

mac m5 ultra上线中国官网。1.2T显存带宽,256GB版本8.6万

已定时 已固定 已锁定 已移动 AI硬件
macapple-m3apple-m5
49 帖子 16 发布者 1.3k 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • kop wangK 离线
    kop wangK 离线
    kop wang
    超级版主
    编写于 最后由 kop wang 编辑
    #1
    编者注:此文完全是数字推演,不代表真实硬件能力。笔者不对信息准确度负责。
    信源会罗列在文章下方
    

    结合256GB统一内存来看,目前比较有价值的就是运行ds-v4-flash-0731,恰巧最近omlx有过一次版本更新,官方性能数据如下:信息来源
    f917c000-707f-43a1-b0a1-23bd464ed4e9-image.jpeg

    然后,M5 Ultra的内存带宽是M3 Ultra的接近1.5倍。又根据苹果官网数据,其prefill性能是M3 Ultra的4倍(ollama数据,框架不同,只能参考)

    所以大概预期,M5 Ultra运行ds-v4-flash-0731 Q4的大致性能是:

    prefill

    上下文 M3U(v0.5.4rc2) 3× 4×
    1K 531.0 ~1590 ~2120
    4K 486.5 ~1460 ~1950
    64K 468.5 ~1410 ~1870
    128K 438.6 ~1320 ~1750

    decode

    场景 M3 Ultra M5 Ultra 预计
    MTP 关,1K 27.6 ~40
    MTP 关,4K 25.8 ~38
    MTP 关,64K 22.8 ~33
    MTP 关,128K 21.3 ~31

    信息来源:
    https://newreleases.io/project/github/jundot/omlx/release/v0.5.4rc2
    https://www.apple.com.cn/mac-studio/
    https://omlx.ai/compare

    虚心交流,一起进步

    cc tgoC 1 条回复 最后回复
    2
    • ,kop wangK kop wang 将此主题从 LLM讨论区 移至此处
    • Rex FanR 离线
      Rex FanR 离线
      Rex Fan
      编写于 最后由 编辑
      #2

      首发 pcie 6.0 ssd,带宽有30gb/s(和cx7网络速度相当),似乎可以买低配 + 用硬盘跑超大规模模型

      1 条回复 最后回复
      0
      • kos orK 离线
        kos orK 离线
        kos or
        超凡大师
        编写于 最后由 kos or 编辑
        #3

        新加坡顯卡商說第四季RTX 顯卡供貨會減少, 幾個小時前有傳聞說RTX50 Series 顯卡將會 “大減” 有人看到類似的消息嗎?

        de404fd2-70e2-40b8-bc57-891a3089c076-image.jpeg

        Rex FanR 1 条回复 最后回复
        0
        • kos orK kos or

          新加坡顯卡商說第四季RTX 顯卡供貨會減少, 幾個小時前有傳聞說RTX50 Series 顯卡將會 “大減” 有人看到類似的消息嗎?

          de404fd2-70e2-40b8-bc57-891a3089c076-image.jpeg

          Rex FanR 离线
          Rex FanR 离线
          Rex Fan
          编写于 最后由 编辑
          #4

          @kos-or 国内也说游戏显卡要减半 + 二次涨价

          1 条回复 最后回复
          1
          • terryT 离线
            terryT 离线
            terry
            超级版主
            编写于 最后由 编辑
            #5

            很好,我省了8.6万

            油管:https://www.youtube.com/@抡锤者

            1 条回复 最后回复
            0
            • Tony WangT 离线
              Tony WangT 离线
              Tony Wang
              超级版主
              编写于 最后由 编辑
              #6

              M5 Ultra
              30CPU/64GPU/256G/1T RMB 70599
              36CPU/80GPU/256G/1T RMB 79374

              内存带宽1.2T, 256G统一内存还是有吸引力, 单机可跑deepseek v4 flash Q4.

              号召论坛土豪们先入手测试一下啊 😊

              terryT Kirin H.K 2 条回复 最后回复
              0
              • Tony WangT Tony Wang

                M5 Ultra
                30CPU/64GPU/256G/1T RMB 70599
                36CPU/80GPU/256G/1T RMB 79374

                内存带宽1.2T, 256G统一内存还是有吸引力, 单机可跑deepseek v4 flash Q4.

                号召论坛土豪们先入手测试一下啊 😊

                terryT 离线
                terryT 离线
                terry
                超级版主
                编写于 最后由 编辑
                #7

                @Tony-Wang 没啥卵用,意义不大,256G能跑DSV4 Flash,应该是最好的选择,没有之一。但是为了个大模型花这么多钱,我还是舍不得。ComfyUI能力等于残疾。

                油管:https://www.youtube.com/@抡锤者

                Tony WangT J Rex FanR 3 条回复 最后回复
                1
                • Tony WangT Tony Wang

                  M5 Ultra
                  30CPU/64GPU/256G/1T RMB 70599
                  36CPU/80GPU/256G/1T RMB 79374

                  内存带宽1.2T, 256G统一内存还是有吸引力, 单机可跑deepseek v4 flash Q4.

                  号召论坛土豪们先入手测试一下啊 😊

                  Kirin H.K 离线
                  Kirin H.K 离线
                  Kirin H.
                  编写于 最后由 编辑
                  #8

                  @Tony-Wang 这个好像比两台dgx spark跑速度快不少是不是?

                  Tony WangT 1 条回复 最后回复
                  0
                  • terryT terry

                    @Tony-Wang 没啥卵用,意义不大,256G能跑DSV4 Flash,应该是最好的选择,没有之一。但是为了个大模型花这么多钱,我还是舍不得。ComfyUI能力等于残疾。

                    Tony WangT 离线
                    Tony WangT 离线
                    Tony Wang
                    超级版主
                    编写于 最后由 编辑
                    #9

                    @terry

                    对一些小型工作室, 个人. 主要处理文字, 文档和图片的, 应该还是不错的选择. 比如律所, 会所, 编辑部, 作家等等.

                    1 条回复 最后回复
                    0
                    • Kirin H.K Kirin H.

                      @Tony-Wang 这个好像比两台dgx spark跑速度快不少是不是?

                      Tony WangT 离线
                      Tony WangT 离线
                      Tony Wang
                      超级版主
                      编写于 最后由 编辑
                      #10

                      @Kirin-H.

                      dgx spark 内存带宽只有273G, 两台并行的话, 因为每层的计算结果都要交互, 速度肯定不能按X2 来计算. 而 M5 Ultra 内存带宽是1.2T.

                      所以, 只看LLM decode 的话, M5 Ultra肯定是要快不少的. Prefill 阶段, 结论就不是很明确了. 等等测试结果吧.

                      张光璞张 1 条回复 最后回复
                      1
                      • Tony WangT Tony Wang

                        @Kirin-H.

                        dgx spark 内存带宽只有273G, 两台并行的话, 因为每层的计算结果都要交互, 速度肯定不能按X2 来计算. 而 M5 Ultra 内存带宽是1.2T.

                        所以, 只看LLM decode 的话, M5 Ultra肯定是要快不少的. Prefill 阶段, 结论就不是很明确了. 等等测试结果吧.

                        张光璞张 离线
                        张光璞张 离线
                        张光璞
                        劳动模范 德高望重
                        编写于 最后由 编辑
                        #11

                        @Tony-Wang 说:

                        @Kirin-H.

                        dgx spark 内存带宽只有273G, 两台并行的话, 因为每层的计算结果都要交互, 速度肯定不能按X2 来计算. 而 M5 Ultra 内存带宽是1.2T.

                        所以, 只看LLM decode 的话, M5 Ultra肯定是要快不少的. Prefill 阶段, 结论就不是很明确了. 等等测试结果吧.

                        以国内黄牛的尿性,这台机起码要到2027年下半年才能买到。

                        1 条回复 最后回复
                        0
                        • kop wangK 离线
                          kop wangK 离线
                          kop wang
                          超级版主
                          编写于 最后由 编辑
                          #12

                          已更新性能推演,纯云,不对结果负责。

                          虚心交流,一起进步

                          1 条回复 最后回复
                          0
                          • terryT terry

                            @Tony-Wang 没啥卵用,意义不大,256G能跑DSV4 Flash,应该是最好的选择,没有之一。但是为了个大模型花这么多钱,我还是舍不得。ComfyUI能力等于残疾。

                            J 离线
                            J 离线
                            johnnybegood
                            劳动模范 技术大牛
                            编写于 最后由 编辑
                            #13

                            @terry 臣附议

                            1 条回复 最后回复
                            0
                            • benton yiB 离线
                              benton yiB 离线
                              benton yi
                              技术大牛
                              编写于 最后由 benton yi 编辑
                              #14

                              e9113669-86ef-4ac2-8a03-ea18c7ae0a15-image.jpeg

                              来自https://spark-arena.com/leaderboard
                              2 nodes的gb10集群运行FP8量化的0731版dsv4-flash(实际是FP8和NVFP4混合量化)的榜单能到50t/s(极限调教科技与狠活,关闭GUI),且512K可用,1M上下文有衰减。
                              GB10的社区在持续发力,而且大神不少,让这个小盒子从发布到现在的含金量持续缓缓上升。个人感觉这次苹果发布的macmini/macstudio系列在ai战场略显疲态。

                              1 条回复 最后回复
                              2
                              • terryT terry

                                @Tony-Wang 没啥卵用,意义不大,256G能跑DSV4 Flash,应该是最好的选择,没有之一。但是为了个大模型花这么多钱,我还是舍不得。ComfyUI能力等于残疾。

                                Rex FanR 离线
                                Rex FanR 离线
                                Rex Fan
                                编写于 最后由 编辑
                                #15

                                @terry 硬件底子很好,框架拉了,512G 如果跑 GLM 如果能优化到 60tps 就是值的

                                terryT 1 条回复 最后回复
                                0
                                • Rex FanR Rex Fan

                                  @terry 硬件底子很好,框架拉了,512G 如果跑 GLM 如果能优化到 60tps 就是值的

                                  terryT 离线
                                  terryT 离线
                                  terry
                                  超级版主
                                  编写于 最后由 编辑
                                  #16

                                  @Rex-Fan 苹果出来了,但是似乎苹果很贵,还没有老黄的机器有性价比。

                                  油管:https://www.youtube.com/@抡锤者

                                  Rex FanR 1 条回复 最后回复
                                  0
                                  • terryT terry

                                    @Rex-Fan 苹果出来了,但是似乎苹果很贵,还没有老黄的机器有性价比。

                                    Rex FanR 离线
                                    Rex FanR 离线
                                    Rex Fan
                                    编写于 最后由 编辑
                                    #17

                                    @terry 香港教育优惠 m5 ultra + 256g 人民币 58880 ,512g(如果不调整价格)差不多10w。性能保底能用和spark集群打平,之后生态起来了估计反超。缺点是 m5 设计的架构设计的太早了,精度还以 FP16/INT8 优化为主。估计要到 m7 才会给更实用的硬件原生 4-bit 张量优化

                                    terryT 1 条回复 最后回复
                                    0
                                    • Rex FanR Rex Fan

                                      @terry 香港教育优惠 m5 ultra + 256g 人民币 58880 ,512g(如果不调整价格)差不多10w。性能保底能用和spark集群打平,之后生态起来了估计反超。缺点是 m5 设计的架构设计的太早了,精度还以 FP16/INT8 优化为主。估计要到 m7 才会给更实用的硬件原生 4-bit 张量优化

                                      terryT 离线
                                      terryT 离线
                                      terry
                                      超级版主
                                      编写于 最后由 编辑
                                      #18

                                      @Rex-Fan 现在的本地4比特也只是权重量化,推理还是BF16,苹果的问题是FP32卷积算力残疾,没有tensor core。跑LLM没问题,BF16抗打就行。

                                      油管:https://www.youtube.com/@抡锤者

                                      Rex FanR 1 条回复 最后回复
                                      0
                                      • ,terryT terry 固定了此主题
                                      • terryT terry

                                        @Rex-Fan 现在的本地4比特也只是权重量化,推理还是BF16,苹果的问题是FP32卷积算力残疾,没有tensor core。跑LLM没问题,BF16抗打就行。

                                        Rex FanR 离线
                                        Rex FanR 离线
                                        Rex Fan
                                        编写于 最后由 编辑
                                        #19

                                        @terry tensor core m5这一代加入了。苹果还有一个问题是没有类似SGLang、vllm之类的框架,投机解码也没有英伟达那边那么好用

                                        1 条回复 最后回复
                                        1
                                        • williamlouisW 离线
                                          williamlouisW 离线
                                          williamlouis
                                          超级版主
                                          编写于 最后由 编辑
                                          #20

                                          还是得靠粉丝顶。如果买了做本地算力。我建议还是算了。
                                          8.6W 搞了都不如 充值个订阅。爽玩还没噪音。
                                          1W 上个 Mac mini M6 之后充值个 靠谱的在线订阅 或 直接充值 DeepSeek 是个更好的玩法。

                                          个人主页:xlkj.org Telegram https://t.me/xlkjorg

                                          Rex FanR C 2 条回复 最后回复
                                          0

                                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                          有了你的建议,这篇帖子会更精彩哦 💗

                                          注册 登录
                                          回复
                                          • 在新帖中回复
                                          登录后回复
                                          • 从旧到新
                                          • 从新到旧
                                          • 最多赞同


                                          • 登录

                                          • 登录或注册以进行搜索。
                                          • 第一个帖子
                                            最后一个帖子
                                          0
                                          • 版块
                                          • 最新
                                          • 标签
                                          • 热门
                                          • 用户
                                          • 群组