跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. 感慨,Deepseek V4 Flash 终于本地跑起来了,非作业,纯感想

感慨,Deepseek V4 Flash 终于本地跑起来了,非作业,纯感想

已定时 已固定 已锁定 已移动 LLM讨论区
deepseek本地模型
27 帖子 7 发布者 628 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Ben LeeB
    Ben LeeB
    Ben Lee
    劳动模范 技术大牛
    编写于 最后由 编辑
    #6

    老哥,恭喜跑起来!想请教几个部署细节:

    1. 用的是 llama.cpp、DwarfStar 还是其他推理引擎?
    2. Q4 模型具体是哪个 GGUF 版本?文件有多大?
    3. 双 3090 分别占用了多少显存?CPU Offload 了多少层?有没有用 --n-cpu-moe?
    4. 10–11 tok/s 对应多长的 Context?

    我也想研究这条路线。

    johnnybegoodJ 1 条回复 最后回复
    0
    • Ben LeeB Ben Lee

      老哥,恭喜跑起来!想请教几个部署细节:

      1. 用的是 llama.cpp、DwarfStar 还是其他推理引擎?
      2. Q4 模型具体是哪个 GGUF 版本?文件有多大?
      3. 双 3090 分别占用了多少显存?CPU Offload 了多少层?有没有用 --n-cpu-moe?
      4. 10–11 tok/s 对应多长的 Context?

      我也想研究这条路线。

      johnnybegoodJ
      johnnybegoodJ
      johnnybegood
      超凡大师
      编写于 最后由 编辑
      #7

      @Ben-Lee 我也写了, 非作业, 因为感觉弄得不是特别满意, 只是能跑起来而已。

      1、用的是 llama.cpp , dspark 加速
      2、Q4 用的就是unsloth的原版 UD Q4 KL 模型, 166G
      3、几乎占满了, 都是22G多, 多少层没仔细看,因为draft也弄到显存了,PLE表肯定是在内存, 内存几乎用满了,128G一度达到98%
      4、10-11tok/s 对应 1024 context, 又跑了几次长程, 基本就是7-9左右了。

      我也想知道有没有别的方法能继续加速, 能超过15我就很满足了。

      1 条回复 最后回复
      1
      • Ben LeeB
        Ben LeeB
        Ben Lee
        劳动模范 技术大牛
        编写于 最后由 编辑
        #8

        我是32G显存N卡,内存和你一模一样 128 GB DDR4 3200,也只能跑出11~12tok/s。问了AI,发现瓶颈在内存交换速度。我的只有53G,差太远了,用这个瓶颈AI算给我说也就是12tok/s

        johnnybegoodJ 2 条回复 最后回复
        0
        • Ben LeeB Ben Lee

          我是32G显存N卡,内存和你一模一样 128 GB DDR4 3200,也只能跑出11~12tok/s。问了AI,发现瓶颈在内存交换速度。我的只有53G,差太远了,用这个瓶颈AI算给我说也就是12tok/s

          johnnybegoodJ
          johnnybegoodJ
          johnnybegood
          超凡大师
          编写于 最后由 johnnybegood 编辑
          #9

          @Ben-Lee 你让ai编个程序实测一下内存带宽。 应该不到50G/s ,反正我的主板插满四根内存后, 给我降速到了 30G多, 另外瓶颈这个事, 别说30G/s , 其实 20G/s 也基本够, 我最大瓶颈是第二个PCIE 插槽最多只能 X4 ,无法 X8 更不能 x16, 否则速度我觉得应该能翻倍

          1 条回复 最后回复
          0
          • Ben LeeB
            Ben LeeB
            Ben Lee
            劳动模范 技术大牛
            编写于 最后由 编辑
            #10

            我刚测过了,i7-12700K + DDR4-3600 双通道: 测试数据如下

            1 线程: 9.3 GB/s
            2 线程: 23.3 GB/s
            4 线程: 36.0 GB/s
            8 线程: 53.4 GB/s ← 峰值

            AI计算过程

            DSF 10B active params @ ~4bit量化 ≈ 5 GB/token
            53.4 GB/s 除以 5GB/token → 11 tok/s 左右 (理论上限)

            我实测最高到12 tok/s

            johnnybegoodJ 1 条回复 最后回复
            1
            • Ben LeeB Ben Lee

              我是32G显存N卡,内存和你一模一样 128 GB DDR4 3200,也只能跑出11~12tok/s。问了AI,发现瓶颈在内存交换速度。我的只有53G,差太远了,用这个瓶颈AI算给我说也就是12tok/s

              johnnybegoodJ
              johnnybegoodJ
              johnnybegood
              超凡大师
              编写于 最后由 编辑
              #11

              @Ben-Lee 说:

              内存和你一模一样 128 GB DDR4 3200

              不是3200么? 测出3600? 超频用了?

              Ben LeeB 1 条回复 最后回复
              0
              • Ben LeeB Ben Lee

                我刚测过了,i7-12700K + DDR4-3600 双通道: 测试数据如下

                1 线程: 9.3 GB/s
                2 线程: 23.3 GB/s
                4 线程: 36.0 GB/s
                8 线程: 53.4 GB/s ← 峰值

                AI计算过程

                DSF 10B active params @ ~4bit量化 ≈ 5 GB/token
                53.4 GB/s 除以 5GB/token → 11 tok/s 左右 (理论上限)

                我实测最高到12 tok/s

                johnnybegoodJ
                johnnybegoodJ
                johnnybegood
                超凡大师
                编写于 最后由 johnnybegood 编辑
                #12

                @Ben-Lee 那看来差不多就这个速度了, 当个知识数据库聊聊天应该没啥问题, 干活儿估计就比较痛苦了。另外你加了Dspark预测编码了么? 按你说的你现在应该是baseline速度啊, 加了预测说不定能到15

                1 条回复 最后回复
                0
                • johnnybegoodJ johnnybegood

                  @Ben-Lee 说:

                  内存和你一模一样 128 GB DDR4 3200

                  不是3200么? 测出3600? 超频用了?

                  Ben LeeB
                  Ben LeeB
                  Ben Lee
                  劳动模范 技术大牛
                  编写于 最后由 编辑
                  #13

                  @johnnybegood 对,有个什么XMP,打开就是可以超到3600

                  johnnybegoodJ 2 条回复 最后回复
                  0
                  • Ben LeeB Ben Lee

                    @johnnybegood 对,有个什么XMP,打开就是可以超到3600

                    johnnybegoodJ
                    johnnybegoodJ
                    johnnybegood
                    超凡大师
                    编写于 最后由 johnnybegood 编辑
                    #14
                    此主題已被删除!
                    1 条回复 最后回复
                    0
                    • Ben LeeB Ben Lee

                      @johnnybegood 对,有个什么XMP,打开就是可以超到3600

                      johnnybegoodJ
                      johnnybegoodJ
                      johnnybegood
                      超凡大师
                      编写于 最后由 编辑
                      #15

                      @Ben-Lee 不敢啊, 两条3200超频到 3600 还敢用用, 四条怕不稳定啊。。。。什么品牌型号的内存? 我是海盗船.

                      更新一下: 调了一下内存时序, 超频了一下, 也用了 3600, 但是发现并没有什么帮助, decode也没有更快。 看来内存不是瓶颈。 另外再问一下, 你的 prefill 速度是多少?

                      1 条回复 最后回复
                      0
                      • Ben LeeB
                        Ben LeeB
                        Ben Lee
                        劳动模范 技术大牛
                        编写于 最后由 编辑
                        #16

                        听你这么一说,我查了下,我的是 4条 Patriot 32GB Viper Steel DDR4 3600 MHz UDIMM Memory。我一直还以为我的是3200 MHz,哈哈。想当年,这4根内存的价格跟现在四根DDR5的价格真实天差地别。

                        johnnybegoodJ 2 条回复 最后回复
                        0
                        • Ben LeeB Ben Lee

                          听你这么一说,我查了下,我的是 4条 Patriot 32GB Viper Steel DDR4 3600 MHz UDIMM Memory。我一直还以为我的是3200 MHz,哈哈。想当年,这4根内存的价格跟现在四根DDR5的价格真实天差地别。

                          johnnybegoodJ
                          johnnybegoodJ
                          johnnybegood
                          超凡大师
                          编写于 最后由 johnnybegood 编辑
                          #17

                          @Ben-Lee 到 15t/s 了! 用的这个模型 https://huggingface.co/turboderp/DeepSeek-V4-Flash-Vision-Exp-exl3/tree/3.04bpw , 特地部署了 exllamaV3 + TabbyAPI , 跑起来确实快了不少,聊起天来肉眼上还是能接受的比较舒服了, 另外试了一下coding, 应该是比 15tok/s 更快一些,可能超过20-25了。

                          1 条回复 最后回复
                          1
                          • Ben LeeB Ben Lee

                            听你这么一说,我查了下,我的是 4条 Patriot 32GB Viper Steel DDR4 3600 MHz UDIMM Memory。我一直还以为我的是3200 MHz,哈哈。想当年,这4根内存的价格跟现在四根DDR5的价格真实天差地别。

                            johnnybegoodJ
                            johnnybegoodJ
                            johnnybegood
                            超凡大师
                            编写于 最后由 编辑
                            #18

                            @Ben-Lee 我又研究了一下, 跑得时候我发现cpu满载, 看来跟cpu速度也有关, 我是 3950X, 如果cpu是更猛的 285K, 9950X 等等, 估计速度还会进一步提升。 现在看来MTP是用 CPU在跑的。

                            1 条回复 最后回复
                            0
                            • Ben LeeB
                              Ben LeeB
                              Ben Lee
                              劳动模范 技术大牛
                              编写于 最后由 编辑
                              #19

                              厉害啊兄弟,我也试试

                              johnnybegoodJ 1 条回复 最后回复
                              0
                              • Ben LeeB Ben Lee

                                厉害啊兄弟,我也试试

                                johnnybegoodJ
                                johnnybegoodJ
                                johnnybegood
                                超凡大师
                                编写于 最后由 johnnybegood 编辑
                                #20

                                @Ben-Lee 刚刚又试了一下, 短暂地将CPU超频了 30%, 跑起来了, 速度还真涨了接近 20% ...

                                完整对比:

                                threads avg decode avg e2e 备注
                                16 15.73 t/s 12.47 物理核满载
                                28 17.44 t/s 14.77 14 物理核 × 2 SMT 部分加速
                                32 7.71 t/s 3.94 全 SMT 兄弟抢资源,掉速 50%

                                结论:threads=28 是最优(14 物理核 × 2 SMT,让部分兄弟核帮忙分摊访存延迟,但不全开)。

                                1 条回复 最后回复
                                1
                                • Ben LeeB
                                  Ben LeeB
                                  Ben Lee
                                  劳动模范 技术大牛
                                  编写于 最后由 编辑
                                  #21

                                  试了,120 GB 装不进 我的机器 32 GB显存+128G内存,exl3 不支持 offload。你的48G显存立功了。另:祝贺,这些速度都到了17了,其实可用了,不着急的任务,或者晚上睡觉前丢给它让它跑。

                                  johnnybegoodJ 2 条回复 最后回复
                                  0
                                  • Ben LeeB Ben Lee

                                    试了,120 GB 装不进 我的机器 32 GB显存+128G内存,exl3 不支持 offload。你的48G显存立功了。另:祝贺,这些速度都到了17了,其实可用了,不着急的任务,或者晚上睡觉前丢给它让它跑。

                                    johnnybegoodJ
                                    johnnybegoodJ
                                    johnnybegood
                                    超凡大师
                                    编写于 最后由 编辑
                                    #22

                                    @Ben-Lee 有两个问题, 据说exllamav3只支持nvidia, 不知道你是nvidia的卡么? 第二, offload 到内存是肯定支持的, 要不我也跑不起来啊, 内存里面我放了 30层 moe呢。

                                    1 条回复 最后回复
                                    0
                                    • Ben LeeB
                                      Ben LeeB
                                      Ben Lee
                                      劳动模范 技术大牛
                                      编写于 最后由 编辑
                                      #23
                                      此主題已被删除!
                                      1 条回复 最后回复
                                      0
                                      • johnnybegoodJ johnnybegood

                                        Deepseek V4 Flash 0731 Q4量化版,终于本地跑起来了。速度当然惨不忍睹,也就10-11tok/s——但回想来时路,还是有点感慨的。这台 6 年的老电脑,缝缝补补能到这一步,挺满足了。(最新情况, 到 15tok/s 了, 看 17楼帖子)

                                        1. 本来的样子

                                        CPU : AMD Ryzen 9 3950X
                                        内存 : 32 GB DDR4
                                        显卡 : ASUS RTX 2060 SUPER 8G
                                        主板 : ASUS X570 TUF Gaming

                                        这种配置当年装出来其实已经过剩,日常写代码、打游戏绰绰有余,完全没必要折腾。

                                        2. 沉寂的那些年

                                        前两年有次朋友给了块 3070 8G,我顺手把 2060S 换掉了——机器对我来说还是"够用就行",从来没想着升级配置。

                                        存储倒是买过几根——存储最便宜那阵子加了一条 32G,凑成 64G;再买了 2T、4T 的 SSD。那会儿 2T 才 500 多、4T 也就 1000 左右,买的时候还嫌贵。现在想想,幸亏那时候的自己——没在便宜的时候囤货这件事上犹豫,后面才知道什么叫真贵。

                                        3. 去年:开始关注大模型

                                        DeepSeek 出圈那会儿,我开始正儿八经研究大模型。早期本地能跑的那些小模型,玩了一圈觉得意思不大, 后面发现Qwen3系列模型不错, 3070 能跑起来像样的东西了,才看见希望。

                                        心里想升级,行动上又拖了下来。

                                        4. 今年:开始加速

                                        年初开始玩龙虾,进一步意识到本地模型的价值。Qwen3.5 一波小尺寸又好用的模型出来后,我下定决心——加一块 3090。

                                        拿回来一跑,真的豁然开朗:很多以前跑不动的大模型都能跑起来了。那一刻甚至有点飘,觉得自己已经"无所不能"——直到碰到 DeepSeek。才发现 DeepSeek 是一道真正的鸿沟。

                                        网上搜了无数教程,基本只有两类:要么 M3 Ultra 大内存一体机,要么好几张 RTX 6000 Pro。看着别人的配置,真有一种望洋兴叹的无力感。

                                        后来 Qwen3.8 Flash Next 出来,3070 拖了它大腿,于是直接换成了 3080 20G,内存加到 96G。

                                        升级完也就爽了两星期——立刻发现两个新问题:

                                        • 3080+3090 不对称, 两张卡基本各跑各的
                                        • 96G 内存单双通道混插,带宽掉得很厉害,影响所有 batch / offload 类的参数

                                        这些问题虽然烦,至少 Qwen3.8 Flash Next 是跑起来了。DeepSeek V4 Flash Q4 也第一次看到了"希望"——虽然最后还是 OOM。

                                        于是决定:加到 128G 内存,3080 换成 3090。顺便整顿了机箱风道,装了几个 F9 R120 风扇,真的吹得很爽。

                                        5. 现在的样子

                                        CPU : AMD Ryzen 9 3950X
                                        内存 : 128 GB DDR4 3200
                                        显卡 : ASUS RTX 3090 24G × 2
                                        主板 : ASUS X570 TUF Gaming(原地没动)

                                        前前后后所有升级加一起,不到 1.6W RMB。
                                        除了能跑大模型, 我喜欢的游戏,现在也能用3090支持 DLSS5 和多帧生成了~老游戏焕发第二春,也挺开心的,一不小心就玩了一整天。

                                        6. 关于主板

                                        但要说说这块主板。

                                        搞了那么多升级,最后才发现——这块主板只支持 PCIE 4.0 16X + 4X,跑不了 8X + 8X,也不能 P2P。
                                        真是有点如鲠在喉。

                                        下一步,只能换主板。但至少 DeepSeek V4 Flash 0731 在这台机器上真的跑起来了——也算完成了当初那个小小的愿望吧,不知道有没有大神能在指导指导,让我跑的更快点。

                                        后记

                                        这机器,陪我 6 年,稀里糊涂各种很拮据的升级,虽然没钱,但继续升级只是因为不愿意放弃。

                                        下一步折腾什么?谁知道呢。折腾无止境,后面继续折腾。

                                        David WangD
                                        David WangD
                                        David Wang
                                        编写于 最后由 编辑
                                        #24

                                        @johnnybegood 老机器新生命 真棒!

                                        1 条回复 最后回复
                                        1
                                        • Ben LeeB Ben Lee

                                          试了,120 GB 装不进 我的机器 32 GB显存+128G内存,exl3 不支持 offload。你的48G显存立功了。另:祝贺,这些速度都到了17了,其实可用了,不着急的任务,或者晚上睡觉前丢给它让它跑。

                                          johnnybegoodJ
                                          johnnybegoodJ
                                          johnnybegood
                                          超凡大师
                                          编写于 最后由 编辑
                                          #25

                                          @Ben-Lee 现在 GLM5.3-flash 也能跑到 19 tok/s 了。 https://lcz.me/topic/1929

                                          1 条回复 最后回复
                                          2

                                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您下次访问时都将自动回到上次浏览的位置,并可选择接收新回复的通知(通过电子邮件或推送通知)。您还可以收藏帖子、为帖子点赞,以此向其他社区成员表达您的感谢。

                                          有了你的建议,这篇帖子会更精彩哦 💗

                                          注册 登录
                                          回复
                                          • 在新帖中回复
                                          登录后回复
                                          • 从旧到新
                                          • 从新到旧
                                          • 最多赞同


                                          • 登录

                                          • 登录或注册以进行搜索。
                                          • 第一个帖子
                                            最后一个帖子
                                          0
                                          • 版块
                                          • 最新
                                          • 标签
                                          • 热门
                                          • 用户
                                          • 群组