感慨,Deepseek V4 Flash 终于本地跑起来了,非作业,纯感想
-
Deepseek V4 Flash 0731 Q4量化版,终于本地跑起来了。速度当然惨不忍睹,也就10-11tok/s——但回想来时路,还是有点感慨的。这台 6 年的老电脑,缝缝补补能到这一步,挺满足了。(最新情况, 到 15tok/s 了, 看 17楼帖子)
1. 本来的样子
CPU : AMD Ryzen 9 3950X
内存 : 32 GB DDR4
显卡 : ASUS RTX 2060 SUPER 8G
主板 : ASUS X570 TUF Gaming这种配置当年装出来其实已经过剩,日常写代码、打游戏绰绰有余,完全没必要折腾。
2. 沉寂的那些年
前两年有次朋友给了块 3070 8G,我顺手把 2060S 换掉了——机器对我来说还是"够用就行",从来没想着升级配置。
存储倒是买过几根——存储最便宜那阵子加了一条 32G,凑成 64G;再买了 2T、4T 的 SSD。那会儿 2T 才 500 多、4T 也就 1000 左右,买的时候还嫌贵。现在想想,幸亏那时候的自己——没在便宜的时候囤货这件事上犹豫,后面才知道什么叫真贵。
3. 去年:开始关注大模型
DeepSeek 出圈那会儿,我开始正儿八经研究大模型。早期本地能跑的那些小模型,玩了一圈觉得意思不大, 后面发现Qwen3系列模型不错, 3070 能跑起来像样的东西了,才看见希望。
心里想升级,行动上又拖了下来。
4. 今年:开始加速
年初开始玩龙虾,进一步意识到本地模型的价值。Qwen3.5 一波小尺寸又好用的模型出来后,我下定决心——加一块 3090。
拿回来一跑,真的豁然开朗:很多以前跑不动的大模型都能跑起来了。那一刻甚至有点飘,觉得自己已经"无所不能"——直到碰到 DeepSeek。才发现 DeepSeek 是一道真正的鸿沟。
网上搜了无数教程,基本只有两类:要么 M3 Ultra 大内存一体机,要么好几张 RTX 6000 Pro。看着别人的配置,真有一种望洋兴叹的无力感。
后来 Qwen3.8 Flash Next 出来,3070 拖了它大腿,于是直接换成了 3080 20G,内存加到 96G。
升级完也就爽了两星期——立刻发现两个新问题:
- 3080+3090 不对称, 两张卡基本各跑各的
- 96G 内存单双通道混插,带宽掉得很厉害,影响所有 batch / offload 类的参数
这些问题虽然烦,至少 Qwen3.8 Flash Next 是跑起来了。DeepSeek V4 Flash Q4 也第一次看到了"希望"——虽然最后还是 OOM。
于是决定:加到 128G 内存,3080 换成 3090。顺便整顿了机箱风道,装了几个 F9 R120 风扇,真的吹得很爽。
5. 现在的样子
CPU : AMD Ryzen 9 3950X
内存 : 128 GB DDR4 3200
显卡 : ASUS RTX 3090 24G × 2
主板 : ASUS X570 TUF Gaming(原地没动)前前后后所有升级加一起,不到 1.6W RMB。
除了能跑大模型, 我喜欢的游戏,现在也能用3090支持 DLSS5 和多帧生成了~老游戏焕发第二春,也挺开心的,一不小心就玩了一整天。6. 关于主板
但要说说这块主板。
搞了那么多升级,最后才发现——这块主板只支持 PCIE 4.0 16X + 4X,跑不了 8X + 8X,也不能 P2P。
真是有点如鲠在喉。下一步,只能换主板。但至少 DeepSeek V4 Flash 0731 在这台机器上真的跑起来了——也算完成了当初那个小小的愿望吧,不知道有没有大神能在指导指导,让我跑的更快点。
后记
这机器,陪我 6 年,稀里糊涂各种很拮据的升级,虽然没钱,但继续升级只是因为不愿意放弃。
下一步折腾什么?谁知道呢。折腾无止境,后面继续折腾。
-
主板 : ASUS X570 TUF Gaming(原地没动)
当年的投资没白费。
1 更新 BIOS 到最新版——TUF X570-Plus 早期 BIOS 的拆分选项是不全的,这是最常见原因;
2 进 BIOS 后去 Advanced → Onboard Devices Configuration → PCIEX16_1 Bandwidth Bifurcation Configuration,把 Auto 改成 X8/X8(双设备)或 PCIe RAID Mode(x4x4x4x4,四盘转接卡);
3 拆的是第一条 x16 槽,转接卡/第二条设备要插在这条槽上;第二条物理 x16 槽只有 x4 走线,不参与拆分。 -
主板 : ASUS X570 TUF Gaming(原地没动)
当年的投资没白费。
1 更新 BIOS 到最新版——TUF X570-Plus 早期 BIOS 的拆分选项是不全的,这是最常见原因;
2 进 BIOS 后去 Advanced → Onboard Devices Configuration → PCIEX16_1 Bandwidth Bifurcation Configuration,把 Auto 改成 X8/X8(双设备)或 PCIe RAID Mode(x4x4x4x4,四盘转接卡);
3 拆的是第一条 x16 槽,转接卡/第二条设备要插在这条槽上;第二条物理 x16 槽只有 x4 走线,不参与拆分。@williamlouis 是的, 这个办法想过, 但是要加个 PCIE switcher, 有点麻烦了就。 在考虑考虑, 嘿嘿。
-
折腾路线很真实,你这台的下一步其实挺明确,别先急着换主板。
1. 先量再换:用
llama-bench把 pp(prefill)和 tg(decode)分开跑,确认 DeepSeek V4 Flash Q4 现在卡在哪一段。10–11 t/s 对这类模型,多半是权重没全进显存、专家层在 CPU 上跑,而不是算力不够。2. 48GB 显存怎么放:如果是 MoE,用
--n-cpu-moe N只把一部分专家放 CPU(从多到少试),attention/dense 层留 GPU;纯 dense 大模型 48GB 塞不下就别硬塞,Q4 也塞不下。同时开--flash-attn,KV 用--cache-type-k q8_0 --cache-type-v q8_0,能省大约一半 KV 显存,给权重腾地方。3. 内存先别掉链子:128G DDR4-3200 在 3950X 上插满 4 条通常会掉到 2933/2666,先
dmidecode -t memory | grep -i "Configured Memory Speed"看实际频率。掉频的话,把内存稳在 3200(比换主板便宜得多)比换板更值。4. X570 的 x16+x4 是真瓶颈:第二条物理 x16 槽只有 CPU x4 走线,双卡各跑各的、做不了 TP。williamlouis 说的 BIOS 拆 x8/x8 是首选——先更新到最新 BIOS,再看 Advanced → Onboard Devices Configuration → PCIEX16_1 Bifurcation,改成 X8/X8;但 TUF X570 是否物理支持要看你具体板型和 BIOS,拆不了再谈换板。别为 P2P 折腾——X570 同样有 ACS 挡着,双 3090 想要低延迟 all-reduce 只有 NVLink(3-slot 桥,约 ¥2300),换 X99 或 Gen4 板子的收益都不如它;要换就按"先 NVLink、后主板"排。
5. 发热:220W/卡 + 前下进后上出 + 限功耗方向对,3090 显存 85°C 可接受但别再往上,核心热点温度用
nvidia-smi -q -d TEMPERATURE看。一句话:先把 V4 Flash 的 pp/tg 测出来、把专家 offload 和 KV 量化调对,再决定换不换板;真要花钱,NVLink 优先。
-
老哥,恭喜跑起来!想请教几个部署细节:
- 用的是 llama.cpp、DwarfStar 还是其他推理引擎?
- Q4 模型具体是哪个 GGUF 版本?文件有多大?
- 双 3090 分别占用了多少显存?CPU Offload 了多少层?有没有用 --n-cpu-moe?
- 10–11 tok/s 对应多长的 Context?
我也想研究这条路线。
-
我是32G显存N卡,内存和你一模一样 128 GB DDR4 3200,也只能跑出11~12tok/s。问了AI,发现瓶颈在内存交换速度。我的只有53G,差太远了,用这个瓶颈AI算给我说也就是12tok/s
-
我是32G显存N卡,内存和你一模一样 128 GB DDR4 3200,也只能跑出11~12tok/s。问了AI,发现瓶颈在内存交换速度。我的只有53G,差太远了,用这个瓶颈AI算给我说也就是12tok/s
-
我刚测过了,i7-12700K + DDR4-3600 双通道: 测试数据如下
1 线程: 9.3 GB/s
2 线程: 23.3 GB/s
4 线程: 36.0 GB/s
8 线程: 53.4 GB/s ← 峰值AI计算过程
DSF 10B active params @ ~4bit量化 ≈ 5 GB/token
53.4 GB/s 除以 5GB/token → 11 tok/s 左右 (理论上限)我实测最高到12 tok/s
-
-
@johnnybegood 对,有个什么XMP,打开就是可以超到3600
此主題已被删除! -
@johnnybegood 对,有个什么XMP,打开就是可以超到3600
-
听你这么一说,我查了下,我的是 4条 Patriot 32GB Viper Steel DDR4 3600 MHz UDIMM Memory。我一直还以为我的是3200 MHz,哈哈。想当年,这4根内存的价格跟现在四根DDR5的价格真实天差地别。
@Ben-Lee 到 15t/s 了! 用的这个模型 https://huggingface.co/turboderp/DeepSeek-V4-Flash-Vision-Exp-exl3/tree/3.04bpw , 特地部署了 exllamaV3 + TabbyAPI , 跑起来确实快了不少,聊起天来肉眼上还是能接受的比较舒服了, 另外试了一下coding, 应该是比 15tok/s 更快一些,可能超过20-25了。
-
听你这么一说,我查了下,我的是 4条 Patriot 32GB Viper Steel DDR4 3600 MHz UDIMM Memory。我一直还以为我的是3200 MHz,哈哈。想当年,这4根内存的价格跟现在四根DDR5的价格真实天差地别。