跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

Bukong LiB

Bukong Li

@Bukong Li
取消关注 关注
关于
帖子
17
主题
4
分享
0
群组
0
粉丝
0
关注
1

帖子

最新 最佳 有争议的

  • 编剧从业部署AI,求助!
    Bukong LiB Bukong Li

    编剧从业,想做AI本地部署。目前有m1max 32g。戴尔730xd。想做rag,塞满个人电影资料库。部署AI写电影剧本。求指导。
    想问下,730xd上部署大模型可行吗?需要什么级别的显卡。最低价格,舒适级别?
    实现,能调用本地rag资料库。有长文本记忆。电影剧本一般3万字左右。需要AI提供创作辅助。故事大纲的设计。台词的润色。情节走向推理辅助。
    目前偏重剧本。后期,可能想做视频生成。目前的话730xd能作为主力机器部署本地Ai吗?
    技术小白,求指导!感恩。

    AI硬件

  • 【经验教训】魔改 48GB 4090D 的血泪教训:花屏、TDR 0x116、卡 VGA 灯完整排查记录
    Bukong LiB Bukong Li

    太长不看版:买 AI 显卡千万别买魔改显存卡。花屏 + 蓝屏 0x116 + 开机卡 VGA 灯 + 空载崩溃,全套症状都是改装显存不稳定的典型表现,换驱动、调供电、降 PCIe 全都没用。


    一、背景

    为了跑 Qwen3.6-27B-FP8(131K 上下文),入手了「单卡 48GB 的 RTX 4090D」。当时觉得性价比无敌:24GB 的卡钱买 48GB 显存。现在回头看,这是整件事最大的错误。

    二、症状(按时间线)

    时间 症状
    装驱动后第 6 天 开始蓝屏,Minidump 留存
    之后 8 天内 崩溃 5+ 次:0x116 (VIDEO_TDR_FAILURE)、0x117、0x119、0x141、0x133 全齐了
    高负载(AI 推理) 必崩,NVIDIA Overlay 也跟着崩
    低负载(登录界面按键盘) 也花屏崩溃——这是最要命的信号
    重启 间歇性卡主板 VGA 灯(POST 显卡初始化失败)
    显示器接核显 独显仅参与桌面合成,照样崩

    三、排查过程(给后来人的取证清单)

    1. 崩溃日志取证(不用猜,全部有据):

    Event 41 (Kernel-Power) → BugcheckCode 字段非 0 = 系统崩溃重启,不是外部断电
    Event 1001 (WER)       → 崩溃代码 + 转储文件路径
    Minidump (C:\Windows\Minidump) → 内核栈,可分析崩溃驱动
    Event 1019             → 「可能相关的驱动程序:nvlddmkm.sys」
    nvlddmkm Event 14 刷屏 → 显卡驱动崩溃瞬间疯狂报错
    

    2. 逐个排除(按成本从低到高):

    • ✅ 排除供电:12VHPWR 接头检查,无烧焦无变形
    • ✅ 排除 OOM:登录界面空载崩溃,显存根本没压力
    • ✅ 排除驱动:空载按键崩 + POST 卡 VGA 灯(驱动没加载的阶段)——驱动背不了这个锅
    • ✅ 排除 PCIe:Gen5 空载也不至于崩,且卡灯发生在驱动加载前
    • ❌ 最后定位:显卡硬件本体

    3. 致命发现——显卡真身:

    nvidia-smi 显示 "NVIDIA GeForce RTX 4090 D"
    但官方 4090D 只有 24GB——48GB 是商家魔改(双面 2GB 显存颗粒 ×24 颗)
    

    四、教训总结

    1. 魔改显存卡的本质:显存颗粒来源不明(拆机片/降级片)、焊接工艺看商家良心、时序/温度参数没经过 NVIDIA 出厂验证。跑游戏可能勉强,跑 7×24 高负载 AI 推理 = 原形毕露。
    2. 「低负载也崩」是硬件问题的铁证:驱动/OOM/链路问题都需要负载触发,空载崩溃基本锁定硬件。
    3. 「卡 VGA 灯」是 POST 层症状:Windows 驱动还没加载就失败,任何软件层面手段都救不了。
    4. 买大显存 AI 卡的正路:单卡 48GB 要么专业卡(RTX 6000 Ada/L40S),要么等真·大显存游戏卡(B60 PRO 48G 这类),别碰魔改。
    5. 魔改卡没有官方保修,售后只能找商家,维权成本极高。

    五、现状

    显卡已拆下走京东售后换货。机器用核显正常运行(Ryzen 9900X 核显 + 93.7G 内存顶一阵子)。27B 模型暂时跑不了,等新卡。

    花钱买的教训:AI 算力硬件,稳定性 > 性价比。魔改显存一时爽,数据丢失火葬场。

    AI硬件 rtx4090

  • 想买两台华硕 DGX 跑 V4,论坛大神给个建议吧
    Bukong LiB Bukong Li

    最近准备认真折腾一下本地 AI,目标比较明确:想上两台华硕 DGX Spark,组起来跑 DeepSeek V4。

    目前纠结的点主要是:两台 DGX Spark 到底值不值得直接上,以及实际跑 V4 的体验究竟怎么样。

    我现在手上也有一张 48GB 显存的 4090,跑一些 20B~30B 级别模型没什么问题,但到了 V4 这种级别,单卡基本就不用想了。看了 DGX Spark 的资料,两台机器可以通过高速网络互联,所以理论上可以把显存和算力组合起来跑更大的模型。

    但我比较担心的是:理论性能和实际性能可能完全是两回事。

    尤其是 V4 这种超大 MoE 模型,除了显存容量,真正影响速度的还有 GPU、内存带宽、节点之间的互联带宽、推理框架以及多机通信效率。

    所以想请论坛里的大神帮忙判断一下:

    1. 两台 DGX Spark 跑 V4,实际生成速度大概能到多少 token/s?
    2. 两台之间用 200G 网络互联,实际通信效率怎么样?
    3. 跑 V4 的时候,两台机器是比较接近“线性叠加”,还是通信开销会吃掉很多性能?
    4. 如果主要用途是编程、Agent、长上下文和日常本地 AI,两台 DGX Spark 是否值得?
    5. 有没有已经实际部署过 V4 的朋友,能分享一下真实测试数据?
    6. 如果现在买,华硕、技嘉、微星等不同品牌的 DGX Spark,散热、SSD、稳定性方面有没有明显区别?
    7. 1TB 版本是不是就够了?后面自己升级 SSD 是否更划算?

    我不是单纯想追求“能不能跑起来”,更关心的是跑起来之后到底好不好用。

    如果两台 DGX Spark 能把 V4 跑到一个比较舒服的速度,那我觉得还是挺有吸引力的;但如果实际只有几十 token/s,而且多机通信损耗比较大,那可能就要重新考虑了。

    所以想请各位真正折腾过 DGX Spark、多机推理或者 V4 的大神给点建议。

    预算倒不是最大的问题,主要是不想花钱买回来以后发现实际体验和想象差太多。

    欢迎直接劝退,也欢迎晒实测数据 😂

    两台 DGX Spark 跑 V4,到底是不是目前个人/小工作室比较靠谱的方案?

    AI硬件 dgxspark deepseek
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组