我刚搞了两台 dgx,现在测试v4的数据。现在在测试512k ,加24,32并发数据。
Bukong Li
-
DGX单机也有春天——Qwen3.8-27B at 34-38 tok/s on DGX Spark (GB10) — one-command SGLang + NVFP4 + DSpark -
想买两台华硕 DGX 跑 V4,论坛大神给个建议吧@terry 上边
那个链接里边测试说的。你看下靠谱吗 -
想买两台华硕 DGX 跑 V4,论坛大神给个建议吧@terry
80t,你觉得有必要搞吗。会不会太慢了 -
想买两台华硕 DGX 跑 V4,论坛大神给个建议吧 -
想买两台华硕 DGX 跑 V4,论坛大神给个建议吧最近准备认真折腾一下本地 AI,目标比较明确:想上两台华硕 DGX Spark,组起来跑 DeepSeek V4。
目前纠结的点主要是:两台 DGX Spark 到底值不值得直接上,以及实际跑 V4 的体验究竟怎么样。
我现在手上也有一张 48GB 显存的 4090,跑一些 20B~30B 级别模型没什么问题,但到了 V4 这种级别,单卡基本就不用想了。看了 DGX Spark 的资料,两台机器可以通过高速网络互联,所以理论上可以把显存和算力组合起来跑更大的模型。
但我比较担心的是:理论性能和实际性能可能完全是两回事。
尤其是 V4 这种超大 MoE 模型,除了显存容量,真正影响速度的还有 GPU、内存带宽、节点之间的互联带宽、推理框架以及多机通信效率。
所以想请论坛里的大神帮忙判断一下:
- 两台 DGX Spark 跑 V4,实际生成速度大概能到多少 token/s?
- 两台之间用 200G 网络互联,实际通信效率怎么样?
- 跑 V4 的时候,两台机器是比较接近“线性叠加”,还是通信开销会吃掉很多性能?
- 如果主要用途是编程、Agent、长上下文和日常本地 AI,两台 DGX Spark 是否值得?
- 有没有已经实际部署过 V4 的朋友,能分享一下真实测试数据?
- 如果现在买,华硕、技嘉、微星等不同品牌的 DGX Spark,散热、SSD、稳定性方面有没有明显区别?
- 1TB 版本是不是就够了?后面自己升级 SSD 是否更划算?
我不是单纯想追求“能不能跑起来”,更关心的是跑起来之后到底好不好用。
如果两台 DGX Spark 能把 V4 跑到一个比较舒服的速度,那我觉得还是挺有吸引力的;但如果实际只有几十 token/s,而且多机通信损耗比较大,那可能就要重新考虑了。
所以想请各位真正折腾过 DGX Spark、多机推理或者 V4 的大神给点建议。
预算倒不是最大的问题,主要是不想花钱买回来以后发现实际体验和想象差太多。
欢迎直接劝退,也欢迎晒实测数据

两台 DGX Spark 跑 V4,到底是不是目前个人/小工作室比较靠谱的方案?
-
【经验教训】魔改 48GB 4090D 的血泪教训:花屏、TDR 0x116、卡 VGA 灯完整排查记录 -
【经验教训】魔改 48GB 4090D 的血泪教训:花屏、TDR 0x116、卡 VGA 灯完整排查记录AI写的,我排查的不知道是不是确定显卡的问题。AI说大概率是,我只能找京东换货了。
-
【经验教训】魔改 48GB 4090D 的血泪教训:花屏、TDR 0x116、卡 VGA 灯完整排查记录
-
【经验教训】魔改 48GB 4090D 的血泪教训:花屏、TDR 0x116、卡 VGA 灯完整排查记录太长不看版:买 AI 显卡千万别买魔改显存卡。花屏 + 蓝屏 0x116 + 开机卡 VGA 灯 + 空载崩溃,全套症状都是改装显存不稳定的典型表现,换驱动、调供电、降 PCIe 全都没用。
一、背景
为了跑 Qwen3.6-27B-FP8(131K 上下文),入手了「单卡 48GB 的 RTX 4090D」。当时觉得性价比无敌:24GB 的卡钱买 48GB 显存。现在回头看,这是整件事最大的错误。
二、症状(按时间线)
时间 症状 装驱动后第 6 天 开始蓝屏,Minidump 留存 之后 8 天内 崩溃 5+ 次:0x116 (VIDEO_TDR_FAILURE)、0x117、0x119、0x141、0x133 全齐了 高负载(AI 推理) 必崩,NVIDIA Overlay 也跟着崩 低负载(登录界面按键盘) 也花屏崩溃——这是最要命的信号 重启 间歇性卡主板 VGA 灯(POST 显卡初始化失败) 显示器接核显 独显仅参与桌面合成,照样崩 三、排查过程(给后来人的取证清单)
1. 崩溃日志取证(不用猜,全部有据):
Event 41 (Kernel-Power) → BugcheckCode 字段非 0 = 系统崩溃重启,不是外部断电 Event 1001 (WER) → 崩溃代码 + 转储文件路径 Minidump (C:\Windows\Minidump) → 内核栈,可分析崩溃驱动 Event 1019 → 「可能相关的驱动程序:nvlddmkm.sys」 nvlddmkm Event 14 刷屏 → 显卡驱动崩溃瞬间疯狂报错2. 逐个排除(按成本从低到高):
排除供电:12VHPWR 接头检查,无烧焦无变形
排除 OOM:登录界面空载崩溃,显存根本没压力
排除驱动:空载按键崩 + POST 卡 VGA 灯(驱动没加载的阶段)——驱动背不了这个锅
排除 PCIe:Gen5 空载也不至于崩,且卡灯发生在驱动加载前
最后定位:显卡硬件本体
3. 致命发现——显卡真身:
nvidia-smi 显示 "NVIDIA GeForce RTX 4090 D" 但官方 4090D 只有 24GB——48GB 是商家魔改(双面 2GB 显存颗粒 ×24 颗)四、教训总结
- 魔改显存卡的本质:显存颗粒来源不明(拆机片/降级片)、焊接工艺看商家良心、时序/温度参数没经过 NVIDIA 出厂验证。跑游戏可能勉强,跑 7×24 高负载 AI 推理 = 原形毕露。
- 「低负载也崩」是硬件问题的铁证:驱动/OOM/链路问题都需要负载触发,空载崩溃基本锁定硬件。
- 「卡 VGA 灯」是 POST 层症状:Windows 驱动还没加载就失败,任何软件层面手段都救不了。
- 买大显存 AI 卡的正路:单卡 48GB 要么专业卡(RTX 6000 Ada/L40S),要么等真·大显存游戏卡(B60 PRO 48G 这类),别碰魔改。
- 魔改卡没有官方保修,售后只能找商家,维权成本极高。
五、现状
显卡已拆下走京东售后换货。机器用核显正常运行(Ryzen 9900X 核显 + 93.7G 内存顶一阵子)。27B 模型暂时跑不了,等新卡。
花钱买的教训:AI 算力硬件,稳定性 > 性价比。魔改显存一时爽,数据丢失火葬场。
-
Hermes Agent Telegram 语音转文字(STT)问题排查记录:Groq 正常,但 Gateway 未自动触发转写Hermes Agent Telegram 语音转文字(STT)问题排查记录:Groq 正常,但 Gateway 未自动触发转写
一、环境信息
硬件 / 系统
- NAS 环境运行 Hermes Agent
- Docker 容器部署
- s6 作为进程管理
- Hermes Gateway 通过 s6 启动
启动方式:
hermes gateway run --replace
后续调试增加:
hermes gateway run --replace -vv
开启 DEBUG 日志。
⸻
二、目标
希望 Telegram 发送语音消息后:
Telegram Voice
↓
Hermes Gateway
↓
STT 转文字
↓
LLM 理解文本
↓
Telegram 返回回复STT 使用 Groq Whisper API。
⸻
三、最初问题表现
Telegram 发送语音:
日志:
Cached user voice at /opt/data/cache/audio/xxxx.ogg
但是之后没有:
Transcribing user voice
也没有:
Transcribed via command STT provider
最终表现:
- Gateway 收到语音

- 音频缓存成功

- 但是没有自动转写

- LLM 收不到语音内容

⸻
四、首先排查 Groq API
测试结果
Groq API 通过代理可以正常访问。
问题不是:
- API Key 错误
- 网络限制
- Groq 服务异常
原因:
国内环境直接访问 Groq 可能失败,但代理访问正常。
⸻
五、发现 OpenAI SDK 代理问题
Hermes 内部 STT 使用:
OpenAI(
api_key=...,
base_url="https://api.groq.com/openai/v1"
)没有传:
http_client=httpx.Client(proxy=...)
导致:
- curl 可以访问 Groq
- Hermes 内部 OpenAI SDK 不走代理
解决思路:
原本考虑:
- 修改 Hermes 源码增加 http_client
- monkey patch OpenAI SDK
- sitecustomize
- PYTHONSTARTUP
但是最终没有采用。
⸻
六、采用更稳定方案:command STT provider
改为:
stt.provider = groq-proxy
通过:
调用 Groq。
架构:
Hermes Gateway
↓
command STT provider
↓
groq-stt-wrapper.sh
↓
httpx 显式代理
↓
Groq Whisper API⸻
七、验证 Groq STT 链路
手动调用:
transcribe_audio()
成功。
结果:
你好介绍一下你自己
确认:
- Groq

- Proxy

- Wrapper

- command provider

⸻
八、发现新的矛盾
虽然:
transcribe_audio()
成功。
但是 Telegram 语音仍然:
Cached user voice
之后没有:
Transcribing user voice
说明:
问题不是 STT。
问题在:
Gateway 收到语音
↓
调用 STT这一段。
⸻
九、开启 DEBUG 日志
发现:
成功转写日志:
logger.debug()
失败日志:
默认日志级别看不到成功过程。
修改启动:
原:
hermes gateway run --replace
改:
hermes gateway run --replace -vv
确认 DEBUG 生效。
⸻
十、DEBUG 测试结果
发送语音:
Cached user voice (audio_xxxx.ogg)
但是仍然没有:
Transcribing user voice
结论:
Gateway 没有进入:
_enrich_message_with_transcription()
或者:
_prepare_inbound_message_text()
中的 STT 分支。
⸻
十一、进一步定位方向
怀疑:
可能 1
event.media_urls 丢失
流程:
Telegram Adapter
↓
下载音频
↓
event.media_urls
↓
handle_message()可能:
音频缓存成功,但是:
event.media_urls=[]
导致:
if event.media_urls:
不成立。
⸻
可能 2
MessageType 不正确
例如:
收到:
VOICE
但是 event 中:
message_type != MessageType.VOICE
导致跳过。
⸻
可能 3
实际运行路径不同
源码显示:
Telegram Adapter
↓
handle_message()
↓
_prepare_inbound_message_text()但实际运行可能走另一条路径。
需要确认:
- Telegram Voice 实际进入哪个函数
- 调用栈
- event 在哪里丢失
⸻
十二、调试限制
容器权限:
- Hermes 用户运行
- /opt/hermes 部分文件属于 root
- 无 sudo
- 无法直接修改:
/opt/hermes/gateway/run.py
尝试:
cp
dd
tee
shutil.copy2均失败。
⸻
十三、尝试过的方法
失败
- PYTHONSTARTUP
原因:
只对交互式 Python 生效。
Gateway 非交互启动,不加载。
⸻
- .pth 文件
原因:
Python import 路径固定:
/opt/hermes
无法覆盖已安装 package。
⸻
- PYTHONPATH shadow
失败原因:
模块已经从:
/opt/hermes
加载。
⸻
- launcher wrapper
创建:
尝试启动前 patch。
风险:
改变 s6 启动链。
未采用。
⸻
十四、目前状态
已确认:
项目 状态
Telegram 收到语音
音频缓存
Groq API
Groq Proxy
Wrapper
command STT provider
transcribe_audio()
Gateway 自动调用 STT
⸻
十五、下一步计划
需要一次最小源码日志修改。
目标:
只在:
_prepare_inbound_message_text()
增加:
logger.warning("[STT_TRACE] ...")
观察:
- event.media_urls
- event.message_type
- audio_paths
- 是否调用 _enrich_message_with_transcription()
不修改业务逻辑。
⸻
当前核心问题
不是:
- Groq
- 网络
- API
- 权限
- STT provider
而是:
Hermes Gateway 收到 Telegram Voice 后,为什么没有把音频路径传入 STT 转写流程。
希望有熟悉 Hermes Gateway / Telegram Adapter 的朋友帮忙确认:
- Voice 消息正常情况下 event.media_urls 应该在哪里生成?
- _prepare_inbound_message_text() 是否是唯一 STT 入口?
- Telegram Voice 是否存在独立处理路径?
- 是否有配置项会导致 Voice 只缓存、不转写?
感谢。
-
编剧从业部署AI,求助!@Bukong-Li 你不需要RAG,编剧,写剧本属于通用模型智能的一部分,你可以尝试使用Deepseek V4 Pro + Hermes,我视频里有谈到过如何写作,创作小说,对Agent不懂的话可以用Gemini的Gem功能。
好的,我先用这个流程在 M1 MAX试下。感谢各位大神
-
编剧从业部署AI,求助!或者有必要买m2ultra128g吗?
-
编剧从业部署AI,求助!还有我自己的个人笔记。创作灵感等文字内容。想放进rag。
-
编剧从业部署AI,求助!@terry 剧本写作需要多轮复杂对话,可能涉及几十万字的长文本记忆。线上模型我试过Gemini,claud,gpt。免费版对话几句就没token了。付费版我没试,但是感觉也不会够用吧。
另外,想做rag是想沉淀自己的写作风格,让ai能从自己放进rag的资料进行有控制的生成。rag不只是剧本,可能有小说,编剧工具书等。可能放进去几千部电影剧本,不同题材会分类。人物性格,人物关系等。所以做rag没必要吗?
730xd对3090,4090具体哪里支持不够呢?我是
想先给730配个显卡,做文字剧本生成。后期生视频在升级整体硬件。不知道行不行。还是说直接升级硬件? -
编剧从业部署AI,求助!编剧从业,想做AI本地部署。目前有m1max 32g。戴尔730xd。想做rag,塞满个人电影资料库。部署AI写电影剧本。求指导。
想问下,730xd上部署大模型可行吗?需要什么级别的显卡。最低价格,舒适级别?
实现,能调用本地rag资料库。有长文本记忆。电影剧本一般3万字左右。需要AI提供创作辅助。故事大纲的设计。台词的润色。情节走向推理辅助。
目前偏重剧本。后期,可能想做视频生成。目前的话730xd能作为主力机器部署本地Ai吗?
技术小白,求指导!感恩。
