跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

Bukong LiB

Bukong Li

@Bukong Li
取消关注 关注
关于
帖子
17
主题
4
分享
0
群组
0
粉丝
0
关注
1

帖子

最新 最佳 有争议的

  • DGX单机也有春天——Qwen3.8-27B at 34-38 tok/s on DGX Spark (GB10) — one-command SGLang + NVFP4 + DSpark
    Bukong LiB Bukong Li

    我刚搞了两台 dgx,现在测试v4的数据。现在在测试512k ,加24,32并发数据。

    LLM讨论区 dgxspark qwen-27b gb10

  • 想买两台华硕 DGX 跑 V4,论坛大神给个建议吧
    Bukong LiB Bukong Li

    @terry 上边
    那个链接里边测试说的。你看下靠谱吗

    AI硬件 dgxspark deepseek

  • 想买两台华硕 DGX 跑 V4,论坛大神给个建议吧
    Bukong LiB Bukong Li

    @terry
    80t,你觉得有必要搞吗。会不会太慢了

    AI硬件 dgxspark deepseek

  • 想买两台华硕 DGX 跑 V4,论坛大神给个建议吧
    Bukong LiB Bukong Li

    我看网上测试有到80t/s .https://ai.rs/ai-developer/deepseek-v4-flash-304b-two-gb10?utm_source=chatgpt.com.线上api,我问v4,它说有110左右。

    AI硬件 dgxspark deepseek

  • 想买两台华硕 DGX 跑 V4,论坛大神给个建议吧
    Bukong LiB Bukong Li

    最近准备认真折腾一下本地 AI,目标比较明确:想上两台华硕 DGX Spark,组起来跑 DeepSeek V4。

    目前纠结的点主要是:两台 DGX Spark 到底值不值得直接上,以及实际跑 V4 的体验究竟怎么样。

    我现在手上也有一张 48GB 显存的 4090,跑一些 20B~30B 级别模型没什么问题,但到了 V4 这种级别,单卡基本就不用想了。看了 DGX Spark 的资料,两台机器可以通过高速网络互联,所以理论上可以把显存和算力组合起来跑更大的模型。

    但我比较担心的是:理论性能和实际性能可能完全是两回事。

    尤其是 V4 这种超大 MoE 模型,除了显存容量,真正影响速度的还有 GPU、内存带宽、节点之间的互联带宽、推理框架以及多机通信效率。

    所以想请论坛里的大神帮忙判断一下:

    1. 两台 DGX Spark 跑 V4,实际生成速度大概能到多少 token/s?
    2. 两台之间用 200G 网络互联,实际通信效率怎么样?
    3. 跑 V4 的时候,两台机器是比较接近“线性叠加”,还是通信开销会吃掉很多性能?
    4. 如果主要用途是编程、Agent、长上下文和日常本地 AI,两台 DGX Spark 是否值得?
    5. 有没有已经实际部署过 V4 的朋友,能分享一下真实测试数据?
    6. 如果现在买,华硕、技嘉、微星等不同品牌的 DGX Spark,散热、SSD、稳定性方面有没有明显区别?
    7. 1TB 版本是不是就够了?后面自己升级 SSD 是否更划算?

    我不是单纯想追求“能不能跑起来”,更关心的是跑起来之后到底好不好用。

    如果两台 DGX Spark 能把 V4 跑到一个比较舒服的速度,那我觉得还是挺有吸引力的;但如果实际只有几十 token/s,而且多机通信损耗比较大,那可能就要重新考虑了。

    所以想请各位真正折腾过 DGX Spark、多机推理或者 V4 的大神给点建议。

    预算倒不是最大的问题,主要是不想花钱买回来以后发现实际体验和想象差太多。

    欢迎直接劝退,也欢迎晒实测数据 😂

    两台 DGX Spark 跑 V4,到底是不是目前个人/小工作室比较靠谱的方案?

    AI硬件 dgxspark deepseek

  • 【经验教训】魔改 48GB 4090D 的血泪教训:花屏、TDR 0x116、卡 VGA 灯完整排查记录
    Bukong LiB Bukong Li

    IMG_0331.png
    @terry

    AI硬件 rtx4090

  • 【经验教训】魔改 48GB 4090D 的血泪教训:花屏、TDR 0x116、卡 VGA 灯完整排查记录
    Bukong LiB Bukong Li

    AI写的,我排查的不知道是不是确定显卡的问题。AI说大概率是,我只能找京东换货了。

    AI硬件 rtx4090

  • 【经验教训】魔改 48GB 4090D 的血泪教训:花屏、TDR 0x116、卡 VGA 灯完整排查记录
    Bukong LiB Bukong Li

    IMG_0303.jpg

    AI硬件 rtx4090

  • 【经验教训】魔改 48GB 4090D 的血泪教训:花屏、TDR 0x116、卡 VGA 灯完整排查记录
    Bukong LiB Bukong Li

    太长不看版:买 AI 显卡千万别买魔改显存卡。花屏 + 蓝屏 0x116 + 开机卡 VGA 灯 + 空载崩溃,全套症状都是改装显存不稳定的典型表现,换驱动、调供电、降 PCIe 全都没用。


    一、背景

    为了跑 Qwen3.6-27B-FP8(131K 上下文),入手了「单卡 48GB 的 RTX 4090D」。当时觉得性价比无敌:24GB 的卡钱买 48GB 显存。现在回头看,这是整件事最大的错误。

    二、症状(按时间线)

    时间 症状
    装驱动后第 6 天 开始蓝屏,Minidump 留存
    之后 8 天内 崩溃 5+ 次:0x116 (VIDEO_TDR_FAILURE)、0x117、0x119、0x141、0x133 全齐了
    高负载(AI 推理) 必崩,NVIDIA Overlay 也跟着崩
    低负载(登录界面按键盘) 也花屏崩溃——这是最要命的信号
    重启 间歇性卡主板 VGA 灯(POST 显卡初始化失败)
    显示器接核显 独显仅参与桌面合成,照样崩

    三、排查过程(给后来人的取证清单)

    1. 崩溃日志取证(不用猜,全部有据):

    Event 41 (Kernel-Power) → BugcheckCode 字段非 0 = 系统崩溃重启,不是外部断电
    Event 1001 (WER)       → 崩溃代码 + 转储文件路径
    Minidump (C:\Windows\Minidump) → 内核栈,可分析崩溃驱动
    Event 1019             → 「可能相关的驱动程序:nvlddmkm.sys」
    nvlddmkm Event 14 刷屏 → 显卡驱动崩溃瞬间疯狂报错
    

    2. 逐个排除(按成本从低到高):

    • ✅ 排除供电:12VHPWR 接头检查,无烧焦无变形
    • ✅ 排除 OOM:登录界面空载崩溃,显存根本没压力
    • ✅ 排除驱动:空载按键崩 + POST 卡 VGA 灯(驱动没加载的阶段)——驱动背不了这个锅
    • ✅ 排除 PCIe:Gen5 空载也不至于崩,且卡灯发生在驱动加载前
    • ❌ 最后定位:显卡硬件本体

    3. 致命发现——显卡真身:

    nvidia-smi 显示 "NVIDIA GeForce RTX 4090 D"
    但官方 4090D 只有 24GB——48GB 是商家魔改(双面 2GB 显存颗粒 ×24 颗)
    

    四、教训总结

    1. 魔改显存卡的本质:显存颗粒来源不明(拆机片/降级片)、焊接工艺看商家良心、时序/温度参数没经过 NVIDIA 出厂验证。跑游戏可能勉强,跑 7×24 高负载 AI 推理 = 原形毕露。
    2. 「低负载也崩」是硬件问题的铁证:驱动/OOM/链路问题都需要负载触发,空载崩溃基本锁定硬件。
    3. 「卡 VGA 灯」是 POST 层症状:Windows 驱动还没加载就失败,任何软件层面手段都救不了。
    4. 买大显存 AI 卡的正路:单卡 48GB 要么专业卡(RTX 6000 Ada/L40S),要么等真·大显存游戏卡(B60 PRO 48G 这类),别碰魔改。
    5. 魔改卡没有官方保修,售后只能找商家,维权成本极高。

    五、现状

    显卡已拆下走京东售后换货。机器用核显正常运行(Ryzen 9900X 核显 + 93.7G 内存顶一阵子)。27B 模型暂时跑不了,等新卡。

    花钱买的教训:AI 算力硬件,稳定性 > 性价比。魔改显存一时爽,数据丢失火葬场。

    AI硬件 rtx4090

  • Hermes Agent Telegram 语音转文字(STT)问题排查记录:Groq 正常,但 Gateway 未自动触发转写
    Bukong LiB Bukong Li

    Hermes Agent Telegram 语音转文字(STT)问题排查记录:Groq 正常,但 Gateway 未自动触发转写

    一、环境信息

    硬件 / 系统

    • NAS 环境运行 Hermes Agent
    • Docker 容器部署
    • s6 作为进程管理
    • Hermes Gateway 通过 s6 启动

    启动方式:

    hermes gateway run --replace

    后续调试增加:

    hermes gateway run --replace -vv

    开启 DEBUG 日志。

    ⸻

    二、目标

    希望 Telegram 发送语音消息后:

    Telegram Voice
    ↓
    Hermes Gateway
    ↓
    STT 转文字
    ↓
    LLM 理解文本
    ↓
    Telegram 返回回复

    STT 使用 Groq Whisper API。

    ⸻

    三、最初问题表现

    Telegram 发送语音:

    日志:

    Cached user voice at /opt/data/cache/audio/xxxx.ogg

    但是之后没有:

    Transcribing user voice

    也没有:

    Transcribed via command STT provider

    最终表现:

    • Gateway 收到语音 ✅
    • 音频缓存成功 ✅
    • 但是没有自动转写 ❌
    • LLM 收不到语音内容 ❌

    ⸻

    四、首先排查 Groq API

    测试结果

    Groq API 通过代理可以正常访问。

    问题不是:

    • API Key 错误
    • 网络限制
    • Groq 服务异常

    原因:

    国内环境直接访问 Groq 可能失败,但代理访问正常。

    ⸻

    五、发现 OpenAI SDK 代理问题

    Hermes 内部 STT 使用:

    OpenAI(
    api_key=...,
    base_url="https://api.groq.com/openai/v1"
    )

    没有传:

    http_client=httpx.Client(proxy=...)

    导致:

    • curl 可以访问 Groq
    • Hermes 内部 OpenAI SDK 不走代理

    解决思路:

    原本考虑:

    1. 修改 Hermes 源码增加 http_client
    2. monkey patch OpenAI SDK
    3. sitecustomize
    4. PYTHONSTARTUP

    但是最终没有采用。

    ⸻

    六、采用更稳定方案:command STT provider

    改为:

    stt.provider = groq-proxy

    通过:

    groq-stt-wrapper.sh

    调用 Groq。

    架构:

    Hermes Gateway
    ↓
    command STT provider
    ↓
    groq-stt-wrapper.sh
    ↓
    httpx 显式代理
    ↓
    Groq Whisper API

    ⸻

    七、验证 Groq STT 链路

    手动调用:

    transcribe_audio()

    成功。

    结果:

    你好介绍一下你自己

    确认:

    • Groq ✅
    • Proxy ✅
    • Wrapper ✅
    • command provider ✅

    ⸻

    八、发现新的矛盾

    虽然:

    transcribe_audio()

    成功。

    但是 Telegram 语音仍然:

    Cached user voice

    之后没有:

    Transcribing user voice

    说明:

    问题不是 STT。

    问题在:

    Gateway 收到语音
    ↓
    调用 STT

    这一段。

    ⸻

    九、开启 DEBUG 日志

    发现:

    成功转写日志:

    logger.debug()

    失败日志:

    logger.info()

    默认日志级别看不到成功过程。

    修改启动:

    原:

    hermes gateway run --replace

    改:

    hermes gateway run --replace -vv

    确认 DEBUG 生效。

    ⸻

    十、DEBUG 测试结果

    发送语音:

    Cached user voice (audio_xxxx.ogg)

    但是仍然没有:

    Transcribing user voice

    结论:

    Gateway 没有进入:

    _enrich_message_with_transcription()

    或者:

    _prepare_inbound_message_text()

    中的 STT 分支。

    ⸻

    十一、进一步定位方向

    怀疑:

    可能 1

    event.media_urls 丢失

    流程:

    Telegram Adapter
    ↓
    下载音频
    ↓
    event.media_urls
    ↓
    handle_message()

    可能:

    音频缓存成功,但是:

    event.media_urls=[]

    导致:

    if event.media_urls:

    不成立。

    ⸻

    可能 2

    MessageType 不正确

    例如:

    收到:

    VOICE

    但是 event 中:

    message_type != MessageType.VOICE

    导致跳过。

    ⸻

    可能 3

    实际运行路径不同

    源码显示:

    Telegram Adapter
    ↓
    handle_message()
    ↓
    _prepare_inbound_message_text()

    但实际运行可能走另一条路径。

    需要确认:

    • Telegram Voice 实际进入哪个函数
    • 调用栈
    • event 在哪里丢失

    ⸻

    十二、调试限制

    容器权限:

    • Hermes 用户运行
    • /opt/hermes 部分文件属于 root
    • 无 sudo
    • 无法直接修改:

    /opt/hermes/gateway/run.py

    尝试:

    cp
    dd
    tee
    shutil.copy2

    均失败。

    ⸻

    十三、尝试过的方法

    失败

    1. PYTHONSTARTUP

    原因:

    只对交互式 Python 生效。

    Gateway 非交互启动,不加载。

    ⸻

    1. .pth 文件

    原因:

    Python import 路径固定:

    /opt/hermes

    无法覆盖已安装 package。

    ⸻

    1. PYTHONPATH shadow

    失败原因:

    模块已经从:

    /opt/hermes

    加载。

    ⸻

    1. launcher wrapper

    创建:

    gateway-launcher.py

    尝试启动前 patch。

    风险:

    改变 s6 启动链。

    未采用。

    ⸻

    十四、目前状态

    已确认:

    项目 状态
    Telegram 收到语音 ✅
    音频缓存 ✅
    Groq API ✅
    Groq Proxy ✅
    Wrapper ✅
    command STT provider ✅
    transcribe_audio() ✅
    Gateway 自动调用 STT ❌

    ⸻

    十五、下一步计划

    需要一次最小源码日志修改。

    目标:

    只在:

    _prepare_inbound_message_text()

    增加:

    logger.warning("[STT_TRACE] ...")

    观察:

    1. event.media_urls
    2. event.message_type
    3. audio_paths
    4. 是否调用 _enrich_message_with_transcription()

    不修改业务逻辑。

    ⸻

    当前核心问题

    不是:

    • Groq
    • 网络
    • API
    • 权限
    • STT provider

    而是:

    Hermes Gateway 收到 Telegram Voice 后,为什么没有把音频路径传入 STT 转写流程。

    希望有熟悉 Hermes Gateway / Telegram Adapter 的朋友帮忙确认:

    1. Voice 消息正常情况下 event.media_urls 应该在哪里生成?
    2. _prepare_inbound_message_text() 是否是唯一 STT 入口?
    3. Telegram Voice 是否存在独立处理路径?
    4. 是否有配置项会导致 Voice 只缓存、不转写?

    感谢。

    LLM讨论区 hermes

  • 编剧从业部署AI,求助!
    Bukong LiB Bukong Li

    @terry 说:

    @Bukong-Li 你不需要RAG,编剧,写剧本属于通用模型智能的一部分,你可以尝试使用Deepseek V4 Pro + Hermes,我视频里有谈到过如何写作,创作小说,对Agent不懂的话可以用Gemini的Gem功能。

    好的,我先用这个流程在 M1 MAX试下。感谢各位大神

    AI硬件

  • 编剧从业部署AI,求助!
    Bukong LiB Bukong Li

    或者有必要买m2ultra128g吗?

    AI硬件

  • 编剧从业部署AI,求助!
    Bukong LiB Bukong Li

    还有我自己的个人笔记。创作灵感等文字内容。想放进rag。

    AI硬件

  • 编剧从业部署AI,求助!
    Bukong LiB Bukong Li

    @terry 剧本写作需要多轮复杂对话,可能涉及几十万字的长文本记忆。线上模型我试过Gemini,claud,gpt。免费版对话几句就没token了。付费版我没试,但是感觉也不会够用吧。
    另外,想做rag是想沉淀自己的写作风格,让ai能从自己放进rag的资料进行有控制的生成。rag不只是剧本,可能有小说,编剧工具书等。可能放进去几千部电影剧本,不同题材会分类。人物性格,人物关系等。所以做rag没必要吗?
    730xd对3090,4090具体哪里支持不够呢?我是
    想先给730配个显卡,做文字剧本生成。后期生视频在升级整体硬件。不知道行不行。还是说直接升级硬件?

    AI硬件

  • 编剧从业部署AI,求助!
    Bukong LiB Bukong Li

    编剧从业,想做AI本地部署。目前有m1max 32g。戴尔730xd。想做rag,塞满个人电影资料库。部署AI写电影剧本。求指导。
    想问下,730xd上部署大模型可行吗?需要什么级别的显卡。最低价格,舒适级别?
    实现,能调用本地rag资料库。有长文本记忆。电影剧本一般3万字左右。需要AI提供创作辅助。故事大纲的设计。台词的润色。情节走向推理辅助。
    目前偏重剧本。后期,可能想做视频生成。目前的话730xd能作为主力机器部署本地Ai吗?
    技术小白,求指导!感恩。

    AI硬件
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组