跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. LLM讨论区
  3. 双3090 nvlink Xid 175 - 为了解决问题 反而有意外惊喜

双3090 nvlink Xid 175 - 为了解决问题 反而有意外惊喜

已定时 已固定 已锁定 已移动 LLM讨论区
rtx3090
3 帖子 3 发布者 138 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • A 离线
    A 离线
    applejuice
    技术大牛 劳动模范
    发表于 最后由 applejuice 编辑
    #1

    这几天发生了几次 GPU 挂掉(GPU没反应 nvtop 没反应)所以叫AI 解决

    变更 原因
    驱动从 nvidia-driver-595-open 切换到 nvidia-driver-595 (proprietary) open kernel 驱动强制使用 GSP-RM,无法关闭。要关 GSP-RM 必须切回 proprietary。
    关闭 GSP-RM (NVreg_EnableGpuFirmware=0) Xid 175 是 GSP 固件超时挂起。关闭 GSP-RM 完全消除这一类故障。
    gpu-memory-utilization 从 0.9388 调到 0.9 下午的 Xid 74 是 NVLink 错误,怀疑是显存使用率太高(98.6%)

    当前配置 测试结果

    测试项目 数值
    首响应时间 TTFT(短 prompt,冷启动) 163 ms
    总响应时间(10 tokens) 293 ms
    Prefill 1K 1,991 tok/s
    Prefill 4K 2,036 tok/s
    Prefill 16K 1,985 tok/s
    Decode(单流) 69.3 tok/s
    50K prompt 冷启动 TTFT 25.06 秒
    50K prompt 缓存命中 TTFT 0.69 秒
    缓存加速比 36.5×

    配置 对比

    测试项目 nvidia-driver-595-open, GSP-on, util=0.9388 当前 nvidia-driver-595, GSP-off, util=0.9
    Decode 67 tok/s 69.3 tok/s
    Prefill 4K 1,289 tok/s 2,036 tok/s
    Prefill 16K — 1,985 tok/s
    50K cold TTFT ~35 秒(估算) 25.06 秒
    显存峰值(双并发负载) 23.6+ GiB 22.7 GiB

    vLLM 启动参数 (docker-compose.yml)

    --model /models/heretic-gptq-int4
    --served-model-name qwen3.6-27b-heretic
    --quantization gptq_marlin
    --dtype float16
    --tensor-parallel-size 2
    --max-model-len 262144
    --gpu-memory-utilization 0.9        # via ~/vllm/.env: GPU_MEM_UTIL=0.9
    --max-num-seqs 2
    --max-num-batched-tokens 8192
    --kv-cache-dtype fp8_e5m2
    --trust-remote-code
    --reasoning-parser qwen3
    --enable-auto-tool-choice
    --tool-call-parser qwen3_coder
    --enable-prefix-caching
    --enable-chunked-prefill
    --disable-custom-all-reduce         # 必需 — 否则双 socket NUMA setup 在 CUDA graph profiling 阶段崩溃
    --host 0.0.0.0
    --port 8000
    

    硬件 & 操作系统

    项目 配置
    GPU 2× NVIDIA GeForce RTX 3090 (24 GiB / card, NVLink)
    功耗上限 250 W / GPU
    OS Ubuntu 24.04 LTS (noble)
    内核 6.8.0-124-generic
    NVIDIA 驱动 nvidia-driver-595 proprietary, v595.71.05 (DKMS-built)
    GSP-RM 禁用 (NVreg_EnableGpuFirmware=0 in /etc/modprobe.d/nvidia-no-gsp.conf)
    Docker 29.5.2 + nvidia-container-toolkit 1.19.1

    vLLM 引擎

    项目 配置
    版本 vLLM v0.21.0 (官方镜像 vllm/vllm-openai:v0.21.0)
    部署方式 Docker Compose,systemd 启动 (vllm-heretic.service)
    1 条回复 最后回复
    0
    • A applejuice 于 删除了此主题
    • A applejuice 于 恢复了此主题
    • Tony WangT 离线
      Tony WangT 离线
      Tony Wang
      超级版主
      发表于 最后由 编辑
      #2

      速度不错 👍

      1 条回复 最后回复
      0
      • terryT 在线
        terryT 在线
        terry
        超级版主
        发表于 最后由 编辑
        #3

        不错,nvlink以后个人市场很难看到了,也算有考古价值了。

        油管:https://www.youtube.com/@抡锤者

        1 条回复 最后回复
        0

        你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

        厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

        有了你的建议,这篇帖子会更精彩哦 💗

        注册 登录
        回复
        • 在新帖中回复
        登录后回复
        • 从旧到新
        • 从新到旧
        • 最多赞同


        • 登录

        • 没有帐号? 注册

        • 登录或注册以进行搜索。
        • 第一个帖子
          最后一个帖子
        0
        • 版块
        • 最新
        • 标签
        • 热门
        • 用户
        • 群组