双3090 nvlink Xid 175 - 为了解决问题 反而有意外惊喜
-
这几天发生了几次 GPU 挂掉(GPU没反应 nvtop 没反应)所以叫AI 解决
变更 原因 驱动从 nvidia-driver-595-open切换到nvidia-driver-595(proprietary)open kernel 驱动强制使用 GSP-RM,无法关闭。要关 GSP-RM 必须切回 proprietary。 关闭 GSP-RM ( NVreg_EnableGpuFirmware=0)Xid 175 是 GSP 固件超时挂起。关闭 GSP-RM 完全消除这一类故障。 gpu-memory-utilization从 0.9388 调到 0.9下午的 Xid 74 是 NVLink 错误,怀疑是显存使用率太高(98.6%) 当前配置 测试结果
测试项目 数值 首响应时间 TTFT(短 prompt,冷启动) 163 ms 总响应时间(10 tokens) 293 ms Prefill 1K 1,991 tok/s Prefill 4K 2,036 tok/s Prefill 16K 1,985 tok/s Decode(单流) 69.3 tok/s 50K prompt 冷启动 TTFT 25.06 秒 50K prompt 缓存命中 TTFT 0.69 秒 缓存加速比 36.5× 配置 对比
测试项目 nvidia-driver-595-open, GSP-on, util=0.9388 当前 nvidia-driver-595, GSP-off, util=0.9 Decode 67 tok/s 69.3 tok/s Prefill 4K 1,289 tok/s 2,036 tok/s Prefill 16K — 1,985 tok/s 50K cold TTFT ~35 秒(估算) 25.06 秒 显存峰值(双并发负载) 23.6+ GiB 22.7 GiB
vLLM 启动参数 (docker-compose.yml)
--model /models/heretic-gptq-int4 --served-model-name qwen3.6-27b-heretic --quantization gptq_marlin --dtype float16 --tensor-parallel-size 2 --max-model-len 262144 --gpu-memory-utilization 0.9 # via ~/vllm/.env: GPU_MEM_UTIL=0.9 --max-num-seqs 2 --max-num-batched-tokens 8192 --kv-cache-dtype fp8_e5m2 --trust-remote-code --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --enable-prefix-caching --enable-chunked-prefill --disable-custom-all-reduce # 必需 — 否则双 socket NUMA setup 在 CUDA graph profiling 阶段崩溃 --host 0.0.0.0 --port 8000硬件 & 操作系统
项目 配置 GPU 2× NVIDIA GeForce RTX 3090 (24 GiB / card, NVLink) 功耗上限 250 W / GPU OS Ubuntu 24.04 LTS (noble) 内核 6.8.0-124-generic NVIDIA 驱动 nvidia-driver-595proprietary, v595.71.05 (DKMS-built)GSP-RM 禁用 ( NVreg_EnableGpuFirmware=0in/etc/modprobe.d/nvidia-no-gsp.conf)Docker 29.5.2 + nvidia-container-toolkit 1.19.1 vLLM 引擎
项目 配置 版本 vLLM v0.21.0 (官方镜像 vllm/vllm-openai:v0.21.0)部署方式 Docker Compose,systemd 启动 ( vllm-heretic.service) -
A applejuice 于 删除了此主题
-
A applejuice 于 恢复了此主题
