x99,ddr3-32g 2080ti22g+11g+nvlink, Qwen3.8 27B Q4_K_P、128K Q8 KV、embedded MTP
已启用 llama.cpp 的 NVLink P2P 直接交换模式。
验证结果:
-
MTP 服务已重启,PID:114030
-
进程环境:GGML_CUDA_P2P=1
-
GPU0
GPU1 P2P 读写:均为 OK -
双卡显存占用:
- GPU0:7750 MiB
- GPU1:14524 MiB
-
Q8 KV、思考模式、MTP 推测解码及 1,2 分层比例保持不变
-
实际推理请求成功,约 38.7 token/s