一、硬件描述
- 显卡: RTX 5070 Ti × 2
- 主板: 华南牌 X99-CD4 Gaming
- 处理器: E5-2680 V4
- 内存: DDR4 ECC-REG 16GB × 4
- 存储: 512GB NVMe
二、安装避坑
由于 RTX 5070 Ti 较新,我选择自行编译 llama.cpp,现将过程中的坑告诉大家:
- 编译器选择 GCC 12 版本;
- CUDA 生态选择 CUDA 13.3 版本。
三、模型量化选择
我选择的是:
qwen3.8-27b-text-nvfp4-mtp.gguf
体验一下 50 系显卡支持的 NVFP4 格式。
四、提速规划
我选择下面两种方法提高吐字效率:
- 选择张量并行,两张卡的核心同时计算;
- 选择开启 MTP,在计算第一个 Token 的时候预测接下来的两个 Token。
五、提速效果
- 选择流水线并行(
--split-mode layer,按层分割)工作模式,默认一开始跑 40+ Token/s,上下文多了以后跑 31+ Token/s;改为张量并行(--split-mode tensor)工作模式以后,高上下文情况下稳定 52+ Token/s; - 在张量并行高上下文 52+ Token/s 的基础上开启 MTP,稳定跑在 64+ Token/s,最高可以到 70+ Token/s。
六、llama.cpp 启动命令分享
./build/bin/llama-server \
--model "$MODEL_PATH" \
--host 0.0.0.0 \
--port 8080 \
--n-gpu-layers 999 \
--ctx-size 262144 \
--flash-attn on \
--parallel 2 \
--threads 16 \
--batch-size 2048 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--split-mode tensor \
--main-gpu 0 \
--tensor-split 1,1 \
--spec-type draft-mtp \
--spec-draft-n-max 2 \
-np 1 \
--no-mmap \
--verbose > "$LOG_FILE" 2>&1 &
七、显卡工作状态
提供一下高负载情况下显卡工作状态:
Sat Aug 22 13:42:57 2026
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 580.173.02 Driver Version: 580.173.02 CUDA Version: 13.0 |
+-----------------------------------------+------------------------+----------------------+
| GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
| | | MIG M. |
|=========================================+========================+======================|
| 0 NVIDIA GeForce RTX 5070 Ti Off | 00000000:03:00.0 Off | N/A |
| 40% 59C P1 189W / 300W | 15823MiB / 16303MiB | 83% Default |
| | | N/A |
+-----------------------------------------+------------------------+----------------------+
| 1 NVIDIA GeForce RTX 5070 Ti Off | 00000000:04:00.0 Off | N/A |
| 46% 60C P1 192W / 300W | 15823MiB / 16303MiB | 83% Default |
| | | N/A |
+-----------------------------------------+------------------------+----------------------+
+-----------------------------------------------------------------------------------------+
| Processes: |
| GPU GI CI PID Type Process name GPU Memory |
| ID ID Usage |
|=========================================================================================|
| 0 N/A N/A 1372 C ./build/bin/llama-server 15808MiB |
| 1 N/A N/A 1372 C ./build/bin/llama-server 15808MiB |
+-----------------------------------------------------------------------------------------+
总结
双 RTX 5070 Ti 16GB 显卡可以支持 Qwen3.8-27B 在 256K 上下文环境下提供可靠的 Token 产出效率,但是只能单用户使用;整机成本在购买的时候大概是 ¥19000 元左右。