你的知识库需要更新了,我昨天已经跑通llama.cpp驱动双卡跑张量计算。详情请看下方链接。
https://lcz.me/topic/1268/双rtx5070ti在llama.cpp环境下运行qwen3.8-27b的效果
你的知识库需要更新了,我昨天已经跑通llama.cpp驱动双卡跑张量计算。详情请看下方链接。
https://lcz.me/topic/1268/双rtx5070ti在llama.cpp环境下运行qwen3.8-27b的效果
本周五尝试使用DS4F的API修改一个开源项目。项目改完了,烧掉了¥25元左右。如果每个工作日我都这么干,那么12个月就会花掉6000元,5年就花掉三万元。这还不算突然来活要多花点的情况。
抱歉,初学者没有发帖经验,下次我会按照提醒格式化文档输出后再PO文。
由于 RTX 5070 Ti 较新,我选择自行编译 llama.cpp,现将过程中的坑告诉大家:
我选择的是:
qwen3.8-27b-text-nvfp4-mtp.gguf
体验一下 50 系显卡支持的 NVFP4 格式。
我选择下面两种方法提高吐字效率:
--split-mode layer,按层分割)工作模式,默认一开始跑 40+ Token/s,上下文多了以后跑 31+ Token/s;改为张量并行(--split-mode tensor)工作模式以后,高上下文情况下稳定 52+ Token/s;./build/bin/llama-server \
--model "$MODEL_PATH" \
--host 0.0.0.0 \
--port 8080 \
--n-gpu-layers 999 \
--ctx-size 262144 \
--flash-attn on \
--parallel 2 \
--threads 16 \
--batch-size 2048 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--split-mode tensor \
--main-gpu 0 \
--tensor-split 1,1 \
--spec-type draft-mtp \
--spec-draft-n-max 2 \
-np 1 \
--no-mmap \
--verbose > "$LOG_FILE" 2>&1 &
提供一下高负载情况下显卡工作状态:
Sat Aug 22 13:42:57 2026
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 580.173.02 Driver Version: 580.173.02 CUDA Version: 13.0 |
+-----------------------------------------+------------------------+----------------------+
| GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
| | | MIG M. |
|=========================================+========================+======================|
| 0 NVIDIA GeForce RTX 5070 Ti Off | 00000000:03:00.0 Off | N/A |
| 40% 59C P1 189W / 300W | 15823MiB / 16303MiB | 83% Default |
| | | N/A |
+-----------------------------------------+------------------------+----------------------+
| 1 NVIDIA GeForce RTX 5070 Ti Off | 00000000:04:00.0 Off | N/A |
| 46% 60C P1 192W / 300W | 15823MiB / 16303MiB | 83% Default |
| | | N/A |
+-----------------------------------------+------------------------+----------------------+
+-----------------------------------------------------------------------------------------+
| Processes: |
| GPU GI CI PID Type Process name GPU Memory |
| ID ID Usage |
|=========================================================================================|
| 0 N/A N/A 1372 C ./build/bin/llama-server 15808MiB |
| 1 N/A N/A 1372 C ./build/bin/llama-server 15808MiB |
+-----------------------------------------------------------------------------------------+
双 RTX 5070 Ti 16GB 显卡可以支持 Qwen3.8-27B 在 256K 上下文环境下提供可靠的 Token 产出效率,但是只能单用户使用;整机成本在购买的时候大概是 ¥19000 元左右。