跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
叶镇源叶

叶镇源

@叶镇源
取消关注 关注
关于
帖子
4
主题
1
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 双RTX5070TI在llama.cpp环境下运行Qwen3.8-27B的效果
    叶镇源叶 叶镇源

    一、硬件描述

    • 显卡: RTX 5070 Ti × 2
    • 主板: 华南牌 X99-CD4 Gaming
    • 处理器: E5-2680 V4
    • 内存: DDR4 ECC-REG 16GB × 4
    • 存储: 512GB NVMe

    二、安装避坑

    由于 RTX 5070 Ti 较新,我选择自行编译 llama.cpp,现将过程中的坑告诉大家:

    1. 编译器选择 GCC 12 版本;
    2. CUDA 生态选择 CUDA 13.3 版本。

    三、模型量化选择

    我选择的是:

    qwen3.8-27b-text-nvfp4-mtp.gguf

    体验一下 50 系显卡支持的 NVFP4 格式。

    四、提速规划

    我选择下面两种方法提高吐字效率:

    1. 选择张量并行,两张卡的核心同时计算;
    2. 选择开启 MTP,在计算第一个 Token 的时候预测接下来的两个 Token。

    五、提速效果

    1. 选择流水线并行(--split-mode layer,按层分割)工作模式,默认一开始跑 40+ Token/s,上下文多了以后跑 31+ Token/s;改为张量并行(--split-mode tensor)工作模式以后,高上下文情况下稳定 52+ Token/s;
    2. 在张量并行高上下文 52+ Token/s 的基础上开启 MTP,稳定跑在 64+ Token/s,最高可以到 70+ Token/s。

    六、llama.cpp 启动命令分享

    ./build/bin/llama-server \
        --model "$MODEL_PATH" \
        --host 0.0.0.0 \
        --port 8080 \
        --n-gpu-layers 999 \
        --ctx-size 262144 \
        --flash-attn on \
        --parallel 2 \
        --threads 16 \
        --batch-size 2048 \
        --cache-type-k q8_0 \
        --cache-type-v q8_0 \
        --split-mode tensor \
        --main-gpu 0 \
        --tensor-split 1,1 \
        --spec-type draft-mtp \
        --spec-draft-n-max 2 \
        -np 1 \
        --no-mmap \
        --verbose > "$LOG_FILE" 2>&1 &
    

    七、显卡工作状态

    提供一下高负载情况下显卡工作状态:

    Sat Aug 22 13:42:57 2026
    +-----------------------------------------------------------------------------------------+
    | NVIDIA-SMI 580.173.02             Driver Version: 580.173.02     CUDA Version: 13.0     |
    +-----------------------------------------+------------------------+----------------------+
    | GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |
    | Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
    |                                         |                        |               MIG M. |
    |=========================================+========================+======================|
    |   0  NVIDIA GeForce RTX 5070 Ti     Off |   00000000:03:00.0 Off |                  N/A |
    | 40%   59C    P1            189W /  300W |   15823MiB /  16303MiB |     83%      Default |
    |                                         |                        |                  N/A |
    +-----------------------------------------+------------------------+----------------------+
    |   1  NVIDIA GeForce RTX 5070 Ti     Off |   00000000:04:00.0 Off |                  N/A |
    | 46%   60C    P1            192W /  300W |   15823MiB /  16303MiB |     83%      Default |
    |                                         |                        |                  N/A |
    +-----------------------------------------+------------------------+----------------------+
    
    +-----------------------------------------------------------------------------------------+
    | Processes:                                                                              |
    |  GPU   GI   CI              PID   Type   Process name                        GPU Memory |
    |        ID   ID                                                               Usage      |
    |=========================================================================================|
    |    0   N/A  N/A            1372      C   ./build/bin/llama-server              15808MiB |
    |    1   N/A  N/A            1372      C   ./build/bin/llama-server              15808MiB |
    +-----------------------------------------------------------------------------------------+
    

    总结

    双 RTX 5070 Ti 16GB 显卡可以支持 Qwen3.8-27B 在 256K 上下文环境下提供可靠的 Token 产出效率,但是只能单用户使用;整机成本在购买的时候大概是 ¥19000 元左右。

    LLM讨论区 llama.cpp qwen-27b 多卡部署

  • 本地大模型部署的必要性分析,请大家投票。
    叶镇源叶 叶镇源

    本周五尝试使用DS4F的API修改一个开源项目。项目改完了,烧掉了¥25元左右。如果每个工作日我都这么干,那么12个月就会花掉6000元,5年就花掉三万元。这还不算突然来活要多花点的情况。

    AI硬件 本地模型

  • 双RTX5070TI在llama.cpp环境下运行Qwen3.8-27B的效果
    叶镇源叶 叶镇源

    @terry

    抱歉,初学者没有发帖经验,下次我会按照提醒格式化文档输出后再PO文。

    LLM讨论区 llama.cpp qwen-27b 多卡部署
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组