跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. 随便聊聊
  4. Proxmox VE 9.2+ Intel 核显 SR-IOV + AMD Radeon AI PRO R9700 直通+Ubuntu24.04部署实测(四)

Proxmox VE 9.2+ Intel 核显 SR-IOV + AMD Radeon AI PRO R9700 直通+Ubuntu24.04部署实测(四)

已定时 已固定 已锁定 已移动 随便聊聊
r9700llama.cpp本地模型
3 帖子 2 发布者 105 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Magic629M 离线
    Magic629M 离线
    Magic629
    德高望重
    编写于 最后由 编辑
    #1

    Proxmox VE 9.2+ Intel 核显 SR-IOV + AMD Radeon AI PRO R9700 直通+Ubuntu24.04部署实测(四)


    一、本机验证过的调优

    读取工作区实体机三份文档,核心调优配方如下,已对齐应用到本机:

    参数 作用 实体机实测依据
    --spec-type draft-mtp --spec-draft-n-max 2 MTP 投机解码 26 → 42~48 t/s(≈1.6 倍)
    -ctk q8_0 -ctv q8_0 KV 缓存量化 省约一半 KV 显存并提速
    --reasoning-effort medium 控制思考长度 治好默认 xhigh 的"雷霆大思考"
    --temp 0.3 --top-p 0.9 低温采样 准确度↑ + MTP 接受率↑(94.2%)
    --load-mode none 权重不经 mmap 模型 4 秒加载
    -ngl all -np 1 全层进显存 + 单槽位 单用户 KV 池全归当前会话
    --override-kv qwen35.context_length=int:131072 前端如实显示 128K 防客户端按 256K 发送超限
    --alias qwen3.8 API 模型别名 客户端用 qwen3.8 调用

    二、最终生效的启动命令

    由 systemd 单元 /etc/systemd/system/qwen38.service 执行(开机自启 + 崩溃自愈):

    /opt/llama.cpp/bin/llama-server \
      -m /opt/llama.cpp/models/Qwen3.8-27B-Uncensored-Q5_K_M.gguf \
      --mmproj /opt/llama.cpp/models/mmproj-Qwen3.8-27B-Uncensored-F16.gguf \
      --alias qwen3.8 \
      -c 131072 --override-kv qwen35.context_length=int:131072 \
      -ctk q8_0 -ctv q8_0 -fa on --load-mode none \
      --reasoning-effort medium -ngl 99 -np 1 \
      --temp 0.3 --top-p 0.9 \
      --spec-type draft-mtp --spec-draft-n-max 2 \
      --host 0.0.0.0 --port 8080
    

    环境变量:LD_LIBRARY_PATH=/opt/llama.cpp/bin:/opt/rocm/lib、HIP_VISIBLE_DEVICES=0


    三、调优结果(前后对比)

    指标 调优前 调优后 提升
    生成速度 23 t/s 40–41 t/s ↑ 1.75 倍
    MTP 投机解码 未启用 生效(接受率 67–78%) —
    思考长度 失控(曾跑 7900+ token) ~126 字受控 修复
    显存占用 28.2GB(92%) 26.8GB(88%) 省 1.4GB
    采样退化 有风险(temp 0.6) 无退化(temp 0.3) 修复
    KV 缓存 f16 q8_0(省一半) —
    日志告警 有 unused tensor 警告 零告警零错误 修复

    四、调稳措施

    1. systemd 常驻:/etc/systemd/system/qwen38.service,状态 enabled + active,开机自启 + 崩溃 5 秒自动拉起(对齐实体机方案)。
    2. 单槽位 -np 1:单用户场景 KV 池全归当前会话,避免多槽抢占显存。
    3. 低温采样 temp 0.3:从根源杜绝"你你我我"式退化重复。

    systemd 单元文件内容

    [Unit]
    Description=Qwen3.8-27B llama.cpp server (R9700 HIP, MTP, 128K)
    After=network.target
    
    [Service]
    User=magicz890
    Group=magicz890
    Environment=LD_LIBRARY_PATH=/opt/llama.cpp/bin:/opt/rocm/lib
    Environment=HIP_VISIBLE_DEVICES=0
    ExecStart=/opt/llama.cpp/bin/llama-server \
      -m /opt/llama.cpp/models/Qwen3.8-27B-Uncensored-Q5_K_M.gguf \
      --mmproj /opt/llama.cpp/models/mmproj-Qwen3.8-27B-Uncensored-F16.gguf \
      --alias qwen3.8 \
      -c 131072 --override-kv qwen35.context_length=int:131072 \
      -ctk q8_0 -ctv q8_0 -fa on --load-mode none \
      --reasoning-effort medium -ngl 99 -np 1 \
      --temp 0.3 --top-p 0.9 \
      --spec-type draft-mtp --spec-draft-n-max 2 \
      --host 0.0.0.0 --port 8080
    Restart=on-failure
    RestartSec=5
    TimeoutStopSec=60
    KillSignal=SIGTERM
    
    [Install]
    WantedBy=multi-user.target
    

    五、最终测试结果(systemd 运行中实测)

    测试项 结果
    /health {"status":"ok"}
    /v1/models 别名 qwen3.8,上下文 131072(override-kv 生效)
    文本生成 "我是一个由阿里巴巴通义实验室研发的大语言模型…"(40.17 t/s)
    MTP 接受率 67–78%(随内容波动,mean len ≈ 2.2–2.6)
    视觉识图 正确识别 "LLaMA C++" 封面及副标题
    思考控制 思考长度 126 字(reasoning-effort medium 生效)
    日志告警 零告警零错误(MTP 张量已正确加载,无 unused)
    GPU 40°C、空闲 3%、无硬件错误(UEC=0)

    84b37c92-748d-4c7e-bd68-d928937297d4-image.jpeg

    1 条回复 最后回复
    1
    • Dajian ZhangD 离线
      Dajian ZhangD 离线
      Dajian Zhang
      编写于 最后由 编辑
      #2

      好文, Host内存多大?

      Magic629M 1 条回复 最后回复
      0
      • Dajian ZhangD Dajian Zhang

        好文, Host内存多大?

        Magic629M 离线
        Magic629M 离线
        Magic629
        德高望重
        编写于 最后由 编辑
        #3

        @Dajian-Zhang 我给了48G,如果多开就给40G应该可以够用,其他分给别的虚拟机用。

        1 条回复 最后回复
        0

        你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

        厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

        有了你的建议,这篇帖子会更精彩哦 💗

        注册 登录
        回复
        • 在新帖中回复
        登录后回复
        • 从旧到新
        • 从新到旧
        • 最多赞同


        • 登录

        • 登录或注册以进行搜索。
        • 第一个帖子
          最后一个帖子
        0
        • 版块
        • 最新
        • 标签
        • 热门
        • 用户
        • 群组