Ubuntu 24 系统与 llama.cpp 服务器 健康度 · 功耗 · 温度控制 综合检查报告 (小白慢慢补图,我先报告完供大神审阅指正,谢谢!)
-
主机名:magicz890-Ai
操作系统:Ubuntu 24.04.4 LTS (Noble Numbat)
内核:7.0.0-30-generic
处理器:Intel Core Ultra 7 265K(20 线程)
计算 GPU:AMD Radeon AI PRO R9700(32 GB)
显示 GPU:Intel 核显(Arrow Lake-U,4K 输出)
推理服务:qwen38.service(Qwen3.8-27B-Q5_K_M)本报告汇总了三次只读检查的完整结果:① 系统整体健康度与功耗;② 待机功耗与温度控制机制;③ 针对"学习 +日常办公 + 7×24 推理"用法的 GPU 功耗模式建议。所有数据均为实测,未执行任何修改操作。
一、系统健康度与功耗报告
1、系统概况

2、温度(全部正常)

3、功耗(RAPL + rocm-smi 实测)

整机估算:推理时约 80–100 W,空闲时更低。功耗水平健康。
4、llama.cpp 服务器(qwen38.service)


近期推理性能(日志实测,30 分钟内多次任务)
- 生成速度:37–44 tokens/s(tg_3s 峰值 47.4 t/s)
- Prompt 处理:163–420 tokens/s
- MTP 草稿接受率:0.78–0.88,平均长度 2.57–2.76(投机解码效果很好)
- 单次任务上下文 1.9–2.1 万 token,无截断、无报错
日志健康度
近 30 分钟日志全部为正常推理记录,无 error/warning。系统日志中仅有两类无害告警:gnome-shell dock 布局的常规噪音,以及 Canonical Livepatch 检查网络失败(livepatch.canonical.com 连接 EOF,会自动重试,不影响系统)
5 结论
- 系统健康度:优
—— 负载低、内存充裕、磁盘充足、CPU 温度 44°C、无 OOM/硬件错误。 - llama.cpp 服务器:健康且活跃
—— 服务稳定运行 19 小时,推理吞吐 ~40 t/s,投机解码接受率 ~0.8,正在持续处理请求。 - 功耗:CPU ~32 W + GPU ~50 W,整机推理时约 80–100 W,水平正常。
- 唯一可留意点:GPU 显存温度 82°C 略偏高(推理满载时),以及显存占用 86%——均为 131k 长上下文 + 27B 模型的预期行为,暂无风险。
二、整机待机功耗与温度控制深度检查报告
重要前提:这台机器没有真正的"待机"状态——
qwen38.service(llama-server)在持续对外服务,检查期间它一直在处理推理任务。因此下面的"待机功耗"实际上是"轻载基线":CPU 只忙 6.8%(推理在 GPU 上),但 GPU 随时会被唤醒。2.1 待机(轻载)功耗实测
CPU 包(turbostat 两轮 5 秒采样)
指标 第 1 轮 第 2 轮 PkgWatt(整包) 32.8 W 31.5 W CorWatt(核心) 23.6 W 22.3 W GFXWatt(核显) 0.45 W 0.44 W RAMWatt 未测量(无 PMT 计数器) — CPU 忙碌度 6.8% 6.6% 平均频率 254 MHz 237 MHz 包温度 39 °C 39 °C GPU(Radeon AI PRO R9700,rocm-smi 多次采样)
采样点 功耗 使用率 采样 1 56 W(滑动平均) 3% 采样 2(6 秒后) 23 W 3% GPU 空闲时自动降频:sclk 1128 MHz(最高 2350)、mclk 96 MHz(最高 1258)——降频策略工作正常。
其他部件
部件 状态 NVMe (nvme0n1) 温度 40 °C,IO 仅 ~184 KB/s,基本静默 核显(显示输出) 0.45 W,RC6 空闲态 17.6% 内存控制器 (SAM) 99.2% 时间处于 mc6 深度空闲 整机待机功耗估算
部件 功耗 CPU 包 ~32 W GPU(空闲波动) ~23–56 W 内存 + 主板 + NVMe + 外设(估算) ~15–25 W 整机合计(轻载基线) 约 70–110 W 对比:推理满载时 CPU ~32 W + GPU 明显升高,整机约 100–150 W。
2.2 温度控制情况
当前温度(全部健康)
部件 温度 评价 CPU 包 39–40 °C 很凉 CPU 核心 38–40 °C 正常 GPU edge 62 °C(推理时 68–72) 正常 GPU junction 74 °C(推理时 79) 正常 GPU 显存 71 °C(推理峰值 82–91) 可接受,见建议 NVMe 40 °C 正常 主板 (acpitz) 27.8 °C 正常 热保护与调频机制(重点检查项)
检查项 结果 评价 热节流计数(package/core) 0 次 / 0 次
从未触发过热保护CPU 调频驱动 intel_pstate + HWP 硬件调频
最优方案调频策略 powersave,EPP:核心 0x40(balanced)、包 0x80(powersave)
偏节能配置系统电源策略 power-profiles-daemon = balanced
合理C 状态驻留 c1 40% / c6 30% / c7 22%
深度睡眠使用充分内存控制器空闲 mc6 99.2%
优秀GPU 空闲降频 sclk/mclk 均降至最低档
正常GPU 功耗模式 BOOTUP_DEFAULT(默认档) 可用,见建议 磁盘/定时任务 无异常 IO;定时任务正常 
部件健康度
- NVMe:磨损 3%、备用块 100%、无 critical warning、通电 7269 小时——非常健康。
- llama-server 服务:运行 19 小时无重启、无错误日志,推理 37–44 t/s,MTP 接受率 0.74–0.88。
- 系统日志仅两类无害告警:gnome-shell dock 布局噪音、Canonical Livepatch 联网检查失败(自动重试中,不影响运行)。
2.3 结论
- 温度控制:优秀
—— 零热节流事件,CPU 39°C / GPU 62–74°C,HWP + powersave + 深度 C 状态全部生效,空闲降频正常。 - 待机功耗:正常但偏高(约 70–110 W) —— 主要构成是 CPU 包 ~32 W(265K 是 125W TDP 的桌面级芯片,基线功耗天然不低)+ GPU 23–56 W + 平台开销。由于 LLM 服务器 7×24 运行,机器永远达不到纯待机。
2.4 建议(仅供参考,未执行任何一项)
- 想测真实待机功耗:临时
systemctl stop qwen38后再用turbostat采样,可看到纯平台基线(预计 CPU 包降到 ~20–25 W,整机 ~40–60 W)。测完systemctl start qwen38恢复。 - GPU 功耗模式:当前是
BOOTUP_DEFAULT。若主要跑推理,可考虑COMPUTE档,对计算负载的功耗/性能调度更优;混合用途则保持现状即可(详见报告三)。 - 显存温度:推理满载时 82–91°C 属规格内但偏高,建议留意机箱风道;R9700 是涡轮卡,确保进风口无遮挡。
- 加监控:llama-server 启动参数加
--metrics,之后/metrics端点可出 Prometheus 指标,配合现有 sysstat 定时任务做长期追踪。 - Livepatch 告警:livepatch.canonical.com 连接失败在反复重试,若不用 Livepatch 可忽略;在意日志干净可考虑停用该服务。
- 内存功耗不可测:turbostat 的 RAMWatt 为 0(该平台无 PMT 计数器),如需精确整机功耗,最可靠的方法是用外置功率计(插排计量插座)实测墙端功耗。
三、GPU 功耗模式(COMPUTE 档)详细建议
3.1 关键发现:AMD 卡是"纯计算卡"
GPU 型号 显示输出 角色 card0 Intel 核显 (Arrow Lake-U) HDMI-A-1 已连接,4K 3840×2160 负责所有显示/办公/学习画面 card1 AMD Radeon AI PRO R9700 无任何显示器连接 纯计算,只跑 LLM 推理 办公、学习、看网页、写文档时,AMD 卡完全空闲,画面全由 Intel 核显 + CPU 承担。AMD 卡唯一的活儿就是给 llama-server 做推理。对一块"只干计算、不碰显示"的卡,COMPUTE 档就是为它量身定做的。
3.2 各档位差异(基于该卡实际 DPM 参数)
档位 最低核心频率 功耗上限 加速 (Boost) 定位 BOOTUP_DEFAULT(当前) ~500 MHz 800(较保守) 自动 通用均衡,偏省电 COMPUTE 600 MHz(固定下限) 16384(高,放开) 解除限制 持续计算优化 POWER_SAVING ~500 MHz 0 受限(3) 最省电,牺牲性能 3D_FULL_SCREEN / WINDOW_3D ~500 MHz 0 满加速(1) 游戏,瞬时高帧 VIDEO ~500 MHz 500 自动 视频播放省电 VR 600 MHz 16384 解除 与 COMPUTE 几乎相同 核心差异两点:
- COMPUTE 把核心频率下限抬到 600 MHz(默认约 500),空闲时略高一点点;
- COMPUTE 放开了功耗上限(16384 vs 800)并解除加速限制——长时间推理时 GPU 能维持更高、更稳定的频率,不容易被功耗墙压频。
3.3 建议:切到 COMPUTE 档
理由(针对"学习 + 办公 + 7×24 推理"场景):
- 负载性质完全匹配:AMD 卡 100% 的负载是推理(持续计算),COMPUTE 正是为这种"长时间、稳定、吃算力和显存带宽"的负载调的。
- 减少长推理压频:单次任务动辄 2–4 万 token、跑十几秒,属持续负载。默认档的保守功耗墙(800)更易触发降频;COMPUTE 放开功耗墙后,长任务的 tokens/s 更稳、峰值更高。
- 没有"显示"副作用:显示器接在 Intel 核显上,COMPUTE 抬高的频率下限不会让办公画面变卡或更耗电——那块卡办公时根本闲着。
- 代价极小:600 vs 500 MHz 的下限差,空闲功耗只多 ~1–2 W,可忽略;温度方面 GPU 现在才 62–74°C,余量充足。
什么情况下不建议切(供权衡):
- 若把"极致省电"排在"推理速度"前面,且能接受推理略慢/略不稳,保持
BOOTUP_DEFAULT也完全没问题——它本就是安全的均衡档。 - 但就"卡只干推理"的用法看,COMPUTE 的收益(更稳更快的推理)明显大于代价(多 1–2 W 空闲功耗)。
一句话结论:建议切 COMPUTE。 它和这块纯计算卡的用法是最佳匹配,收益实在、代价可忽略。
3.4 如何验证(A/B 测试,建议先测再定)
-
记录基线(当前 BOOTUP_DEFAULT):跑一个固定 prompt 的推理,记下 tokens/s、
rocm-smi --showpower、GPU 温度。 -
临时切档(立即生效,重启即还原,不改任何文件):
echo 5 | sudo tee /sys/class/drm/card1/device/pp_power_profile_mode(5 = COMPUTE;改完用
cat同一文件确认,*号会移到 COMPUTE 上) -
重复同样的推理,对比 tokens/s、功耗、温度。
-
满意就保留,不满意
echo 0 | sudo tee ...切回默认。
注意:
pp_power_profile_mode是运行时设置,重启后会回到BOOTUP_DEFAULT。3.5 若决定长期用 COMPUTE,如何持久化(三选一)
- systemd 覆盖 qwen38.service(最贴合,随推理服务一起生效):加一个
ExecStartPre在启动 llama-server 前写入档位。 - udev 规则:在 amdgpu 设备就绪时自动写入,开机即生效,与具体服务解耦。
- 独立 oneshot systemd 服务:开机跑一次
echo 5 > .../pp_power_profile_mode。
三者都能做到"开机自动 COMPUTE",选 1 最省事(和推理服务绑定)。
3.6 补充提醒
- 切档后留意一次满载温度:显存峰值到过 82–91°C,COMPUTE 放开功耗墙后满载会略热,确认机箱风道没问题即可(R9700 是涡轮卡,别堵进风口)。
- 这个改动只影响 AMD 计算卡,对办公/学习的 Intel 核显显示路径零影响。
- 按用户要求,本次未做任何修改,以上全部是查看 + 建议。
本报告由只读检查生成,所有数据均为实测值。检查过程中未对系统、服务或配置做任何修改。生成工具:weasyprint(HTML → PDF),字体:Noto Sans CJK SC。
刚学会用.md文件,后期是用.md文件复制过来的,请包含,版面有点乱。小白积极参与请大家多多包涵
刚拍了张照片测试下


-
报告质量很高,几个数字帮你标定一下,都在物理区间内、机器是健康的:
-
37–44 t/s(峰值 47)——R9700 640GB/s 带宽下,27B Q5_K_M 就该落在这个带,没有优化空间了。MTP 接受率 0.78–0.88 / 平均 2.57–2.76,说明 draft head 吃得很满,已经是最优区间,不用再调。
-
82°C 是显存 junction(温感探针)读数,RDNA 显存控制器的热裕量比这高得多,长期 131K 长上下文负载下这个温度正常,不是风险;edge 62–72°C 更是凉快。想让它再降,可以 --override-kv 或压低功耗档,但没必要为 82°C 牺牲性能。
-
86% 显存 = 19G 权重 + 长上下文 KV,正好卡在 32G 的合理填充区。想给多开或更长上下文留头,手柄是 KV 量化(Q8→Q4)或把默认上下文从 131K 降回 64K——日常用不着那么长。
整体这台机器 7×24 挂着 70–110W 待机、满载 ~150W,是"学习 + 办公 + 常驻推理"最省心的形态,选型对了。唯一留意点是 Canonical Livepatch 网络 EOF,无害,忽略即可。
-
-
7900xtx待机时候功耗不到20w,一般15w以下。环境 proxmox + Ubuntu 26.04 server VM。还跑着其他VMs,总体待机功耗70左右。
其他配置: 2696 V4 + 4x64G DDR4 + 1T SATA SSD+ 18T HDD.
这几天北方降温,我机箱盖子因为各种原因,盖不住,温度满负载不到70度,显卡功耗最高300w。平时待机就是30多度的温度
-
7900xtx待机时候功耗不到20w,一般15w以下。环境 proxmox + Ubuntu 26.04 server VM。还跑着其他VMs,总体待机功耗70左右。
其他配置: 2696 V4 + 4x64G DDR4 + 1T SATA SSD+ 18T HDD.
这几天北方降温,我机箱盖子因为各种原因,盖不住,温度满负载不到70度,显卡功耗最高300w。平时待机就是30多度的温度