【Prometheus 】Prometheus + Docker 监控服务器CPU、内存完整实战

📅 2026/7/22 15:16:45
【Prometheus 】Prometheus + Docker 监控服务器CPU、内存完整实战
Prometheus Docker 监控服务器CPU、内存完整实战承接上一篇 Java JVM 监控这里分两套方案node-exporter标准方案采集宿主机整机CPU、内存、磁盘、网络配套 Prometheus 配置、Grafana 面板、CPU/内存告警、Mermaid 流程图一、整体架构图 Mermaid暴露服务器硬件指标物理/云服务器node-exporter容器 9100端口PrometheusGrafana 展示CPU/内存曲线告警规则 CPU高、内存溢出node-exporter 专门抓取 Linux 系统层指标CPU使用率、总内存/可用内存、Swap、磁盘IO、负载等。二、Docker 部署 node-exporter 1. 启动 node-exporter 容器dockerrun-d\--namenode-exporter\--nethost\--pidhost\-v/:/host:ro,rslave\-v/run/udev:/run/udev:ro\quay.io/prometheus/node-exporter:v1.8.2\--path.rootfs/host--nethost共享宿主机网络暴露 9100 端口--pidhost读取宿主机进程、CPU、内存信息访问指标地址http://服务器IP:9100/metrics三、修改 Prometheus 配置 prometheus.yml新增抓取 node-exporter 的 job同时保留之前 Java JVM 任务global:scrape_interval:10sevaluation_interval:10srule_files:-alert-rules.ymlscrape_configs:# 1、Java JVM监控原有-job_name:java-jvm-demometrics_path:/actuator/prometheusstatic_configs:-targets:[host.docker.internal:8080]labels:service:java-app# 2、服务器宿主机监控CPU/内存-job_name:linux-server-nodestatic_configs:-targets:[host.docker.internal:9100]labels:env:production重启 Prometheus 生效docker-composerestart prometheus打开 PrometheusStatus - Targets看到linux-server-node状态 UP 即采集成功。四、核心CPU、内存 PromQL 查询语句 1. CPU 使用率常用1单CPU核心空闲率计算1分钟内非空闲CPU占比100 - (avg by (instance) (irate(node_cpu_seconds_total{modeidle}[1m])) * 100)结果0~100代表整机CPU总使用率2各核心CPU使用率100 - (irate(node_cpu_seconds_total{modeidle}[1m]) * 100)3系统负载 1分钟/5分钟/15分钟node_load1 node_load5 node_load152. 内存使用率1物理内存使用率百分比(1 - node_memory_MemFree_bytes / node_memory_MemTotal_bytes) * 1002可用内存MBnode_memory_MemFree_bytes / 1024 / 10243Swap交换分区使用率(1 - node_memory_SwapFree_bytes / node_memory_SwapTotal_bytes) * 100五、Grafana 服务器监控大盘导入官方 Linux Node 监控模板 ID1860Grafana - Import输入 1860数据源选择 Prometheus自动生成完整面板CPU总使用率、单核曲线、CPU上下文切换内存、Swap、缓存、缓冲区占用磁盘读写、磁盘使用率、网络流量六、CPU/内存告警规则 alert-rules.yml ⚠️groups:-name:server-resource-alertrules:# CPU使用率超过85%持续5分钟告警-alert:ServerCpuHighexpr:100-(avg by(instance) (irate(node_cpu_seconds_total{modeidle}[1m])) * 100)85for:5mlabels:severity:warningannotations:summary:服务器CPU使用率过高description:机器{{$labels.instance}} CPU使用率 {{$value}}%持续超过85%# 内存使用率超过90%持续3分钟严重告警-alert:ServerMemHighexpr:(1-node_memory_MemFree_bytes / node_memory_MemTotal_bytes) * 10090for:3mlabels:severity:criticalannotations:summary:服务器内存占用过高存在OOM风险description:机器{{$labels.instance}} 内存使用率 {{$value}}%# Swap大量使用内存不足-alert:ServerSwapUsedexpr:(1-node_memory_SwapFree_bytes / node_memory_SwapTotal_bytes) * 10050for:2mlabels:severity:warningannotations:summary:Swap交换分区占用过高七、整合进 docker-compose.yml完整容器编排原有 compose 增加 node-exporter 服务version:3.8volumes:prom_data:grafana_data:services:prometheus:image:prom/prometheus:v2.47.0container_name:prometheusports:-9090:9090volumes:-./prometheus/prometheus.yml:/etc/prometheus/prometheus.yml-./prometheus/alert-rules.yml:/etc/prometheus/alert-rules.yml-prom_data:/prometheuscommand:---config.file/etc/prometheus/prometheus.yml---storage.tsdb.retention.time15dextra_hosts:-host.docker.internal:host-gatewayrestart:unless-stoppedgrafana:image:grafana/grafana:10.2.0container_name:grafanaports:-3000:3000volumes:-grafana_data:/var/lib/grafanaenvironment:-GF_SECURITY_ADMIN_USERadmin-GF_SECURITY_ADMIN_PASSWORD123456depends_on:-prometheusrestart:unless-stopped# 新增服务器资源采集器node-exporter:image:quay.io/prometheus/node-exporter:v1.8.2container_name:node-exporternetwork_mode:hostpid:hostvolumes:-/:/host:ro,rslave-/run/udev:/run/udev:rocommand:---path.rootfs/hostrestart:unless-stopped一键启动docker-composeup-d八、常见问题 Targets 显示 DOWNLinux 环境不能用host.docker.internaltarget 改为172.17.0.1:9100防火墙放行 9100、9090、3000 端口CPU 指标全为0node-exporter 必须加--nethost --pidhost才能读取宿主机硬件数据内存指标不准使用node_memory_MemFree_bytes不要用缓存内存做判断九、区分两个监控范围重点node-exporter服务器整机CPU、内存、磁盘、系统负载SpringBoot actuator/prometheus单个Java进程JVM堆、GC、线程、应用CPU占用两者搭配使用既能看机器资源又能定位是哪个Java服务吃光CPU/内存。