基础设施层

Node Exporter

  • 计算资源:CPU 使用率(系统、用户、I/O 等待)、CPU 负载、内存使用率与 Swap 交换区状态。
  • 存储 I/O:磁盘空间使用率、磁盘读写吞吐量(IOPS)、磁盘读写延迟、文件系统 Inode 使用率。
  • 网络带宽:网卡每秒收发包数量(PPS)、网络丢包/错包率、网卡带宽吞吐率。

k8s集群层

cAdvisor

  • K8s 核心组件:API Server 响应延迟与请求成功率、Controller Manager 队列深度、Etcd 的选主状态及写盘延迟、CoreDNS 域名解析延迟。
  • Pod/容器状态:Pod 重启次数(如 CrashLoopBackOff)、容器 CPU/内存限额(Throttling/OOM Killed)情况。
  • 集群调度:节点状态(Ready/NotReady)、集群整体 CPU/内存分配率、物理持久卷(PV)的剩余空间。

中间件/数据库层

专属 Exporter

  1. 数据库类 (如 MySQL, Elasticsearch)

    • MySQL:当前活跃连接数、每秒查询率(QPS)/每秒事务数(TPS)、慢查询数量、主从同步延迟。
    • Elasticsearch:集群健康状态(Green/Yellow/Red)、JVM 内存垃圾回收(GC)频率、索引写入延迟、分片(Shards)状态。
  2. 缓存与队列类 (如 Redis, Kafka, RabbitMQ)

    • Redis:内存占用大小与碎片率、Key 的命中率、连接的客户端数、持久化(AOF/RDB)是否失败。
    • Kafka消费者组积压量(Consumer Lag)(最关键的指标,防止消息处理不及时)、Broker 副本同步状态、每秒生产/消费消息条数。
  3. 接入层网络 (如 Nginx, Ingress)

    • Nginx / Ingress:HTTP 状态码比例(尤其是 5xx 占比)、连接并发数、单次请求响应耗时(P99/P95 延迟)。

业务应用层

  1. 语言运行时指标(以 Java JVM 为例)

    • 堆内存:Eden 区、Old 区、Metaspace 内存分配及回收趋势。
    • 垃圾回收:Young GC / Full GC 触发的频次与垃圾回收造成的 STW 停顿时间
    • 线程状态:死锁数量、活动线程数、业务线程池(ThreadPoolExecutor)的队列积压深度和拒绝策略触发次数
  2. 业务黄金指标(RED 方法论)

    • Rate(吞吐量):每秒订单创建量、用户登录 QPS、支付接口调用频次。
    • Errors(错误率):下单失败率、第三方通道超时比例、异常抛出(Exception)统计。
    • Duration(耗时):核心结算接口的平均响应时间、高并发场景下的 P99 核心长尾延迟。