Alerting & On-Call — DevOps

Alerting: Reaksi Otomatis terhadap Masalah Monitoring tanpa alerting hanya dashboard yang tidak pernah dilihat. Alerting memberi notifikasi saat metric melewati

Alerting: Reaksi Otomatis terhadap Masalah

Monitoring tanpa alerting hanya dashboard yang tidak pernah dilihat. Alerting memberi notifikasi saat metric melewati threshold tertentu.

Aturan Alert yang Baik

Contoh Alert Rules

# Grafana Alert / Prometheus Alertmanager

# Critical: Error rate > 5% selama 5 menit
- alert: HighErrorRate
  expr: rate(http_requests_total{status=~"5.."}[5m]) /
        rate(http_requests_total[5m]) > 0.05
  for: 5m
  labels:
    severity: critical
  annotations:
    summary: "Error rate above 5%"

# Warning: Response time p95 > 2 detik
- alert: SlowResponses
  expr: histogram_quantile(0.95, rate(http_response_time_bucket[5m])) > 2
  for: 10m
  labels:
    severity: warning

On-Call & Incident Response

Alert Triggered → PagerDuty/Opsgenie → On-Call Engineer
                                              │
                                    1. Acknowledge alert
                                    2. Assess severity
                                    3. Mitigate (rollback?)
                                    4. Root cause analysis
                                    5. Post-mortem document

Severity Levels

Yang akan kamu pelajari