Kembali ke Blog
MonitoringDevOpsKubernetes

Monitoring Server Anti-Kaget: Prometheus + Grafana + Telegram Alert

2025-08-30 1 min readby Asad Tahta A

Pengalaman mengelola backend Ujione: tanpa monitoring yang tepat, gangguan server baru diketahui setelah ada keluhan pengguna.

Masalah

Saat mengelola backend Ujione (VPS + Kubernetes), insiden kerap diketahui belakangan — dari laporan pengguna, bukan dari sistem. Kondisi tersebut tidak dapat diterima dalam praktik DevOps yang baik.

Stack yang saya pakai

  • Prometheus — metrics (CPU, RAM, disk, pod status)
  • Grafana — dashboard visual
  • Alertmanager → Telegram — alert real-time ke HP
  • Blackbox exporter — cek endpoint HTTP dari luar

Aturan alert yang masuk akal

- alert: HighCPU
  expr: avg(rate(node_cpu_seconds_total{mode!="idle"}[5m])) > 0.85
  for: 5m
  labels: { severity: warning }
  annotations:
    summary: "CPU {{ $labels.instance }} > 85% selama 5 menit"

Hindari alert pada lonjakan sesaat — alert fatigue menyebabkan peringatan penting terabaikan. Gunakan for: 5m.

Hasil di Ujione

  • MTTR turun dari hitungan jam ke hitungan menit
  • Rating maksimal dari klien

Mulai dari mana?

Bagi yang baru memulai: pasang Uptime Kuma (siap dalam 5 menit) untuk cek HTTP, lalu naik kelas ke Prometheus saat sudah membutuhkan metrics yang detail.

Membutuhkan bantuan implementasi?

Saya siap membantu setup dan troubleshooting secara remote.

Hubungi Saya →

Butuh pengerjaan profesional dengan invoice & garansi? Seruni Technology →