Monitoring Server Anti-Kaget: Prometheus + Grafana + Telegram Alert
Pengalaman mengelola backend Ujione: tanpa monitoring yang tepat, gangguan server baru diketahui setelah ada keluhan pengguna.
Masalah
Saat mengelola backend Ujione (VPS + Kubernetes), insiden kerap diketahui belakangan — dari laporan pengguna, bukan dari sistem. Kondisi tersebut tidak dapat diterima dalam praktik DevOps yang baik.
Stack yang saya pakai
- Prometheus — metrics (CPU, RAM, disk, pod status)
- Grafana — dashboard visual
- Alertmanager → Telegram — alert real-time ke HP
- Blackbox exporter — cek endpoint HTTP dari luar
Aturan alert yang masuk akal
- alert: HighCPU
expr: avg(rate(node_cpu_seconds_total{mode!="idle"}[5m])) > 0.85
for: 5m
labels: { severity: warning }
annotations:
summary: "CPU {{ $labels.instance }} > 85% selama 5 menit"
Hindari alert pada lonjakan sesaat — alert fatigue menyebabkan peringatan penting terabaikan. Gunakan
for: 5m.
Hasil di Ujione
- MTTR turun dari hitungan jam ke hitungan menit
- Rating maksimal dari klien
Mulai dari mana?
Bagi yang baru memulai: pasang Uptime Kuma (siap dalam 5 menit) untuk cek HTTP, lalu naik kelas ke Prometheus saat sudah membutuhkan metrics yang detail.
Membutuhkan bantuan implementasi?
Saya siap membantu setup dan troubleshooting secara remote.
Hubungi Saya →Butuh pengerjaan profesional dengan invoice & garansi? Seruni Technology →