Monitoring & Logs
« Ça marche » ne suffit pas pour savoir ce qui se passe réellement sur votre infrastructure. Sans supervision, on découvre les problèmes quand les utilisateurs les signalent — trop tard.
Je mets en place des stacks de supervision que j’utilise moi-même au quotidien : Zabbix, Grafana, Prometheus pour les métriques, Graylog et ELK pour la centralisation des logs. L’objectif n’est pas d’accumuler des alertes, mais de ne garder que celles qui sont réellement exploitables — une supervision qui envoie 150 notifications par jour finit ignorée.
Exemples concrets

Alerting qui reste exploitable
Supervision multi-sites (Zabbix, Grafana) avec triage automatique des alertes — l’objectif est de garder 5 signaux utiles par jour, pas 150 notifications ignorées.

Détection au bon moment
C’est une supervision active qui a permis d’identifier rapidement l’exposition à une CVE critique avant qu’elle ne soit exploitée.

Centralisation des logs
Agrégation des logs (Graylog, ELK) de plusieurs services pour retrouver l’origine d’un incident en minutes, pas en heures.