« Plus il y a d’alertes, meilleure est la supervision. »
Une alerte utile signale un symptôme associé à un impact, attend assez longtemps pour éviter le bruit et indique une action possible. Les métriques détaillées servent ensuite à rechercher la cause.
01Choisir les preuves
Commence par le service rendu. Pour un accès intranet, un ping de gateway ne suffit pas. Il faut au minimum distinguer :
02Produire des métriques
Télécharge le collecteur, puis choisis un répertoire de textfile collector :
chmod +x module5c-network-observer.sh
sudo mkdir -p /var/lib/node_exporter/textfile_collector
sudo TARGET_ICMP=10.90.10.1 TARGET_HTTP=http://10.90.20.10:8080/ TARGET_TCP_HOST=10.90.20.10 TARGET_TCP_PORT=8080 VRRP_VIP=10.90.10.1 ./module5c-network-observer.sh /var/lib/node_exporter/textfile_collector
Le fichier est écrit sous un nom temporaire puis déplacé. Cette écriture atomique évite que node_exporter lise un fichier incomplet.
cat /var/lib/node_exporter/textfile_collector/soria_network.prom
03Valider le format
promtool check metrics < /var/lib/node_exporter/textfile_collector/soria_network.prom
Corrige toute erreur avant d’exposer le fichier. Le textfile collector lit les fichiers *.prom présents dans le répertoire configuré ; les timestamps explicites dans les lignes de métriques ne sont pas utilisés.
04Planifier la collecte
Pour un laboratoire, un timer systemd ou cron peut exécuter le script toutes les minutes. En production, documente l’utilisateur, les droits, le timeout et le coût de chaque probe.
* * * * * root TARGET_ICMP=10.90.10.1 TARGET_HTTP=http://10.90.20.10:8080/ /usr/local/sbin/module5c-network-observer.sh /var/lib/node_exporter/textfile_collector
05Valider les alertes
promtool check rules module5c-alert-rules.yml
Une règle avec for: 2m devient d’abord pending. Elle ne passe à firing que si la condition reste vraie pendant la durée demandée.
Arrête le service HTTP sans couper la gateway
- arrête le serveur HTTP du laboratoire VRRP ;
- relance le collecteur ;
- montre que la probe ICMP peut rester à 1 alors que la probe HTTP passe à 0 ;
- attends la temporisation de l’alerte HTTP ;
- utilise le runbook pour localiser la panne au-dessus du réseau.
06Rendre l’alerte actionnable
Pour chaque alerte, ajoute :
- le symptôme ;
- la durée ;
- la criticité ;
- l’équipe propriétaire ;
- une référence de runbook ;
- une condition claire de clôture.
Alertmanager gère ensuite le routage, les silences et les notifications. Il ne remplace pas la définition correcte du symptôme dans Prometheus.
✓Ce que tu retiens
Une supervision utile assemble plusieurs preuves, alerte sur un symptôme durable et conduit vers une action documentée. La validation avec promtool fait partie du changement, pas d’un contrôle facultatif.