Architecture des réseaux · Étape 27

Supervise les symptômes et construis des alertes

Transforme des tests réseau en métriques Prometheus, valide les règles et relie chaque alerte à une action opérateur.

Durée indicative · ~2 hNiveau intermédiairePrérequis conseillé · Module 5B — convergence OSPF et failover VRRPPratique · TP
L’idée reçue

« Plus il y a d’alertes, meilleure est la supervision. »

Une alerte utile signale un symptôme associé à un impact, attend assez longtemps pour éviter le bruit et indique une action possible. Les métriques détaillées servent ensuite à rechercher la cause.

1Mesurerétat ou valeur observable
2Comparerobjectif et historique
3Alertersymptôme durable
4Agirrunbook et validation

01Choisir les preuves

Commence par le service rendu. Pour un accès intranet, un ping de gateway ne suffit pas. Il faut au minimum distinguer :

Preuve
Ce qu’elle confirme
Ce qu’elle ne confirme pas
Interface up
Lien local déclaré actif
Route et service
Route par défaut
Chemin configuré
Joignabilité réelle
ICMP
Réponse IP de la cible
Port applicatif
TCP
Port ouvert
Réponse fonctionnelle
HTTP
Chaîne applicative minimale
Parcours utilisateur complet

02Produire des métriques

Télécharge le collecteur, puis choisis un répertoire de textfile collector :

chmod +x module5c-network-observer.sh
sudo mkdir -p /var/lib/node_exporter/textfile_collector

sudo TARGET_ICMP=10.90.10.1 TARGET_HTTP=http://10.90.20.10:8080/ TARGET_TCP_HOST=10.90.20.10 TARGET_TCP_PORT=8080 VRRP_VIP=10.90.10.1 ./module5c-network-observer.sh /var/lib/node_exporter/textfile_collector

Le fichier est écrit sous un nom temporaire puis déplacé. Cette écriture atomique évite que node_exporter lise un fichier incomplet.

cat /var/lib/node_exporter/textfile_collector/soria_network.prom
Les métriques séparent la réussite des probes, la présence de route, l’état d’interface, WireGuard, OSPF et le VIP. Une métrique absente ou indisponible n’est pas confondue avec un service sain.

03Valider le format

promtool check metrics < /var/lib/node_exporter/textfile_collector/soria_network.prom

Corrige toute erreur avant d’exposer le fichier. Le textfile collector lit les fichiers *.prom présents dans le répertoire configuré ; les timestamps explicites dans les lignes de métriques ne sont pas utilisés.

04Planifier la collecte

Pour un laboratoire, un timer systemd ou cron peut exécuter le script toutes les minutes. En production, documente l’utilisateur, les droits, le timeout et le coût de chaque probe.

* * * * * root TARGET_ICMP=10.90.10.1 TARGET_HTTP=http://10.90.20.10:8080/ /usr/local/sbin/module5c-network-observer.sh /var/lib/node_exporter/textfile_collector

05Valider les alertes

promtool check rules module5c-alert-rules.yml

Une règle avec for: 2m devient d’abord pending. Elle ne passe à firing que si la condition reste vraie pendant la durée demandée.

Panne volontaire

Arrête le service HTTP sans couper la gateway

  1. arrête le serveur HTTP du laboratoire VRRP ;
  2. relance le collecteur ;
  3. montre que la probe ICMP peut rester à 1 alors que la probe HTTP passe à 0 ;
  4. attends la temporisation de l’alerte HTTP ;
  5. utilise le runbook pour localiser la panne au-dessus du réseau.

06Rendre l’alerte actionnable

Pour chaque alerte, ajoute :

  • le symptôme ;
  • la durée ;
  • la criticité ;
  • l’équipe propriétaire ;
  • une référence de runbook ;
  • une condition claire de clôture.

Alertmanager gère ensuite le routage, les silences et les notifications. Il ne remplace pas la définition correcte du symptôme dans Prometheus.

Ce que tu retiens

Une supervision utile assemble plusieurs preuves, alerte sur un symptôme durable et conduit vers une action documentée. La validation avec promtool fait partie du changement, pas d’un contrôle facultatif.

Ta progression

Chargement de l’état… Se connecter pour synchroniser.