Un test de résilience vérifie la réaction d’un système à une panne contrôlée. Il doit avoir un périmètre, une observation et une procédure d’arrêt.
Choisir un scénario
Encadrer l’exercice
Définissez périmètre, durée, impact acceptable, observateurs et condition d’arrêt. Utilisez données fictives et comptes isolés. Surveillez erreurs, latence, files, logs et alertes. Après restauration, contrôlez parcours métier, doublons, permissions et ressources temporaires avant de fermer l’exercice.
Commencez par arrêt d’un worker, lenteur d’une dépendance ou perte d’une instance de test. Évitez les données réelles. Définissez impact acceptable et personne autorisée à interrompre l’exercice.
Observer
Suivez erreurs, latence, files, logs et alertes. Comparez le comportement aux SLO. Une alerte doit conduire à une action documentée, comme dans le runbook de reprise cloud.
Restaurer
Vérifiez redistribution, retries, idempotence et retour à la capacité normale. Notez les messages perdus, doublons et permissions manquantes. Ne fermez pas l’exercice avant contrôle métier.
Apprendre
Transformez chaque faiblesse en action avec responsable et échéance. Sources : Google SRE, AWS Fault Injection Service.