Back to Blog
Devops

Tests de résilience cloud : commencer prudemment dans une PME

1 min read
Share:

Un test de résilience vérifie la réaction d’un système à une panne contrôlée. Il doit avoir un périmètre, une observation et une procédure d’arrêt.

Choisir un scénario

Encadrer l’exercice

Définissez périmètre, durée, impact acceptable, observateurs et condition d’arrêt. Utilisez données fictives et comptes isolés. Surveillez erreurs, latence, files, logs et alertes. Après restauration, contrôlez parcours métier, doublons, permissions et ressources temporaires avant de fermer l’exercice.

Commencez par arrêt d’un worker, lenteur d’une dépendance ou perte d’une instance de test. Évitez les données réelles. Définissez impact acceptable et personne autorisée à interrompre l’exercice.

Observer

Suivez erreurs, latence, files, logs et alertes. Comparez le comportement aux SLO. Une alerte doit conduire à une action documentée, comme dans le runbook de reprise cloud.

Restaurer

Vérifiez redistribution, retries, idempotence et retour à la capacité normale. Notez les messages perdus, doublons et permissions manquantes. Ne fermez pas l’exercice avant contrôle métier.

Apprendre

Transformez chaque faiblesse en action avec responsable et échéance. Sources : Google SRE, AWS Fault Injection Service.

Enjoyed this article? Share it!