View a markdown version of this page

Testez les charges de travail intégrées dans la détection et la réponse aux incidents - Guide de l'utilisateur d'AWS Incident Detection and Response

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Testez les charges de travail intégrées dans la détection et la réponse aux incidents

Une fois Ingestion d'alarme terminé, AWS Incident Detection and Response permet de surveiller votre charge de travail et envoie une Go-Live confirmation. Votre charge de travail est surveillée activement à partir de maintenant.

Les tests d'alarme confirment que vos alarmes intégrées activent AWS Incident Detection and Response comme prévu, déclenchent les runbooks appropriés et toutes les autres actions souhaitées, telles que la création automatique de cas si vous l'avez sélectionnée lors de l'ingestion de l'alarme.

Les tests sont facultatifs mais fortement recommandés. Vous êtes responsable de valider vos dispositions d'intervention avant qu'un véritable incident ne se produise.

Options de test

AWS Incident Detection and Response propose deux options de test.

Option 1 : Planifié GameDay (recommandé)

Un planning GameDay est une simulation en direct de bout en bout de ce qui pourrait se passer lors d'un incident réel. AWS Incident Detection and Response suit les étapes que vous avez prescrites pour vous donner un aperçu de la façon dont un incident réel peut se dérouler. GameDay C'est l'occasion pour vous de poser des questions ou d'affiner les instructions pour améliorer l'engagement.

Pour planifier un GameDay, procédez comme suit :
  1. Informez AWS Incident Detection and Response en indiquant une date préférée et un créneau horaire d'une heure, fuseau horaire compris. Prévoyez un délai d'au moins 48 heures.

  2. Planifiez des ressources pour le GameDay, y compris votre SRE/Ops équipe et les contacts d'escalade.

GameDay calendrier :

  1. Vous et AWS Incident Detection and Response participez à l'appel.

  2. Vous désactivez les actions d'alarme, le cas échéant.

  3. Vous réglez manuellement vos alarmes sur l'état ALARME en suivant les instructions figurant dansComment tester vos alarmes.

  4. AWS Incident Detection and Response confirme la réception de la notification d'alarme.

  5. AWS Incident Detection and Response répond à l'alarme et rejoint la passerelle prescrite dans votre runbook.

  6. Vous et AWS Incident Detection and Response confirmez le GameDay résultat.

Option 2 : test d'alarme hors ligne

Vous pouvez tester vos alarmes de manière indépendante à tout moment sans programmer d'appel. Le déclenchement d'une alarme active AWS Incident Detection and Response en fonction de votre runbook, comme cela serait le cas lors d'un incident réel.

Pour effectuer des tests d'alarme hors ligne, procédez comme suit :
  1. Pour éviter toute action involontaire, désactivez toutes les actions CloudWatch d'alarme Amazon.

  2. Déclenchez vos alarmes en suivant les instructions figurant dansComment tester vos alarmes.

  3. Dans les 5 minutes, un dossier de support est créé en votre nom et AWS Incident Detection and Response vous contacte comme indiqué dans votre runbook.

  4. Informez le gestionnaire des incidents que vous effectuez des tests d'alarme hors ligne.

  5. Le gestionnaire des incidents confirme quels changements d'état d'alarme ont été reçus et valide les dispositions d'intervention.

Si aucun dossier d'assistance n'est créé dans les 5 minutes, soumettez une demande d'incident pour engager manuellement AWS Incident Detection and Response à des fins de dépannage.

Comment tester vos alarmes

CloudWatch Alarmes Amazon

Note

L' Gestion des identités et des accès AWS utilisateur ou le rôle que vous utilisez pour tester les alarmes doit être cloudwatch:SetAlarmState autorisé.

Utilisez le AWS Command Line Interface ou AWS CloudShell pour régler manuellement votre alarme sur l'état ALARME. Ces commandes modifient l'état de l'alarme sans affecter votre charge de travail.

Pour éviter toute action involontaire, par exemple le redémarrage d'une instance Amazon EC2, désactivez toutes les actions CloudWatch d'alarme avant de modifier l'état de l'alarme. Vous pouvez réactiver les actions CloudWatch d'alarme une fois les tests terminés. Pour en savoir plus sur la désactivation ou l'activation des actions d'alarme, consultez DisableAlarmActions et consultez EnableAlarmActions l'Amazon CloudWatch API Reference.

Désactivez les actions d'alarme :

aws cloudwatch disable-alarm-actions --alarm-names "ExampleAlarm" --region us-east-1

Réglez l'état de l'alarme sur ALARM :

aws cloudwatch set-alarm-state --alarm-name "ExampleAlarm" --state-value ALARM --state-reason "Testing AWS Incident Detection and Response" --region us-east-1

Re-enable actions d'alarme après le test :

aws cloudwatch enable-alarm-actions --alarm-names "ExampleAlarm" --region us-east-1

L'état d'alarme revient automatiquement à OK en quelques secondes.

Alarmes composites

La set-alarm-state commande ne garantit pas que les alarmes composites reviendront à l'état OK. Il est recommandé de vérifier l'état des alarmes composites après les tests. Pour réinitialiser manuellement une alarme composite, utilisez la commande suivante :

aws cloudwatch set-alarm-state --alarm-name "ExampleCompositeAlarm" --state-value OK --state-reason "Testing AWS Incident Detection and Response" --region us-east-1

Pour en savoir plus sur la modification manuelle de l'état des CloudWatch alarmes, consultez SetAlarmState le manuel Amazon CloudWatch API Reference.

Pour en savoir plus sur les autorisations requises pour les opérations CloudWatch d'API, consultez la référence CloudWatch des autorisations Amazon.

Third-party Alarmes APM

Les charges de travail qui utilisent un outil tiers de surveillance des performances des applications (APM), tel que Datadog, Splunk, New Relic ou Dynatrace, nécessitent des instructions différentes pour simuler une alarme.

  1. Désactivez les actions d'alarme dans votre APM pour éviter toute action involontaire.

  2. Modifiez votre seuil d'alarme ou votre opérateur de comparaison pour forcer l'alarme à passer en état ALARME. Cela déclenche une charge utile pour AWS Incident Detection and Response.

  3. Une fois le test terminé, annulez les modifications apportées au seuil ou à l'opérateur de comparaison pour rétablir l'état OK de l'alarme.

Principaux résultats

Après des tests réussis :

  • L'ingestion de l'alarme est confirmée et la configuration de votre alarme est correcte.

  • Les alarmes sont reçues par AWS Incident Detection and Response.

  • Un dossier d'assistance est créé et les contacts que vous avez prescrits sont notifiés.

  • AWS Incident Detection and Response vous engage par les moyens de conférence que vous avez définis.

  • Toutes les alarmes et tous les cas d'assistance générés lors des tests sont résolus.

Questions fréquentes (FAQ)

Les tests d'alarme sont-ils obligatoires ?

Non. Les tests sont facultatifs mais fortement recommandés pour valider vos dispositifs de réponse de bout en bout avant qu'un véritable incident ne se produise.

Ma charge de travail sera-t-elle affectée ?

Non. Cependant, pendant les tests, toutes les actions d'alarme configurées sur vos alarmes sont déclenchées, sauf si vous les désactivez. Désactivez les actions d'alarme avant les tests pour éviter les impacts imprévus.

Qui est averti lors des tests ?

Lors d'une planification GameDay, tous les contacts et voies d'escalade de votre runbook sont contactés pour vérification. Lors des tests d'alarme hors ligne, seul le contact initial spécifié lors de l'intégration de l'alarme est averti.

Puis-je répondre par e-mail aux mises à jour sur les cas ?

Non. Des copies électroniques des correspondances Support relatives aux affaires sont envoyées à partir d'une adresse de non-réponse. Pour mettre à jour un dossier, utilisez le AWS Support Center Console.

Comment puis-je demander une demande GameDay après la mise en service ?

Répondez à votre demande d'assistance d'intégration existante, s'il existe, ou créez unDemander des modifications à une charge de travail intégrée dans la section Détection et réponse aux incidents.