Skip to main content
Une version plus récente de ce produit est disponible.
La version française est une traduction automatique. La version anglaise prévaut sur la française en cas de divergence.

Surveillez l'état du système dans StorageGRID

${post_edited_translations.segment}

À propos de cette tâche

Le système StorageGRID peut continuer à fonctionner lorsque certaines parties de la grille ne sont pas disponibles. Les problèmes potentiels indiqués par des alertes ne sont pas nécessairement des problèmes liés au fonctionnement du système. Examinez les problèmes résumés sur la carte État de santé du tableau de bord du Grid Manager.

Pour être informé des alertes dès qu'elles sont déclenchées, vous pouvez "${post_edited_translations.segment}" ou "configurer les traps SNMP".

Carte de statut sanitaire - tableau de bord

En cas de problème, des liens apparaissent qui vous permettent de consulter des détails supplémentaires :

Lien Apparaît lorsque…​

Détails de la grille

${post_edited_translations.segment}

${post_edited_translations.segment}

Alertes récemment résolues

Alertes déclenchées au cours de la semaine dernière ${post_edited_translations.segment}.

Licence

Il y a un problème avec la licence logicielle de ce système StorageGRID. Vous pouvez "${post_edited_translations.segment}".

Surveiller l'état de connexion des nœuds

Si un ou plusieurs nœuds sont déconnectés de la grille, les opérations StorageGRID critiques risquent d'être affectées. Surveillez les états de connexion des nœuds et résolvez rapidement tout problème.

Icône Description Action requise

icône point d'interrogation bleue

${post_edited_translations.segment}

Pour une raison inconnue, un nœud est déconnecté ou les services sur le nœud sont arrêtés de manière inattendue. Par exemple, un service sur le nœud peut être arrêté, ou le nœud peut avoir perdu sa connexion réseau en raison d'une panne de courant ou d'une panne inattendue.

L'alerte Impossible de communiquer avec le nœud peut également être déclenchée. D'autres alertes peuvent également être actives.

Requiert une attention immédiate. ${post_edited_translations.segment} et suivez les actions recommandées.

${post_edited_translations.segment}

Remarque : Un nœud peut apparaître comme Inconnu lors des opérations d’arrêt géré. Vous pouvez ignorer l’état Inconnu dans ces cas.

icône point d'interrogation grise

${post_edited_translations.segment}

Pour une raison prévisible, le nœud n'est pas connecté à la grille.

Par exemple, le nœud ou les services sur le nœud ont été arrêtés correctement, le nœud est en cours de redémarrage ou le logiciel est en cours de mise à niveau. Une ou plusieurs alertes peuvent également être actives.

En fonction du problème sous-jacent, ces nœuds se remettent souvent en ligne sans intervention.

Déterminez si des alertes affectent ce nœud.

Si une ou plusieurs alertes sont actives, Sélectionnez chaque alerte suivez les actions recommandées.

icône d'alerte coche verte

Connecté

${post_edited_translations.segment}

Aucune action requise.

Afficher les alertes en cours et résolues

Alertes en cours : Lorsqu’une alerte est déclenchée, une icône d’alerte s’affiche sur le tableau de bord. Une icône d’alerte s’affiche également pour le nœud sur la page Nœuds. Si "${post_edited_translations.segment}", une notification par e-mail sera également envoyée, sauf si l’alerte a été désactivée.

Alertes résolues : Vous pouvez rechercher et consulter un historique des alertes qui ont été résolues.

Vous avez éventuellement visionné la vidéo :

Aperçu des alertes

Le tableau suivant décrit les informations affichées dans le Grid Manager pour les alertes en cours et résolues.

${post_edited_translations.segment} Description

${post_edited_translations.segment}

${post_edited_translations.segment}

Gravité

La gravité de l'alerte. Pour les alertes actives, si plusieurs alertes sont regroupées, la ligne de titre indique le nombre d'occurrences de cette alerte pour chaque niveau de gravité.

Icône d’alerte rouge critique Critique : Une condition anormale existe qui a interrompu le fonctionnement normal d’un nœud ou service StorageGRID. Vous devez résoudre immédiatement le problème sous-jacent. Une interruption de service et une perte de données peuvent survenir si le problème n’est pas résolu.

${post_edited_translations.segment} Majeur : Une anomalie existe qui affecte les opérations en cours ou approche le seuil d’alerte critique. Vous devez enquêter sur les alertes majeures et résoudre tout problème sous-jacent afin de garantir que l’anomalie ne perturbe pas le fonctionnement normal d’un nœud ou d’un service StorageGRID.

${post_edited_translations.segment} Mineur : Le système fonctionne normalement, mais une anomalie existe qui pourrait affecter la capacité du système à fonctionner si elle persiste. Vous devez surveiller et résoudre les alertes mineures qui ne se résolvent pas d'elles-mêmes afin de vous assurer qu'elles ne provoquent pas un problème plus grave.

${post_edited_translations.segment}

Alertes en cours : La date et l’heure auxquelles l’alerte a été déclenchée sont indiquées dans votre heure locale et en UTC. Si plusieurs alertes sont regroupées, la ligne d’en-tête affiche les heures pour l’instance la plus récente de l’alerte (newest) et l’instance la plus ancienne de l’alerte (oldest).

${post_edited_translations.segment}

Site/Nœud

${post_edited_translations.segment}

Statut

Que l'alerte soit active, mise en sourdine ou résolue. Si plusieurs alertes sont regroupées et que Toutes les alertes est sélectionné dans la liste déroulante, la ligne de titre indique le nombre d'instances de cette alerte qui sont actives et le nombre d'instances qui ont été mises en sourdine.

Heure de résolution (alertes résolues uniquement)

Depuis combien de temps l'alerte a-t-elle été résolue.

${post_edited_translations.segment}

La valeur de la métrique ayant déclenché l'alerte. Pour certaines alertes, des valeurs supplémentaires sont affichées pour vous aider à comprendre et à examiner l'alerte. Par exemple, les valeurs affichées pour une alerte Low object data storage incluent le pourcentage d'espace disque utilisé, la quantité totale d'espace disque et la quantité d'espace disque utilisée.

Remarque : Si plusieurs alertes en cours sont regroupées, les valeurs actuelles ne sont pas affichées dans la ligne de titre.

Valeurs déclenchées (alertes résolues uniquement)

La valeur de la métrique ayant déclenché l'alerte. Pour certaines alertes, des valeurs supplémentaires sont affichées pour vous aider à comprendre et à examiner l'alerte. Par exemple, les valeurs affichées pour une alerte Low object data storage incluent le pourcentage d'espace disque utilisé, la quantité totale d'espace disque et la quantité d'espace disque utilisée.

Étapes
  1. Sélectionnez le lien Alertes en cours ou Alertes résolues pour afficher la liste des alertes de ces catégories. Vous pouvez également consulter les détails d'une alerte en sélectionnant Nodes > node > Overview, puis en sélectionnant l'alerte dans le tableau des alertes.

    Par défaut, les alertes en cours sont affichées comme suit :

    • Les alertes les plus récentes sont affichées en premier.

    • Les alertes multiples du même type sont affichées en groupe.

    • ${post_edited_translations.segment}

    • Pour une alerte spécifique sur un nœud spécifique, si les seuils sont atteints pour plus d'une gravité, seule l'alerte la plus grave est affichée. Autrement dit, si les seuils d'alerte sont atteints pour les gravités mineure, majeure et critique, seule l'alerte critique est affichée.

      ${post_edited_translations.segment}

  2. Pour développer les groupes d'alertes, sélectionnez la flèche vers le bas icône flèche vers le bas. Pour réduire les alertes individuelles d'un groupe, sélectionnez la flèche vers le haut icône de flèche vers le haut, ou sélectionnez le nom du groupe.

  3. ${post_edited_translations.segment}

  4. Pour trier les alertes ou groupes d'alertes en cours, sélectionnez les flèches haut/bas Icône de flèches de tri dans l'en-tête de chaque colonne.

    • Lorsque l'option Alertes groupées est sélectionnée, les groupes d'alertes ainsi que les alertes individuelles au sein de chaque groupe sont triés. Par exemple, vous pouvez trier les alertes d'un groupe par Date de déclenchement pour trouver l'occurrence la plus récente d'une alerte spécifique.

    • Lorsque l’option Alertes de groupe est désactivée, la liste complète des alertes est triée. Par exemple, vous pouvez trier toutes les alertes par Nœud/Site pour afficher toutes les alertes concernant un nœud spécifique.

  5. ${post_edited_translations.segment}

  6. ${post_edited_translations.segment}

    • ${post_edited_translations.segment}

    • ${post_edited_translations.segment}

    • Sélectionnez une ou plusieurs règles d'alerte par défaut ou personnalisées dans le menu déroulant Règle d'alerte pour filtrer les alertes résolues liées à une règle d'alerte spécifique.

    • ${post_edited_translations.segment}

  7. Pour afficher les détails d'une alerte spécifique, sélectionnez l'alerte. Une boîte de dialogue fournit les détails et les actions recommandées pour l'alerte que vous avez sélectionnée.

  8. ${post_edited_translations.segment}

    Vous devez disposer de la "Gérer les alertes ou l'autorisation d'accès root" pour désactiver une règle d’alerte.

    Avertissement Soyez prudent lorsque vous décidez de rendre muette une règle d'alerte. Si une règle d'alerte est rendue muette, vous risquez de ne pas détecter un problème sous-jacent avant qu'il n'empêche la réalisation d'une opération critique.
  9. ${post_edited_translations.segment}

    1. ${post_edited_translations.segment}

      ${post_edited_translations.segment}

    2. Pour fermer la fenêtre contextuelle, cliquez n'importe où en dehors de la fenêtre contextuelle.

  10. Vous pouvez également sélectionner Modifier la règle pour modifier la règle d'alerte qui a déclenché cette alerte.

    Vous devez disposer de "Gérer les alertes ou l'autorisation d'accès root" pour modifier une règle d'alerte.

    Avertissement Soyez prudent lorsque vous décidez de modifier une règle d'alerte. Si vous modifiez les valeurs de déclenchement, vous risquez de ne pas détecter un problème sous-jacent avant qu'il n'empêche une opération critique de se terminer.
  11. ${post_edited_translations.segment}