Skip to main content
Une version plus récente de ce produit est disponible.
La version française est une traduction automatique. La version anglaise prévaut sur la française en cas de divergence.

Surveiller les tâches de réparation des données StorageGRID

Vous pouvez surveiller l'état des tâches de réparation en utilisant le repair-data script depuis la ligne de commandes.

Cela inclut les tâches que vous avez lancées manuellement, ou les tâches que StorageGRID a lancées automatiquement dans le cadre d'une procédure de mise hors service.

Remarque Si vous exécutez des tâches de restauration de volume, "Surveillez l'avancement et consultez l'historique de ces tâches dans le Grid Manager" à la place.

Surveillez l'état des tâches repair-data selon que vous utilisez des données répliquées, des données avec code d'effacement (EC) ou les deux.

Données répliquées
  • Pour obtenir une estimation du pourcentage d'achèvement de la réparation répliquée, ajoutez l'option show-replicated-repair-status à la commande repair-data.

    repair-data show-replicated-repair-status

  • Pour déterminer si les réparations sont terminées :

    1. Sélectionnez Nœuds > Nœud de stockage en cours de réparation > ILM.

    2. Examinez les attributs dans la section Évaluation. Une fois les réparations terminées, l'attribut En attente - Tous indique 0 objets.

  • Pour surveiller la réparation plus en détail :

    1. Sélectionnez Nœuds.

    2. Sélectionnez grid name > ILM.

    3. Positionnez votre curseur sur le graphique de la file d'attente ILM pour voir la valeur de l'attribut Taux de numérisation (objets/sec), qui correspond au taux auquel les objets de la grille sont analysés et mis en file d'attente pour ILM.

    4. Dans la section File d'attente ILM, examinez les attributs suivants :

      • Période de scan - estimée : Temps estimé pour effectuer un scan ILM complet de tous les objets.

        Une analyse complète ne garantit pas que l'ILM a été appliqué à tous les objets.

      • Tentatives de réparation : nombre total de tentatives de réparation d’objets pour les données répliquées considérées comme à haut risque. Les objets à haut risque sont tous les objets dont il ne reste qu’une seule copie, que ce soit spécifié par la politique ILM ou à la suite de copies perdues. Ce compteur s’incrémente chaque fois qu’un nœud de stockage tente de réparer un objet à haut risque. Les réparations ILM à haut risque sont prioritaires si la grille devient occupée.

        La tentative de réparation d'un même objet peut être incrémentée à nouveau si la réplication échoue après la réparation. Ces attributs peuvent être utiles lorsque vous surveillez la progression de la récupération du volume du nœud de stockage. Si le nombre de tentatives de réparation a cessé d'augmenter et qu'une analyse complète a été effectuée, la réparation est probablement terminée.

    5. Vous pouvez également soumettre une requête Prometheus pour storagegrid_ilm_scan_period_estimated_minutes et storagegrid_ilm_repairs_attempted.

Données codées par effacement (EC)

Pour surveiller la réparation des données à codage d'effacement et réessayer les requêtes ayant pu échouer :

  1. Déterminez l'état des réparations des données codées par effacement :

    • Sélectionnez Support > Outils > Métriques pour afficher le temps estimé jusqu'à l'achèvement et le pourcentage d'achèvement de la tâche en cours. Ensuite, sélectionnez EC Overview dans la section Grafana. Consultez les tableaux de bord Grid EC Job Estimated Time to Completion et Grid EC Job Percentage Completed.

    • Utilisez cette commande pour consulter l'état d'une opération `repair-data`spécifique :

      repair-data show-ec-repair-status --repair-id repair ID

    • Utilisez cette commande pour lister toutes les réparations :

      repair-data show-ec-repair-status

    La liste des résultats contient des informations, y compris repair ID, sur toutes les réparations précédemment effectuées et en cours.

  2. Si le résultat indique que l'opération de réparation a échoué, utilisez l'option --repair-id pour réessayer la réparation.

    Cette commande réessaie une réparation de nœud ayant échoué, en utilisant l'ID de réparation 6949309319275667690 :

    repair-data start-ec-node-repair --repair-id 6949309319275667690

    Cette commande réessaie une réparation de volume ayant échoué, en utilisant l'ID de réparation 6949309319275667690 :

    repair-data start-ec-volume-repair --repair-id 6949309319275667690