Restaurer les données d'objet sur le volume de stockage StorageGRID (panne disque)
Après avoir récupéré les volumes de stockage d'un nœud de stockage non-appliance, vous pouvez restaurer les données d'objet répliquées ou à codage d'effacement qui ont été perdues lors de la panne du nœud de stockage.
Quelle procédure devez-vous utiliser ?
Dans la mesure du possible, restaurez les données des objets à l'aide de la page Volume restoration dans le Grid Manager.
-
Si les volumes sont répertoriés sous Maintenance > Restauration de volumes > Nœuds à restaurer, restaurez les données d'objet à l'aide de "Page de restauration de volume dans le Grid Manager".
-
Si les volumes ne sont pas répertoriés dans Maintenance > Restauration de volumes > Nœuds à restaurer, suivez les étapes ci-dessous pour utiliser le script
repair-dataafin de restaurer les données d'objet.Si le nœud de stockage récupéré contient moins de volumes que le nœud qu'il remplace, vous devez utiliser le script
repair-data.
|
|
Le script repair-data est obsolète et sera supprimé dans une prochaine version. Lorsque cela est possible, utilisez le "Procédure de restauration du volume dans le Grid Manager". |
Utilisez le repair-data script pour restaurer les données de l'objet
-
Vous avez confirmé que le nœud de stockage récupéré a un état de connexion Connecté
sur l’onglet Nœuds > Vue d’ensemble dans le Grid Manager.
Les données d'objet peuvent être restaurées à partir d'autres nœuds de stockage ou d'un Cloud Storage Pool, à condition que les règles ILM de la grille aient été configurées de manière à ce que des copies d'objet soient disponibles.
Remarque :
-
Si une règle ILM a été configurée pour ne stocker qu'une seule copie répliquée et que cette copie se trouvait sur un volume de stockage défaillant, vous ne pourrez pas récupérer l'objet.
-
Si la seule copie restante d'un objet se trouve dans un Cloud Storage Pool, StorageGRID doit envoyer plusieurs requêtes au point de terminaison du Cloud Storage Pool pour restaurer les données de l'objet. Avant d'effectuer cette procédure, contactez le support technique pour obtenir une estimation du délai de récupération et des coûts associés.
À propos du `repair-data`scénario
Pour restaurer les données d'objet, vous exécutez le repair-data script. Ce script lance le processus de restauration des données d'objet et fonctionne avec l'analyse ILM pour garantir le respect des règles ILM.
Sélectionnez Données répliquées ou Données à codage d'effacement (EC) ci-dessous pour découvrir les différentes options du script repair-data, selon que vous restaurez des données répliquées ou des données à codage d'effacement. Si vous devez restaurer les deux types de données, vous devez exécuter les deux séries de commandes.
|
|
Pour plus d'informations sur le repair-data script, saisissez repair-data --help depuis la ligne de commandes du nœud d'administration principal.
|
|
|
Le script repair-data est obsolète et sera supprimé dans une prochaine version. Lorsque cela est possible, utilisez le "Procédure de restauration du volume dans le Grid Manager". |
Deux commandes sont disponibles pour restaurer les données répliquées, selon que vous ayez besoin de réparer l'intégralité du nœud ou seulement certains volumes sur le nœud :
repair-data start-replicated-node-repair
repair-data start-replicated-volume-repair
Vous pouvez suivre les réparations des données répliquées avec cette commande :
repair-data show-replicated-repair-status
Deux commandes sont disponibles pour restaurer les données à codage d'effacement, selon que vous ayez besoin de réparer l'ensemble du nœud ou seulement certains volumes sur le nœud :
repair-data start-ec-node-repair
repair-data start-ec-volume-repair
Vous pouvez suivre les réparations des données à codage d'effacement avec cette commande :
repair-data show-ec-repair-status
|
|
La réparation des données à codage d'effacement peut commencer même si certains nœuds de stockage sont hors ligne. Cependant, si toutes les données à codage d'effacement ne peuvent pas être retrouvées, la réparation ne peut pas être terminée. La réparation sera terminée lorsque tous les nœuds seront disponibles. |
|
|
La tâche de réparation de l'EC réserve temporairement une grande quantité d'espace de stockage. Des alertes de stockage peuvent être déclenchées, mais seront résolues lorsque la réparation sera terminée. S'il n'y a pas assez d'espace de stockage pour la réservation, la tâche de réparation de l'EC échouera. Les réservations d'espace de stockage sont libérées lorsque la tâche de réparation de l'EC se termine, que la tâche ait échoué ou réussi. |
Trouver le nom d’hôte du nœud de stockage
-
Connectez-vous à n'importe quel nœud d'administration :
-
Saisissez la commande suivante :
ssh admin@primary_Admin_Node_IP -
Saisissez le mot de passe indiqué dans le fichier
Passwords.txt. -
Saisissez la commande suivante pour passer en mode superutilisateur :
su - -
Saisissez le mot de passe indiqué dans le fichier
Passwords.txt.Lorsque vous êtes connecté en tant que root, l'invite passe de
$à#.
-
-
Utilisez le
/etc/hostsfichier pour trouver le nom d’hôte du nœud de stockage pour les volumes de stockage restaurés. Pour afficher la liste de tous les nœuds de la grille, saisissez la commande suivante :cat /etc/hosts.
Réparez les données si tous les volumes ont échoué
Si tous les volumes de stockage sont défaillants, réparez l'ensemble du nœud. Suivez les instructions relatives aux données répliquées, aux données à codage d'effacement (EC) ou aux deux, selon que vous utilisez des données répliquées, des données à codage d'effacement (EC) ou les deux.
Si seuls certains volumes ont échoué, rendez-vous à Réparez les données si seuls certains volumes ont échoué.
|
|
Vous ne pouvez pas exécuter repair-data d'opérations sur plus d'un nœud à la fois. Pour récupérer plusieurs nœuds, contactez le support technique.
|
Si votre grille comprend des données répliquées, utilisez la commande repair-data start-replicated-node-repair avec l’option --nodes, où --nodes est le nom d’hôte (nom du système), pour réparer l’ensemble du nœud de stockage.
Cette commande répare les données répliquées sur un nœud de stockage nommé SG-DC-SN3 :
repair-data start-replicated-node-repair --nodes SG-DC-SN3
|
|
Lors de la restauration des données d'objet, l'alerte Objets perdus est déclenchée si le système StorageGRID ne parvient pas à localiser les données d'objet répliquées. Des alertes peuvent être déclenchées sur les nœuds de stockage de l'ensemble du système. Vous devez déterminer la cause de la perte et si une récupération est possible. Voir "Examiner les objets potentiellement perdus". |
Si votre grille contient des données à codage d'effacement, utilisez la repair-data start-ec-node-repair commande avec l'option --nodes, où --nodes est le nom d'hôte (nom du système), pour réparer l'ensemble du Storage Node.
Cette commande répare les données à code d'effacement sur un nœud de stockage nommé SG-DC-SN3 :
repair-data start-ec-node-repair --nodes SG-DC-SN3
L'opération renvoie un identifiant repair ID unique qui identifie cette repair_data opération. Utilisez cet repair ID identifiant pour suivre la progression et le résultat de l' repair_data opération. Aucun autre retour d'information n'est fourni lorsque le processus de récupération est terminé.
La réparation des données à codage d'effacement peut commencer même si certains nœuds de stockage sont hors ligne. La réparation sera terminée une fois que tous les nœuds seront disponibles.
Réparez les données si seuls certains volumes ont échoué
Si seuls certains volumes sont défaillants, réparez les volumes concernés. Suivez les instructions relatives aux données répliquées, aux données à codage d'effacement (EC) ou aux deux, selon que vous utilisez des données répliquées, des données à codage d'effacement (EC) ou les deux.
Si tous les volumes ont échoué, allez à Réparez les données si tous les volumes ont échoué.
Saisissez les identifiants de volume en hexadécimal. Par exemple, 0000 est le premier volume et 000F est le seizième volume. Vous pouvez spécifier un seul volume, une plage de volumes ou plusieurs volumes qui ne sont pas dans une séquence.
Tous les volumes doivent se trouver sur le même nœud de stockage. Si vous devez restaurer des volumes pour plus d'un nœud de stockage, contactez le support technique.
Si votre grille contient des données répliquées, utilisez la start-replicated-volume-repair commande avec l’option --nodes pour identifier le nœud (où --nodes est le nom d’hôte du nœud). Ajoutez ensuite soit l’option --volumes soit l’option --volume-range, comme indiqué dans les exemples suivants.
Volume unique : Cette commande restaure les données répliquées sur le volume 0002 d’un nœud de stockage nommé SG-DC-SN3 :
repair-data start-replicated-volume-repair --nodes SG-DC-SN3 --volumes 0002
Plage de volumes : Cette commande restaure les données répliquées sur tous les volumes de la plage 0003 à 0009 sur un nœud de stockage nommé SG-DC-SN3 :
repair-data start-replicated-volume-repair --nodes SG-DC-SN3 --volume-range 0003,0009
Plusieurs volumes non séquentiels : Cette commande restaure les données répliquées sur les volumes 0001, 0005, et 0008 sur un nœud de stockage nommé SG-DC-SN3 :
repair-data start-replicated-volume-repair --nodes SG-DC-SN3 --volumes 0001,0005,0008
|
|
Lors de la restauration des données d'objets, l'alerte Objets perdus est déclenchée si le système StorageGRID ne parvient pas à localiser les données d'objets répliquées. Des alertes peuvent être déclenchées sur les nœuds de stockage de l'ensemble du système. Veuillez consulter la description de l'alerte et les actions recommandées pour déterminer la cause de la perte et si une récupération est possible. |
Si votre grille contient des données à codage par effacement, utilisez la start-ec-volume-repair commande avec l’option --nodes pour identifier le nœud (où --nodes est le nom d’hôte du nœud). Ajoutez ensuite soit l’option --volumes soit l’option --volume-range, comme indiqué dans les exemples suivants.
Volume unique : Cette commande restaure les données à codage d’effacement sur le volume 0007 d’un nœud de stockage nommé SG-DC-SN3 :
repair-data start-ec-volume-repair --nodes SG-DC-SN3 --volumes 0007
Plage de volumes : Cette commande restaure les données à codage d’effacement sur tous les volumes de la plage 0004 à 0006 sur un nœud de stockage nommé SG-DC-SN3 :
repair-data start-ec-volume-repair --nodes SG-DC-SN3 --volume-range 0004,0006
Plusieurs volumes non séquentiels : Cette commande restaure les données à codage d'effacement sur les volumes 000A, 000C, et 000E sur un nœud de stockage nommé SG-DC-SN3 :
repair-data start-ec-volume-repair --nodes SG-DC-SN3 --volumes 000A,000C,000E
L’opération repair-data renvoie un repair ID unique qui identifie cette repair_data opération. Utilisez cet repair ID identifiant pour suivre la progression et le résultat de l’ repair_data opération. Aucun autre retour d’information n’est fourni lorsque le processus de récupération est terminé.
|
|
La réparation des données à codage d'effacement peut commencer même si certains nœuds de stockage sont hors ligne. La réparation sera terminée une fois que tous les nœuds seront disponibles. |
Surveillez les réparations
Surveillez l'état des travaux de réparation, selon que vous utilisez des données répliquées, des données à codage d'effacement (EC) ou les deux.
Vous pouvez également suivre l'état des tâches de restauration de volume en cours et consulter l'historique des tâches de restauration terminées dans "Gestionnaire de grille".
-
Pour obtenir une estimation du pourcentage d'achèvement de la réparation répliquée, ajoutez l'option
show-replicated-repair-statusà la commande repair-data.repair-data show-replicated-repair-status -
Pour déterminer si les réparations sont terminées :
-
Sélectionnez Nœuds > Nœud de stockage en cours de réparation > ILM.
-
Examinez les attributs dans la section Évaluation. Une fois les réparations terminées, l'attribut En attente - Tous indique 0 objets.
-
-
Pour surveiller la réparation plus en détail :
-
Sélectionnez Nœuds.
-
Sélectionnez grid name > ILM.
-
Positionnez votre curseur sur le graphique de la file d'attente ILM pour voir la valeur de l'attribut Taux de numérisation (objets/sec), qui correspond au taux auquel les objets de la grille sont analysés et mis en file d'attente pour ILM.
-
Dans la section File d'attente ILM, examinez les attributs suivants :
-
Période de scan - estimée : Temps estimé pour effectuer un scan ILM complet de tous les objets.
Une analyse complète ne garantit pas que l'ILM a été appliqué à tous les objets.
-
Tentatives de réparation : nombre total de tentatives de réparation d’objets pour les données répliquées considérées comme à haut risque. Les objets à haut risque sont tous les objets dont il ne reste qu’une seule copie, que ce soit spécifié par la politique ILM ou à la suite de copies perdues. Ce compteur s’incrémente chaque fois qu’un nœud de stockage tente de réparer un objet à haut risque. Les réparations ILM à haut risque sont prioritaires si la grille devient occupée.
La tentative de réparation d'un même objet peut être incrémentée à nouveau si la réplication échoue après la réparation. Ces attributs peuvent être utiles lorsque vous surveillez la progression de la récupération du volume du nœud de stockage. Si le nombre de tentatives de réparation a cessé d'augmenter et qu'une analyse complète a été effectuée, la réparation est probablement terminée.
-
-
Vous pouvez également soumettre une requête Prometheus pour
storagegrid_ilm_scan_period_estimated_minutesetstoragegrid_ilm_repairs_attempted.
-
Pour surveiller la réparation des données à codage d'effacement et réessayer les requêtes ayant pu échouer :
-
Déterminez l'état des réparations des données codées par effacement :
-
Sélectionnez Support > Outils > Métriques pour afficher le temps estimé jusqu'à l'achèvement et le pourcentage d'achèvement de la tâche en cours. Ensuite, sélectionnez EC Overview dans la section Grafana. Consultez les tableaux de bord Grid EC Job Estimated Time to Completion et Grid EC Job Percentage Completed.
-
Utilisez cette commande pour consulter l'état d'une opération `repair-data`spécifique :
repair-data show-ec-repair-status --repair-id repair ID -
Utilisez cette commande pour lister toutes les réparations :
repair-data show-ec-repair-status
La liste des résultats contient des informations, y compris
repair ID, sur toutes les réparations précédemment effectuées et en cours. -
-
Si le résultat indique que l'opération de réparation a échoué, utilisez l'option
--repair-idpour réessayer la réparation.Cette commande réessaie une réparation de nœud ayant échoué, en utilisant l'ID de réparation 6949309319275667690 :
repair-data start-ec-node-repair --repair-id 6949309319275667690Cette commande réessaie une réparation de volume ayant échoué, en utilisant l'ID de réparation 6949309319275667690 :
repair-data start-ec-volume-repair --repair-id 6949309319275667690