Mettre hors service les nœuds StorageGRID déconnectés
Vous pourriez avoir besoin de mettre hors service un nœud qui n'est actuellement pas connecté à la grille (un nœud dont l'état est inconnu ou qui est administrativement hors service).
-
Vous comprenez les considérations relatives à la mise hors service "Nœuds d'administration et de passerelle" et les considérations relatives à la mise hors service "Nœuds de stockage".
-
Vous avez obtenu tous les éléments prérequis.
-
Vous avez vérifié qu'aucune tâche de réparation de données n'est en cours. Voir "Vérifiez les travaux de réparation de données".
-
Vous avez confirmé qu'aucune récupération de nœud de stockage n'est en cours sur l'ensemble de la grille. Si tel est le cas, vous devez attendre la fin de toute reconstruction de Cassandra effectuée dans le cadre de la récupération. Vous pouvez ensuite procéder à la mise hors service.
-
Vous avez veillé à ce qu'aucune autre procédure de maintenance ne soit exécutée pendant la procédure de mise hors service du nœud, sauf si la procédure de mise hors service du nœud est suspendue.
-
La colonne Mise hors service possible pour le ou les nœuds déconnectés que vous souhaitez mettre hors service comporte une coche verte.
-
Vous disposez de la phrase secrète de provisionnement.
Vous pouvez identifier les nœuds déconnectés en recherchant l’icône bleue Inconnu
ou l’icône grise Administrativement hors service
dans la colonne Santé.
Avant de mettre hors service un nœud déconnecté, notez ce qui suit :
-
Cette procédure est principalement conçue pour la suppression d'un seul nœud déconnecté. Si votre grid comporte plusieurs nœuds déconnectés, le logiciel exige leur mise hors service simultanée, ce qui augmente le risque de résultats inattendus.
Une perte de données peut survenir si vous mettez hors service plusieurs nœuds de stockage déconnectés simultanément. Voir "Considérations relatives aux nœuds de stockage déconnectés". Soyez prudent lorsque vous mettez hors service des nœuds de stockage dans une grille contenant des nœuds logiciels dédiés uniquement aux métadonnées. Si vous mettez hors service tous les nœuds configurés pour stocker à la fois des objets et des métadonnées, la capacité de stocker des objets est supprimée de la grille. Voir "Types de nœuds de stockage" pour plus d'informations sur les nœuds de stockage dédiés uniquement aux métadonnées. -
Si un nœud déconnecté ne peut pas être supprimé (par exemple, un nœud de stockage requis pour le quorum ADC), aucun autre nœud déconnecté ne peut être supprimé.
-
Sauf si vous mettez hors service un nœud d'archivage (qui doit être déconnecté), essayez de remettre en ligne ou de récupérer tout nœud de grille déconnecté.
Voir "Procédures de récupération des nœuds de grille" pour les instructions.
-
Si vous ne parvenez pas à récupérer un nœud de grid déconnecté et que vous souhaitez le mettre hors service pendant qu'il est déconnecté, cochez la case pour ce nœud.
Si votre grid comporte plusieurs nœuds déconnectés, le logiciel vous oblige à les mettre hors service tous simultanément, ce qui augmente le risque de résultats inattendus. Soyez prudent lorsque vous choisissez de mettre hors service plusieurs nœuds de grille déconnectés simultanément, surtout si vous sélectionnez plusieurs nœuds de stockage déconnectés. Si vous avez plusieurs nœuds de stockage déconnectés que vous ne pouvez pas récupérer, contactez le support technique pour déterminer la meilleure marche à suivre. -
Saisissez la phrase secrète de provisionnement.
Le bouton Démarrer la mise hors service est activé.
-
Cliquez sur Démarrer la mise hors service.
Un avertissement apparaît, indiquant que vous avez sélectionné un nœud déconnecté et que les données de l'objet seront perdues si le nœud possède la seule copie d'un objet.
-
Vérifiez la liste des nœuds, puis cliquez sur OK.
La procédure de mise hors service démarre et sa progression est affichée pour chaque nœud. Au cours de la procédure, un nouveau package de récupération contenant la modification de la configuration du grid est généré.
-
Dès que le nouveau package de récupération est disponible, cliquez sur le lien ou sélectionnez Maintenance > System > Recovery package pour accéder à la page du recovery package. Ensuite, téléchargez le
.zipfichier.Consultez les instructions pour "téléchargement du package de récupération".
Téléchargez le package de récupération dès que possible afin de pouvoir restaurer votre grid en cas de problème lors de la procédure de mise hors service. Le fichier du package de récupération doit être sécurisé, car il contient des clés de chiffrement et des mots de passe qui peuvent être utilisés pour obtenir des données du système StorageGRID. -
Surveillez régulièrement la page de mise hors service pour vous assurer que tous les nœuds sélectionnés ont bien été mis hors service.
La mise hors service des nœuds de stockage peut prendre plusieurs jours, voire plusieurs semaines. Une fois toutes les tâches terminées, la liste de sélection des nœuds s'affiche à nouveau avec un message de réussite. Si vous avez mis hors service un nœud de stockage déconnecté, un message d'information indique que les tâches de réparation ont été lancées.
-
Une fois les nœuds arrêtés automatiquement dans le cadre de la procédure de mise hors service, supprimez toutes les machines virtuelles restantes ou autres ressources associées au nœud mis hors service.
N'effectuez pas cette étape tant que les nœuds ne se sont pas arrêtés automatiquement. -
Si vous mettez hors service un nœud de stockage, surveillez l'état des tâches de réparation des données répliquées et des données à codage d'effacement (EC) qui sont automatiquement lancées pendant le processus de mise hors service.
-
Pour obtenir une estimation du pourcentage d'achèvement de la réparation répliquée, ajoutez l'option
show-replicated-repair-statusà la commande repair-data.repair-data show-replicated-repair-status -
Pour déterminer si les réparations sont terminées :
-
Sélectionnez Nœuds > Nœud de stockage en cours de réparation > ILM.
-
Examinez les attributs dans la section Évaluation. Une fois les réparations terminées, l'attribut En attente - Tous indique 0 objets.
-
-
Pour surveiller la réparation plus en détail :
-
Sélectionnez Nœuds.
-
Sélectionnez grid name > ILM.
-
Positionnez votre curseur sur le graphique de la file d'attente ILM pour voir la valeur de l'attribut Taux de numérisation (objets/sec), qui correspond au taux auquel les objets de la grille sont analysés et mis en file d'attente pour ILM.
-
Dans la section File d'attente ILM, examinez les attributs suivants :
-
Période de scan - estimée : Temps estimé pour effectuer un scan ILM complet de tous les objets.
Une analyse complète ne garantit pas que l'ILM a été appliqué à tous les objets.
-
Tentatives de réparation : nombre total de tentatives de réparation d’objets pour les données répliquées considérées comme à haut risque. Les objets à haut risque sont tous les objets dont il ne reste qu’une seule copie, que ce soit spécifié par la politique ILM ou à la suite de copies perdues. Ce compteur s’incrémente chaque fois qu’un nœud de stockage tente de réparer un objet à haut risque. Les réparations ILM à haut risque sont prioritaires si la grille devient occupée.
La tentative de réparation d'un même objet peut être incrémentée à nouveau si la réplication échoue après la réparation. Ces attributs peuvent être utiles lorsque vous surveillez la progression de la récupération du volume du nœud de stockage. Si le nombre de tentatives de réparation a cessé d'augmenter et qu'une analyse complète a été effectuée, la réparation est probablement terminée.
-
-
Vous pouvez également soumettre une requête Prometheus pour
storagegrid_ilm_scan_period_estimated_minutesetstoragegrid_ilm_repairs_attempted.
-
Pour surveiller la réparation des données à codage d'effacement et réessayer les requêtes ayant pu échouer :
-
Déterminez l'état des réparations des données codées par effacement :
-
Sélectionnez Support > Outils > Métriques pour afficher le temps estimé jusqu'à l'achèvement et le pourcentage d'achèvement de la tâche en cours. Ensuite, sélectionnez EC Overview dans la section Grafana. Consultez les tableaux de bord Grid EC Job Estimated Time to Completion et Grid EC Job Percentage Completed.
-
Utilisez cette commande pour consulter l'état d'une opération `repair-data`spécifique :
repair-data show-ec-repair-status --repair-id repair ID -
Utilisez cette commande pour lister toutes les réparations :
repair-data show-ec-repair-status
La liste des résultats contient des informations, y compris
repair ID, sur toutes les réparations précédemment effectuées et en cours. -
-
Si le résultat indique que l'opération de réparation a échoué, utilisez l'option
--repair-idpour réessayer la réparation.Cette commande réessaie une réparation de nœud ayant échoué, en utilisant l'ID de réparation 6949309319275667690 :
repair-data start-ec-node-repair --repair-id 6949309319275667690Cette commande réessaie une réparation de volume ayant échoué, en utilisant l'ID de réparation 6949309319275667690 :
repair-data start-ec-volume-repair --repair-id 6949309319275667690
Dès que les nœuds déconnectés auront été mis hors service et que toutes les tâches de réparation des données auront été terminées, vous pouvez mettre hors service, si nécessaire, tous les nœuds de grille connectés.
Ensuite, effectuez les étapes suivantes une fois la procédure de mise hors service terminée :
-
Assurez-vous que les disques du nœud de grille mis hors service soient effacés. Utilisez un outil ou un service d'effacement de données disponible dans le commerce pour supprimer définitivement et en toute sécurité les données des disques.
-
Si vous avez mis hors service un nœud d'appliance et que les données sur l'appliance étaient protégées à l'aide du chiffrement de nœud, utilisez le StorageGRID Appliance Installer pour effacer la configuration du serveur de gestion des clés (Effacer KMS). Vous devez effacer la configuration KMS si vous souhaitez ajouter l'appliance à une autre grille. Pour obtenir des instructions, consultez "Surveiller le chiffrement du nœud en mode maintenance".