Vérifiez l'intégrité des données d'objet dans StorageGRID
Le système StorageGRID vérifie l'intégrité des données d'objets sur les nœuds de stockage, en contrôlant les objets corrompus et manquants.
Il existe deux processus de vérification : la vérification en arrière-plan et le contrôle d'existence des objets (auparavant appelé vérification au premier plan). Ils fonctionnent ensemble pour garantir l'intégrité des données. La vérification en arrière-plan s'exécute automatiquement et vérifie en continu l'exactitude des données d'objet. Un utilisateur peut déclencher le contrôle d'existence des objets afin de vérifier plus rapidement l'existence (mais pas l'exactitude) des objets.
Qu'est-ce que la vérification des antécédents ?
Le processus de vérification en arrière-plan contrôle automatiquement et en continu les nœuds de stockage à la recherche de copies corrompues de données d'objets et tente automatiquement de réparer tout problème détecté.
La vérification en arrière-plan contrôle l'intégrité des objets répliqués et des objets à codage d'effacement, comme suit :
-
Objets répliqués : Si le processus de vérification en arrière-plan détecte un objet répliqué corrompu, la copie corrompue est supprimée de son emplacement et mise en quarantaine ailleurs sur le nœud de stockage. Ensuite, une nouvelle copie non corrompue est générée et placée afin de satisfaire les politiques ILM actives. La nouvelle copie peut ne pas être placée sur le nœud de stockage utilisé pour la copie d'origine.
|
|
Les données d'objet corrompues sont mises en quarantaine plutôt que supprimées du système, afin qu'elles restent accessibles. Pour plus d'informations sur l'accès aux données d'objet mises en quarantaine, contactez le support technique. |
-
Objets à codage d'effacement : Si le processus de vérification en arrière-plan détecte qu'un fragment d'un objet à codage d'effacement est corrompu, StorageGRID tente automatiquement de reconstruire le fragment manquant sur place sur le même nœud de stockage, en utilisant les fragments de données et de parité restants. Si le fragment corrompu ne peut pas être reconstruit, une tentative de récupération d'une autre copie de l'objet est effectuée. En cas de succès, une évaluation ILM est réalisée afin de créer une copie de remplacement de l'objet à codage d'effacement.
Le processus de vérification en arrière-plan vérifie uniquement les objets sur les nœuds de stockage. Il ne vérifie pas les objets dans un pool de stockage cloud. Les objets doivent dater de plus de quatre jours pour être éligibles à la vérification en arrière-plan.
La vérification en arrière-plan s'exécute en continu afin de ne pas perturber les activités ordinaires du système. La vérification en arrière-plan ne peut pas être arrêtée. Cependant, vous pouvez augmenter la fréquence de la vérification en arrière-plan pour vérifier plus rapidement le contenu d'un Storage Node si vous suspectez un problème.
Alertes liées à la vérification en arrière-plan
Si le système détecte un objet corrompu qu'il ne peut pas corriger automatiquement (car la corruption empêche l'identification de l'objet), l'alerte Objet corrompu non identifié détecté est déclenchée.
Si la vérification en arrière-plan ne peut pas remplacer un objet corrompu parce qu'elle ne peut pas localiser une autre copie, l'alerte Objets potentiellement perdus est déclenchée.
Qu'est-ce qu'une vérification d'existence d'objet ?
La vérification de l'existence des objets vérifie si toutes les copies répliquées attendues des objets et les fragments codés par effacement existent sur un nœud de stockage. La vérification de l'existence des objets ne vérifie pas les données d'objet elles-mêmes (la vérification en arrière-plan s'en charge) ; elle permet plutôt de vérifier l'intégrité des périphériques de stockage, en particulier si un problème matériel récent a pu affecter l'intégrité des données.
Contrairement à la vérification en arrière-plan, qui s'effectue automatiquement, vous devez lancer manuellement une tâche de vérification de l'existence d'un objet.
La vérification d'existence des objets lit les métadonnées de chaque objet stocké dans StorageGRID et vérifie l'existence des copies répliquées d'objets ainsi que des fragments d'objets codés par effacement. Toute donnée manquante est traitée comme suit :
-
Copies répliquées : si une copie de données d'objet répliquées est manquante, StorageGRID tente automatiquement de remplacer la copie à partir d'une copie stockée ailleurs dans le système. Le nœud de stockage soumet une copie existante à une évaluation ILM, qui déterminera que la politique ILM actuelle n'est plus respectée pour cet objet car une autre copie est manquante. Une nouvelle copie est générée et placée pour satisfaire aux politiques ILM actives du système. Cette nouvelle copie peut ne pas être placée au même emplacement que celui où la copie manquante était stockée.
-
Fragments à codage d'effacement : Si un fragment d'un objet à codage d'effacement est manquant, StorageGRID tente automatiquement de reconstruire le fragment manquant sur le même nœud de stockage à partir des fragments restants. Si le fragment manquant ne peut pas être reconstruit (en raison d'un trop grand nombre de fragments perdus), ILM tente de trouver une autre copie de l'objet, qu'il peut utiliser pour générer un nouveau fragment à codage d'effacement.
Exécutez une vérification de l'existence de l'objet
Vous créez et exécutez une seule tâche de vérification de l'existence des objets à la fois. Lorsque vous créez une tâche, vous sélectionnez les Storage Nodes et les volumes que vous souhaitez vérifier. Vous sélectionnez également la cohérence pour la tâche.
-
Vous êtes connecté au Gestionnaire de grille à l'aide d'un "navigateur Web pris en charge".
-
Vous avez le "Autorisation d'accès à la maintenance ou à la racine".
-
Vous vous êtes assuré que les nœuds de stockage que vous souhaitez vérifier sont en ligne. Sélectionnez Nodes pour afficher le tableau des nœuds. Assurez-vous qu'aucune icône d'alerte n'apparaît à côté du nom du nœud pour les nœuds que vous souhaitez vérifier.
-
Vous avez vérifié que les procédures suivantes ne sont pas en cours d'exécution sur les nœuds que vous souhaitez contrôler :
-
Extension de la grille pour ajouter un nœud de stockage
-
Mise hors service du nœud de stockage
-
Récupération d'un volume de stockage défaillant
-
Récupération d'un nœud de stockage dont le disque système est défaillant
-
Rééquilibrage EC
-
Clone de nœud d'appliance
-
La vérification de l'existence de l'objet ne fournit pas d'informations utiles pendant l'exécution de ces procédures.
La vérification de l'existence d'un objet peut prendre plusieurs jours, voire plusieurs semaines, selon le nombre d'objets dans la grille, les nœuds et volumes de stockage sélectionnés, ainsi que la cohérence sélectionnée. Vous ne pouvez exécuter qu'une seule tâche à la fois, mais vous pouvez sélectionner plusieurs Storage Nodes et volumes simultanément.
-
Sélectionnez Maintenance > Tâches > Vérification de l'existence de l'objet.
-
Sélectionnez Créer une tâche. L'assistant Créer une tâche de vérification de l'existence d'un objet s'affiche.
-
Sélectionnez les nœuds contenant les volumes que vous souhaitez vérifier. Pour sélectionner tous les nœuds en ligne, cochez la case Node name dans l'en-tête de colonne.
Vous pouvez effectuer une recherche par nom de nœud ou par site.
Vous ne pouvez pas sélectionner les nœuds qui ne sont pas connectés à la grille.
-
Sélectionnez Continue.
-
Sélectionnez un ou plusieurs volumes pour chaque nœud de la liste. Vous pouvez rechercher des volumes à l'aide du numéro de volume de stockage ou du nom du nœud.
Pour sélectionner tous les volumes pour chaque nœud que vous avez sélectionné, cochez la case Volume de stockage dans l'en-tête de colonne.
-
Sélectionnez Continue.
-
Sélectionnez la cohérence pour la tâche.
La cohérence détermine le nombre de copies des métadonnées de l'objet utilisées pour la vérification de l'existence de l'objet.
-
Site fort : Deux copies des métadonnées sur un seul site.
-
Fort-global : Deux copies des métadonnées sur chaque site.
-
Tous (par défaut) : Les trois copies des métadonnées sur chaque site.
Pour plus d'informations sur la cohérence, consultez les descriptions de l'assistant.
-
-
Sélectionnez Continue.
-
Examinez et vérifiez vos sélections. Vous pouvez sélectionner Précédent pour revenir à une étape précédente de l'assistant afin de mettre à jour vos sélections.
Une tâche de vérification d'existence d'objet est générée et s'exécute jusqu'à ce que l'un des événements suivants se produise :
-
La tâche est terminée.
-
Vous mettez la tâche en pause ou vous l'annulez. Vous pouvez reprendre une tâche que vous avez mise en pause, mais vous ne pouvez pas reprendre une tâche que vous avez annulée.
-
La tâche se bloque. L'alerte Object existence check has stalled est déclenchée. Suivez les actions correctives spécifiées pour l'alerte.
-
La tâche échoue. L'alerte La vérification de l'existence de l'objet a échoué est déclenchée. Suivez les actions correctives spécifiées pour l'alerte.
-
Un message « Service indisponible » ou « Erreur interne du serveur » s’affiche. Après une minute, actualisez la page pour continuer à surveiller la tâche.
Au besoin, vous pouvez quitter la page de vérification de l'existence de l'objet et y revenir pour continuer à surveiller la tâche.
-
-
Pendant l'exécution de la tâche, consultez l'onglet Tâche active et notez la valeur de Missing object copies detected.
Cette valeur représente le nombre total de copies manquantes d'objets répliqués et d'objets codés par effacement comportant un ou plusieurs fragments manquants.
Si le nombre de copies d'objets manquantes détectées est supérieur à 100, il pourrait y avoir un problème avec le stockage du nœud de stockage.
-
Une fois le travail terminé, prenez toutes les mesures supplémentaires requises :
-
Si le nombre de copies d'objets manquantes détectées est nul, aucun problème n'a été trouvé. Aucune action n'est requise.
-
Si la valeur de Copies d'objets manquantes détectées est supérieure à zéro et que l'alerte Objets potentiellement perdus n'a pas été déclenchée, toutes les copies manquantes ont été réparées par le système. Vérifiez que tous les problèmes matériels ont été corrigés afin d'éviter d'endommager les copies d'objets à l'avenir.
-
Si le nombre de copies d'objets manquantes détectées est supérieur à zéro et que l'alerte Objets potentiellement perdus a été déclenchée, alors l'intégrité des données pourrait être affectée. Contactez le support technique.
-
Vous pouvez rechercher les copies d'objets potentiellement perdues en utilisant grep pour extraire les messages d'audit LLST :
grep LLST audit_file_name.Cette procédure est similaire à celle pour "enquête sur des objets potentiellement perdus", bien que pour les copies d'objets, vous recherchiez
LLSTau lieu deOLST.
-
-
Si vous avez sélectionné la cohérence forte du site ou la cohérence forte globale pour la tâche, attendez environ trois semaines pour la cohérence des métadonnées, puis relancez la tâche sur les mêmes volumes.
Lorsque StorageGRID a eu le temps d'assurer la cohérence des métadonnées pour les nœuds et les volumes inclus dans la tâche, la réexécution de la tâche peut corriger les copies d'objets manquantes signalées par erreur ou entraîner la vérification de copies d'objets supplémentaires si elles ont été omises.
-
Sélectionnez Maintenance > Vérification de l’existence de l’objet > Historique des travaux.
-
Déterminez quelles tâches sont prêtes à être réexécutées :
-
Consultez la colonne Heure de fin pour déterminer quelles tâches ont été exécutées il y a plus de trois semaines.
-
Pour ces tâches, parcourez la colonne Consistency control pour trouver strong-site ou strong-global.
-
-
Cochez la case correspondant à chaque tâche que vous souhaitez relancer, puis sélectionnez Relancer.
-
Dans l'assistant de réexécution des tâches, vérifiez les nœuds et les volumes sélectionnés ainsi que la cohérence.
-
Lorsque vous êtes prêt à relancer les tâches, sélectionnez Relancer.
-
L'onglet « Tâches actives » s'affiche. Toutes les tâches que vous avez sélectionnées sont réexécutées en une seule tâche avec une cohérence strong-site. Un champ Tâches associées dans la section Détails répertorie les identifiants des tâches d'origine.