Skip to main content
Une version plus récente de ce produit est disponible.
La version française est une traduction automatique. La version anglaise prévaut sur la française en cas de divergence.

Dépanner les services de plateforme StorageGRID

Les points de terminaison utilisés dans les services de la plateforme sont créés et gérés par les utilisateurs locataires dans le Tenant Manager. Cependant, si un locataire rencontre des difficultés pour configurer ou utiliser les services de la plateforme, vous pouvez utiliser le Grid Manager pour aider à résoudre le problème.

Problèmes liés aux nouveaux points de terminaison

Avant qu'un locataire puisse utiliser les services de la plateforme, il doit créer un ou plusieurs points de terminaison à l'aide du Tenant Manager. Chaque point de terminaison représente une destination externe pour un service de la plateforme, telle qu'un compartiment StorageGRID S3, un compartiment Amazon Web Services, un sujet Amazon Simple Notification Service, un sujet Kafka ou un cluster Elasticsearch hébergé localement ou sur AWS. Chaque point de terminaison inclut à la fois l'emplacement de la ressource externe et les informations d'identification nécessaires pour accéder à cette ressource.

Lorsqu'un locataire crée un point de terminaison, le système StorageGRID vérifie que le point de terminaison existe et qu'il est accessible à l'aide des identifiants spécifiés. La connexion au point de terminaison est validée à partir d'un nœud sur chaque site.

En cas d'échec de la validation du point de terminaison, un message d'erreur explique la raison de cet échec. L'utilisateur du locataire doit résoudre le problème, puis essayer de créer à nouveau le point de terminaison.

Remarque La création du point de terminaison échouera si les services de la plateforme ne sont pas activés pour le compte du locataire.

Problèmes liés aux points de terminaison existants

Si une erreur se produit lorsque StorageGRID tente d'atteindre un point de terminaison existant, un message s'affiche sur le tableau de bord du Tenant Manager.

Message d'erreur du point de terminaison sur le tableau de bord

Les utilisateurs locataires peuvent accéder à la page « Points de terminaison » pour examiner le message d'erreur le plus récent pour chaque point de terminaison et déterminer depuis combien de temps l'erreur s'est produite. La colonne « Dernière erreur » affiche le message d'erreur le plus récent pour chaque point de terminaison et indique depuis combien de temps l'erreur s'est produite. Les erreurs qui incluent l'icône Icône X rouge se sont produites au cours des 7 derniers jours.

Capture d'écran de la page Endpoints affichant la colonne Dernière erreur

Remarque Certains messages d'erreur de la colonne Dernière erreur peuvent contenir un logID entre parenthèses. Un administrateur de grille ou le support technique peut utiliser ce logID pour trouver des informations plus détaillées sur l'erreur dans le fichier bycast.log.

Si vous avez configuré un "proxy de stockage" entre les nœuds de stockage et les points de terminaison des services de la plateforme, des erreurs peuvent survenir si votre service proxy n'autorise pas les messages provenant de StorageGRID. Pour résoudre ces problèmes, vérifiez les paramètres de votre serveur proxy afin de vous assurer que les messages relatifs aux services de la plateforme ne sont pas bloqués.

Déterminez si une erreur s'est produite

Si des erreurs de point de terminaison se sont produites au cours des 7 derniers jours, le tableau de bord du Tenant Manager affiche un message d'alerte. Vous pouvez accéder à la page Endpoints pour voir plus de détails sur l'erreur.

Les opérations du client échouent

Certains problèmes liés aux services de la plateforme peuvent entraîner l'échec des opérations client sur le compartiment S3. Par exemple, les opérations client S3 échoueront si le service interne Replicated State Machine (RSM) s'arrête ou si un trop grand nombre de messages de services de plateforme sont en attente de livraison.

Pour vérifier l'état des services :

  1. Sélectionnez Nodes > site > Storage Node > Overview.

  2. Vérifiez les alertes actives dans le tableau des alertes.

  3. Résolvez les alertes en cours. Au besoin, contactez le support technique.

Erreurs de point de terminaison récupérables et irrécupérables

Une fois les points de terminaison créés, des erreurs de requête de service de la plateforme peuvent survenir pour diverses raisons. Certaines erreurs sont récupérables avec l'intervention de l'utilisateur. Par exemple, des erreurs récupérables peuvent survenir pour les raisons suivantes :

  • Les identifiants de l'utilisateur ont été supprimés ou ont expiré.

  • Le compartiment de destination n'existe pas.

  • La notification ne peut pas être transmise.

Si StorageGRID rencontre une erreur récupérable, la requête de service de la plateforme sera réessayée jusqu'à ce qu'elle réussisse.

D'autres erreurs sont irrécupérables. Par exemple, des erreurs irrécupérables peuvent survenir pour les raisons suivantes :

  • Le point de terminaison a été supprimé.

  • Un point de terminaison webhook de destination répond à une requête de notification par une erreur 400 Bad Request.

Si StorageGRID rencontre une erreur de point de terminaison irrécupérable :

  • Dans le Gestionnaire de grille, accédez à Support > Outils > Métriques > Grafana > Platform Services Overview pour afficher les détails de l'erreur.

  • Dans le Gestionnaire de locataires, accédez à STOCKAGE (S3) > Points de terminaison des services de plateforme pour afficher les détails de l'erreur.

  • Vérifiez la /var/local/log/bycast-err.log pour les erreurs associées. Les nœuds de stockage disposant du service ADC contiennent ce fichier journal.

Les messages des services de la plateforme ne peuvent pas être remis.

Si la destination rencontre un problème l'empêchant de recevoir les messages des services de plateforme, l'opération client sur le compartiment réussit, mais le message des services de plateforme n'est pas transmis. Par exemple, cette erreur peut se produire si les informations d'identification sont mises à jour sur la destination et que StorageGRID ne peut plus s'authentifier auprès du service de destination.

Vérifiez les alertes associées.

Performances ralenties pour les requêtes de service de la plateforme

Le logiciel StorageGRID peut limiter le nombre de requêtes S3 entrantes pour un compartiment si le débit d'envoi des requêtes dépasse le débit auquel le point de terminaison de destination peut les recevoir. La limitation ne se produit que lorsqu'il y a un retard d'envoi des requêtes en attente vers le point de terminaison de destination.

Le seul effet visible est un allongement du temps d'exécution des requêtes S3 entrantes. Si vous constatez un ralentissement significatif des performances, vous devez réduire le débit d'ingestion ou utiliser un point de terminaison offrant une capacité supérieure. Si le nombre de requêtes en attente continue d'augmenter, les opérations S3 côté client (telles que les requêtes PUT) finiront par échouer.

CloudMirror Les requêtes sont plus susceptibles d'être affectées par les performances du point de terminaison de destination, car elles impliquent généralement plus de transfert de données que les requêtes d'intégration de recherche ou de notification d'événements.

Les requêtes de service de la plateforme échouent

Pour consulter le taux d'échec des requêtes pour les services de la plateforme :

  1. Sélectionnez Nœuds.

  2. Sélectionnez site > Services de plateforme.

  3. Consultez le graphique du taux d'erreur des requêtes.

    Services de plateforme de la page des nœuds au niveau du site

Alerte d'indisponibilité des services de la plateforme

L'alerte Services de plateforme indisponibles indique qu'aucune opération de service de plateforme ne peut être effectuée sur un site, car trop peu de nœuds de stockage avec le service RSM sont en cours d'exécution ou disponibles.

Le service RSM garantit que les requêtes de service de la plateforme sont envoyées à leurs points de terminaison respectifs.

Pour résoudre cette alerte, identifiez les nœuds de stockage du site qui hébergent le service RSM. (Le service RSM est présent sur les nœuds de stockage qui hébergent également le service ADC.) Ensuite, assurez-vous qu'une majorité simple de ces nœuds de stockage sont en cours d'exécution et disponibles.

Remarque Si plusieurs nœuds de stockage contenant le service RSM tombent en panne sur un site, vous perdez toutes les requêtes de service de plateforme en attente pour ce site.

Conseils de dépannage supplémentaires pour les points de terminaison des services de plateforme