Métriques Prometheus couramment utilisées dans StorageGRID
Consultez cette liste de métriques Prometheus couramment utilisées pour mieux comprendre les conditions des règles d'alerte par défaut ou pour construire les conditions des règles d'alerte personnalisées.
Vous pouvez également obtenir une liste complète de toutes les métriques.
Pour plus de détails sur la syntaxe des requêtes Prometheus, voir "Interroger Prometheus".
Que sont les métriques Prometheus ?
Les métriques Prometheus sont des mesures de séries temporelles. Le service Prometheus sur les nœuds d'administration collecte ces métriques auprès des services présents sur tous les nœuds. Les métriques sont stockées sur chaque nœud d'administration jusqu'à ce que l'espace réservé aux données Prometheus soit plein. Lorsque le /var/local/mysql_ibdata/ volume atteint sa capacité, les métriques les plus anciennes sont supprimées en premier.
Où les métriques Prometheus sont-elles utilisées ?
Les métriques collectées par Prometheus sont utilisées à plusieurs endroits dans le Grid Manager :
-
Page « Nœuds » : Les graphiques et diagrammes des onglets de la page « Nœuds » utilisent l’outil de visualisation Grafana pour afficher les métriques de séries temporelles collectées par Prometheus. Grafana affiche les données de séries temporelles sous forme de graphiques et de diagrammes, tandis que Prometheus sert de source de données principale.

-
Alertes : Les alertes sont déclenchées à des niveaux de gravité spécifiques lorsque les conditions des règles d’alerte utilisant les métriques Prometheus sont évaluées comme vraies.
-
API de gestion du Grid : Vous pouvez utiliser les métriques Prometheus dans des règles d'alerte personnalisées ou avec des outils d'automatisation externes pour surveiller votre système StorageGRID. La liste complète des métriques Prometheus est disponible via l'API de gestion du Grid. (En haut du Grid Manager, sélectionnez l'icône d'aide et sélectionnez API documentation > metrics.) Bien que plus d'un millier de métriques soient disponibles, seul un nombre relativement restreint est nécessaire pour surveiller les opérations StorageGRID les plus critiques.
Les indicateurs dont le nom inclut private sont destinés à un usage interne uniquement et peuvent être modifiés entre les versions de StorageGRID sans préavis. -
La page Support > Outils > Diagnostics et la page Support > Outils > Métriques : ces pages, principalement destinées au support technique, fournissent plusieurs outils et graphiques qui utilisent les valeurs des métriques Prometheus.
Certaines fonctionnalités et certains éléments de menu de la page Métriques sont intentionnellement non fonctionnels et sont susceptibles d'être modifiés.
Liste des indicateurs les plus courants
La liste suivante contient les métriques Prometheus les plus couramment utilisées.
|
|
Les indicateurs dont le nom inclut private sont réservés à un usage interne et peuvent être modifiés sans préavis entre les versions de StorageGRID. |
- alertmanager_notifications_failed_total
-
Nombre total de notifications d'alerte ayant échoué.
- octets disponibles du système de fichiers du nœud
-
La quantité d'espace du système de fichiers disponible pour les utilisateurs non root, en octets.
- node_memory_MemAvailable_bytes
-
Champ d'information mémoire MemAvailable_bytes.
- node_network_carrier
-
Valeur porteuse de
/sys/class/net/iface. - total des erreurs de réception du réseau du nœud
-
Statistiques des périphériques réseau
receive_errs. - total des erreurs de transmission du réseau du nœud
-
Statistiques des périphériques réseau
transmit_errs. - storagegrid_administratively_down
-
Le nœud n'est pas connecté à la grille pour une raison prévue. Par exemple, le nœud, ou les services sur le nœud, a été arrêté correctement, le nœud est en cours de redémarrage ou le logiciel est en cours de mise à niveau.
- état du matériel du contrôleur de calcul StorageGRID Appliance
-
État du matériel du contrôleur de calcul dans un appareil.
- disques défaillants de l'appliance StorageGRID
-
Pour le contrôleur de stockage d'un appareil, le nombre de disques qui ne sont pas optimaux.
- storagegrid_appliance_état_matériel_contrôleur_de_stockage
-
État général du matériel du contrôleur de stockage dans un appliance.
- storagegrid_content_buckets_and_containers
-
Le nombre total de compartiments S3 connus par ce nœud de stockage.
- storagegrid_content_objects
-
Nombre total d'objets de données S3 connus de ce Storage Node. Ce nombre est valable uniquement pour les objets de données créés par les applications clientes qui interagissent avec le système via S3.
- objets de contenu StorageGRID perdus
-
Le nombre total d'objets que ce service détecte comme manquants dans le système StorageGRID. Des mesures doivent être prises pour déterminer la cause de la perte et évaluer la possibilité de récupération.
- storagegrid_sessions_http_entrantes_tentées
-
Le nombre total de sessions HTTP qui ont été tentées vers un Storage Node.
- storagegrid_http_sessions_incoming_currently_established
-
Le nombre de sessions HTTP actuellement actives (ouvertes) sur le Storage Node.
- échec des sessions HTTP entrantes StorageGRID
-
Le nombre total de sessions HTTP qui n'ont pas pu aboutir, soit en raison d'une requête HTTP malformée, soit en raison d'une erreur lors du traitement d'une opération.
- storagegrid_http_sessions_incoming_successful
-
Le nombre total de sessions HTTP qui se sont terminées avec succès.
- storagegrid_ilm_en_attente_objets_arrière-plan
-
Le nombre total d'objets sur ce nœud en attente d'évaluation ILM à partir de l'analyse.
- storagegrid_ilm_awaiting_client_evaluation_objects_per_second
-
Le taux actuel auquel les objets sont évalués par rapport à la politique ILM sur ce nœud.
- storagegrid_ilm_awaiting_client_objects
-
Le nombre total d'objets sur ce nœud en attente d'évaluation ILM suite aux opérations du client (par exemple, ingestion).
- storagegrid_ilm_awaiting_total_objects
-
Nombre total d'objets en attente d'évaluation ILM.
- storagegrid_ilm_scan_objects_per_second
-
Le taux auquel les objets appartenant à ce nœud sont analysés et mis en file d'attente pour ILM.
- storagegrid_ilm_scan_period_estimated_minutes
-
Le temps estimé pour effectuer une analyse ILM complète sur ce nœud.
Remarque : Une analyse complète ne garantit pas que ILM a été appliqué à tous les objets appartenant à ce nœud.
- délai d'expiration du certificat du point de terminaison de l'équilibreur de charge StorageGRID
-
La durée d'expiration du certificat du point de terminaison de l'équilibreur de charge en secondes depuis l'époque.
- latence_moyenne_millisecondes des requêtes de métadonnées StorageGRID
-
Le temps moyen nécessaire pour exécuter une requête sur le magasin de métadonnées via ce service.
- octets reçus par le réseau StorageGRID
-
Quantité totale de données reçues depuis l'installation.
- octets transmis par le réseau StorageGRID
-
Quantité totale de données envoyées depuis l'installation.
- pourcentage d'utilisation du processeur du nœud StorageGRID
-
Le pourcentage de temps processeur disponible actuellement utilisé par ce service. Indique le niveau de charge du service. La quantité de temps processeur disponible dépend du nombre de processeurs du serveur.
- storagegrid_ntp_chosen_time_source_offset_milliseconds
-
Décalage temporel systématique fourni par une source de temps choisie. Un décalage est introduit lorsque le délai pour atteindre une source de temps n'est pas égal au temps nécessaire pour que la source de temps atteigne le client NTP.
- storagegrid_ntp_locked
-
Le nœud n'est pas verrouillé sur un serveur Network Time Protocol (NTP).
- storagegrid_s3_data_transfers_bytes_ingested
-
Quantité totale de données ingérées par les clients S3 vers ce Storage Node depuis la dernière réinitialisation de l'attribut.
- storagegrid_s3_data_transfers_bytes_retrieved
-
Quantité totale de données récupérées par les clients S3 à partir de ce Storage Node depuis la dernière réinitialisation de l'attribut.
- storagegrid_s3_operations_failed
-
Le nombre total d'opérations S3 ayant échoué (codes d'état HTTP 4xx et 5xx), à l'exclusion de celles causées par un échec d'autorisation S3.
- storagegrid_s3_operations_successful
-
Le nombre total d'opérations S3 réussies (code d'état HTTP 2xx).
- storagegrid_s3_operations_unauthorized
-
Le nombre total d'opérations S3 ayant échoué en raison d'un échec d'autorisation.
- storagegrid_servercertificate_management_interface_cert_expiry_days
-
Nombre de jours avant l'expiration du certificat de l'interface de gestion.
- storagegrid_servercertificate_storage_api_endpoints_cert_expiry_days
-
Nombre de jours avant l'expiration du certificat de l'API Object Storage.
- storagegrid_service_cpu_seconds
-
Durée cumulée d'utilisation du processeur par ce service depuis son installation.
- storagegrid_service_memory_usage_bytes
-
Quantité de mémoire vive (RAM) actuellement utilisée par ce service. Cette valeur est identique à celle affichée par l'utilitaire Linux top sous la forme RES.
- octets reçus par le réseau du service StorageGRID
-
${post_edited_translations.segment}
- octets transmis par le réseau du service StorageGRID
-
Quantité totale de données envoyées par ce service.
- ${post_edited_translations.segment}
-
${post_edited_translations.segment}
- ${post_edited_translations.segment}
-
${post_edited_translations.segment}
- storagegrid_service_uptime_seconds
-
${post_edited_translations.segment}
- ${post_edited_translations.segment}
-
État actuel des services de stockage. Les valeurs des attributs sont :
-
${post_edited_translations.segment}
-
15 = Maintenance
-
${post_edited_translations.segment}
-
${post_edited_translations.segment}
-
- storagegrid_storage_status
-
L'état actuel des services de stockage. Les valeurs d'attribut sont :
-
0 = Aucune erreur
-
10 = En transition
-
${post_edited_translations.segment}
-
30 = Volume(s) indisponible(s)
-
${post_edited_translations.segment}
-
- ${post_edited_translations.segment}
-
Une estimation de la taille totale des données d’objets répliquées et codées par effacement sur le Storage Node.
- ${post_edited_translations.segment}
-
L'espace total sur le volume 0 de chaque nœud de stockage autorisé pour les métadonnées d'objet. Cette valeur est toujours inférieure à l'espace réel réservé aux métadonnées sur un nœud, car une partie de l'espace réservé est requise pour les opérations essentielles de la base de données (telles que le compactage et la réparation) et les futures mises à niveau matérielles et logicielles.L'espace autorisé pour les métadonnées d'objet contrôle la capacité globale d'objets.
- storagegrid_storage_utilization_metadata_bytes
-
Quantité de métadonnées d'objet sur le volume de stockage 0, en octets.
- ${post_edited_translations.segment}
-
La quantité totale d'espace de stockage allouée à tous les magasins d'objets.
- storagegrid_storage_utilization_usable_space_bytes
-
La quantité totale d'espace de stockage d'objets restant. Calculée en additionnant la quantité d'espace disponible pour tous les magasins d'objets sur le Storage Node.
- storagegrid_tenant_usage_data_bytes
-
${post_edited_translations.segment}
- ${post_edited_translations.segment}
-
Le nombre d'objets pour le locataire.
- ${post_edited_translations.segment}
-
L'espace logique maximal disponible pour les objets du locataire. Si aucune métrique de quota n'est fournie, une quantité illimitée d'espace est disponible.