Metriche Prometheus comunemente utilizzate in StorageGRID
Consulta questo elenco di metriche Prometheus comunemente utilizzate per comprendere meglio le condizioni delle regole di avviso predefinite o per definire le condizioni delle regole di avviso personalizzate.
Puoi anche ottenere un elenco completo di tutte le metriche.
Per i dettagli sulla sintassi delle query di Prometheus, vedi "Interrogare Prometheus".
Che cosa sono le metriche di Prometheus?
Le metriche Prometheus sono misurazioni di serie temporali. Il servizio Prometheus sui nodi di amministrazione raccoglie queste metriche dai servizi su tutti i nodi. Le metriche vengono memorizzate su ciascun nodo di amministrazione fino a quando lo spazio riservato ai dati di Prometheus è pieno. Quando il /var/local/mysql_ibdata/ volume raggiunge la capacità, le metriche più vecchie vengono eliminate per prime.
Dove vengono utilizzate le metriche di Prometheus?
Le metriche raccolte da Prometheus vengono utilizzate in diversi punti del Grid Manager:
-
Pagina Nodi: I grafici e i diagrammi presenti nelle schede disponibili nella pagina Nodi utilizzano lo strumento di visualizzazione Grafana per mostrare le metriche delle serie temporali raccolte da Prometheus. Grafana visualizza i dati delle serie temporali in formato grafico e diagrammatico, mentre Prometheus funge da origine dati backend.

-
Avvisi: Gli avvisi vengono attivati a specifici livelli di gravità quando le condizioni delle regole di avviso che utilizzano metriche Prometheus risultano vere.
-
Grid Management API: Puoi usare le metriche Prometheus nelle regole di avviso personalizzate o con strumenti di automazione esterni per monitorare il tuo sistema StorageGRID. Un elenco completo delle metriche Prometheus è disponibile tramite la Grid Management API. (Dalla parte superiore di Grid Manager, seleziona l'icona di aiuto e scegli API documentation > metrics.) Anche se sono disponibili oltre mille metriche, solo un numero relativamente piccolo è necessario per monitorare le operazioni StorageGRID più critiche.
Le metriche che includono private nel loro nome sono destinate esclusivamente all'uso interno e sono soggette a modifiche tra le versioni di StorageGRID senza preavviso. -
Le pagine Supporto > Strumenti > Diagnostica e Supporto > Strumenti > Metriche: queste pagine, destinate principalmente all'utilizzo da parte del supporto tecnico, forniscono diversi strumenti e grafici che utilizzano i valori delle metriche Prometheus.
Alcune funzionalità e voci di menu all'interno della pagina Metriche sono intenzionalmente non funzionanti e sono soggette a modifiche.
Elenco delle metriche più comuni
Il seguente elenco contiene le metriche Prometheus più comunemente utilizzate.
|
|
Le metriche che includono private nel loro nome sono destinate esclusivamente all'uso interno e sono soggette a modifiche senza preavviso tra una versione e l'altra di StorageGRID. |
- alertmanager_notifications_failed_total
-
Il numero totale di notifiche di avviso non riuscite.
- node_filesystem_avail_bytes
-
Quantità di spazio file system disponibile per gli utenti non root, in byte.
- node_memory_MemAvailable_bytes
-
Campo delle informazioni sulla memoria MemAvailable_bytes.
- node_network_carrier
-
Valore del vettore
/sys/class/net/iface. - node_network_receive_errs_total
-
Statistiche del dispositivo di rete
receive_errs. - node_network_transmit_errs_total
-
Statistiche del dispositivo di rete
transmit_errs. - storagegrid_amministrativamente_disattivato
-
Il nodo non è connesso alla grid per un motivo previsto. Ad esempio, il nodo, o i servizi sul nodo, sono stati arrestati correttamente, il nodo è in fase di riavvio oppure il software è in fase di aggiornamento.
- stato hardware del controller di calcolo dell'appliance StorageGRID
-
Lo stato dell'hardware del compute controller in un appliance.
- dischi guasti dell'appliance StorageGRID
-
Per lo storage controller in un appliance, il numero di drive che non sono ottimali.
- storagegrid_appliance_storage_controller_hardware_status
-
Lo stato generale dell'hardware dello storage controller in un appliance.
- bucket e container di StorageGRID
-
Il numero totale di bucket S3 noti a questo Storage Node.
- storagegrid_content_objects
-
Il numero totale di oggetti dati S3 noti a questo Storage Node. Il conteggio è valido solo per gli oggetti dati creati dalle applicazioni client che interagiscono con il sistema tramite S3.
- storagegrid_content_objects_lost
-
Il numero totale di oggetti che questo servizio rileva come mancanti dal sistema StorageGRID. Dovresti intervenire per determinare la causa della perdita e se è possibile recuperarli.
- storagegrid_http_sessions_incoming_attempted
-
Il numero totale di sessioni HTTP che sono state tentate verso uno Storage Node.
- storagegrid_http_sessions_incoming_currently_established
-
Il numero di sessioni HTTP attualmente attive (aperte) sullo Storage Node.
- storagegrid_http_sessions_incoming_failed
-
Il numero totale di sessioni HTTP che non sono state completate con successo, a causa di una richiesta HTTP non valida o di un errore durante l'elaborazione di un'operazione.
- storagegrid_http_sessions_incoming_successful
-
Il numero totale di sessioni HTTP completate con successo.
- storagegrid_ilm_awaiting_background_objects
-
Il numero totale di oggetti su questo nodo in attesa di valutazione ILM dalla scansione.
- storagegrid_ilm_awaiting_client_evaluation_objects_per_second
-
La frequenza attuale con cui gli oggetti vengono valutati rispetto alla policy ILM su questo nodo.
- storagegrid_ilm_awaiting_client_objects
-
Il numero totale di oggetti su questo nodo in attesa di valutazione ILM dalle operazioni del client (ad esempio, ingest).
- storagegrid_ilm_awaiting_total_objects
-
Il numero totale di oggetti in attesa di valutazione ILM.
- storagegrid_ilm_scan_objects_per_second
-
La frequenza con cui gli oggetti di proprietà di questo nodo vengono scansionati e messi in coda per ILM.
- minuti stimati del periodo di scansione ILM di StorageGRID
-
Tempo stimato per completare una scansione ILM completa su questo nodo.
Nota: Una scansione completa non garantisce che ILM sia stato applicato a tutti gli oggetti di proprietà di questo nodo.
- tempo di scadenza del certificato dell'endpoint del load balancer di StorageGRID
-
Il tempo di scadenza del certificato dell'endpoint del load balancer in secondi dall'epoca.
- latenza media delle query sui metadati di StorageGRID in millisecondi
-
Il tempo medio necessario per eseguire una query sullo store dei metadati tramite questo servizio.
- byte ricevuti dalla rete StorageGRID
-
Quantità totale di dati ricevuti dall'installazione.
- byte trasmessi dalla rete StorageGRID
-
Quantità totale di dati inviati dall'installazione.
- percentuale di utilizzo della CPU del nodo StorageGRID
-
La percentuale di tempo CPU disponibile attualmente utilizzata da questo servizio. Indica quanto il servizio sia occupato. La quantità di tempo CPU disponibile dipende dal numero di CPU del server.
- storagegrid_ntp_chosen_time_source_offset_milliseconds
-
Offset sistematico dell'ora fornito da una sorgente oraria selezionata. L'offset viene introdotto quando il ritardo per raggiungere una sorgente oraria non è uguale al tempo necessario affinché la sorgente oraria raggiunga il client NTP.
- storagegrid_ntp_locked
-
Il nodo non è vincolato a un server Network Time Protocol (NTP).
- storagegrid_s3_data_transfers_bytes_ingested
-
La quantità totale di dati acquisiti dai client S3 in questo Storage Node dall'ultimo ripristino dell'attributo.
- storagegrid_s3_data_transfers_bytes_retrieved
-
La quantità totale di dati recuperati dai client S3 da questo Storage Node dall'ultimo ripristino dell'attributo.
- storagegrid_s3_operations_failed
-
Numero totale di operazioni S3 non riuscite (codici di stato HTTP 4xx e 5xx), escluse quelle causate da errori di autorizzazione S3.
- storagegrid_s3_operations_successful
-
Numero totale di operazioni S3 riuscite (codice di stato HTTP 2xx).
- storagegrid_s3_operations_unauthorized
-
Il numero totale di operazioni S3 non riuscite a causa di un errore di autorizzazione.
- storagegrid_servercertificate_management_interface_cert_expiry_days
-
Il numero di giorni prima che il certificato dell'interfaccia di gestione scada.
- storagegrid_servercertificate_storage_api_endpoints_cert_expiry_days
-
Il numero di giorni prima che il certificato dell'API Object Storage scada.
- storagegrid_service_cpu_seconds
-
Il tempo complessivo in cui la CPU è stata utilizzata da questo servizio dall'installazione.
- storagegrid_service_memory_usage_bytes
-
La quantità di memoria (RAM) attualmente utilizzata da questo servizio. Questo valore è identico a quello visualizzato dall'utility top di Linux come RES.
- byte ricevuti dalla rete di servizi di StorageGRID
-
La quantità totale di dati ricevuti da questo servizio dall'installazione.
- byte trasmessi dalla rete del servizio StorageGRID
-
Quantità totale di dati inviati da questo servizio.
- riavvii del servizio StorageGRID
-
Il numero totale di volte in cui il servizio è stato riavviato.
- storagegrid_service_runtime_seconds
-
Il tempo totale in cui il servizio è stato in esecuzione dall'installazione.
- storagegrid_service_uptime_seconds
-
Il tempo totale in cui il servizio è stato in esecuzione dall'ultimo riavvio.
- storagegrid_storage_state_current
-
Stato attuale dei servizi di storage. I valori degli attributi sono:
-
10 = Offline
-
15 = Manutenzione
-
20 = Sola lettura
-
30 = Online
-
- storagegrid_storage_status
-
Stato attuale dei servizi di storage. I valori degli attributi sono:
-
0 = Nessun errore
-
10 = In transizione
-
20 = Spazio libero insufficiente
-
30 = Volume(i) non disponibili
-
40 = Errore
-
- storagegrid_storage_utilization_data_bytes
-
Una stima della dimensione totale dei dati degli oggetti replicati e codificati con cancellazione sul Storage Node.
- storagegrid_storage_utilization_metadata_allowed_bytes
-
Lo spazio totale sul volume 0 di ciascun Storage Node che è consentito per i metadati degli oggetti. Questo valore è sempre inferiore allo spazio effettivamente riservato per i metadati su un nodo, perché una parte dello spazio riservato è necessaria per operazioni essenziali del database (come compaction e riparazione) e per futuri aggiornamenti hardware e software. Lo spazio consentito per i metadati degli oggetti controlla la capacità complessiva degli oggetti.
- utilizzo dei metadati di StorageGRID
-
Quantità di metadati degli oggetti sul volume di storage 0, in byte.
- storagegrid_storage_utilization_total_space_bytes
-
La quantità totale di spazio di storage allocato a tutti gli object store.
- storagegrid_storage_utilization_usable_space_bytes
-
La quantità totale di spazio di storage a oggetti rimanente. Calcolata sommando la quantità di spazio disponibile per tutti gli object store sullo Storage Node.
- storagegrid_tenant_usage_data_bytes
-
La dimensione logica di tutti gli oggetti per il tenant.
- conteggio degli oggetti utilizzati dal tenant in StorageGRID
-
Il numero di oggetti per il tenant.
- storagegrid_tenant_usage_quota_bytes
-
La quantità massima di spazio logico disponibile per gli oggetti del tenant. Se non viene fornita una metrica di quota, è disponibile una quantità illimitata di spazio.