Métricas do Prometheus comumente usadas no StorageGRID
Consulte esta lista de métricas Prometheus comumente usadas para entender melhor as condições nas regras de alerta padrão ou para construir as condições para regras de alerta personalizadas.
Você também pode Obtenha uma lista completa de todas as métricas.
Para obter detalhes sobre a sintaxe das consultas do Prometheus, consulte "Consultando Prometheus".
O que são métricas Prometheus?
As métricas do Prometheus são medições de séries temporais. O serviço Prometheus nos nós de administração coleta essas métricas dos serviços em todos os nós. As métricas são armazenadas em cada nó de administração até que o espaço reservado para os dados do Prometheus esteja cheio. Quando o volume /var/local/mysql_ibdata/ atinge a capacidade, as métricas mais antigas são excluídas primeiro.
Onde as métricas do Prometheus são utilizadas?
As métricas coletadas pelo Prometheus são usadas em vários locais no Grid Manager:
-
Página de Nós: Os gráficos e tabelas nas abas disponíveis na página de Nós utilizam a ferramenta de visualização Grafana para exibir as métricas de séries temporais coletadas pelo Prometheus. O Grafana exibe os dados de séries temporais em formatos de gráfico e tabela, enquanto o Prometheus serve como fonte de dados de backend.

-
Alertas: Os alertas são acionados em níveis de gravidade específicos quando as condições das regras de alerta que usam métricas Prometheus são avaliadas como verdadeiras.
-
API de Gerenciamento de Grid: Você pode usar métricas do Prometheus em regras de alerta personalizadas ou com ferramentas de automação externas para monitorar seu sistema StorageGRID. Uma lista completa de métricas do Prometheus está disponível na API de Gerenciamento de Grid. (Na parte superior do Gerenciador de Grid, selecione o ícone de ajuda e selecione API documentation > metrics.) Embora mais de mil métricas estejam disponíveis, apenas um número relativamente pequeno é necessário para monitorar as operações mais críticas do StorageGRID.
As métricas que incluem private em seus nomes destinam-se apenas ao uso interno e estão sujeitas a alterações entre versões do StorageGRID sem aviso prévio. -
As páginas Suporte > Ferramentas > Diagnóstico e Suporte > Ferramentas > Métricas: essas páginas, destinadas principalmente ao suporte técnico, fornecem diversas ferramentas e gráficos que utilizam os valores das métricas do Prometheus.
Algumas funcionalidades e itens de menu na página de Métricas são intencionalmente não funcionais e estão sujeitos a alterações.
Lista das métricas mais comuns
A lista a seguir contém as métricas Prometheus mais usadas.
|
|
As métricas que incluem private em seus nomes são apenas para uso interno e estão sujeitas a alterações sem aviso prévio entre as versões do StorageGRID. |
- alertmanager_notifications_failed_total
-
O número total de notificações de alerta com falha.
- bytes disponíveis no sistema de arquivos do nó
-
A quantidade de espaço do sistema de arquivos disponível para usuários não-root, em bytes.
- node_memory_MemAvailable_bytes
-
Campo de informações de memória MemAvailable_bytes.
- portadora de rede do nó
-
Valor portador de
/sys/class/net/iface. - node_network_receive_errs_total
-
Estatística de dispositivo de rede
receive_errs. - node_network_transmit_errs_total
-
Estatística de dispositivo de rede
transmit_errs. - storagegrid_administrativamente_desativado
-
O nó não está conectado à grid por um motivo esperado. Por exemplo, o nó, ou os serviços no nó, foram desligados corretamente, o nó está reiniciando ou o software está sendo atualizado.
- status_do_hardware_do_controlador_de_computação_da_appliance_StorageGRID
-
O status do hardware do controlador de computação em um appliance.
- discos com falha do StorageGRID appliance
-
Para o controlador de armazenamento em um appliance, o número de unidades que não estão otimizadas.
- status_do_hardware_do_controlador_de_armazenamento_da_appliance_StorageGRID
-
O status geral do hardware do controlador de armazenamento em um appliance.
- storagegrid_content_buckets_and_containers
-
O número total de buckets S3 conhecidos por este Storage Node.
- objetos_de_conteúdo_do_storagegrid
-
Número total de objetos de dados S3 conhecidos por este Storage Node. A contagem é válida apenas para objetos de dados criados por aplicativos cliente que interagem com o sistema por meio do S3.
- storagegrid_content_objects_lost
-
O número total de objetos que este serviço detecta como ausentes no sistema StorageGRID. Você deve tomar medidas para determinar a causa da perda e se a recuperação é possível.
- storagegrid_http_sessions_incoming_attempted
-
O número total de sessões HTTP que foram tentadas em um Storage Node.
- storagegrid_http_sessions_incoming_currently_established
-
O número de sessões HTTP que estão atualmente ativas (abertas) no Storage Node.
- storagegrid_http_sessions_incoming_failed
-
O número total de sessões HTTP que não foram concluídas com sucesso, seja devido a uma solicitação HTTP malformada ou a uma falha durante o processamento de uma operação.
- storagegrid_http_sessions_incoming_successful
-
O número total de sessões HTTP que foram concluídas com sucesso.
- storagegrid_ilm_aguardando_objetos_em_fundo
-
Número total de objetos neste nó aguardando avaliação de ILM a partir da varredura.
- storagegrid_ilm_aguardando_avaliação_do_cliente_objetos_por_segundo
-
A taxa atual na qual os objetos são avaliados em relação à política ILM neste nó.
- storagegrid_ilm_aguardando_objetos_do_cliente
-
O número total de objetos neste nó aguardando avaliação do ILM provenientes de operações do cliente (por exemplo, ingestão).
- storagegrid_ilm_aguardando_total_objetos
-
O número total de objetos aguardando avaliação ILM.
- storagegrid_ilm_scan_objects_per_second
-
A taxa na qual os objetos pertencentes a este nó são verificados e enfileirados para ILM.
- storagegrid_ilm_scan_period_estimated_minutes
-
Tempo estimado para concluir uma varredura ILM completa neste nó.
Nota: Uma verificação completa não garante que o ILM tenha sido aplicado a todos os objetos pertencentes a este nó.
- storagegrid_load_balancer_endpoint_cert_expiry_time
-
O tempo de expiração do certificado do endpoint do balanceador de carga em segundos desde a época.
- storagegrid_metadata_queries_average_latency_milliseconds
-
Tempo médio necessário para executar uma consulta no repositório de metadados por meio deste serviço.
- storagegrid_network_received_bytes
-
Quantidade total de dados recebidos desde a instalação.
- bytes_transmitidos_da_rede_StorageGRID
-
Quantidade total de dados enviados desde a instalação.
- porcentagem de utilização da CPU do nó StorageGRID
-
A porcentagem de tempo de CPU disponível que está sendo usada por este serviço. Indica o nível de carga do serviço. A quantidade de tempo de CPU disponível depende do número de CPUs do servidor.
- storagegrid_ntp_chosen_time_source_offset_milliseconds
-
Desvio sistemático de tempo fornecido por uma fonte de tempo escolhida. O desvio é introduzido quando o atraso para alcançar uma fonte de tempo não é igual ao tempo necessário para a fonte de tempo alcançar o cliente NTP.
- storagegrid_ntp_locked
-
O nó não está vinculado a um servidor de Network Time Protocol (NTP).
- storagegrid_s3_data_transfers_bytes_ingested
-
A quantidade total de dados ingeridos de clientes S3 para este Storage Node desde a última redefinição do atributo.
- storagegrid_s3_data_transfers_bytes_retrieved
-
A quantidade total de dados recuperados pelos clientes S3 deste Storage Node desde a última redefinição do atributo.
- storagegrid_s3_operations_failed
-
Número total de operações S3 com falha (códigos de status HTTP 4xx e 5xx), excluindo aquelas causadas por falha de autorização S3.
- storagegrid_s3_operations_successful
-
O número total de operações S3 bem-sucedidas (código de status HTTP 2xx).
- storagegrid_s3_operations_unauthorized
-
O número total de operações S3 com falha que são resultado de uma falha de autorização.
- storagegrid_servercertificate_management_interface_cert_expiry_days
-
O número de dias antes do vencimento do certificado da interface de gerenciamento.
- storagegrid_servercertificate_storage_api_endpoints_cert_expiry_days
-
O número de dias antes do vencimento do certificado da API de Object Storage.
- storagegrid_service_cpu_seconds
-
A quantidade cumulativa de tempo que a CPU foi usada por este serviço desde a instalação.
- uso de memória do serviço storagegrid_service_memory_usage_bytes
-
A quantidade de memória (RAM) atualmente em uso por este serviço. Este valor é idêntico ao exibido pelo utilitário top do Linux como RES.
- storagegrid_service_network_received_bytes
-
Quantidade total de dados recebidos por este serviço desde a instalação.
- storagegrid_service_network_transmitted_bytes
-
A quantidade total de dados enviados por este serviço.
- reinicializações_do_serviço_StorageGRID
-
O número total de vezes que o serviço foi reiniciado.
- storagegrid_service_runtime_seconds
-
O tempo total em que o serviço está em execução desde a instalação.
- storagegrid_service_uptime_seconds
-
O tempo total em que o serviço está em execução desde a última reinicialização.
- storagegrid_storage_state_current
-
O estado atual dos serviços de armazenamento. Os valores dos atributos são:
-
10 = Offline
-
15 = Manutenção
-
20 = Somente leitura
-
30 = Online
-
- status_storagegrid_storage
-
O estado atual dos serviços de storage. Os valores dos atributos são:
-
0 = Sem erros
-
10 = Em Transição
-
20 = Espaço livre insuficiente
-
30 = Volume(s) indisponível(is)
-
40 = Erro
-
- storagegrid_storage_utilization_data_bytes
-
Uma estimativa do tamanho total dos dados de objetos replicados e codificados para eliminação no Storage Node.
- storagegrid_storage_utilization_metadata_allowed_bytes
-
O espaço total no volume 0 de cada Storage Node permitido para metadados de objetos. Esse valor é sempre menor que o espaço real reservado para metadados em um nó, pois uma parte do espaço reservado é necessária para operações essenciais do banco de dados (como compactação e reparo) e futuras atualizações de hardware e software. O espaço permitido para metadados de objetos controla a capacidade geral de objetos.
- storagegrid_storage_utilization_metadata_bytes
-
Quantidade de metadados de objetos no volume de storage 0, em bytes.
- storagegrid_storage_utilization_total_space_bytes
-
A quantidade total de espaço de storage alocado a todos os object stores.
- storagegrid_storage_utilization_usable_space_bytes
-
A quantidade total de espaço de storage de objetos restante. Calculada somando a quantidade de espaço disponível para todos os storages de objetos no Storage Node.
- storagegrid_tenant_usage_data_bytes
-
O tamanho lógico de todos os objetos para o tenant.
- storagegrid_tenant_usage_object_count
-
O número de objetos para o tenant.
- storagegrid_tenant_usage_quota_bytes
-
A quantidade máxima de espaço lógico disponível para os objetos do locatário. Se nenhuma métrica de cota for fornecida, uma quantidade ilimitada de espaço estará disponível.
Obtenha uma lista de todas as métricas
Para obter a lista completa de métricas, use a Grid Management API.
-
Na parte superior do Grid Manager, selecione o ícone de ajuda e selecione API documentation.
-
Localize as operações de métricas.
-
Execute a
GET /grid/metric-namesoperação. -
Baixe os resultados.