Skip to main content
Uma versão mais recente deste produto está disponível.
O português é fornecido por meio de tradução automática para sua conveniência. O inglês precede o português em caso de inconsistências.

Monitore a integridade do sistema no StorageGRID

Monitore diariamente a saúde geral do seu sistema StorageGRID.

Sobre esta tarefa

O sistema StorageGRID pode continuar operando quando partes do grid estiverem indisponíveis. Problemas potenciais indicados por alertas não são necessariamente problemas nas operações do sistema. Investigue os problemas resumidos no cartão de status de integridade do painel do Grid Manager.

Para ser notificado sobre alertas assim que forem acionados, você pode "Configurar notificações por e-mail para alertas" ou "configurar traps SNMP".

Cartão de status de integridade - dashboard

Quando surgirem problemas, aparecerão links que permitem que você visualize detalhes adicionais:

Link Aparece quando…​

Detalhes do grid

Quaisquer nós estão desconectados (estado da conexão Desconhecido ou Administrativamente Down).

Alertas atuais (Crítico, Grave, Leve)

Os alertas são atualmente ativo.

Alertas resolvidos recentemente

Alertas acionados na última semana agora estão resolvidos.

Licença

Existe um problema com a licença de software deste sistema StorageGRID. Você pode "Atualize as informações da licença conforme necessário".

Monitorar os estados de conexão dos nós

Se um ou mais nós forem desconectados da grid, operações críticas do StorageGRID poderão ser afetadas. Monitore os estados de conexão dos nós e resolva quaisquer problemas imediatamente.

Ícone Descrição Ação necessária

ícone de ponto de interrogação azul

Não conectado - Desconhecido

Por razões desconhecidas, um nó é desconectado ou os serviços no nó são interrompidos inesperadamente. Por exemplo, um serviço no nó pode ter sido interrompido ou o nó pode ter perdido a conexão de rede devido a uma falha de energia ou interrupção inesperada.

O alerta Não foi possível comunicar com o nó também pode ser acionado. Outros alertas também podem estar ativos.

Requer atenção imediata. Selecione cada alerta e siga as ações recomendadas.

Por exemplo, você pode precisar reiniciar um serviço que parou ou reiniciar o host do nó.

Nota: Um nó pode aparecer como Desconhecido durante operações de desligamento gerenciado. Você pode ignorar o estado Desconhecido nesses casos.

ícone de ponto de interrogação cinza

Sem conexão - administrativamente inativo

Por um motivo previsível, o nó não está conectado à grid.

Por exemplo, o nó, ou os serviços no nó, foi desligado corretamente, o nó está reiniciando ou o software está sendo atualizado. Um ou mais alertas também podem estar ativos.

Dependendo do problema subjacente, esses nós geralmente voltam a ficar online sem intervenção.

Verifique se algum alerta está afetando este nó.

Se um ou mais alertas estiverem ativos, selecione cada alerta siga as ações recomendadas.

ícone de alerta marca de seleção verde

Conectado

O nó está conectado à grid.

Nenhuma ação necessária.

Veja os alertas atuais e resolvidos

Alertas atuais: Quando um alerta é acionado, um ícone de alerta é exibido no painel. Um ícone de alerta também é exibido para o nó na página Nodes. Se "As notificações de alerta por e-mail estão configuradas", uma notificação por e-mail também será enviada, a menos que o alerta tenha sido silenciado.

Alertas resolvidos: você pode pesquisar e visualizar um histórico de alertas que foram resolvidos.

Opcionalmente, você assistiu ao vídeo:

Visão geral dos alertas

A tabela a seguir descreve as informações exibidas no Grid Manager para alertas atuais e resolvidos.

Cabeçalho da coluna Descrição

Nome ou título

O nome do alerta e sua descrição.

Gravidade

A gravidade do alerta. Para alertas atuais, se vários alertas estiverem agrupados, a linha de título mostra quantas ocorrências desse alerta estão acontecendo em cada nível de gravidade.

Ícone de alerta vermelho críticoCrítico: Existe uma condição anormal que interrompeu o funcionamento normal de um nó ou serviço do StorageGRID. Você deve resolver o problema imediatamente. A não resolução do problema pode resultar em interrupção do serviço e perda de dados.

Ícone de alerta laranja majorGrave: Existe uma condição anormal que está afetando as operações atuais ou se aproximando do limite para um alerta crítico. Você deve investigar alertas graves e resolver quaisquer problemas subjacentes para garantir que a condição anormal não interrompa a operação normal de um StorageGRID node ou serviço.

Ícone de alerta amarelo menorMenor: O sistema está operando normalmente, mas existe uma condição anormal que pode afetar a capacidade do sistema de operar se persistir. Você deve monitorar e resolver alertas menores que não se resolvem sozinhos para garantir que não resultem em um problema mais sério.

Acionado por tempo

Alertas atuais: A data e a hora em que o alerta foi acionado no seu horário local e em UTC. Se vários alertas estiverem agrupados, a linha de título mostra os horários da instância mais recente do alerta (newest) e da instância mais antiga do alerta (oldest).

Alertas resolvidos: há quanto tempo o alerta foi acionado.

Site/Nó

O nome do site e do nó onde o alerta está ocorrendo ou ocorreu.

Status

Indica se o alerta está ativo, silenciado ou resolvido. Se vários alertas estiverem agrupados e a opção Todos os alertas estiver selecionada no menu suspenso, a linha do título mostra quantas instâncias desse alerta estão ativas e quantas instâncias foram silenciadas.

Tempo resolvido (apenas alertas resolvidos)

Há quanto tempo o alerta foi resolvido.

Valores atuais ou valores de dados

O valor da métrica que acionou o alerta. Para alguns alertas, valores adicionais são exibidos para ajudar você a entender e investigar o alerta. Por exemplo, os valores exibidos para um alerta de Low object data storage incluem a porcentagem de espaço de disco usado, a quantidade total de espaço de disco e a quantidade de espaço de disco usado.

Nota: Se vários alertas atuais estiverem agrupados, os valores atuais não são exibidos na linha de título.

Valores acionados (somente alertas resolvidos)

O valor da métrica que acionou o alerta. Para alguns alertas, valores adicionais são exibidos para ajudar você a entender e investigar o alerta. Por exemplo, os valores exibidos para um alerta de Low object data storage incluem a porcentagem de espaço de disco usado, a quantidade total de espaço de disco e a quantidade de espaço de disco usado.

Passos
  1. Selecione o link Alertas atuais ou Alertas resolvidos para visualizar uma lista de alertas nessas categorias. Você também pode visualizar os detalhes de um alerta selecionando Nós > > Visão geral e, em seguida, selecionando o alerta na tabela Alertas.

    Por padrão, os alertas atuais são exibidos da seguinte forma:

    • Os alertas acionados mais recentemente são exibidos primeiro.

    • Vários alertas do mesmo tipo são exibidos em grupo.

    • Alertas que foram silenciados não são exibidos.

    • Para um alerta específico em um nó específico, se os limites forem atingidos para mais de uma gravidade, apenas o alerta mais grave será exibido. Ou seja, se os limites de alerta forem atingidos para as gravidades menor, maior e crítica, apenas o alerta crítico será exibido.

      A página de alertas atuais é atualizada a cada dois minutos.

  2. Para expandir grupos de alertas, selecione a seta para baixo ícone de seta para baixo. Para recolher alertas individuais em um grupo, selecione a seta para cima Ícone de seta para cima ou selecione o nome do grupo.

  3. Para exibir alertas individuais em vez de grupos de alertas, desmarque a caixa de seleção Agrupar alertas.

  4. Para classificar os alertas atuais ou grupos de alertas, selecione as setas para cima/para baixo Ícone de setas de classificação em cada cabeçalho de coluna.

    • Quando a opção Agrupar alertas é selecionada, tanto os grupos de alertas quanto os alertas individuais dentro de cada grupo são classificados. Por exemplo, você pode querer classificar os alertas em um grupo por Hora de acionamento para encontrar a instância mais recente de um alerta específico.

    • Quando a opção Agrupar alertas é desmarcada, toda a lista de alertas é classificada. Por exemplo, você pode querer classificar todos os alertas por Nó/Site para ver todos os alertas que afetam um nó específico.

  5. Para filtrar os alertas atuais por status (Todos os alertas, Ativos ou Silenciados, use o menu suspenso na parte superior da tabela.

  6. Para classificar os alertas resolvidos:

    • Selecione um período de tempo no menu suspenso Quando acionado.

    • Selecione uma ou mais gravidades no menu suspenso Gravidade.

    • Selecione uma ou mais regras de alerta padrão ou personalizadas no menu suspenso Regra de alerta para filtrar alertas resolvidos relacionados a uma regra de alerta específica.

    • Selecione um ou mais nós no menu suspenso para filtrar os alertas resolvidos relacionados a um nó específico.

  7. Para visualizar os detalhes de um alerta específico, selecione o alerta. Uma caixa de diálogo fornece detalhes e ações recomendadas para o alerta que você selecionou.

  8. (Opcional) Para um alerta específico, selecione silenciar este alerta para silenciar a regra de alerta que fez com que este alerta fosse acionado.

    Você precisa ter a "Gerenciar alertas ou permissão de acesso root" para silenciar uma regra de alerta.

    Cuidado Tenha cuidado ao decidir silenciar uma regra de alerta. Se uma regra de alerta for silenciada, você pode não detectar um problema subjacente até que ele impeça a conclusão de uma operação crítica.
  9. Para visualizar as condições atuais da regra de alerta:

    1. Nos detalhes do alerta, selecione Ver condições.

      Aparece uma janela pop-up, listando a expressão Prometheus para cada nível de severidade definido.

    2. Para fechar a janela pop-up, clique em qualquer lugar fora da janela pop-up.

  10. Opcionalmente, selecione Editar regra para editar a regra de alerta que fez com que este alerta fosse acionado.

    Você precisa ter a "Gerenciar alertas ou permissão de acesso root" para editar uma regra de alerta.

    Cuidado Tenha cuidado ao decidir editar uma regra de alerta. Se você alterar os valores de acionamento, você pode não detectar um problema subjacente até que ele impeça a conclusão de uma operação crítica.
  11. Para fechar os detalhes do alerta, selecione Fechar.