Monitorar tarefas de reparo de dados do StorageGRID
Você pode monitorar o status das tarefas de reparo usando o script repair-data na linha de comando.
Isso inclui tarefas que você iniciou manualmente ou tarefas que StorageGRID iniciou automaticamente como parte de um procedimento de desativação.
|
|
Se você estiver executando tarefas de restauração de volume, "Monitore o progresso e visualize o histórico dessas tarefas no Grid Manager" em vez disso. |
Monitore o status dos repair-data trabalhos com base no uso de dados replicados, dados com código de apagamento (EC) ou ambos.
-
Para obter uma estimativa da porcentagem de conclusão do reparo replicado, adicione a
show-replicated-repair-statusopção ao comando repair-data.repair-data show-replicated-repair-status -
Para determinar se os reparos foram concluídos:
-
Selecione Nodes > Storage Node being repaired > ILM.
-
Analise os atributos na seção Avaliação. Quando os reparos estiverem concluídos, o atributo Aguardando - Todos indica 0 objetos.
-
-
Para monitorar o reparo com mais detalhes:
-
Selecione Nós.
-
Selecione grid name > ILM.
-
Posicione o cursor sobre o gráfico da fila ILM para ver o valor do atributo Taxa de varredura (objetos/seg), que é a taxa na qual os objetos na grid são verificados e enfileirados para o ILM.
-
Na seção Fila ILM, observe os seguintes atributos:
-
Período de digitalização - estimado: tempo estimado para concluir uma digitalização completa do ILM de todos os objetos.
Uma varredura completa não garante que o ILM tenha sido aplicado a todos os objetos.
-
Tentativas de reparo: O número total de tentativas de reparo de objetos para dados replicados considerados de alto risco. Objetos de alto risco são quaisquer objetos com uma cópia restante, seja especificado pela política ILM ou como resultado de cópias perdidas. Essa contagem incrementa cada vez que um Storage Node tenta reparar um objeto de alto risco. Os reparos ILM de alto risco são priorizados se a grid ficar ocupada.
O reparo do mesmo objeto pode incrementar novamente se a replicação falhar após o reparo. + Esses atributos podem ser úteis quando você estiver monitorando o progresso da recuperação do volume do Storage Node. Se o número de reparos tentados parar de aumentar e uma verificação completa for concluída, o reparo provavelmente foi concluído.
-
-
Alternativamente, envie uma consulta Prometheus para
storagegrid_ilm_scan_period_estimated_minutesestoragegrid_ilm_repairs_attempted.
-
Para monitorar o reparo de dados com codificação de eliminação e repetir quaisquer solicitações que possam ter falhado:
-
Determine o status dos reparos de dados codificados por apagamento:
-
Selecione Support > Tools > Metrics para visualizar o tempo estimado de conclusão e a porcentagem de conclusão da tarefa atual. Em seguida, selecione EC Overview na seção Grafana. Observe os painéis Grid EC Job Estimated Time to Completion e Grid EC Job Percentage Completed.
-
Use este comando para ver o status de uma operação
repair-dataespecífica:repair-data show-ec-repair-status --repair-id repair ID -
Use este comando para listar todos os reparos:
repair-data show-ec-repair-status
A lista de resultados exibe informações, incluindo
repair ID, sobre todos os reparos anteriores e atuais em andamento. -
-
Se o resultado mostrar que a operação de reparo falhou, use a
--repair-idopção para tentar o reparo novamente.Este comando tenta novamente um reparo de nó com falha, usando o ID de reparo 6949309319275667690:
repair-data start-ec-node-repair --repair-id 6949309319275667690Este comando tenta novamente um reparo de volume com falha, usando o ID de reparo 6949309319275667690:
repair-data start-ec-volume-repair --repair-id 6949309319275667690