Skip to main content
Uma versão mais recente deste produto está disponível.
O português é fornecido por meio de tradução automática para sua conveniência. O inglês precede o português em caso de inconsistências.

Restaurar dados de objetos para o volume de armazenamento StorageGRID (falha na unidade do sistema)

Após recuperar os volumes de armazenamento de um nó de storage que não seja um appliance, você pode restaurar os dados de objetos replicados ou codificados por eliminação que foram perdidos quando o nó de storage falhou.

Qual procedimento devo usar?

Sempre que possível, restaure os dados do objeto usando a página Restauração de volume no Grid Manager.

  • Se os volumes estiverem listados em Manutenção > Restauração de volume > Nós a restaurar, restaure os dados do objeto usando o "Página de restauração de volume no Grid Manager".

  • Se os volumes não estiverem listados em Manutenção > Restauração de volume > Nós a restaurar, siga os passos abaixo para usar o script repair-data para restaurar os dados do objeto.

    Se o nó de armazenamento recuperado contiver menos volumes do que o nó que está substituindo, você deve usar o repair-data script.

Observação O script repair-data está obsoleto e será removido em uma versão futura. Quando possível, use o "Procedimento de restauração de volume no Grid Manager".

Use o repair-data script para restaurar os dados do objeto

Antes de começar
  • Você confirmou que o nó de armazenamento recuperado tem um estado de conexão Conectado ícone de alerta marca de seleção verde na guia Nós > Visão geral do Grid Manager.

Sobre esta tarefa

Os dados dos objetos podem ser restaurados a partir de outros nós de armazenamento ou de um Cloud Storage Pool, desde que as regras ILM da grid estejam configuradas de forma que as cópias dos objetos estejam disponíveis.

Observe o seguinte:

  • Se uma regra ILM foi configurada para armazenar apenas uma cópia replicada e essa cópia existia em um volume de armazenamento que apresentou falha, você não poderá recuperar o objeto.

  • Se a única cópia restante de um objeto estiver em um Cloud Storage Pool, StorageGRID deve enviar várias solicitações ao endpoint do Cloud Storage Pool para restaurar os dados do objeto. Antes de executar este procedimento, entre em contato com o suporte técnico para obter ajuda na estimativa do tempo de recuperação e dos custos associados.

Sobre o repair-data script

Para restaurar os dados do objeto, você executa o repair-data script. Este script inicia o processo de restauração dos dados do objeto e trabalha em conjunto com a verificação do ILM para garantir que as regras do ILM sejam atendidas.

Selecione Dados replicados ou Dados com código de apagamento (EC) abaixo para conhecer as diferentes opções do repair-data script, dependendo se você está restaurando dados replicados ou dados com código de apagamento. Se precisar restaurar ambos os tipos de dados, você deve executar os dois conjuntos de comandos.

Observação Para obter mais informações sobre o repair-data`script, digite `repair-data --help na linha de comando do nó de administração principal.
Observação O script repair-data está obsoleto e será removido em uma versão futura. Quando possível, use o "Procedimento de restauração de volume no Grid Manager".
Dados replicados

Existem dois comandos disponíveis para restaurar dados replicados, dependendo se você precisa reparar o nó inteiro ou apenas determinados volumes no nó:

repair-data start-replicated-node-repair

repair-data start-replicated-volume-repair

Você pode acompanhar os reparos de dados replicados com este comando:

repair-data show-replicated-repair-status

Dados codificados por apagamento (EC)

Existem dois comandos disponíveis para restaurar dados codificados por apagamento, dependendo se você precisa reparar o nó inteiro ou apenas determinados volumes no nó:

repair-data start-ec-node-repair

repair-data start-ec-volume-repair

Você pode rastrear reparos de dados codificados por apagamento com este comando:

repair-data show-ec-repair-status

Observação Os reparos de dados codificados por eliminação podem começar enquanto alguns Storage Nodes estiverem offline. No entanto, se não for possível contabilizar todos os dados codificados por eliminação, o reparo não poderá ser concluído. O reparo será concluído após todos os nós estarem disponíveis.
Observação A tarefa de reparo do EC reserva temporariamente uma grande quantidade de armazenamento. Alertas de armazenamento podem ser acionados, mas serão resolvidos quando o reparo for concluído. Se não houver armazenamento suficiente para a reserva, a tarefa de reparo do EC falhará. As reservas de armazenamento são liberadas quando a tarefa de reparo do EC é concluída, independentemente de ter falhado ou sido bem-sucedida.

Encontre o nome do host para o nó de armazenamento

  1. Faça login em qualquer nó administrativo:

    1. Digite o seguinte comando: ssh admin@primary_Admin_Node_IP

    2. Digite a senha listada no arquivo Passwords.txt.

    3. Digite o seguinte comando para alternar para root: su -

    4. Digite a senha listada no arquivo Passwords.txt.

      Quando você está logado como root, o prompt muda de $ para #.

  2. Use o /etc/hosts arquivo para encontrar o nome do host do Storage Node dos volumes de armazenamento restaurados. Para ver uma lista de todos os nós na grid, digite o seguinte: cat /etc/hosts.

Reparar dados se todos os volumes falharem

Se todos os volumes de armazenamento falharem, repare o nó inteiro. Siga as instruções para dados replicados, dados com codificação de apagamento (EC) ou ambos, dependendo se você usa dados replicados, dados com codificação de apagamento (EC) ou ambos.

Se apenas alguns volumes falharem, acesse Reparar dados se apenas alguns volumes falharem.

Observação Não é possível executar `repair-data`operações em mais de um nó simultaneamente. Para recuperar vários nós, entre em contato com o suporte técnico.
Dados replicados

Se sua grade incluir dados replicados, use o comando repair-data start-replicated-node-repair com a opção --nodes, onde --nodes é o nome do host (nome do sistema), para reparar todo o Storage Node.

Este comando repara os dados replicados em um nó de armazenamento chamado SG-DC-SN3:

repair-data start-replicated-node-repair --nodes SG-DC-SN3

Observação À medida que os dados dos objetos são restaurados, o alerta Objetos Perdidos é acionado se o sistema StorageGRID não conseguir localizar os dados replicados dos objetos. Os alertas podem ser acionados em nós de armazenamento em todo o sistema. Você deve determinar a causa da perda e se a recuperação é possível. Consulte "Investigue objetos potencialmente perdidos".
Dados codificados por apagamento (EC)

Se sua grade contiver dados codificados por eliminação, use o comando repair-data start-ec-node-repair com a opção --nodes, onde --nodes é o nome do host (nome do sistema), para reparar todo o Storage Node.

Este comando repara os dados com codificação de eliminação em um nó de armazenamento chamado SG-DC-SN3:

repair-data start-ec-node-repair --nodes SG-DC-SN3

A operação retorna um repair ID identificador exclusivo que identifica esta repair_data operação. Use este repair ID para acompanhar o progresso e o resultado da repair_data operação. Nenhum outro feedback é retornado quando o processo de recuperação é concluído.

Os reparos de dados com codificação de eliminação podem começar enquanto alguns nós de armazenamento estiverem offline. O reparo será concluído depois que todos os nós estiverem disponíveis.

Reparar dados se apenas alguns volumes falharem

Se apenas alguns volumes apresentarem falha, repare os volumes afetados. Siga as instruções para dados replicados, dados com código de apagamento (EC) ou ambos, dependendo se você utiliza dados replicados, dados com código de apagamento (EC) ou ambos.

Se todos os volumes falharem, acesse Reparar dados se todos os volumes falharem.

Insira os IDs dos volumes em hexadecimal. Por exemplo, 0000 é o primeiro volume e 000F é o décimo sexto volume. Você pode especificar um volume, um intervalo de volumes ou vários volumes que não estejam em sequência.

Todos os volumes devem estar no mesmo nó de armazenamento. Se precisar restaurar volumes de mais de um nó de armazenamento, entre em contato com o suporte técnico.

Dados replicados

Se sua grade contiver dados replicados, use o start-replicated-volume-repair comando com a --nodes opção para identificar o nó (onde --nodes é o nome do host do nó). Em seguida, adicione a opção --volumes ou --volume-range, conforme mostrado nos exemplos a seguir.

Volume único: Este comando restaura os dados replicados para o volume 0002 em um nó de armazenamento chamado SG-DC-SN3:

repair-data start-replicated-volume-repair --nodes SG-DC-SN3 --volumes 0002

Intervalo de volumes: Este comando restaura os dados replicados em todos os volumes no intervalo 0003 a 0009 em um nó de armazenamento chamado SG-DC-SN3:

repair-data start-replicated-volume-repair --nodes SG-DC-SN3 --volume-range 0003,0009

Vários volumes não sequenciais: Este comando restaura os dados replicados para os volumes 0001, 0005 e 0008 em um nó de armazenamento chamado SG-DC-SN3:

repair-data start-replicated-volume-repair --nodes SG-DC-SN3 --volumes 0001,0005,0008

Observação À medida que os dados dos objetos são restaurados, o alerta Objetos Perdidos é acionado se o sistema StorageGRID não conseguir localizar os dados replicados dos objetos. Os alertas podem ser acionados em nós de armazenamento em todo o sistema. Observe a descrição do alerta e as ações recomendadas para determinar a causa da perda e se a recuperação é possível.
Dados codificados por apagamento (EC)

Se a sua grade contiver dados codificados por apagamento, use o start-ec-volume-repair comando com a opção --nodes para identificar o nó (onde --nodes é o nome do host do nó). Em seguida, adicione a opção --volumes ou --volume-range, conforme mostrado nos exemplos a seguir.

Volume único: Este comando restaura os dados com codificação de eliminação para o volume 0007 em um nó de armazenamento chamado SG-DC-SN3:

repair-data start-ec-volume-repair --nodes SG-DC-SN3 --volumes 0007

Intervalo de volumes: Este comando restaura os dados codificados para apagamento em todos os volumes no intervalo 0004 a 0006 em um Storage Node chamado SG-DC-SN3:

repair-data start-ec-volume-repair --nodes SG-DC-SN3 --volume-range 0004,0006

Vários volumes não sequenciais: Este comando restaura os dados codificados por apagamento nos volumes 000A, 000C e 000E em um Storage Node chamado SG-DC-SN3:

repair-data start-ec-volume-repair --nodes SG-DC-SN3 --volumes 000A,000C,000E

A `repair-data`operação retorna um `repair ID`identificador exclusivo que identifica esta `repair_data`operação. Use este `repair ID`identificador para acompanhar o progresso e o resultado da `repair_data`operação. Nenhum outro feedback é retornado quando o processo de recuperação é concluído.

Observação Os reparos de dados com codificação de eliminação podem começar enquanto alguns nós de armazenamento estiverem offline. O reparo será concluído depois que todos os nós estiverem disponíveis.

Monitorar reparos

Monitore o status das tarefas de reparo, com base no uso de dados replicados, dados com código de apagamento (EC) ou ambos.

Você também pode monitorar o status dos trabalhos de restauração de volume em andamento e visualizar um histórico dos trabalhos de restauração concluídos em "Grid Manager".

Dados replicados
  • Para obter uma estimativa da porcentagem de conclusão do reparo replicado, adicione a show-replicated-repair-status opção ao comando repair-data.

    repair-data show-replicated-repair-status

  • Para determinar se os reparos foram concluídos:

    1. Selecione Nodes > Storage Node being repaired > ILM.

    2. Analise os atributos na seção Avaliação. Quando os reparos estiverem concluídos, o atributo Aguardando - Todos indica 0 objetos.

  • Para monitorar o reparo com mais detalhes:

    1. Selecione Nós.

    2. Selecione grid name > ILM.

    3. Posicione o cursor sobre o gráfico da fila ILM para ver o valor do atributo Taxa de varredura (objetos/seg), que é a taxa na qual os objetos na grid são verificados e enfileirados para o ILM.

    4. Na seção Fila ILM, observe os seguintes atributos:

      • Período de digitalização - estimado: tempo estimado para concluir uma digitalização completa do ILM de todos os objetos.

        Uma varredura completa não garante que o ILM tenha sido aplicado a todos os objetos.

      • Tentativas de reparo: O número total de tentativas de reparo de objetos para dados replicados considerados de alto risco. Objetos de alto risco são quaisquer objetos com uma cópia restante, seja especificado pela política ILM ou como resultado de cópias perdidas. Essa contagem incrementa cada vez que um Storage Node tenta reparar um objeto de alto risco. Os reparos ILM de alto risco são priorizados se a grid ficar ocupada.

        O reparo do mesmo objeto pode incrementar novamente se a replicação falhar após o reparo. + Esses atributos podem ser úteis quando você estiver monitorando o progresso da recuperação do volume do Storage Node. Se o número de reparos tentados parar de aumentar e uma verificação completa for concluída, o reparo provavelmente foi concluído.

    5. Alternativamente, envie uma consulta Prometheus para storagegrid_ilm_scan_period_estimated_minutes e storagegrid_ilm_repairs_attempted.

Dados codificados por apagamento (EC)

Para monitorar o reparo de dados com codificação de eliminação e repetir quaisquer solicitações que possam ter falhado:

  1. Determine o status dos reparos de dados codificados por apagamento:

    • Selecione Support > Tools > Metrics para visualizar o tempo estimado de conclusão e a porcentagem de conclusão da tarefa atual. Em seguida, selecione EC Overview na seção Grafana. Observe os painéis Grid EC Job Estimated Time to Completion e Grid EC Job Percentage Completed.

    • Use este comando para ver o status de uma operação repair-data específica:

      repair-data show-ec-repair-status --repair-id repair ID

    • Use este comando para listar todos os reparos:

      repair-data show-ec-repair-status

    A lista de resultados exibe informações, incluindo repair ID, sobre todos os reparos anteriores e atuais em andamento.

  2. Se o resultado mostrar que a operação de reparo falhou, use a --repair-id opção para tentar o reparo novamente.

    Este comando tenta novamente um reparo de nó com falha, usando o ID de reparo 6949309319275667690:

    repair-data start-ec-node-repair --repair-id 6949309319275667690

    Este comando tenta novamente um reparo de volume com falha, usando o ID de reparo 6949309319275667690:

    repair-data start-ec-volume-repair --repair-id 6949309319275667690