Solucione problemas em um sistema StorageGRID
Se você encontrar um problema ao usar um sistema StorageGRID, consulte as dicas e orientações desta seção para obter ajuda na identificação e resolução do problema.
Muitas vezes, você consegue resolver problemas sozinho; no entanto, pode ser necessário escalar algumas questões para o suporte técnico.
Defina o problema
O primeiro passo para resolver um problema é defini-lo claramente.
Esta tabela fornece exemplos dos tipos de informações que você pode coletar para definir um problema:
| Pergunta | Exemplo de resposta |
|---|---|
O que o sistema StorageGRID está fazendo ou não fazendo? Quais são os seus sintomas? |
Os aplicativos cliente estão relatando que os objetos não podem ser inseridos no StorageGRID. |
Quando o problema começou? |
A ingestão do objeto foi negada pela primeira vez por volta das 14:50 do dia 8 de janeiro de 2020. |
Como você percebeu o problema pela primeira vez? |
Notificado pelo aplicativo cliente. Também recebeu notificações de alerta por e-mail. |
O problema ocorre sempre ou apenas às vezes? |
O problema persiste. |
Se o problema ocorre regularmente, quais etapas fazem com que ele ocorra |
O problema ocorre sempre que um cliente tenta ingerir um objeto. |
Se o problema ocorrer de forma intermitente, quando ele acontece? Registre os horários de cada incidente de que você tiver conhecimento. |
O problema não é intermitente. |
Você já se deparou com esse problema antes? Com que frequência você teve esse problema no passado? |
É a primeira vez que me deparo com esse problema. |
Avalie o risco e o impacto no sistema
Após definir o problema, avalie o risco e o impacto no sistema StorageGRID. Por exemplo, a presença de alertas críticos não significa necessariamente que o sistema não esteja fornecendo os serviços essenciais.
Esta tabela resume o impacto que o problema de exemplo está tendo nas operações do sistema:
| Pergunta | Exemplo de resposta |
|---|---|
O sistema StorageGRID consegue ingerir conteúdo? |
Não |
Os aplicativos cliente podem recuperar conteúdo? |
Alguns objetos podem ser recuperados e outros não. |
Os dados estão em risco? |
Não |
A capacidade de conduzir negócios está gravemente afetada? |
Sim, porque os aplicativos cliente não podem armazenar objetos no sistema StorageGRID e os dados não podem ser recuperados de forma consistente. |
Coletar dados
Após definir o problema e avaliar seus riscos e impactos, colete dados para análise. O tipo de dado mais útil a ser coletado depende da natureza do problema.
| Tipo de dados a serem coletados | Por que coletar esses dados | Instruções |
|---|---|---|
Criar linha do tempo das mudanças recentes |
Alterações no seu sistema StorageGRID, na sua configuração ou no seu ambiente podem causar novos comportamentos. |
|
Revisar alertas |
Os alertas podem ajudar você a determinar rapidamente a causa raiz de um problema, fornecendo pistas importantes sobre as questões subjacentes que podem estar causando isso. Consulte a lista de alertas atuais para verificar se StorageGRID identificou a causa raiz de um problema para você. Analise os alertas acionados no passado para obter informações adicionais. |
|
Estabeleça linhas de base |
Reúna informações sobre os níveis normais de vários valores operacionais. Esses valores de referência e os desvios em relação a eles podem fornecer pistas valiosas. |
|
Realize testes de ingestão e recuperação |
Para solucionar problemas de desempenho com a ingestão e recuperação de dados, utilize uma estação de trabalho para armazenar e recuperar objetos. Compare os resultados com aqueles obtidos ao usar o aplicativo cliente. |
|
Revisar mensagens de auditoria |
Analise as mensagens de auditoria para acompanhar em detalhes as operações do StorageGRID. Os detalhes nas mensagens de auditoria podem ser úteis para solucionar muitos tipos de problemas, incluindo problemas de desempenho. |
|
Verifique a localização dos objetos e a integridade do armazenamento |
Se estiver com problemas de armazenamento, verifique se os objetos estão sendo colocados onde você espera. Verifique a integridade dos dados dos objetos em um Storage Node. |
|
Coletar dados para suporte técnico |
O suporte técnico poderá solicitar que você colete dados ou revise informações específicas para ajudar na resolução de problemas. |
Crie uma linha do tempo das mudanças recentes
Quando um problema ocorrer, você deve considerar o que mudou recentemente e quando essas mudanças ocorreram.
-
Alterações no seu sistema StorageGRID, na sua configuração ou no seu ambiente podem causar novos comportamentos.
-
Uma linha do tempo das alterações pode ajudar você a identificar quais mudanças podem ser responsáveis por um problema e como cada mudança pode ter afetado seu desenvolvimento.
Crie uma tabela com as alterações recentes do seu sistema, incluindo informações sobre quando cada alteração ocorreu e quaisquer detalhes relevantes sobre a alteração, como informações sobre o que mais estava acontecendo enquanto a alteração estava em andamento:
| Tempo de mudança | Tipo de alteração | Detalhes |
|---|---|---|
Por exemplo:
|
O que aconteceu? O que você fez? |
Documente todos os detalhes relevantes sobre a alteração. Por exemplo:
Certifique-se de observar se mais de uma alteração ocorreu simultaneamente. Por exemplo, essa alteração foi feita durante uma atualização em andamento? |
Exemplos de mudanças significativas recentes
Aqui estão alguns exemplos de mudanças potencialmente significativas:
-
O sistema StorageGRID foi instalado, expandido ou recuperado recentemente?
-
O sistema foi atualizado recentemente? Um hotfix foi aplicado?
-
Algum componente do hardware foi reparado ou alterado recentemente?
-
A política ILM foi atualizada?
-
A carga de trabalho do cliente mudou?
-
O aplicativo cliente ou seu comportamento foram alterados?
-
Você alterou os balanceadores de carga ou adicionou ou removeu um grupo de alta disponibilidade de Admin Nodes ou Gateway Nodes?
-
Alguma tarefa foi iniciada e pode levar muito tempo para ser concluída? Exemplos incluem:
-
Recuperação de um nó de armazenamento com falha
-
Desativação de Storage Node
-
-
Houve alguma alteração na autenticação do usuário, como a adição de um tenant ou a alteração da configuração LDAP?
-
A migração de dados está ocorrendo?
-
Os serviços da plataforma foram ativados ou alterados recentemente?
-
A conformidade foi ativada recentemente?
-
Pools de armazenamento em nuvem foram adicionados ou removidos?
-
Houve alguma alteração na compressão de armazenamento ou criptografia?
-
Houve alguma alteração na infraestrutura de rede? Por exemplo, VLANs, roteadores ou DNS.
-
Houve alguma alteração nas fontes do NTP?
-
Houve alguma alteração nas interfaces de Grid, Admin ou Cliente?
-
${post_edited_translations.segment}
Estabeleça linhas de base
Você pode estabelecer valores de referência para o seu sistema registrando os níveis normais de vários valores operacionais. No futuro, você pode comparar os valores atuais com esses valores de referência para ajudar a detectar e resolver valores anormais.
| Propriedade | Valor | Como obter |
|---|---|---|
Consumo médio de armazenamento |
GB consumidos/dia Percentual consumido por dia |
Acesse o Grid Manager. Na página Nodes, selecione toda a grid ou um site e acesse a guia Storage. No gráfico "Armazenamento Utilizado - Dados do Objeto", encontre um período em que a linha esteja relativamente estável. Posicione o cursor sobre o gráfico para estimar quanto armazenamento é consumido a cada dia Você pode coletar essas informações para todo o sistema ou para um data center específico. |
Consumo médio de metadados |
GB consumidos/dia Percentual consumido por dia |
Acesse o Grid Manager. Na página Nodes, selecione toda a grid ou um site e acesse a guia Storage. No gráfico "Armazenamento Utilizado - Metadados do Objeto", encontre um período em que a linha esteja relativamente estável. Posicione o cursor sobre o gráfico para estimar quanto armazenamento de metadados é consumido diariamente. Você pode coletar essas informações para todo o sistema ou para um data center específico. |
Taxa de operações S3 |
Operações/segundo |
No painel do Grid Manager, selecione Desempenho > Operações S3 para Storage Nodes. Para visualizar as taxas e contagens de ingestão e recuperação de um site ou nó específico, selecione Nodes > site ou Storage Node > Objects. Posicione o cursor sobre o gráfico de ingestão e recuperação do S3. |
Taxa de avaliação ILM |
Objetos/segundo |
Na página Nodes, selecione grid > ILM. No gráfico da fila ILM, encontre um período em que a linha esteja relativamente estável. Posicione o cursor sobre o gráfico para estimar um valor de referência para Taxa de avaliação do seu sistema. |
Taxa de varredura ILM |
Objetos/segundo |
Selecione Nodes > grid > ILM. No gráfico da fila ILM, encontre um período em que a linha esteja relativamente estável. Posicione o cursor sobre o gráfico para estimar um valor de referência para Scan rate do seu sistema. |
Objetos enfileirados de operações do cliente |
Objetos/segundo |
Selecione Nodes > grid > ILM. No gráfico de filas do ILM, encontre um período em que a linha esteja relativamente estável. Posicione o cursor sobre o gráfico para estimar um valor de referência para Objetos enfileirados (de operações do cliente) para o seu sistema. |
Latência média de consulta |
Milissegundos |
Selecione Nós > Nó de Armazenamento > Objetos. Na tabela Consultas, visualize o valor de Latência Média. |
Analisar dados
Utilize as informações que você coletar para determinar a causa do problema e possíveis soluções.
A análise depende do problema, mas, em geral:
-
Localize pontos de falha e gargalos usando os alertas.
-
Reconstrua o histórico do problema usando o histórico de alertas e gráficos.
-
Utilize gráficos para encontrar anomalias e comparar a situação problemática com a operação normal.
Lista de verificação de informações de escalonamento
Se não conseguir resolver o problema sozinho, entre em contato com o suporte técnico. Antes de contatar o suporte técnico, reúna as informações listadas na tabela a seguir para facilitar a resolução do problema.
![]() |
Item | Notas |
|---|---|---|
Declaração do problema |
Quais são os sintomas do problema? Quando o problema começou? Ele ocorre de forma constante ou intermitente? Se intermitente, em que horários ocorreu? |
|
Avaliação de impacto |
Qual a gravidade do problema? Qual o impacto para o aplicativo do cliente?
|
|
ID do sistema StorageGRID |
Selecione Manutenção > Sistema > Licença. O ID do sistema StorageGRID é exibido como parte da licença atual. |
|
Versão do software |
Na parte superior do Grid Manager, selecione o ícone de ajuda e selecione About para ver a versão do StorageGRID. |
|
Personalização |
Resuma como seu sistema StorageGRID está configurado. Por exemplo, liste o seguinte:
|
|
Arquivos de log e dados do sistema |
Colete arquivos de log e dados do sistema para seu sistema. Selecione Support > Tools > Log collection. Você pode coletar logs para toda a grid ou para nós selecionados. Se você estiver coletando logs apenas para nós selecionados, certifique-se de incluir pelo menos um Nó de Armazenamento que tenha o serviço ADC. Os três primeiros Nós de Armazenamento instalados em um site incluem o serviço ADC. |
|
Informações básicas |
Colete informações básicas sobre operações de ingestão, operações de recuperação e consumo de armazenamento. |
|
Cronologia das mudanças recentes |
Crie uma linha do tempo que resuma quaisquer alterações recentes no sistema ou em seu ambiente. |
|
Histórico dos esforços para diagnosticar o problema |
Se você tomou medidas para diagnosticar ou solucionar o problema por conta própria, certifique-se de registrar os passos que seguiu e o resultado obtido. |
