Skip to main content
Data Infrastructure Insights
O português é fornecido por meio de tradução automática para sua conveniência. O inglês precede o português em caso de inconsistências.

Avalie a saúde do armazenamento

Colaboradores netapp-alavoie

Use esta receita para priorizar problemas de storage combinando alertas ativos, intenção de monitoramento, orientações corretivas, logs relevantes da plataforma e contexto do objeto.

Observação O DII MCP é um recurso "Pré-visualização" e, portanto, está sujeito a alterações.

Pré-requisitos

  • Um período de 30 dias ou menos.

  • Escopo opcional de sistema de armazenamento, cluster, pool ou volume.

  • Acesso às ferramentas de alerta, monitoramento, registro e objetos.

Ferramentas utilizadas

  • ServiçoDeAlertas_obterMetadados

  • AlertsService_queryForAlerts

  • AlertsService_getAlertByName

  • MonitorsService_getMonitorById

  • LogService_getLogTypes

  • LogService_getLogTypeMetadata

  • LogService_queryLogEvents

  • ObjectService_getObjectTypes

  • ObjectService_getMetadataForObjectType

  • ObjectService_query

Prompt inicial

Avalie a integridade do armazenamento nas últimas 24 horas. Identifique alertas ativos críticos e de aviso para sistemas de armazenamento, nós, pools e volumes. Para os alertas de maior impacto, explique a condição do monitor e as orientações corretivas e, em seguida, inspecione os logs relevantes do EMS ou da plataforma de armazenamento em torno do horário do acionamento. Separe as evidências confirmadas das causas prováveis.

Fluxo de trabalho do agente

  1. Obter os metadados do alerta.

  2. Identifique campos válidos para gravidade, status, monitor, objeto relacionado e horário de acionamento.

  3. Consultar alertas ativos relacionados ao armazenamento na janela solicitada.

  4. Classifique os alertas usando:

    • Gravidade

    • Tipo de objeto afetado

    • Número de objetos afetados

    • Recência e recorrência

    • Impacto na disponibilidade, proteção de dados, desempenho ou capacidade

  5. Obtenha detalhes completos dos alertas de maior prioridade.

  6. Recupere suas definições de monitoramento e orientações corretivas.

  7. Liste os tipos de log e selecione o fluxo nativo da plataforma relevante para cada alerta, como eventos do ONTAP EMS ou do StorageGRID.

  8. Recupere os metadados do log e, em seguida, consulte um intervalo restrito em torno do alerta.

  9. Recupere atributos ou métricas necessários para confirmar o estado atual.

  10. Elabore um resumo de integridade com evidências, causa provável, impacto e próxima verificação.

Interpretação

Não considere um único sinal como uma avaliação completa da integridade:

  • Alertas mostram as condições detectadas.

  • Os monitores explicam a regra de detecção e a ação corretiva pretendida.

  • Os logs fornecem contexto de eventos nativo da plataforma.

  • Objetos e métricas mostram o inventário atual ou o estado medido.

Um alerta ativo pode permanecer aberto após a mudança da condição subjacente. Use dados novos de objetos e métricas sempre que possível.

Saída sugerida

Para cada problema prioritário:

  • Recurso afetado

  • Gravidade e estado do alerta

  • Tempo de disparo

  • Monitorar e condicionar

  • Registros ou métricas que corroborem

  • Evidências confirmadas

  • Causa provável, classificada como uma inferência

  • Orientação corretiva

  • Confiança e evidências ausentes

Limites e privacidade

  • Mantenha as janelas de alerta e de log abaixo de 30 dias.

  • Use janelas de log estreitas para reduzir eventos não relacionados.

  • Omita UUIDs, endereços, anotações e payloads brutos desnecessários.

  • As orientações corretivas são meramente informativas; valide os comandos em relação à documentação relevante do produto e ao processo de alteração.

Perguntas de acompanhamento

Para o alerta AL-123456, mostre a orientação do monitor e os eventos EMS relacionados em até 30 minutos antes e depois do acionamento.

Agrupe os alertas de armazenamento ativo por sistema afetado e área de impacto. Qual sistema precisa de atenção primeiro e por quê?

Verifique se o alerta de prioridade mais alta ainda é suportado pelas métricas atuais do objeto.