Analizza i problemi di latenza in Workload Factory per EDA
Visualizza i ritardi rilevati e usa strumenti automatizzati per trovare la causa e risolvere le prestazioni lente nei tuoi volumi FSx for ONTAP.
Prima di iniziare
È necessario disporre di "monitoraggio della latenza configurato" prima di poter visualizzare e analizzare gli eventi di latenza.
Visualizza i volumi con latenza superiore alla soglia
La tabella Volumi con latenza superiore alla soglia mostra i volumi che hanno superato la soglia di latenza di avviso o critica nelle ultime 72 ore.
-
Viene mostrata solo la violazione più recente per ciascun volume. Le violazioni precedenti per lo stesso volume non vengono visualizzate.
-
Gli eventi vengono rimossi automaticamente dopo 72 ore.
-
Vengono visualizzati al massimo 200 eventi. Gli eventi più vecchi vengono rimossi man mano che ne vengono aggiunti di nuovi.
-
Gli eventi vengono visualizzati anche senza un collegamento al file system. È necessario un collegamento per visualizzare i dettagli dell'analisi di base o eseguire l'analisi AI.
-
Accedi utilizzando uno dei "esperienze di console".
-
Seleziona il menu
e poi seleziona EDA. -
Seleziona la scheda Latenza.
-
Esamina le informazioni relative a ciascun evento nella tabella.
-
Per visualizzare i dettagli di un evento di latenza, selezionare l'evento nella colonna Gravità. Si apre un pannello di analisi della latenza per quell'evento.
-
Per ordinare la tabella, selezionare un'intestazione di colonna qualsiasi. Per impostazione predefinita, gli eventi critici vengono visualizzati per primi, ordinati per ora, seguiti dagli eventi di avviso, anch'essi ordinati per ora.
-
Per chiudere uno o più eventi, accanto a ciascun evento seleziona
Dismiss. -
Per aggiungere colonne alla tabella, seleziona
, scegli le colonne e seleziona Applica. -
Il pannello di analisi della latenza fornisce una panoramica rapida della violazione, inclusi un grafico della latenza e controlli per intervallo di tempo e tipo. Seleziona Visualizza analisi completa per aprire la pagina di analisi dettagliata della latenza con analisi di base, analisi AI (opzionale) e grafici aggiuntivi. Vedi "Analizza le tendenze della latenza" per dettagli.
Analizzare un evento di latenza
Configura un ARN del modello Amazon Bedrock nelle impostazioni di Workload Factory, vedi "Requisiti di base di GenAI".
Un'analisi di base ti aiuta a individuare rapidamente le cause dei rallentamenti senza dover effettuare indagini manuali.
Pannello di analisi della latenza
Seleziona un evento di latenza nella colonna Gravità per aprire il pannello di analisi della latenza relativo a quell'evento. Il pannello include schede che offrono diverse visualizzazioni dell'evento di latenza.
Se hai configurato un ARN del modello Amazon Bedrock, puoi eseguire analisi AI sui dati e sugli scenari di cluster. Se Bedrock non è configurato, viene fornito un link alla pagina di configurazione dei carichi di lavoro di archiviazione per quel file system, dove puoi configurare l'accesso a Bedrock.
-
Base: Mostra i risultati di un'analisi automatica. Se collegato al file system, visualizza una ripartizione dei componenti e indica quale sta causando il ritardo. Se non esiste alcun collegamento, ti viene chiesto di aggiungerne uno. Viene visualizzato un grafico interattivo della latenza delle metriche di CloudWatch per il volume interessato. Mostra metriche di lettura o scrittura, a seconda di quale allarme ha attivato l'evento. Puoi scegliere intervalli di tempo diversi e usare un filtro per visualizzare tutte le operazioni, solo lettura, solo scrittura o operazioni sui metadati.
-
Analisi tramite IA: Mostra un'indagine più approfondita per determinare la causa principale specifica e le potenziali misure correttive.
-
Analisi dettagliata della latenza: mostra grafici interattivi delle metriche di CloudWatch per il volume interessato. Questi grafici visualizzano latenza, IOPS e throughput nel tempo. Mostrano metriche di lettura o scrittura, a seconda dell'allarme che ha attivato l'evento. Puoi scegliere diversi intervalli di tempo e usare un filtro per visualizzare tutte le operazioni, quelle di lettura, di scrittura o relative ai metadati.
Per istruzioni dettagliate sull'utilizzo dei grafici, vedi "Analizza le tendenze della latenza".
Passi
-
Nella scheda Latenza, individua l'evento che desideri analizzare.
-
Nella colonna Gravità, selezionare un evento di latenza per aprire un pannello di analisi relativo a tale evento.
-
Esamina la scheda Base. Se è presente un collegamento, apri la scomposizione dei componenti per vedere da dove proviene il ritardo. Se non è presente alcun collegamento, seleziona il prompt per collegarne uno così puoi analizzare i componenti.
-
Nella scheda Analisi IA, seleziona Analizza per visualizzare i risultati di un'indagine più approfondita, come possibili problemi relativi ai dati o ai cluster. Questo ti aiuta a determinare la causa principale specifica e le possibili misure correttive.
Esamina i risultati, tra cui:
-
Possibile spiegazione della causa principale
-
Elenco dei client EC2 interessati
-
Misure di risanamento raccomandate
-
-
Seleziona Visualizza analisi completa per vedere tutti i risultati dell'analisi AI, inclusi i grafici delle prestazioni che mostrano la latenza, gli IOPS e il throughput dalle metriche di CloudWatch nel periodo di tempo selezionato.
-
Segui i passaggi consigliati per risolvere il problema di latenza.
-
Dopo aver apportato le modifiche, controlla la tabella degli eventi di latenza per verificare che il problema sia stato risolto.
Best practice
Considera queste raccomandazioni quando analizzi i problemi di latenza:
-
Monitora le tendenze: Controlla regolarmente la tabella Volumes with latency above threshold per individuare modelli o problemi ricorrenti che potrebbero indicare problemi di configurazione.
-
Usa l'analisi AI in modo strategico: Usa l'analisi AI quando esamini i dati se l'analisi di base lo suggerisce. L'analisi AI può rivelare approfondimenti più profondi per problemi di prestazioni complessi che richiedono una risoluzione dettagliata.
-
Esamina gli eventi respinti: Controlla regolarmente perché gli eventi sono stati respinti per vedere se le soglie devono essere regolate o se il sistema può essere migliorato.
Per le best practice sull'analisi delle tendenze di latenza, vedere "Interpretazione del grafico".