Analyser les problèmes de latence dans Workload Factory pour EDA
Consultez les délais détectés et utilisez des outils automatisés pour en trouver la cause et corriger les ralentissements dans vos volumes Amazon FSx for ONTAP.
Avant de commencer
Vous devez avoir "surveillance de la latence configurée" avant de pouvoir visualiser et analyser les événements de latence.
Afficher les volumes avec une latence supérieure au seuil
Le tableau « Volumes avec une latence supérieure au seuil » affiche les volumes qui ont dépassé le seuil de latence d'alerte ou critique au cours des 72 dernières heures.
-
Seule la violation la plus récente pour chaque volume est affichée. Les violations antérieures pour le même volume ne sont pas affichées.
-
Les événements sont automatiquement supprimés après 72 heures.
-
Seuls 200 événements au maximum sont affichés. Les événements les plus anciens sont supprimés au fur et à mesure que de nouveaux sont ajoutés.
-
Les événements apparaissent même sans lien vers le système de fichiers. Un lien est nécessaire pour consulter les détails d’analyse de base ou exécuter une analyse par IA.
-
Connectez-vous en utilisant l'un des "expériences sur console".
-
Sélectionnez le menu
et sélectionnez ensuite EDA. -
Sélectionnez l'onglet Latence.
-
Examinez les informations relatives à chaque événement dans le tableau.
-
Pour afficher les détails d'un événement de latence, sélectionnez l'événement dans la colonne Severity. Cela ouvre un panneau d'analyse de latence pour cet événement.
-
Pour trier le tableau, sélectionnez l'en-tête d'une colonne. Par défaut, les événements critiques sont affichés en premier, triés par heure, suivis des événements d'avertissement triés par heure.
-
Pour annuler un ou plusieurs événements, à côté de chaque événement, sélectionnez
Annuler. -
Pour ajouter des colonnes au tableau, sélectionnez
, choisissez les colonnes, puis sélectionnez Appliquer. -
Le panneau d'analyse de latence offre un aperçu rapide de la violation, incluant un graphique de latence et des contrôles pour la période et le type. Sélectionnez Afficher l'analyse complète pour ouvrir la page d'analyse de latence détaillée avec une analyse de base, une analyse par IA (facultative) et des graphiques supplémentaires. Voir "Analyser les tendances de latence" pour plus de détails.
Analyser un événement de latence
Configurez un ARN de modèle Amazon Bedrock dans les paramètres de Workload Factory, voir "Exigences de base de GenAI".
Une analyse de base vous aide à identifier rapidement la cause des ralentissements sans avoir à enquêter manuellement.
Panneau d'analyse de la latence
Sélectionnez un événement de latence dans la colonne Gravité pour ouvrir le panneau d'analyse de latence correspondant. Le panneau comprend des onglets qui offrent différentes vues de l'événement de latence.
Si un ARN de modèle Amazon Bedrock est configuré, vous pouvez exécuter des analyses d'IA sur les données et les scénarios de cluster. Si Bedrock n'est pas configuré, un lien vers la page de configuration des charges de travail de stockage pour ce système de fichiers est fourni, où vous pouvez configurer l'accès à Bedrock.
-
Basique : Affiche les résultats d'une analyse automatique. S'il est lié au système de fichiers, il présente le détail des composants et indique celui qui est à l'origine du délai. En l'absence de lien, vous êtes invité à en ajouter un. Un graphique interactif de latence des métriques CloudWatch pour le volume concerné s'affiche. Il présente soit les métriques de lecture, soit celles d'écriture, selon l'alarme qui a déclenché l'événement. Vous pouvez choisir différentes plages temporelles et utiliser un filtre pour afficher toutes les opérations, les opérations de lecture, d'écriture ou de métadonnées.
-
Analyse par IA : Affiche une investigation plus approfondie pour déterminer la cause profonde spécifique et les mesures correctives potentielles.
-
Analyse détaillée de la latence : Affiche des graphiques interactifs des métriques CloudWatch pour le volume concerné. Ces graphiques présentent la latence, les IOPS et le débit au fil du temps. Ils affichent soit les métriques de lecture, soit celles d’écriture, selon l’alarme qui a déclenché l’événement. Vous pouvez sélectionner différentes plages horaires et utiliser un filtre pour afficher toutes les opérations, les opérations de lecture, d’écriture ou de métadonnées.
Pour des instructions détaillées sur l'utilisation des graphiques, voir "Analyser les tendances de latence".
Mesures
-
Dans l'onglet Latence, repérez l'événement que vous souhaitez analyser.
-
Dans la colonne Gravité, sélectionnez un événement de latence pour ouvrir un panneau d'analyse pour cet événement.
-
Consultez l'onglet Basic. Si un lien est connecté, ouvrez le détail des composants pour voir d'où provient le délai. Si aucun lien n'est connecté, sélectionnez l'invite pour en lier un afin de pouvoir analyser les composants.
-
Dans l'onglet Analyse IA, sélectionnez Analyser pour consulter les résultats d'une analyse plus approfondie, tels que d'éventuels problèmes de données ou de cluster. Cela vous aide à déterminer la cause première spécifique et les étapes potentielles de remédiation.
Examinez les résultats, notamment :
-
Explication de la cause potentielle
-
Liste des clients EC2 concernés
-
Étapes correctives recommandées
-
-
Sélectionnez Afficher l'analyse complète pour consulter l'intégralité des résultats de l'analyse IA, y compris les graphiques de performance affichant la latence du volume, les IOPS et le débit à partir des métriques CloudWatch sur la période sélectionnée.
-
Suivez les étapes recommandées pour résoudre le problème de latence.
-
Après avoir effectué les modifications, consultez le tableau des événements de latence pour confirmer que le problème est résolu.
Meilleures pratiques
Tenez compte des recommandations suivantes lors de l'analyse des problèmes de latence :
-
Surveillez les tendances : Consultez régulièrement le tableau des volumes dont la latence dépasse le seuil afin de repérer les tendances ou les problèmes récurrents pouvant indiquer des problèmes de configuration.
-
Utilisez l'analyse IA de manière stratégique : utilisez l'analyse IA lors de l'examen des données si une analyse de base le suggère. L'analyse IA peut révéler des informations plus approfondies sur des problèmes de performance complexes nécessitant un dépannage détaillé.
-
Examinez les événements rejetés : Passez régulièrement en revue les raisons pour lesquelles des événements ont été rejetés afin de déterminer si les seuils doivent être ajustés ou si le système doit être amélioré.
Pour connaître les meilleures pratiques en matière d'analyse des tendances de latence, voir "Interprétation du graphique".