Workload Factory for EDAにおけるレイテンシーの問題を分析する
検出された遅延を確認し、自動化ツールを使用して FSx for ONTAP ボリュームのパフォーマンス低下の原因を特定し、修正します。
開始する前に
遅延イベントを表示および分析する前に、"レイテンシー監視を設定済み"を実行しておく必要があります。
しきい値を超えるレイテンシを持つボリュームを表示する
「しきい値を超えるレイテンシを持つボリューム」表には、過去72時間以内に警告または重大なレイテンシのしきい値を超えたボリュームが表示されます。
-
各ボリュームの最新の違反のみが表示されます。同じボリュームに関する過去の違反は表示されません。
-
イベントは 72 時間後に自動的に削除されます。
-
最大200件のイベントが表示されます。新しいイベントが追加されると、古いイベントは削除されます。
-
ファイルシステムリンクがなくてもイベントは表示されます。基本的な分析の詳細を表示したり、AI分析を実行したりするには、リンクが必要です。
-
次のいずれかを使用してログインします "コンソール体験"。
-
メニュー
を選択し、*EDA*を選択します。 -
*レイテンシ*タブを選択します。
-
表に記載されている各イベントの情報を確認してください。
-
遅延イベントの詳細を表示するには、*重大度*列で該当するイベントを選択してください。これにより、そのイベントの遅延分析パネルが開きます。
-
テーブルを並べ替えるには、任意の列ヘッダーを選択してください。デフォルトでは、まず重大なイベントが時間順に表示され、次に警告イベントが時間順に表示されます。
-
1つまたは複数のイベントを破棄するには、各イベントの横にある
*却下*を選択します。 -
テーブルに列を追加するには、
を選択し、列を選択してから*適用*を選択します。 -
レイテンシー分析パネルでは、レイテンシーチャートや時間枠、種類などの制御機能を含め、侵害の状況を素早く確認できます。「完全な分析を表示」を選択すると、基本分析、AI分析(オプション)、および追加のグラフを含む詳細なレイテンシー分析ページが開きます。詳細については、"レイテンシの傾向を分析"を参照してください。
レイテンシイベントを分析する
Workload Factory 設定で Amazon Bedrock モデル ARN を設定します。"GenAIの基本要件"を参照してください。
基本的な分析を行うことで、手動で調査することなく、動作の遅延の原因を迅速に特定できます。
レイテンシ分析パネル
*重大度*列でレイテンシイベントを選択すると、そのイベントのレイテンシ分析パネルが開きます。このパネルには、レイテンシイベントのさまざまな表示方法を示すタブが含まれています。
Amazon BedrockモデルのARNが設定されている場合、データおよびクラスタシナリオに対してAI分析を実行できます。Bedrockが設定されていない場合は、そのファイルシステムのStorage Workloads設定ページへのリンクが提供され、そこでBedrockへのアクセスを設定できます。
-
基本:自動分析の結果を表示します。ファイルシステムにリンクされている場合、コンポーネントの内訳を表示し、どのコンポーネントが遅延の原因となっているかを示します。リンクが存在しない場合は、追加するように促されます。影響を受けたボリュームの CloudWatch メトリクスのインタラクティブなレイテンシーグラフが表示されます。イベントをトリガーしたアラームに応じて、読み取りまたは書き込みのメトリクスが表示されます。異なる期間を選択したり、フィルターを使用して「すべて」、「読み取り」、「書き込み」、またはメタデータの操作を表示したりできます。
-
AI分析:より詳細な調査を行い、具体的な根本原因と潜在的な改善策を特定します。
-
詳細なレイテンシー分析:影響を受けたボリュームの CloudWatch メトリクスのインタラクティブなグラフを表示します。これらのグラフは、時間の経過に伴うレイテンシ、IOPS、およびスループットを示しています。イベントをトリガーしたアラームに応じて、読み取りまたは書き込みのメトリクスが表示されます。異なる期間を選択したり、フィルターを使用して「すべて」、「読み取り」、「書き込み」、または「メタデータ」の操作を表示したりできます。
グラフの使用方法に関する詳細な手順については、"レイテンシの傾向を分析"を参照してください。
手順
-
*レイテンシ*タブで、分析するイベントを探します。
-
*重大度*列で、遅延イベントを選択すると、そのイベントの分析パネルが開きます。
-
「Basic」タブを確認してください。リンクが接続されている場合は、コンポーネントの内訳を開いて、遅延の原因を確認してください。リンクが接続されていない場合は、コンポーネントを分析できるように、リンクを張るためのプロンプトを選択してください。
-
*AI分析*タブで*分析*を選択すると、データやクラスタの問題など、より詳細な調査結果が表示されます。これは、具体的な根本原因と潜在的な改善策を特定するのに役立ちます。
結果を確認します。確認項目は以下のとおりです。
-
潜在的な根本原因の説明
-
影響を受けるEC2クライアントのリスト
-
推奨される修復手順
-
-
*完全な分析を表示*を選択すると、選択した期間におけるCloudWatchメトリクスのボリュームレイテンシ、IOPS、スループットを示すパフォーマンスチャートを含む、AI分析の完全な結果が表示されます。
-
遅延の問題を解決するには、推奨される手順に従ってください。
-
変更を加えた後、レイテンシイベントテーブルを確認して、問題が解決されたことを確認してください。
ベストプラクティス
レイテンシの問題を分析する際には、次の推奨事項を考慮してください:
-
傾向の監視:しきい値を超えるレイテンシを持つボリュームのテーブルを定期的にチェックして、構成の問題を示唆する可能性のあるパターンや繰り返し発生する問題を特定します。
-
AI分析を戦略的に活用する:基本的な分析結果からAI分析が必要であると示唆される場合は、データをレビューする際にAI分析を活用してください。AI分析は、詳細なトラブルシューティングが必要な複雑なパフォーマンス問題について、より深い洞察を明らかにすることができます。
-
却下されたイベントのレビュー:イベントが却下された理由を定期的にレビューし、しきい値を調整する必要があるか、システムを改善する必要があるかを確認します。
遅延傾向の分析に関するベストプラクティスについては、"グラフの解釈"を参照してください。