Skip to main content
日本語は機械翻訳による参考訳です。内容に矛盾や不一致があった場合には、英語の内容が優先されます。

Workload Factory で EDA のレイテンシー傾向を分析する

共同作成者 netapp-sineadd

レイテンシー違反が検出されたら、グラフを使用して、ボリュームレイテンシー、IOPS、およびスループットが時間とともにどのように変化するかを確認してください。これにより、パターンを特定し、修復によってパフォーマンスが向上したかどうかを検証できます。

開始する前に

"レイテンシー監視を設定済み"が必要であり、少なくとも1件の違反が検出されている必要があります。グラフを表示するには、AWSの認証情報が利用可能であることを確認してください。QoSレイテンシコンポーネントの内訳を表示するには、ファイルシステムがリンクされていることを確認してください。

*詳細なレイテンシー分析*ページでは、レイテンシー、IOPS、スループットなど、時間の経過に伴うボリュームの動作を分析するのに役立つパフォーマンスグラフが提供されます。

タスク概要

グラフには、影響を受けたボリュームのCloudWatchメトリクスが表示されます。すべてのグラフは同じタイムラインを使用しています。どのアラームがイベントをトリガーしたかに基づいて、メトリクスが自動的に表示されます。

期間を変更することで、異なる期間のパフォーマンスを確認できます。また、すべての操作、読み取り操作、書き込み操作、メタデータ操作を切り替えることもできます。

視覚化には以下が含まれます:

  • レイテンシグラフ:ボリュームレイテンシ(ms)の時間経過に伴う変化を、警告およびクリティカルしきい値ラインと違反マーカーとともに表示します。

  • IOPSグラフ:時間の経過に伴うIOPSの変化を、しきい値と違反マーカー(設定されている場合)とともに表示します。

  • スループットグラフ:選択した期間におけるスループットの時間変化を表示します。フィルターで「メタデータ」が選択されている場合、スループットグラフにはデータが表示されません。

  • しきい値線:点線の水平線は、警告しきい値と危険しきい値を示します。

  • 違反マーカー:視覚的なマーカーは、検出された違反を示します。マーカーにカーソルを合わせると、深刻度、検出時間、CloudWatch の中央値レイテンシ(ms)、およびQoSレイテンシコンポーネントの内訳を確認できます。

手順
  1. 「レイテンシ」タブで、「重大度」列から該当するイベントを選択します。

    レイテンシー分析パネルが開きます。

  2. 選択した*期間*と*種類*について、レイテンシチャートと違反サマリーを確認してください。

  3. 「完全な分析を表示」を選択して、「詳細なレイテンシー分析」を開きます。

  4. レイテンシーチャート*では、*時間枠(例:72 Hours)と*タイプ*(Read/Write/Metadata)を使用してチャートを調整します。

  5. 以下の項目についてチャートを確認してください:

    • レイテンシ(ms)(警告/クリティカルしきい値ライン付き)

    • しきい値ラインを含む*IOPS*(設定されている場合)

    • 同じ時間範囲における*スループット*

  6. スパイクマーカーと違反サマリー(例:「この期間に1件の重大な違反が検出されました」)を使用して、レイテンシの増加とIOPSおよびスループットの変化との相関関係を調べます。

  7. 期間を変更して他の期間も確認し、パターンを探してください。

  8. レイテンシ、IOPS、スループットのトレンドラインを確認してください。IOPSとレイテンシのグラフには、比較のためのしきい値線が含まれています。

  9. 侵害マーカーにカーソルを合わせると、侵害の詳細(深刻度、検出時刻、CW の中央値レイテンシ、QoS レイテンシコンポーネント)が表示されます。

  10. グラフインサイトを使用して、次の操作を実行します。

    • 遅延の問題が一度だけ発生するのか、繰り返し発生するのかを確認してください。

    • レイテンシが高くなる時間帯を特定する

    • レイテンシースパイクが短時間で発生するのか、長時間続くのかを判断する

    • レイテンシイベントをワークロードパターンまたはシステム変更と比較する

結果

ボリュームの遅延が時間とともにどのように変化するかを確認できます。これは、今すぐ行動を起こすべきか、アラートの制限値を変更するべきか、システムの問題を確認するべきかを判断するのに役立ちます。

メモ チャートではCloudWatchメトリクスを使用しています。これらは、収集方法が異なるため、QoSで報告されるレイテンシコンポーネントとは若干異なる場合があります。

グラフの解釈

応答時間の変化を確認する際は、以下のヒントを参考にしてください。

  • 複数の時間枠を使用する:異なる時間範囲のグラフを見て、一時的な急上昇と継続的な減速の違いを見分けましょう。全体像を把握するために、まずは24時間表示から始めましょう。次に、より短い期間にズームインして特定の事象を調べたり、72時間表示に切り替えて日々のパターンを把握したりできます。

  • しきい値を視覚的に比較する:グラフ上のしきい値線を使用して、警告設定とクリティカル設定がワークロードに合っているかどうかを確認します。レイテンシが頻繁にしきい値に近づくものの、それを超えない場合は、しきい値が高すぎる可能性があります。しきい値を超える短いスパイクが多数発生するものの、動作に影響がない場合は、しきい値の設定が敏感すぎる可能性があります。

  • 日々のパターンを特定する:24時間表示と72時間表示を使用して、日中のパターンを把握します。レイテンシの急増が同時に発生する場合は、負荷の高いタスクを比較的静かな時間帯にスケジュールするか、負荷の高い時間帯に備えて容量を増強してください。

  • スパイクの種類を区別する:短いスパイクは通常、一時的な問題、例えば短時間のリソース競合などを意味します。レイテンシが長時間高いままの場合は、容量不足や設定の問題など、より深刻なシステム上の問題を示唆しています。状況ごとに異なる解決策が必要です。

  • 変更後の傾向を監視する:しきい値の調整、容量の追加、または設定の変更を行った後は、変更が正しく機能したことを確認するために、少なくとも72時間グラフを監視してください。