ディスク障害が原因の動的なパフォーマンス イベントへの対処
Unified Managerを使用して、アグリゲートを過剰に消費しているワークロードが原因のパフォーマンス イベントを調査できます。また、Unified Managerを使用してアグリゲートの健全性を確認し、アグリゲートで検出された最近の健全性イベントがパフォーマンス イベントに関与しているかどうかを判断できます。
開始する前に
-
オペレータ、アプリケーション管理者、またはストレージ管理者のロールが必要です。
-
新規、確認済み、または廃止のパフォーマンス イベントが存在する必要があります。
手順
-
イベントに関する情報を表示するには、「イベントの詳細」ページを表示します。
-
*概要*を読んでください。イベントに関係するワークロードと競合しているクラスタコンポーネントについて説明しています。
競合状態のクラスタ コンポーネントによってレイテンシが影響を受けたVictimボリュームが複数あります。障害ディスクをスペア ディスクと交換するためにRAIDの再構築を実行中のアグリゲートが、競合状態のクラスタ コンポーネントです。[競合しているコンポーネント]の下にアグリゲート アイコンが赤で強調表示され、かっこ内にアグリゲートの名前が表示されます。
-
ワークロード利用率チャートで、「Bully Workloads」を選択します。
-
グラフにカーソルを合わせると、コンポーネントに影響を与えている上位のBullyワークロードが表示されます。
イベントの検出以降、最大利用率が最も高い上位のワークロードがグラフの最上位に表示されます。上位のワークロードの1つはシステム定義のワークロード「Disk Health」です。これはRAIDの再構築を示しています。再構築は、スペア ディスクを使用してアグリゲートを再構築する内部プロセスです。Disk Healthワークロードとこのアグリゲートの他のワークロードが組み合わされて、アグリゲートでの競合および関連するイベントを引き起こした可能性があります。
-
Disk Healthワークロードのアクティビティがイベントの原因であることを確認したら、再構築が完了し、Unified Managerがイベントを分析してアグリゲートが引き続き競合状態にあるかを検出するまで約30分待ちます。
-
*イベントの詳細*を更新します。
RAIDの再構築が完了したら、[状態]が「廃止」になったことを確認します。これは、イベントが解決されたことを示します。
-
ワークロード利用率チャートで、Bully Workloads を選択すると、ピーク利用率別にアグリゲートのワークロードを表示できます。
-
「推奨されるアクション」エリアで、最上位のワークロードの「ワークロードの分析」ボタンをクリックします。
-
*ワークロード分析*ページで、選択したボリュームの過去24時間(1日)のデータを表示するように時間範囲を設定します。
イベントタイムラインでは、赤い点(
)は、ディスク障害イベントが発生した時点を示します。 -
[ノードとアグリゲートの利用率]グラフで、ノード統計の行を非表示にし、アグリゲートの行だけを表示します。
-
このグラフのデータと、イベント発生時の「レイテンシ」グラフのデータを比較してください。
[アグリゲート利用率]では、イベント発生時にRAIDの再構築プロセスが原因の多数の読み取り / 書き込みアクティビティが表示されており、これが選択したボリュームのレイテンシ増加につながりました。イベント発生の数時間後には、読み取り / 書き込みとレイテンシの両方が減少し、アグリゲートの競合状態は解消しました。