ストレージの健全性を評価する
この手順を使用すると、アクティブなアラート、監視意図、是正ガイダンス、関連するプラットフォームログ、およびオブジェクトコンテキストを組み合わせて、ストレージの問題の優先順位付けを行うことができます。
|
|
DII MCPは"プレビュー"機能であるため、変更される可能性があります。 |
前提条件
-
30日以内の期間。
-
オプションで、ストレージシステム、クラスター、プール、またはボリュームの範囲を指定できます。
-
アラート、監視、ログ、およびオブジェクトツールへのアクセス。
使用したツール
-
AlertsService_getMetadata
-
AlertsService_queryForAlerts
-
AlertsService_getAlertByName
-
MonitorsService_getMonitorById
-
LogService_getLogTypes
-
LogService_getLogTypeMetadata
-
LogService_queryLogEvents
-
ObjectService_getObjectTypes
-
ObjectService_getMetadataForObjectType
-
ObjectService_query
スタータープロンプト
過去24時間のストレージの状態を評価します。ストレージシステム、ノード、プール、ボリュームに関する、重大および警告のアクティブなアラートを特定します。最も影響の大きいアラートについては、監視条件と是正措置について説明し、トリガー発生時刻前後の関連するEMSまたはストレージプラットフォームのログを検査します。確証された証拠と可能性のある原因を区別します。
エージェントのワークフロー
-
アラートのメタデータを取得します。
-
重要度、ステータス、監視対象、関連オブジェクト、トリガー時刻について有効なフィールドを特定します。
-
指定された期間内のアクティブなストレージ関連のアラートを照会します。
-
アラートのランク付け方法:
-
重大度
-
影響を受けるオブジェクトタイプ
-
影響を受けるオブジェクトの数
-
最近性と再発
-
可用性、データ保護、パフォーマンス、または容量への影響
-
-
最優先アラートの詳細情報を取得します。
-
モニターの定義と修正ガイダンスを取得してください。
-
ログの種類を一覧表示し、ONTAP EMSやStorageGRIDイベントなど、各アラートに関連するプラットフォームネイティブのストリームを選択します。
-
ログのメタデータを取得し、アラート発生前後の狭い範囲をクエリします。
-
現在の状態を確認するために必要なオブジェクト属性またはメトリクスを取得します。
-
根拠、考えられる原因、影響、次回の確認を記載した健全性の概要を作成してください。
解釈
一つの兆候だけで完全な健康状態の評価とみなさないでください:
-
*アラート*は検出された状況を表示します。
-
*モニター*は、検出ルールと想定される是正措置について説明します。
-
*ログ*は、プラットフォーム固有のイベントコンテキストを提供します。
-
*オブジェクトとメトリクス*は、現在のインベントリまたは測定された状態を示します。
アクティブなアラートは、根本的な状況が変化した後もオープンのままになる場合があります。可能な限り、最新のオブジェクトデータとメトリックデータを使用してください。
推奨出力
各優先課題について:
-
影響を受けるリソース
-
重大度とアラート状態
-
トリガー時間
-
監視とコンディション調整
-
裏付けとなるログまたはメトリクス
-
確認された証拠
-
考えられる原因、推論としてラベル付け
-
是正指導
-
確信度と証拠の欠落
制限とプライバシー
-
アラートとログのウィンドウは30日未満に維持してください。
-
無関係なイベントを減らすために、ログウィンドウを狭く設定してください。
-
不要なUUID、アドレス、注釈、および生のペイロードは省略してください。
-
修正ガイダンスは情報提供を目的としています。関連する製品ドキュメントおよび変更プロセスと照らし合わせてコマンドを検証してください。
フォローアッププロンプト
アラート `AL-123456`について、トリガー発生前後30分以内のモニターガイダンスと関連するEMSイベントを表示します。
アクティブストレージのアラートを、影響を受けるシステムと影響範囲ごとにグループ化します。どのシステムに最初に対処すべきですか、またその理由は何ですか?
最優先アラートが現在のオブジェクトメトリクスで引き続きサポートされているかどうかを確認してください。