パフォーマンスのトラブルシューティング
この手順を使用すると、パフォーマンスメトリック、アラート、プラットフォームログを関連付けることで、低速なボリューム、データストア、仮想マシン、Kubernetesワークロード、またはその他のDIIオブジェクトを調査できます。
|
|
DII MCPは"プレビュー"機能であるため、変更される可能性があります。 |
前提条件
-
影響を受けたリソース名と、おおよそのインシデント発生時刻。
-
30日以内の期間。
-
可能な場合は、比較期間または既知の正常なベースライン。
使用したツール
-
ObjectService_getObjectTypes
-
ObjectService_getMetadataForObjectType
-
ObjectService_query
-
ObjectService_queryPerformanceMetricsForObjects
-
ObjectService_groupObjects
-
AlertsService_getMetadata
-
AlertsService_queryForAlerts
-
LogService_getLogTypes
-
LogService_getLogTypeMetadata
-
LogService_queryLogEvents
スタータープロンプト
09:00から11:00 UTCの間にボリューム `example-volume`の動作が遅くなった原因を調査します。適切なオブジェクトタイプと有効なメトリックを特定し、インシデント発生期間におけるレイテンシ、IOPS、スループットを比較し、関連するアクティブなアラートとプラットフォームログを調査して、正常な期間と比較します。証拠と仮説を区別し、次に必要な測定項目を特定します。
エージェントのワークフロー
-
リソースを正確なオブジェクトタイプとIDに解決します。
-
そのオブジェクトタイプのメタデータを取得します。
-
有効なレイテンシ、操作、スループット、利用率、および容量の指標を特定します。
-
現在のオブジェクト属性を照会して、配置と関係性を確立します。
-
時系列データを取得する:
-
インシデント期間
-
同等の健全なウィンドウ
-
-
メトリクス全体でタイムスタンプと集計関数を整合させます。
-
リソースを含んでいるシステム、ホスト、ノード、またはストレージプールに関連するアラートを取得します。
-
関連するログストリームを選択し、メタデータを取得して、メトリックの変化を中心とした狭い範囲を検索します。
-
妥当な仮説を検証する:
-
需要の急増
-
リソース飽和
-
ストレージまたはファブリックのエラー
-
容量の逼迫
-
ホストまたはVMの競合
-
コレクションギャップ
-
-
最も支持されている説明と、未解決の代替案を報告します。
証拠基準
ラベルの調査結果:
-
観測: ツールから直接返された値。
-
相関: 独立した信号が同じ時間間隔で変化しました。
-
推測: まだ証明されていない、もっともらしい説明。
-
不明: 必要な証拠が入手できません。
相関関係は因果関係ではありません。同時発生したアラートは、メカニズムが確立されていない限り、確証ではなく、それを裏付ける証拠として扱う必要があります。
指標に関するガイダンス
-
広範な動作には `AVG`を使用しますが、短いスパイクが重要な場合は `MAX`を検査してください。
-
加算指標にのみ `SUM`を使用してください。
-
メタデータがサポートしている場合は、カウンタや増加に対して `CHANGE`または CHANGE_RATIO を使用します。
-
異なるバケット境界や単位を持つ系列を比較することは避けてください。
-
フィルターは、時間単位の集計前に適用されます。
推奨出力
-
インシデントの範囲とタイムライン
-
指標の証拠
-
アラートとログの証拠
-
正常期間との比較
-
最も可能性の高い説明
-
代替仮説
-
確信度と証拠の欠落
-
推奨される次のチェック
制限とプライバシー
-
時系列データの表示期間は30日を超えることはできません。
-
パフォーマンスツールは限られた数の系列を返します。制限を増やす前に、フィルターを絞り込んでください。
-
診断に役立たない機密性の高い生ログフィールドは省略してください。
-
通常の運用管理を通じて検証することなく、停止を伴う修復を提案しないでください。
フォローアッププロンプト
インシデント発生時の最大レイテンシと平均レイテンシを、前の正常な日の同じ時間帯と比較してください。
関連するワークロードをホストまたはストレージプールごとにグループ化し、速度低下が個別の問題によるものか、共有されている問題かを特定します。
最初のレイテンシ増加から15分以内のプラットフォームイベントを表示します。