Skip to main content
Data Infrastructure Insights
本繁體中文版使用機器翻譯,譯文僅供參考,若與英文版本牴觸,應以英文版本為準。

評估儲存設備健全狀況

貢獻者 netapp-alavoie

使用此方法,透過結合作用中警報、監控意圖、修正指導、相關平台日誌和物件上下文,確定儲存設備問題的優先順序。

註 DII MCP 是一項 "預覽" 功能,因此可能會發生變化。

先決條件

  • 時間範圍為 30 天或更短。

  • 選用的儲存系統、叢集、資源池或 Volume 範圍。

  • 可存取警報、監控、日誌和物件工具。

使用的工具

  • AlertsService_getMetadata

  • AlertsService_queryForAlerts

  • AlertsService_getAlertByName

  • MonitorsService_getMonitorById

  • LogService_getLogTypes

  • LogService_getLogTypeMetadata

  • LogService_queryLogEvents

  • ObjectService_getObjectTypes

  • ObjectService_getMetadataForObjectType

  • ObjectService_query

啟動提示

評估過去 24 小時的儲存設備健全狀況。識別儲存設備系統、節點、資源池與 Volume 的關鍵與警告作用中警報。對於影響最大的警報,解釋監控狀況與修正指引,然後檢查觸發時間前後相關的 EMS 或儲存設備平台日誌。分隔已確認的證據與可能的原因。

代理程式工作流程

  1. 取得警報中繼資料。

  2. 識別嚴重性、狀態、監控、相關物件和觸發時間的有效欄位。

  3. 在要求的視窗中查詢作用中的儲存設備相關警報。

  4. 使用以下方式排名警示:

    • 嚴重程度

    • 受影響的物件類型

    • 受影響物件的數量

    • 近期與重複發生

    • 可用性、資料保護、效能或容量影響

  5. 擷取最高優先權警報的完整詳細資訊。

  6. 擷取其監控定義與修正指南。

  7. 列出日誌類型,並選擇與每個警報相關的平台原生串流,例如 ONTAP EMS 或 StorageGRID 事件。

  8. 擷取日誌中繼資料,然後查詢警報前後較短的區間。

  9. 擷取確認目前狀態所需的物件屬性或計量。

  10. 產生一份包含證據、可能原因、影響和下次檢查的健全狀況總結。

解釋

不要將單一訊號視為完整的健全狀況評估:

  • *警報*顯示偵測到的情況。

  • *監控*說明偵測規則和預期的修正行動。

  • *日誌*提供平台原生事件情境。

  • 物件和計量 顯示目前庫存或測量狀態。

即使底層條件變化,作用中的警報仍可保持開啟。盡可能使用最新的物件和計量資料。

建議輸出

針對每個優先順序問題:

  • 受影響的資源

  • 嚴重程度和警報狀態

  • 觸發時間

  • 監控和狀態

  • 佐證日誌或計量

  • 已證實的證據

  • 可能的原因,被標記為推斷

  • 修正指引

  • 信心和缺失的證據

限制和隱私

  • 將警報與記錄視窗保持在 30 天以下。

  • 使用較窄的日誌視窗來減少無關事件。

  • 省略不必要的 UUID、位址、註解和原始酬載。

  • 修正指引僅供參考;請根據相關產品文件和變更流程驗證命令。

後續提示

對於警報 AL-123456,顯示觸發前後 30 分鐘內的監控指引和相關的 EMS 事件。

依受影響的系統和影響區域對作用中儲存設備警報進行分組。哪個系統需要優先注意?為什麼?

檢查目前物件計量是否仍支援最高優先級警報。