分析 Workload Factory for EDA 中的延遲問題
查看偵測到的延遲,並使用自動化工具尋找原因並修復 FSx for ONTAP 磁碟區中的效能緩慢問題。
開始之前
您必須先擁有 "已設定的延遲監控" 才能檢視和分析延遲事件。
檢視延遲高於臨界值的 Volume
「延遲超過臨界值的 Volume」表顯示延遲超過警告或關鍵延遲臨界值的 Volume。
-
每個磁碟區僅顯示最近一次資料外洩事件。同一磁碟區之前的外洩事件不會顯示。
-
最多顯示 200 個事件。隨著新事件的新增,較舊的事件將被移除。
-
即使沒有檔案系統連結,事件也會顯示。若要檢視基本分析詳細資料或執行 AI 分析,則需要連結。
-
使用以下任一方式登入 "主機體驗"。
-
選擇選單
,然後選擇 EDA。 -
選取 Latency 標籤。
-
審查表格中每個事件的資訊。
-
若要檢視延遲事件的詳細資訊,請在 Severity 欄中選取該事件。這將開啟該事件的延遲分析面板。
-
若要對表格進行排序,請選取任何欄標題。根據預設,重大事件會先依時間排序顯示,接著是依時間排序的警告事件。
-
若要關閉一個或多個事件,請在每個事件旁邊選取
Dismiss 。 -
若要新增欄至表格,請選擇
,選擇欄,然後選擇 套用。 -
延遲分析面板可快速檢視違規情況,包括延遲圖表以及時間範圍和類型控制選項。選取 檢視完整分析 可開啟詳細的延遲分析頁面,其中包含基本分析、AI 分析(可選)和其他圖表。詳情請參閱 "分析延遲趨勢"。
分析延遲事件
延遲分析可協助您快速找出導致速度變慢的原因,而無需手動調查。
|
|
若要使用 AI 分析,您必須啟用 NetApp 代管 AI。如需詳細資訊,請參閱 "管理 AI 功能"。 |
基本分析功能可以幫助您快速找到導致速度變慢的原因,而無需手動調查。
延遲分析面板
在 Severity 欄位中選取延遲事件,即可開啟該事件的延遲分析面板。此面板包含多個索引標籤,可提供延遲事件的不同檢視。
AI 分析可用度取決於您的帳戶設定。如果 NetApp 代管 AI 已啟用,則無需設定 Bedrock 即可執行 AI 分析。如果達到每月信用額度上限或系統管理員停用 AI 功能,則 AI 分析將無法使用。
-
基本:顯示自動分析結果。如果已連結到檔案系統,則會顯示組件分解訊息,並指出導致延遲的組件。如果未連結到檔案系統,系統會提示您新增連結。畫面會顯示受影響 Volume 的 CloudWatch 計量互動式延遲圖。根據觸發事件的警示,該圖會顯示讀取或寫入計量。您可以選擇不同的時間範圍,並使用篩選器檢視全部、讀取、寫入或元資料操作。
-
AI 分析:顯示更深入的調查,以確定具體的根本原因和潛在的補救步驟。
-
詳細延遲分析:顯示受影響 Volume 的 CloudWatch 計量互動式圖表。圖表顯示延遲、IOPS 和處理量隨時間的變化。根據觸發事件的警示類型,圖表會顯示讀取或寫入計量。您可以選擇不同的時間範圍,並使用篩選器檢視全部、讀取、寫入或元資料操作。
有關使用圖表的詳細說明,請參閱"分析延遲趨勢"。
步驟
-
在 Latency 標籤中,找到要分析的事件。
-
在 Severity 欄位中,選擇一個延遲事件,開啟該事件的分析面板。
-
審查 Basic 索引標籤。如果已連接連結,請開啟組件分解圖,查看延遲來源。如果未連接任何連結,請選擇提示以連結一個連結,以便分析各個組件。
-
在「AI 分析」標籤中,選擇「分析」(如有)以檢視更深入的調查結果,例如可能的資料或叢集問題。這有助於確定具體的根本原因和潛在的補救步驟。
查看結果,包括:
-
潛在根本原因說明
-
受影響的 EC2 用戶端清單
-
建議的補救步驟
-
-
選擇 View full analysis 以檢視 AI 分析的完整結果,包括效能圖表,這些圖表顯示所選時間段內來自 CloudWatch 計量的 Volume 延遲、IOPS 和處理量。
-
請按照建議的步驟解決延遲問題。
-
更改完成後,請檢查延遲事件表以確認問題已解決。
最佳實務
分析延遲問題時,請考慮以下建議:
-
監控趨勢:定期檢查延遲高於臨界值的 Volumes 表,以發現可能指向組態問題的模式或重複出現的問題。
-
策略性地運用 AI 分析:如果基礎分析顯示需要進行 AI 分析,則可在審查資料時使用 AI 分析。AI 分析可揭示複雜效能問題的更深層見解,這些問題需要詳細的疑難排解。
-
審查被駁回的事件:定期審查事件被駁回的原因,以確定是否需要調整閾值或改進系統。
如需分析延遲趨勢的最佳實務做法,請參閱 "圖表解讀"。