分析 Workload Factory 中 EDA 的延遲趨勢
偵測到延遲違規後,請使用圖表查看 Volume 延遲、IOPS 和處理量隨時間的變化。這有助於您發現規律並驗證修復措施是否提升了效能。
開始之前
您需要 "已設定的延遲監控" 且至少偵測到一次安全漏洞。若要檢視圖表,請確保 AWS 憑證可用。若要檢視 QoS 延遲元件細分,請確保檔案系統已連結。
分析延遲趨勢
*詳細延遲分析*頁面提供效能圖表,協助您分析一段時間內的 Volume 行為:延遲、IOPS 和處理量。
圖表顯示受影響 Volume 的 CloudWatch 計量。所有圖表均使用相同時間軸。它們會根據觸發事件的警示自動顯示計量。
您可以變更時間範圍以查看不同時間段的效能。您也可以在「全部」、「讀取」、「寫入」或「元資料」操作之間切換。
視覺化內容包括:
-
延遲圖:顯示 Volume 延遲(毫秒)隨時間的變化,並標有警告和關鍵臨界值線以及違規標記。
-
IOPS 圖表:顯示 IOPS 隨時間的變化,以及臨界值和突破標記(如果已設定)。
-
處理量圖表:顯示所選時間範圍內的處理量變化。如果在篩選器中選擇了 Metadata,則處理量圖表不顯示任何資料。
-
臨界值線:虛線水平線表示警告臨界值和關鍵臨界值。
-
違規標記:視覺標記指示偵測到的違規行為。將滑鼠懸停在標記上可檢視嚴重程度、偵測時間、CloudWatch 中位數延遲(毫秒)以及 QoS 延遲組件細分。
-
在「延遲」標籤中,選取「嚴重性」欄中的事件。
延遲分析面板隨即開啟。
-
審查所選*時間範圍*和*類型*的延遲圖表和違規摘要。
-
選擇 View full analysis 以開啟 Detailed latency analysis。
-
在*延遲圖表*中,使用*時間範圍*(例如,72 小時)和*類型*(讀取/寫入/元資料)來調整圖表。
-
審查以下圖表:
-
延遲(毫秒)及警告/關鍵臨界值線
-
IOPS(含臨界值線,如已設定)
-
在同一時間範圍內的*處理量*
-
-
使用峰值標記和違規摘要(例如,「在此時間範圍內偵測到 1 個關鍵違規」)將延遲增加與 IOPS 和處理量變化相關聯。
-
更改時間範圍,查看其他時間段並尋找規律。
-
查看延遲、IOPS 和吞吐量的趨勢線。IOPS 和延遲圖表包含閾值線,以便進行比較。
-
將滑鼠懸停在違規標記上,即可檢視違規詳情(嚴重性、偵測到的時間、CW 中位數延遲和 QoS 延遲元件)。
-
使用圖表深入分析來:
-
查看延遲問題是只發生一次還是反覆發生
-
確定一天中延遲較高的時段
-
判斷延遲高峰是短暫的還是持續時間較長的
-
將延遲事件與工作負載模式或系統變化進行比較
-
您可以查看磁碟區延遲隨時間的變化。這有助於您決定是否立即採取措施、變更警示限制或檢查系統問題。
|
|
圖表使用 CloudWatch 計量。這些計量可能與 QoS 報告的延遲元件略有不同,因為它們的收集方式不同。 |
圖表解讀
在審查回應時間變化時,請參考以下提示:
-
使用多個時間範圍:查看不同時間範圍的圖表,以區分短暫的尖峰和持續的速度下降。首先查看 24 小時視圖以了解整體情況。然後縮小至較短的時間段以檢視特定事件,或切換至 72 小時視圖以找出每日規律。
-
直觀比較閾值:使用圖表上的閾值線檢查您的警告和嚴重設定是否符合您的工作負載。如果延遲經常接近閾值但未超過閾值,則閾值可能過高。如果您看到許多短暫的峰值超過閾值但不影響作業,則閾值可能過於敏感。
-
辨識每日規律:使用 24 小時和 72 小時檢視來發現一天中的規律。如果延遲高峰出現在同一時間段,請將繁重任務安排在較為空閒的時段,或在繁忙時段增加容量。
-
區分峰值類型:短暫的峰值通常意味著暫時性問題,例如短暫的資源爭用。而長時間持續的高延遲則表示系統有更深層的問題,例如容量不足或組態問題。每種情況都需要不同的解決方案。
-
更改後監測趨勢:調整閾值、增加容量或更改設定後,至少監測圖表 72 小時,以確保更改生效。