Workload Factory에서 EDA의 지연 시간 추세 분석
지연 시간 위반이 감지되면 차트를 사용하여 시간 경과에 따른 볼륨 지연 시간, IOPS 및 처리량의 변화를 확인하십시오. 이를 통해 패턴을 파악하고 개선 조치가 성능을 향상시켰는지 검증할 수 있습니다.
시작하기 전에
"구성된 지연 시간 모니터링"최소 한 건의 침해 감지 사례가 있어야 합니다. 차트를 보려면 AWS 자격 증명이 필요합니다. QoS 지연 시간 구성 요소 분석을 보려면 파일 시스템이 연결되어 있어야 합니다.
지연 시간 추세 분석
상세 지연 시간 분석 페이지는 시간 경과에 따른 볼륨 동작(지연 시간, IOPS 및 처리량)을 분석하는 데 도움이 되는 성능 그래프를 제공합니다.
이 그래프들은 영향을 받은 볼륨에 대한 CloudWatch 메트릭을 보여줍니다. 모든 그래프는 동일한 타임라인을 사용합니다. 어떤 알람이 이벤트를 트리거했는지에 따라 메트릭이 자동으로 표시됩니다.
시간 범위를 변경하여 다양한 기간 동안의 성능을 확인할 수 있습니다. 또한 전체, 읽기, 쓰기 또는 메타데이터 작업 중에서 선택하여 볼 수 있습니다.
시각화에는 다음 내용이 포함됩니다.
-
지연 시간 그래프: 시간 경과에 따른 볼륨 지연 시간(ms)을 경고 및 위험 임계값 선과 위반 표시와 함께 보여줍니다.
-
IOPS 그래프: 시간 경과에 따른 IOPS를 표시하며, 임계값 및 위반 표시(구성된 경우)가 포함됩니다.
-
처리량 그래프: 선택한 기간 동안의 처리량을 시간 경과에 따라 보여줍니다. 필터에서 메타데이터를 선택하면 처리량 그래프에 데이터가 표시되지 않습니다.
-
임계선: 점선으로 표시된 가로선은 경고 및 위험 임계값을 나타냅니다.
-
침해 표시: 시각적 표시는 감지된 침해를 나타냅니다. 표시 위에 마우스를 올리면 심각도, 감지 시간, CloudWatch 중앙값 지연 시간(밀리초) 및 QoS 지연 시간 구성 요소 분석을 볼 수 있습니다.
-
지연 시간 탭에서 심각도 열에 있는 이벤트를 선택합니다.
지연 시간 분석 패널이 열립니다.
-
선택한 기간 및 *유형*에 대한 지연 시간 차트와 침해 요약을 검토하십시오.
-
*전체 분석 보기*를 선택하여 *상세 지연 시간 분석*을 엽니다.
-
지연 시간 차트*에서는 *시간 범위(예: 72시간)와 유형(읽기/쓰기/메타데이터)을 사용하여 차트를 조정할 수 있습니다.
-
다음 항목에 대한 차트를 검토하십시오.
-
경고/위험 임계값 선이 포함된 지연 시간(ms)
-
IOPS (임계값 라인 포함, 설정된 경우)
-
동일한 시간 범위 내의 처리량
-
-
스파이크 마커와 침해 요약(예: "이 기간 동안 심각한 침해 1건 감지됨")을 사용하여 지연 시간 증가와 IOPS 및 처리량 변화 간의 상관관계를 파악하십시오.
-
기간 범위를 변경하여 다른 기간을 검토하고 패턴을 찾아보세요.
-
지연 시간, IOPS 및 처리량의 추세선을 확인하십시오. IOPS 및 지연 시간 그래프에는 비교를 위한 임계값 선이 포함되어 있습니다.
-
침해 표시 위에 마우스를 올리면 침해 세부 정보(심각도, 감지 시간, CW 중앙값 지연 시간 및 QoS 지연 시간 구성 요소)를 볼 수 있습니다.
-
그래프 인사이트를 사용하여 다음을 수행하십시오.
-
지연 문제가 한 번만 발생하는지 아니면 반복적으로 발생하는지 확인하십시오.
-
지연 시간이 더 높은 시간대를 파악합니다.
-
지연 시간 급증 현상이 단기적인지 장기적인지 판단하십시오.
-
지연 이벤트를 워크로드 패턴 또는 시스템 변경 사항과 비교합니다.
-
시간 경과에 따른 볼륨 지연 시간 변화를 확인할 수 있습니다. 이를 통해 지금 조치를 취해야 할지, 알림 한도를 변경해야 할지, 아니면 시스템 문제를 확인해야 할지 결정할 수 있습니다.
|
|
이 차트는 CloudWatch 지표를 사용합니다. 이러한 지표는 수집 방식이 다르기 때문에 QoS에서 보고하는 지연 시간 구성 요소와 약간 다를 수 있습니다. |
그래프 해석
응답 시간 변경 사항을 검토할 때 다음 팁을 활용하십시오.
-
다양한 시간 범위를 활용하세요: 여러 기간의 그래프를 살펴보면서 일시적인 급증과 지속적인 성능 저하를 구분하세요. 먼저 24시간 그래프를 통해 전체적인 맥락을 파악하세요. 그런 다음 더 짧은 기간으로 확대하여 특정 사건을 살펴보거나 72시간 그래프로 전환하여 일별 패턴을 확인하세요.
-
임계값을 시각적으로 비교하세요: 그래프의 임계값 선을 사용하여 경고 및 중요 설정이 워크로드에 적합한지 확인하세요. 지연 시간이 임계값에 자주 근접하지만 넘지 않는다면 임계값이 너무 높을 수 있습니다. 반대로 임계값을 넘는 짧은 스파이크가 자주 발생하지만 운영에 영향을 미치지 않는다면 임계값이 너무 민감할 수 있습니다.
-
일일 패턴 파악: 24시간 및 72시간 보기를 활용하여 하루 중 패턴을 파악하세요. 지연 시간 급증이 같은 시간에 발생하는 경우, 사용량이 많은 작업은 사용량이 적은 시간대에 예약하거나 사용량이 많은 시간대에 용량을 추가하세요.
-
급증 유형 구분: 짧은 시간 동안 발생하는 급증은 일시적인 문제, 예를 들어 짧은 시간 동안의 리소스 경합을 의미합니다. 시간이 지남에 따라 높은 지연 시간이 지속되는 경우는 용량 부족이나 구성 문제와 같은 더 심각한 시스템 문제를 나타냅니다. 각 상황에는 다른 해결책이 필요합니다.
-
변경 후 추세 모니터링: 임계값을 조정하거나, 용량을 추가하거나, 설정을 변경한 후에는 변경 사항이 제대로 적용되었는지 확인하기 위해 최소 72시간 동안 그래프를 모니터링하십시오.