복제된 NVRAM 및 HA 페일오버 동작
NetApp AFX는 NVRAM 복제를 백엔드 클러스터 네트워크로 이동시키고 제로 카피 볼륨 이동성을 사용하여 노드 장애 발생 후 작업 균형을 재조정합니다.
NVRAM이 직접 연결에서 스위치드 복제로 이동했습니다
ONTAP는 클러스터로 들어오는 쓰기 작업을 보호하기 위해 NVRAM을 임시 저장소로 사용합니다. ONTAP 클러스터의 각 노드에는 배터리로 백업되는 NVRAM 카드가 있습니다. 클라이언트에서 볼륨으로 쓰기 작업이 전송되면 먼저 NVRAM에 저장됩니다. NVRAM이 가득 차거나 10초 타이머가 만료되면(둘 중 먼저 발생하는 경우) NVRAM 내용이 디스크에 기록됩니다. 이를 정합성 보장 지점이라고 합니다.
NVRAM 콘텐츠는 HA 쌍 간에 지속적으로 복제되므로 데이터 정합성을 더욱 효과적으로 보호할 수 있습니다. 노드 장애가 발생하더라도 NVRAM 콘텐츠는 정상 노드에 보존되어 디스크에 커밋되기 때문입니다.
통합 ONTAP 클러스터에서 HA 쌍 간의 NVRAM 카드는 서로 직접 연결됩니다. NetApp AFX는 NVRAM 복제를 백엔드 클러스터 네트워크로 이동합니다. 결과적으로 HA 파트너 노드는 노드 간 엄격한 거리 제한을 받지 않습니다. 대신 HA 쌍은 이더넷 최대 거리까지 떨어져 있을 수 있습니다.
NetApp AFX NVRAM 복제

HA 페일오버 동작
통합 ONTAP에서 노드는 디스크와 애그리게이트를 소유하며, 데이터는 볼륨을 통해 제공됩니다. 쓰기 작업은 로컬 노드의 NVRAM을 사용하여 해당 노드가 소유한 디스크에 플러시됩니다. 노드가 재부팅되거나 장애가 발생하면 ONTAP는 장애가 발생한 노드의 리소스에 대한 테이크오버를 트리거하여 디스크 및 애그리게이트 소유권을 파트너 노드로 이전합니다. 네트워크 인터페이스 또한 IP 공간의 포트로 페일오버되며, NVRAM 내용은 HA 쌍 전체에 지속적으로 복제되므로, 해당 노드는 NVRAM 내용을 플러시하여 장애가 발생한 노드의 쓰기 작업을 디스크에 커밋합니다. 이후, 생존한 노드는 노드 반환이 발생할 때까지 장애가 발생한 노드의 애그리게이트와 볼륨을 소유하게 됩니다. 즉, 페일오버 문제가 해결될 때까지 해당 볼륨과 이미 생존한 노드가 소유한 볼륨에 대한 모든 트래픽은 단일 노드에서 처리됩니다.
초기 통합 ONTAP 클러스터 구축 시에는 단일 노드가 파트너 노드에 과부하를 일으키는 것을 방지하기 위해 장애 조치 계획을 미리 세우는 것이 좋습니다. 어떤 볼륨이 성능 저하의 주요 원인이 될지 예측하기 어렵기 때문에 이는 그 자체로 어려운 과제이지만, 무중단 볼륨 이동 및 볼륨 QoS(서비스 품질) 정책과 같은 기능을 통해 문제를 완화할 수 있습니다.
아래 이미지는 통합 ONTAP 클러스터에서 노드 간 성능 불균형이 발생할 수 있는 방식과 장애 조치로 인해 경우에 따라 성능 저하가 발생할 수 있는 방식을 보여줍니다.
Unified ONTAP – 노드 활용률의 잠재적 불균형

HA 쌍의 노드에 볼륨 수 및 성능 사용률 불균형이 발생하면 노드 페일오버가 전체 성능에 영향을 미칩니다. 정상 노드가 장애가 발생한 노드의 모든 볼륨을 소유하게 되기 때문입니다. 한편, 클러스터의 다른 노드에는 추가 작업을 처리할 여유가 있을 수 있습니다.
통합 ONTAP – 장애 조치가 노드 활용률에 미치는 영향

위 예시에서 HA 파트너 노드가 추가 작업을 처리해야 할 경우 과부하가 발생하여 해당 노드의 모든 볼륨 성능에 영향을 미칠 수 있습니다. 볼륨 이동은 이러한 상황을 완화하는 데 도움이 될 수 있지만, 노드 간 복사(사용 가능한 여유 공간 필요)가 필요하며, 이 작업에 소요되는 시간이 노드 장애 복구 시간보다 길어질 수 있습니다. 또한, 볼륨을 이동하면 원래 노드로 장애 복구되지 않습니다. 대신 이동한 노드에 그대로 유지됩니다.
NetApp AFX를 사용하면 노드 장애 조치가 몇 가지 다른 동작을 보입니다.
-
노드는 디스크를 소유하지 않고 물리적 애그리게이트도 없으므로 노드 페일오버 시 이러한 리소스를 전송할 필요가 없습니다. 대신 네트워크 인터페이스와 볼륨 소유권만 다른 노드로 이전됩니다.
-
NVRAM 커밋은 여전히 발생하지만, 직접 연결 대신 HA 네트워크를 통해 이루어집니다.
-
볼륨이 파트너 노드로 초기 페일오버를 수행하면 AFX는 클러스터 내의 다른 생존 노드에 볼륨을 재분배합니다. 이는 제로 카피 볼륨 이동을 통해 가능합니다.
-
노드가 복구되면 볼륨은 원래 노드로 다시 이동합니다.
NetApp AFX는 클러스터의 노드 간 성능 균형을 유지하여 비교적 균등한 사용률을 유지하므로, 장애 조치가 발생하고 볼륨이 재분배될 때 클러스터 전체의 노드 사용률은 거의 동일해야 합니다.
NetApp AFX - 장애 조치 후 볼륨 재조정
