Skip to main content
NetApp artificial intelligence solutions
본 한국어 번역은 사용자 편의를 위해 제공되는 기계 번역입니다. 영어 버전과 한국어 버전이 서로 어긋나는 경우에는 언제나 영어 버전이 우선합니다.

1. 요약

기여자 nkarthik

Karthikeyan Nagalingam, NetApp

[[1-1-purpose-of-this-document]]
== 1.1 본 문서의 목적

이 NetApp 검증 아키텍처(NVA)는 원시 데이터를 수집하고, 머신 러닝에 적합하도록 데이터를 준비하고, NetApp XCP를 사용하여 스토리지 계층 간에 고속으로 데이터를 이동하고, 모델을 학습 및 점진적으로 미세 조정하고, 예측을 생성하고, 거버넌스 및 재현성을 위해 결과를 아카이빙하는 프로덕션 수준의 AI 데이터 파이프라인을 문서화합니다. 이 문서는 아키텍트와 인프라 팀이 설계 근거, 배포, 구성 및 운영을 안내하기 위한 것입니다.

[[1-2-audience]]
== 1.2 대상 독자

솔루션 아키텍트, 스토리지/인프라 엔지니어, 데이터 플랫폼 엔지니어, ML 엔지니어 및 AI/ML 워크로드를 위한 NetApp 스토리지 및 데이터 이동성 기술을 평가하는 IT 의사 결정권자.

[[1-3-business-challenge-overview]]
== 1.3 비즈니스 과제 개요

AI 팀은 오브젝트 스토리지에 저장된 데이터를 안정적으로 변환한 후, 일반적인 워크로드에는 탄력적인 S3를, I/O 집약적인 학습에는 고성능 병렬 파일 시스템(LustreFS)을 사용하는 등 학습에 가장 적합한 컴퓨팅-스토리지 계층으로 전달해야 합니다. 관리되는 데이터 이동성 및 오케스트레이션 계층이 없다면, 팀은 재시도, 체크포인트, 스토리지 유연성 및 감사 추적 기능이 부족한 취약하고 단일 목적의 스크립트에 의존하게 됩니다.

기업의 AI 프로그램이 정체되는 이유는 모델이나 컴퓨팅 성능의 한계 때문이 아니라, 기존 스토리지가 AI에 최적화되어 있지 않기 때문입니다. 대규모 데이터셋을 이동하고, 학습 중 GPU에 지속적으로 데이터를 공급하고, 체크포인트 오버헤드를 관리하고, 스토리지 비용을 통제하는 데 드는 노력이 AI 작업 자체보다 더 많습니다. 단일 계층 아키텍처는 성능과 비용 사이의 절충점을 강요하며, 모델과 데이터셋이 커질수록 이러한 절충점은 더욱 심화됩니다.

[[1-4-netapp-solution-summary]]
== 1.4 NetApp 솔루션 요약

이 솔루션은 Apache Airflow DAG(방향 비순환 그래프)를 사용하여 데이터 수집, 준비, 이동, 학습, 미세 조정, 추론 및 아카이빙을 통합적으로 관리합니다. StorageGRID는 원시 데이터 및 장기 아카이빙 오브젝트 계층을 담당합니다. 데이터 준비 과정에서는 실행 스탬프가 찍힌 데이터셋과 매니페스트를 ONTAP NAS 버킷에 기록하고, 이 버킷은 NFS를 통해 XCP 소스로 노출됩니다. NetApp XCP는 준비된 데이터를 런타임에 선택 가능한 학습 대상(NetApp ONTAP S3 또는 LustreFS)으로 이동시키며, 계층 전환 시 코드 변경이 필요하지 않습니다.

참고

이 설계에서 ONTAP NAS 버킷은 주로 XCP 지원 및 유효성 검사 관점에서 사용됩니다. 이는 모빌리티 워크플로우에 일관된 NFS 소스를 제공하기 때문입니다. 실제 운영 환경에서는 동일한 활성 데이터를 고성능 RDMA 지원 경로를 통해 직접 제공할 수도 있으므로, ONTAP NAS 계층은 유일한 런타임 액세스 방식이 아니라 운영상 편리하고 지원 가능한 스테이징 패턴으로 간주해야 합니다.

이 파이프라인은 보다 광범위한 *NetApp AI 스토리지 아키텍처*의 구체적인 구현체입니다. 이 아키텍처는 각 AI 워크로드 단계에 맞춰 성능과 비용을 최적화하도록 설계된 3계층 스토리지 프레임워크입니다.

  • E-Series (LustreFS): GPU 집약적인 모델 학습 및 체크포인트 작업을 위한 초고속 병렬 스토리지입니다.

  • ONTAP (AFF/AFX): 학습, 미세 조정, 추론, 벡터/RAG 워크로드 및 일부 데이터 준비 사용 사례를 위한 고성능 액티브 스토리지로, FAS 및 NAS 버킷을 지원합니다.

  • StorageGRID: 데이터 수집, 거버넌스 및 장기 보존을 위한 확장 가능한 S3 호환 오브젝트 스토리지입니다.

Apache Airflow와 NetApp XCP를 통해 계층 간 데이터 이동이 완전히 자동화되어 핵심 경로에서 수동 작업이 완전히 제거됩니다.

NetApp 스토리지 아키텍처는 기업이 모든 데이터를 단일 중앙 집중식 데이터 레이크에 저장할 필요 없이 분산된 데이터 준비, 모델 학습, 미세 조정, 추론 및 수명 주기 관리를 지원할 수 있도록 합니다. 불필요한 데이터 이동을 줄임으로써 하이브리드 AI 워크플로에 자연스럽게 적합합니다.

[[1-5-why-netapp]]
== 1.5 NetApp을 선택하는 이유

차원 기존 접근 방식 NetApp AI 스토리지 아키텍처

GPU 생산성

스토리지 병목 현상, 유휴 고비용 컴퓨팅

RDMA 기반 GPUDirect Storage를 사용하면 GPU 클러스터를 최대한 활용할 수 있습니다.

데이터 이동성

수동 스크립트는 파이프라인을 지연시킵니다

Airflow + XCP를 통한 자동화된 계층 간 이동

비용 관리

고가 플래시의 모든 데이터

FabricPool 는 사용 빈도가 낮은 데이터를 자동으로 저렴한 오브젝트 스토리지로 이동시킵니다.

멀티 테넌시

공유 네임스페이스는 데이터 유출 위험을 초래합니다.

전용 ONTAP SVM은 엄격한 테넌트 격리를 시행합니다.

워크로드 범위

학습용 스택과 추론용 스택 분리

AI 라이프사이클 전반을 아우르는 단일 통합 아키텍처

[[1-6-the-business-case]]
== 1.6 비즈니스 케이스

GPU 컴퓨팅은 일반적으로 AI 인프라 예산에서 가장 큰 비중을 차지하는 자본 지출 항목입니다. 클러스터가 데이터를 기다리며 유휴 상태로 있는 매 시간은 직접적이고 측정 가능한 재정적 손실로 이어집니다. NetApp은 적절한 데이터가 적시에 적절한 계층에 자동으로 배치되도록 보장하여 AI 처리량을 높이고 총소유비용(TCO)을 낮추며, 재설계 없이 개념 증명(POC) 단계부터 엔터프라이즈 프로덕션 단계까지 확장 가능한 아키텍처를 제공합니다.

[[1-7-key-benefits-at-a-glance]]
== 1.7 주요 이점 요약

혜택 설명

통합 오케스트레이션

단일 DAG는 수집 → 아카이브를 아우릅니다.

스토리지 계층 유연성

실행 시 구성을 통해 S3 또는 LustreFS 선택

재교육 비용 절감

~을 통한 점진적 미세 조정 partial_fit

더 빠른 복구

체크포인트 기반 훈련 재개

전체 계보

매니페스트, 유효 구성 로그, 아카이브 레코드

스토리지 잠금 없음

멀티 프로토콜: NFS, S3, Lustre

GPU 사용률

계층형 스토리지를 통해 컴퓨팅 자원을 지속적으로 공급하여 GPU 유휴 시간으로 인한 비용 발생을 방지합니다.

비용 최적화된 유지

FabricPool 콜드 데이터를 오브젝트 스토리지로 자동 계층화합니다