1.概要
カーティケヤン ナガリンガム、NetApp
[[1-1-purpose-of-this-document]]
== 1.1 本文書の目的
この NetApp 検証済みアーキテクチャ(NVA)は、本番環境レベルの AI データパイプラインを文書化しており、生データを取り込み、機械学習用に準備し、NetApp XCP を使用してストレージ層間で高速に移動させ、モデルのトレーニングと段階的なファインチューニングを行い、予測を生成し、ガバナンスと再現性のために結果をアーカイブします。本書は、設計の根拠、デプロイ、構成、および運用について、アーキテクトおよびインフラストラクチャチームを支援することを目的としています。
[[1-2-audience]]
== 1.2 対象者
AI/MLワークロード向けにNetAppのストレージおよびデータ モビリティ テクノロジーを評価する、ソリューション アーキテクト、ストレージ/インフラ エンジニア、データ プラットフォーム エンジニア、MLエンジニア、およびIT意思決定者。
[[1-3-business-challenge-overview]]
== 1.3 ビジネス上の課題の概要
AI チームは、オブジェクト ストレージに格納されたデータを確実に変換し、トレーニングに最適なコンピューティング ストレージ ティアに配信する必要があります。一般的なワークロードにはエラスティック S3、I/O 負荷の高いトレーニング向けにはハイパフォーマンス並列ファイルシステム(LustreFS)を使用します。統制されたデータ移動およびオーケストレーション レイヤーがない場合、チームは再試行、チェックポイント、ストレージの柔軟性、監査証跡を欠いた、脆弱で単一目的のスクリプトに頼らざるを得ません。
企業向けAIプログラムが停滞しているのは、モデルや計算能力の限界が原因ではなく、従来のストレージがAI向けに設計されていなかったためです。膨大なデータセットの移動、トレーニング中のGPUへのデータ供給、チェックポイントのオーバーヘッド管理、ストレージコストの抑制などは、AI作業そのものよりも多くの労力を要します。単層アーキテクチャでは、パフォーマンスとコストのトレードオフが生じ、モデルやデータセットが大きくなるにつれてそのトレードオフはさらに深刻化します。
[[1-4-netapp-solution-summary]]
== 1.4 NetApp 解決策まとめ
この解決策は、Apache Airflow DAG(有向非巡回グラフ)として、データの取り込み、準備、データ移動、トレーニング、微調整、推論、およびアーカイブを統括します。StorageGRIDは、生データ層と長期保存用オブジェクト層を固定します。データ準備では、実行スタンプ付きデータセットとマニフェストを、NFSによってXCPソースとして公開されたONTAP NASバケットに書き込みます。NetApp XCPは、準備されたデータを実行時に選択可能なトレーニング先(NetApp ONTAP S3またはLustreFS)へ移動します。ティアを切り替える際にコードの変更は一切不要です。
|
|
このデザインでは、ONTAP NAS バケットは、主に XCP のサポート性および検証の観点から使用されます。これは、モビリティワークフローに対して一貫した NFS ソースを提供するためです。実際の運用環境では、同じアクティブデータをハイパフォーマンスの RDMA 対応パス経由で直接提供することもできるため、ONTAP NAS レイヤーは、唯一の実行時アクセス方法としてではなく、運用上便利でサポートしやすいステージングパターンとして捉えるべきです。 |
このパイプラインは、より広範な NetApp AI ストレージ アーキテクチャ の具体的な実装です。これは、AIワークロードの各フェーズに合わせてパフォーマンスとコストを調整する、目的に即した3層ストレージフレームワークです:
-
Eシリーズ(LustreFS): GPU を多用するモデルのトレーニングとチェックポイントのための超高スループット並列ストレージ。
-
ONTAP(AFF/AFX): トレーニング、ファインチューニング、推論、ベクトル/RAGワークロード、および選択されたデータ準備ユースケース向けのハイパフォーマンスアクティブストレージ。FASおよびNASバケットのサポート。
-
StorageGRID: データ取り込み、ガバナンス、および長期保存のための、拡張性の高いS3互換オブジェクトストレージ。
階層間のデータ移動は、Apache Airflow と NetApp XCP によって完全に自動化されており、クリティカルパスから手動操作を完全に排除します。
NetApp のストレージ アーキテクチャは、すべてのデータを単一の中央集権的なデータレイクに強制的に集約することなく、分散データ準備、モデルトレーニング、ファインチューニング、推論、ライフサイクルガバナンスをサポートできるよう企業を支援します。不要なデータ移動を削減することで、ハイブリッドAIワークフローに自然に適合します。
[[1-5-why-netapp]]
== 1.5 なぜNetAppなのか
| 寸法 | 従来のアプローチ | NetApp AI ストレージ アーキテクチャ |
|---|---|---|
GPU生産性 |
ストレージのボトルネックにより、高価なコンピューティングがアイドル状態になる |
GPUDirect Storage over RDMAは、GPUクラスタのフル活用に役立ちます |
データモビリティ |
手動スクリプトはパイプラインを遅延させる |
Airflowによる階層間の自動移動+XCP |
コスト管理 |
高コストのフラッシュメモリ上のすべてのデータ |
FabricPool はコールドデータを低コストのオブジェクトストレージに自動的に移行します |
マルチテナンシー |
共有ネームスペースはデータ漏洩のリスクがある |
専用のONTAP SVMによる厳格なテナント分離の実施 |
ワークロードの幅 |
トレーニング用と推論用でスタックを分ける |
AIライフサイクル全体を網羅する単一の統合アーキテクチャ |
[[1-6-the-business-case]]
== 1.6 ビジネスケース
AIインフラ予算において、GPUコンピューティングは通常、最大の設備投資項目となります。クラスターがデータ待ちでアイドル状態になっている時間は、1時間ごとに直接的かつ測定可能な経済的損失となります。NetAppは、適切なデータが適切なタイミングで適切な階層に自動的に配置されることを保証し、AIのスループット向上、TCOの削減、そして再設計なしで概念実証からエンタープライズレベルの本番環境まで拡張可能なアーキテクチャを実現します。
[[1-7-key-benefits-at-a-glance]]
== 1.7 主なメリットの概要
| 利点 | 説明 |
|---|---|
統合オーケストレーション |
単一のDAGが取り込み→アーカイブにまたがる |
ストレージ階層の柔軟性 |
設定により実行ごとにS3またはLustreFSが選択される |
再訓練コストの削減 |
以下による段階的な微調整: |
より速い回復 |
チェックポイントベースのトレーニング再開 |
完全な系譜 |
マニフェスト、有効設定ログ、アーカイブ記録 |
ストレージのロックインなし |
マルチプロトコル:NFS、S3、Lustre |
GPU利用率 |
階層型ストレージによりコンピューティングリソースが供給され、アイドル状態のGPUコストを回避できます。 |
コスト最適化された保持 |
FabricPool はコールドデータをオブジェクトストレージに自動階層化します |