1.執行概要
Karthikeyan Nagalingam, NetApp
[[1-1-purpose-of-this-document]]
== 1.1 本文件的目的
此 NetApp 驗證架構(NVA)記錄了生產級 AI 資料傳輸途徑,可擷取原始資料、為機器學習進行準備、使用 NetApp XCP 在儲存設備分層之間高速搬移資料、訓練並遞增微調模型、產生預測,並將結果歸檔以利治理與重現。其旨在作為指南,協助架構師與基礎架構團隊瞭解設計原理、部署、組態與維運。
[[1-2-audience]]
== 1.2 受眾
評估適用於 AI/ML 工作負載的 NetApp 儲存設備與資料移動性技術的解決方案架構師、儲存設備/基礎架構工程師、資料平台工程師、機器學習工程師和 IT 決策者。
[[1-3-business-challenge-overview]]
== 1.3 業務挑戰概述
AI 團隊需要將儲存在物件儲存中的資料可靠地轉換,然後將其交付到最適合訓練的運算儲存分層——例如,彈性 S3 用於通用工作負載,高效能並行檔案系統(LustreFS)進行 I/O 密集型訓練。如果沒有受控的資料移動性和協調階層,團隊只能依賴脆弱的、單一用途的指令碼,這些指令碼缺乏重試機制、檢查點、儲存設備靈活度和稽核追蹤。
企業 AI 專案進展停滯——並非因為模型或運算限制,而是因為老舊儲存設備並非為 AI 而設計。搬移海量資料集、在訓練期間持續為 GPU 提供資料、管理檢查點例行成本以及控制儲存設備成本,所使用的精力甚至超過了 AI 工作本身。單一分層架構迫使在效能與成本之間做出權衡,而隨著模型和資料集的成長,這種權衡會愈發嚴重。
[[1-4-netapp-solution-summary]]
== 1.4 NetApp 解決方案摘要
此解決方案將擷取、準備、資料移動性、訓練、微調校、推論與歸檔協調為 Apache Airflow DAG(有向無環圖)。StorageGRID 為原始資料與長期歸檔物件分層提供錨點。資料準備會將帶有執行時間戳記的資料集與資訊清單寫入 ONTAP NAS 儲存區,並透過 NFS 將其公開為 XCP 來源。然後,NetApp XCP 會將準備好的資料移至執行階段可選的訓練目的地(NetApp ONTAP S3 或 LustreFS),無需變更程式碼即可交換器分層。
|
|
在此設計中, ONTAP NAS 儲存桶主要從 XCP 支援與驗證的角度來使用,因為它為移動性工作流程提供了一致的 NFS 來源。在實際生產環境中,相同的作用中資料也可以透過高效能的 RDMA 路徑直接提供服務,因此 ONTAP NAS 階層應被視為操作便利且可支援的接移模式,而非唯一的執行階段存取方法。 |
此傳輸途徑是更廣泛的 NetApp AI 儲存架構 的具體實作——這是一個專為特定用途所打造的三層儲存設備架構,可將效能和成本與每個 AI 工作負載階段相匹配:
-
E 系列(LustreFS): 超高處理量平行儲存設備,適用於 GPU 密集型模型訓練與檢查點。
-
ONTAP (AFF/AFX): 高效能作用中儲存設備,適用於訓練、微調、推論、向量/RAG 工作負載和選定的資料準備使用案例,支援 FAS 和 NAS 儲存桶。
-
StorageGRID: 可擴充的 S3 相容物件儲存,用於資料擷取、治理和長期保留。
透過 Apache Airflow 和 NetApp XCP,跨分層的資料搬移已完全自動化,徹底消除了關鍵路徑上的手冊操作。
NetApp 儲存架構有助於企業支援分散式資料準備、模型訓練、微調、推論和生命週期治理,而無需將所有資料強制集中到單一集中式資料湖中。透過減少不必要的資料搬移,它非常適合混合式 AI 工作流程。
[[1-5-why-netapp]]
== 1.5 為什麼 NetApp
| 維度 | 傳統方法 | NetApp AI 儲存架構 |
|---|---|---|
GPU 生產力 |
儲存設備瓶頸導致昂貴的運算閒置 |
透過 RDMA 實現的 GPUDirect Storage 有助於維持 GPU 叢集的充分利用 |
資料移動性 |
手動指令碼延遲傳輸途徑 |
透過 Airflow + XCP 進行自動化的分層間搬移 |
成本控制 |
高成本快閃記憶體上的所有資料 |
FabricPool 自動將冷資料降級到低成本物件儲存 |
多租戶 |
共享命名空間存在資料外洩風險 |
專用 ONTAP SVM 可強制執行嚴格的租戶隔離 |
工作負載廣度 |
訓練和推論使用不同的堆疊 |
涵蓋整個人工智慧生命週期的單一統一化架構 |
[[1-6-the-business-case]]
== 1.6 商業案例
GPU 運算通常是 AI 基礎架構預算中最大的資本支出。叢集每閒置一小時等待資料,都是直接且可衡量的財務遺失。NetApp 確保正確的資料在正確的時間自動位於正確的分層,從而提供更高的 AI 處理量、更低的 TCO,以及無需重新設計即可從 POC 擴展到企業生產的架構。
[[1-7-key-benefits-at-a-glance]]
== 1.7 主要優勢概覽
| 益處 | 描述 |
|---|---|
統一協調 |
單一 DAG 跨越擷取 → 歸檔 |
儲存設備分層靈活度 |
透過組態每次執行選擇 S3 或 LustreFS |
降低再訓練成本 |
透過 `partial_fit`進行增量微調 |
更快恢復 |
基於檢查點的訓練恢復 |
完整血統 |
清單、有效組態日誌、歸檔記錄 |
無儲存設備鎖定 |
多協定:NFS、S3、Lustre |
GPU 使用率 |
分層儲存設備可確保運算資源持續供應,避免 GPU 閒置成本 |
成本最佳化保留 |
FabricPool 自動將冷資料分層到物件儲存 |