Skip to main content
NetApp artificial intelligence solutions
本繁體中文版使用機器翻譯,譯文僅供參考,若與英文版本牴觸,應以英文版本為準。

1.執行概要

貢獻者 nkarthik

Karthikeyan Nagalingam, NetApp

[[1-1-purpose-of-this-document]]
== 1.1 本文件的目的

此 NetApp 驗證架構(NVA)記錄了生產級 AI 資料傳輸途徑,可擷取原始資料、為機器學習進行準備、使用 NetApp XCP 在儲存設備分層之間高速搬移資料、訓練並遞增微調模型、產生預測,並將結果歸檔以利治理與重現。其旨在作為指南,協助架構師與基礎架構團隊瞭解設計原理、部署、組態與維運。

[[1-2-audience]]
== 1.2 受眾

評估適用於 AI/ML 工作負載的 NetApp 儲存設備與資料移動性技術的解決方案架構師、儲存設備/基礎架構工程師、資料平台工程師、機器學習工程師和 IT 決策者。

[[1-3-business-challenge-overview]]
== 1.3 業務挑戰概述

AI 團隊需要將儲存在物件儲存中的資料可靠地轉換,然後將其交付到最適合訓練的運算儲存分層——例如,彈性 S3 用於通用工作負載,高效能並行檔案系統(LustreFS)進行 I/O 密集型訓練。如果沒有受控的資料移動性和協調階層,團隊只能依賴脆弱的、單一用途的指令碼,這些指令碼缺乏重試機制、檢查點、儲存設備靈活度和稽核追蹤。

企業 AI 專案進展停滯——並非因為模型或運算限制,而是因為老舊儲存設備並非為 AI 而設計。搬移海量資料集、在訓練期間持續為 GPU 提供資料、管理檢查點例行成本以及控制儲存設備成本,所使用的精力甚至超過了 AI 工作本身。單一分層架構迫使在效能與成本之間做出權衡,而隨著模型和資料集的成長,這種權衡會愈發嚴重。

[[1-4-netapp-solution-summary]]
== 1.4 NetApp 解決方案摘要

此解決方案將擷取、準備、資料移動性、訓練、微調校、推論與歸檔協調為 Apache Airflow DAG(有向無環圖)。StorageGRID 為原始資料與長期歸檔物件分層提供錨點。資料準備會將帶有執行時間戳記的資料集與資訊清單寫入 ONTAP NAS 儲存區,並透過 NFS 將其公開為 XCP 來源。然後,NetApp XCP 會將準備好的資料移至執行階段可選的訓練目的地(NetApp ONTAP S3 或 LustreFS),無需變更程式碼即可交換器分層。

註

在此設計中, ONTAP NAS 儲存桶主要從 XCP 支援與驗證的角度來使用,因為它為移動性工作流程提供了一致的 NFS 來源。在實際生產環境中,相同的作用中資料也可以透過高效能的 RDMA 路徑直接提供服務,因此 ONTAP NAS 階層應被視為操作便利且可支援的接移模式,而非唯一的執行階段存取方法。

此傳輸途徑是更廣泛的 NetApp AI 儲存架構 的具體實作——這是一個專為特定用途所打造的三層儲存設備架構,可將效能和成本與每個 AI 工作負載階段相匹配:

  • E 系列(LustreFS): 超高處理量平行儲存設備,適用於 GPU 密集型模型訓練與檢查點。

  • ONTAP (AFF/AFX): 高效能作用中儲存設備,適用於訓練、微調、推論、向量/RAG 工作負載和選定的資料準備使用案例,支援 FAS 和 NAS 儲存桶。

  • StorageGRID: 可擴充的 S3 相容物件儲存,用於資料擷取、治理和長期保留。

透過 Apache Airflow 和 NetApp XCP,跨分層的資料搬移已完全自動化,徹底消除了關鍵路徑上的手冊操作。

NetApp 儲存架構有助於企業支援分散式資料準備、模型訓練、微調、推論和生命週期治理,而無需將所有資料強制集中到單一集中式資料湖中。透過減少不必要的資料搬移,它非常適合混合式 AI 工作流程。

[[1-5-why-netapp]]
== 1.5 為什麼 NetApp

維度 傳統方法 NetApp AI 儲存架構

GPU 生產力

儲存設備瓶頸導致昂貴的運算閒置

透過 RDMA 實現的 GPUDirect Storage 有助於維持 GPU 叢集的充分利用

資料移動性

手動指令碼延遲傳輸途徑

透過 Airflow + XCP 進行自動化的分層間搬移

成本控制

高成本快閃記憶體上的所有資料

FabricPool 自動將冷資料降級到低成本物件儲存

多租戶

共享命名空間存在資料外洩風險

專用 ONTAP SVM 可強制執行嚴格的租戶隔離

工作負載廣度

訓練和推論使用不同的堆疊

涵蓋整個人工智慧生命週期的單一統一化架構

[[1-6-the-business-case]]
== 1.6 商業案例

GPU 運算通常是 AI 基礎架構預算中最大的資本支出。叢集每閒置一小時等待資料,都是直接且可衡量的財務遺失。NetApp 確保正確的資料在正確的時間自動位於正確的分層,從而提供更高的 AI 處理量、更低的 TCO,以及無需重新設計即可從 POC 擴展到企業生產的架構。

[[1-7-key-benefits-at-a-glance]]
== 1.7 主要優勢概覽

益處 描述

統一協調

單一 DAG 跨越擷取 → 歸檔

儲存設備分層靈活度

透過組態每次執行選擇 S3 或 LustreFS

降低再訓練成本

透過 `partial_fit`進行增量微調

更快恢復

基於檢查點的訓練恢復

完整血統

清單、有效組態日誌、歸檔記錄

無儲存設備鎖定

多協定:NFS、S3、Lustre

GPU 使用率

分層儲存設備可確保運算資源持續供應,避免 GPU 閒置成本

成本最佳化保留

FabricPool 自動將冷資料分層到物件儲存