1.内容提要
Karthikeyan Nagalingam, NetApp
[[1-1-purpose-of-this-document]]
== 1.1 本文件的目的
此 NetApp 经过验证的架构(NVA)记录了生产级 AI 数据管道,该管道可提取原始数据,为机器学习做好准备,使用 NetApp XCP 在存储层之间高速移动数据,训练和增量微调模型,生成预测并归档结果,以实现治理和可重复性。本文档旨在引导架构师和基础设施团队了解设计原理、部署、配置和操作。
[[1-2-audience]]
== 1.2 受众
解决方案架构师、存储/基础设施工程师、数据平台工程师、机器学习工程师以及正在评估 AI/ML 工作负载的 NetApp 存储和数据移动技术的 IT 决策者。
[[1-3-business-challenge-overview]]
== 1.3 业务挑战概述
人工智能团队需要将落在对象存储中的数据进行可靠转换,然后将其传递到最适合训练的计算存储层——用于一般工作负载的弹性 S3,或用于 I/O 密集型训练的高性能并行文件系统 (LustreFS)。如果没有受管理的数据移动性和编排层,团队只能使用脆弱的单一用途脚本,这些脚本缺乏重试、检查点、存储灵活性和审计跟踪功能。
企业 AI 程序停滞不前——不是因为模型或计算限制,而是因为传统存储并非为 AI 而设计。迁移大量数据集、在训练期间保持 GPU 持续供给、管理检查点开销以及控制存储成本,所耗费的精力远超 AI 工作本身。单层架构强制要求在性能与成本之间进行权衡,随着模型和数据集的增长,这一矛盾愈发突出。
[[1-4-netapp-solution-summary]]
== 1.4 NetApp 解决方案总结
该解决方案以 Apache Airflow DAG (有向无环图)的形式协调摄取、准备、数据移动、训练、微调、推断和归档。StorageGRID 锚定原始数据和长期归档对象层。数据准备将运行标记的数据集和清单写入 ONTAP NAS 存储桶,由 NFS 作为 XCP 源公开。NetApp XCP 将准备好的数据移动到运行时可选择的训练目标—— NetApp ONTAP S3 或 LustreFS——无需更改代码即可切换层。
|
|
在此设计中,ONTAP NAS 存储桶主要从 XCP 支持和验证的角度使用,因为它为移动工作流提供了一致的 NFS 源。在实际生产环境中,相同的活动数据也可以直接通过高性能 RDMA 支持的路径提供,因此 ONTAP NAS 层应被视为操作便捷且可支持的暂存模式,而非唯一的运行时访问方法。 |
该管道是更广泛的*NetApp AI 存储架构*的具体实施——这是一个专门构建的三层存储框架,可根据每个 AI 工作负载阶段调整性能和成本:
-
E-Series(LustreFS): 用于 GPU 密集型模型训练和检查点的超高吞吐量并行存储。
-
ONTAP (AFF/AFX): 高性能主动存储,用于训练、微调、推理、矢量/RAG 工作负载和选定的数据准备用例,并支持 FAS 和 NAS 存储桶。
-
StorageGRID: 可扩展的 S3 兼容对象存储,用于数据提取、治理和长期保留。
跨层的数据移动通过 Apache Airflow 和 NetApp XCP 完全自动化,从而彻底消除了关键路径中的手动操作。
NetApp 存储架构可帮助企业支持分布式数据准备、模型训练、微调、推理和生命周期治理,而无需将所有数据强制纳入单个集中式数据湖。通过减少不必要的数据移动,它自然适合混合 AI 工作流程。
[[1-5-why-netapp]]
== 1.5 为什么 NetApp
| 维度 | 传统方法 | NetApp AI 存储架构 |
|---|---|---|
GPU 生产力 |
存储瓶颈闲置昂贵的计算 |
GPUDirect Storage over RDMA有助于保持GPU集群的充分利用 |
数据移动 |
手动脚本延迟管道 |
通过 Airflow + XCP 实现自动层间移动 |
成本控制 |
所有数据都在高成本闪存上 |
FabricPool 自动将冷数据降级至低成本对象存储 |
多租户 |
共享命名空间存在数据泄露风险 |
专用 ONTAP SVM 强制执行严格的租户隔离 |
工作负载广度 |
用于训练和推理的单独堆栈 |
跨越整个 AI 生命周期的单一统一架构 |
[[1-6-the-business-case]]
== 1.6 业务案例
GPU 计算通常是人工智能基础设施预算中最大的资本支出。每小时集群闲置等待数据都是直接、可量化的财务损失。NetApp 确保正确的数据在正确的时间位于正确的层级——自动实现——从而提供更高的 AI 吞吐量、更低的 TCO,以及可从 POC 扩展至企业级生产环境而无需重新设计的架构。
[[1-7-key-benefits-at-a-glance]]
== 1.7 主要优势概览
| 优势 | 描述 |
|---|---|
统一编排 |
单个 DAG 跨越摄取→存档 |
存储层灵活性 |
通过配置按运行选择 S3 或 LustreFS |
降低再培训成本 |
通过 `partial_fit`进行增量微调 |
更快的恢复 |
基于检查点的训练恢复 |
完整沿袭 |
清单、有效配置日志、归档记录 |
无存储锁定 |
多协议:NFS、S3、Lustre |
GPU 利用率 |
分层存储保持计算供给,避免 GPU 空闲成本 |
成本优化的保留 |
FabricPool 将冷数据自动分层至对象存储 |