Skip to main content
NetApp artificial intelligence solutions
简体中文版经机器翻译而成,仅供参考。如与英语版出现任何冲突,应以英语版为准。

2.解决方案概述、业务价值和客户利益

贡献者 nkarthik

Karthikeyan Nagalingam, NetApp

[[2-1-solution-description]]
== 2.1 解决方案说明

该管道实现为 Airflow DAG example_ai_pipeline_sklearn,由任务 ingestion、 data_prep、 xcp_preflight_source、 xcp_copy_prep_to_training、 model_training、 fine_tuning、 inferencing、 checkpoint_model_training、 `route_manual_archive_stage`和 `manual_archive`组成。

[[2-2-use-case-and-problem-statement]]
== 2.2 用例和问题陈述

客户必须使用来自 StorageGRID 的原始数据定期训练和刷新表格回归和文本分类模型。管道在 ONTAP NAS 存储桶中准备该数据,然后根据每次运行的目标选择,使用 NetApp XCP 将其传输到 ONTAP S3 或 LustreFS 进行训练。

[[2-3-target-customer-profile-and-industry-applicability]]
== 2.3 目标客户概况和行业适用性

金融服务(风险/欺诈模型)、制造(预测性维护)、医疗保健(分类/分诊)、零售(需求预测)——任何需要在 NetApp 基础设施上进行受管控、可重复 ML 训练的企业。

[[2-4-solution-scope-and-boundaries]]
== 2.4 解决方案范围和边界

范围内: 摄取门控、数据准备(Python/Spark)、XCP 数据移动(S3/LustreFS)、scikit-learn 训练和增量微调、推理、检查点、手动归档。超出范围: 实时模型服务 API、流式摄取、基于 GPU 的深度学习框架。

[[2-5-assumptions-and-prerequisites]]
== 2.5 假设和前提条件

  • 可从 Airflow 访问的 StorageGRID S3 兼容端点,用于原始数据访问和存档。

  • ONTAP NAS 存储桶可从 Airflow 访问,用于写入已准备好的数据,并通过 NFS 向 XCP 主机公开。

  • NetApp ONTAP S3 兼容端点,当选择 ONTAP S3 作为训练目标时,可从 Airflow 和 XCP 访问该端点。

  • NetApp XCP 已安装,可通过 SSH (Airflow 连接 ssh_default)访问。

  • 当选择 LustreFS 时,LustreFS 客户端已挂载到 XCP 主机上。

  • Airflow 2.x,带 boto3、 scikit-learn;可选 PySpark + Delta/Iceberg 软件包。

[[2-6-business-drivers]]
== 2.6 业务驱动因素

通过增量训练缩短建模时间,降低基础架构成本,消除一次性脚本编写风险。

[[2-7-value-proposition-summary]]
== 2.7 价值主张摘要

StorageGRID、ONTAP NAS、ONTAP S3、LustreFS 和 XCP 与 Airflow 编排相结合,可提供存储层感知、可观察、弹性的 AI 管道。

[[2-8-stakeholder-benefits]]
== 2.8 利益相关者的利益

利益相关者 优势

数据工程

声明式、参数驱动的准备;自动文件发现;Spark/Delta/Iceberg 支持

数据科学/机器学习

增量微调;跨阶段一致的制品源;可重复的拆分

IT运营

运行时存储选择;保护/有效配置日志;基于检查点的恢复

合规/治理

清单和存档记录提供可审计的沿袭;可配置的保留阶段

[[2-9-tco-considerations]]
== 2.9 TCO注意事项

增量微调和检查点恢复可降低经常性计算成本;存储层灵活性可避免为所有工作负载过度配置高性能存储。

[[2-10-roi-considerations]]
== 2.10 ROI 考量因素

更快的模型刷新周期,减少手动维护,缩短每次故障事件的恢复时间。