Skip to main content
NetApp artificial intelligence solutions
O português é fornecido por meio de tradução automática para sua conveniência. O inglês precede o português em caso de inconsistências.

2. Visão geral da solução, valor comercial e benefícios para o cliente

Colaboradores nkarthik

Karthikeyan Nagalingam, NetApp

[[2-1-solution-description]]
== 2.1 Descrição da solução

O pipeline é implementado como o DAG do Airflow example_ai_pipeline_sklearn, composto pelas tarefas ingestion, data_prep, xcp_preflight_source, xcp_copy_prep_to_training, model_training, fine_tuning, inferencing, checkpoint_model_training, route_manual_archive_stage e manual_archive.

[[2-2-use-case-and-problem-statement]]
== 2.2 Caso de uso e declaração do problema

Os clientes devem treinar e atualizar periodicamente os modelos de regressão tabular e classificação de texto usando dados brutos provenientes do StorageGRID. O pipeline prepara esses dados em um bucket NAS do ONTAP e, em seguida, usa o NetApp XCP para entregá-los ao ONTAP S3 ou ao LustreFS para treinamento, com base na seleção de destino por execução.

[[2-3-target-customer-profile-and-industry-applicability]]
== 2.3 Perfil do cliente-alvo e aplicabilidade no setor

Serviços financeiros (modelos de risco/fraude), manufatura (manutenção preditiva), saúde (classificação/triagem), varejo (previsão de demanda) — qualquer empresa que exija treinamento de ML governado e repetível na infraestrutura NetApp.

[[2-4-solution-scope-and-boundaries]]
== 2.4 Escopo e limites da solução

Dentro do escopo: controle de ingestão, preparação de dados (Python/Spark), mobilidade de dados XCP (S3/LustreFS), treinamento e ajuste fino incremental com scikit-learn, inferência, criação de checkpoints, arquivamento manual. Fora do escopo: APIs de serviço de modelos em tempo real, ingestão de streaming, frameworks de aprendizado profundo baseados em GPU.

[[2-5-assumptions-and-prerequisites]]
== 2.5 Pressupostos e pré-requisitos

  • Endpoint do StorageGRID compatível com S3, acessível a partir do Airflow para acesso a dados brutos e arquivamento.

  • O bucket NAS do ONTAP é acessível pelo Airflow para gravações de dados preparados e exposto via NFS para o host XCP.

  • NetApp ONTAP endpoint compatível com S3 acessível a partir do Airflow e do XCP quando o ONTAP S3 é selecionado como destino de treinamento.

  • NetApp XCP instalado e acessível via SSH (conexão Airflow ssh_default).

  • O cliente LustreFS é montado no host XCP quando o LustreFS é selecionado.

  • Airflow 2.x com boto3, scikit-learn; pacotes opcionais PySpark + Delta/Iceberg.

[[2-6-business-drivers]]
== 2.6 Fatores de negócios

Reduza o tempo de criação de modelos, diminua o custo da infraestrutura por meio de treinamento incremental e elimine o risco de scripts pontuais.

[[2-7-value-proposition-summary]]
== 2.7 Resumo da Proposta de Valor

O StorageGRID, o ONTAP NAS, o ONTAP S3, o LustreFS e o XCP, combinados com a orquestração Airflow, oferecem um pipeline de IA resiliente, observável e com reconhecimento de camadas de storage.

[[2-8-stakeholder-benefits]]
== 2.8 Benefícios para as partes interessadas

Parte interessada Benefício

Engenharia de Dados

Preparação declarativa e orientada por parâmetros; descoberta automática de arquivos; suporte a Spark/Delta/Iceberg

Ciência de Dados/Aprendizado de Máquina

Ajuste fino incremental; fonte de artefatos consistente em todas as etapas; divisões reproduzíveis

Operações de TI

Seleção de storage em tempo de execução; logs de guard/effective-config; recuperação baseada em checkpoint

Conformidade/Governança

Os manifestos e registros de arquivamento fornecem linhagem auditável; estágio de retenção configurável

[[2-9-tco-considerations]]
== 2.9 Considerações sobre o TCO

O ajuste fino incremental e a retomada a partir de pontos de verificação reduzem os custos recorrentes de computação; a flexibilidade das camadas de storage evita o provisionamento excessivo de storage de alto desempenho para todas as cargas de trabalho.

[[2-10-roi-considerations]]
== 2.10 Considerações sobre o ROI

Ciclos de atualização de modelos mais rápidos, manutenção manual reduzida, tempo de recuperação por evento de falha reduzido.