Skip to main content
NetApp artificial intelligence solutions
Die deutsche Sprachversion wurde als Serviceleistung für Sie durch maschinelle Übersetzung erstellt. Bei eventuellen Unstimmigkeiten hat die englische Sprachversion Vorrang.

2. Lösungsübersicht, Geschäftswert und Kundenvorteile

Beitragende nkarthik
Änderungen vorschlagen

Karthikeyan Nagalingam, NetApp

[[2-1-solution-description]]
== 2.1 Lösungsbeschreibung

Die Pipeline ist als Airflow DAG example_ai_pipeline_sklearn implementiert und setzt sich aus den Aufgaben ingestion, data_prep, xcp_preflight_source, xcp_copy_prep_to_training, model_training, fine_tuning, inferencing, checkpoint_model_training, route_manual_archive_stage und manual_archive zusammen.

[[2-2-use-case-and-problem-statement]]
== 2.2 Anwendungsfall und Problemstellung

Kunden müssen tabellarische Regressions- und Textklassifizierungsmodelle mit Rohdaten trainieren und regelmäßig aktualisieren, die aus StorageGRID stammen. Die Pipeline bereitet diese Daten in einem ONTAP NAS Bucket vor und verwendet dann NetApp XCP, um sie je nach Auswahl des Ziels pro Lauf entweder an ONTAP S3 oder an LustreFS für das Training zu übermitteln.

[[2-3-target-customer-profile-and-industry-applicability]]
== 2.3 Zielkundenprofil und Anwendbarkeit in der Branche

Finanzdienstleistungen (Risiko-/Betrugsmodelle), Fertigung (vorausschauende Wartung), Gesundheitswesen (Klassifizierung/Triage), Einzelhandel (Nachfrageprognose), jedes Unternehmen, das ein geregeltes, wiederholbares ML-Training auf NetApp Infrastruktur benötigt.

[[2-4-solution-scope-and-boundaries]]
== 2.4 Lösungsumfang und Grenzen

Im Leistungsumfang enthalten: Ingestion-Gating, Datenaufbereitung (Python/Spark), XCP Datenmobilität (S3/LustreFS), scikit-learn-Training und inkrementelles Feintuning, Inferenz, Checkpointing, manuelle Archivierung. Nicht im Leistungsumfang enthalten: Echtzeit-Modellbereitstellungs-APIs, Streaming-Datenaufnahme, GPU-basierte Deep-Learning-Frameworks.

[[2-5-assumptions-and-prerequisites]]
== 2.5 Annahmen und Voraussetzungen

  • StorageGRID S3-kompatibler Endpunkt, der von Airflow aus für den Zugriff auf Rohdaten und die Archivierung erreichbar ist.

  • ONTAP NAS bucket ist von Airflow aus für Schreibvorgänge vorbereiteter Daten erreichbar und über NFS für den XCP Host verfügbar.

  • NetApp ONTAP S3-kompatibler Endpunkt, der von Airflow und XCP erreichbar ist, wenn ONTAP S3 als Trainingsziel ausgewählt ist.

  • NetApp XCP ist installiert und über SSH erreichbar (Airflow Verbindung ssh_default).

  • Der LustreFS Client ist auf dem XCP Host eingebunden, wenn LustreFS ausgewählt ist.

  • Airflow 2.x mit boto3, scikit-learn; optionalen PySpark + Delta/Iceberg-Paketen.

[[2-6-business-drivers]]
== 2.6 Geschäftstreiber

Verkürzung der Zeit bis zum Modell, Senkung der Infrastrukturkosten durch inkrementelles Training, Eliminierung des Risikos einer einmaligen Skripterstellung.

[[2-7-value-proposition-summary]]
== 2.7 Zusammenfassung des Wertversprechens

StorageGRID, ONTAP NAS, ONTAP S3, LustreFS und XCP in Kombination mit Airflow Orchestrierung bieten eine speicherebenenbewusste, beobachtbare und ausfallsichere KI Pipeline.

[[2-8-stakeholder-benefits]]
== 2.8 Vorteile für Stakeholder

Stakeholder Nutzen

Data Engineering

Deklarative, parametergesteuerte Vorbereitung; automatische Dateierkennung; Unterstützung für Spark/Delta/Iceberg

Data Science/ML

Inkrementelle Feinabstimmung; konsistente Artefaktquelle über alle Phasen hinweg; reproduzierbare Aufteilungen

IT-Betrieb

Laufzeitspeicherauswahl; Schutz-/effective-config-Protokolle; checkpoint-basierte Wiederherstellung

Compliance/Governance

Manifeste und Archivdatensätze gewährleisten eine prüfbare Nachvollziehbarkeit; konfigurierbare Aufbewahrungsphase

[[2-9-tco-considerations]]
== 2.9 TCO Überlegungen

Inkrementelles Fine-Tuning und Checkpoint Resume reduzieren die wiederkehrenden Rechenkosten; die Flexibilität der Storage-Ebene vermeidet eine Überbereitstellung von Hochleistungsspeicher für alle Workloads.

[[2-10-roi-considerations]]
== 2.10 ROI Überlegungen

Schnellere Modellaktualisierungszyklen, reduzierter manueller Wartungsaufwand, verkürzte Wiederherstellungszeit pro Ausfallereignis.