Skip to main content
NetApp artificial intelligence solutions
Die deutsche Sprachversion wurde als Serviceleistung für Sie durch maschinelle Übersetzung erstellt. Bei eventuellen Unstimmigkeiten hat die englische Sprachversion Vorrang.

9. Betriebshandbuch

Beitragende nkarthik
Änderungen vorschlagen

Karthikeyan Nagalingam, NetApp

Dieser Leitfaden behandelt die routinemäßige Ausführung, Überwachung, Störungstriage, Wiederherstellung des Trainings, Archivprüfung, Kapazitätsoptimierung und Datensicherung. Er ist zusammen mit den Konfigurationsszenarien in Abschnitt 8 zu verwenden, damit dieselbe Pipeline über die Trainingsmodi lokal, ONTAP S3 und LustreFS hinweg konsistent betrieben wird.

[[9-1-execution-walkthrough]]
== 9.1 Ablauf der Ausführung

Einen Lauf über trigger_and_wait_ai_pipeline_sklearn.sh mit einer CONF_JSON Nutzlast auslösen. Das Skript übermittelt einen eindeutig benannten manuellen Lauf, überwacht den Status bis zum Erreichen eines Endzustands und gibt, sofern verfügbar, lokale Protokollenden für fehlgeschlagene Aufgaben aus. Jede primäre Aufgabe erzeugt beim Start einen effective_config Datensatz, sodass Bediener die ausgewertete Konfiguration überprüfen können, anstatt sich nur auf die übermittelte Nutzlast zu verlassen.

[[9-2-monitoring-and-observability]]
== 9.2 Überwachung und Beobachtbarkeit

Der DAG-Status kann in der Airflow-Benutzeroberfläche oder -CLI überwacht und mit der Lauf-ID und run_stamp korreliert werden. Die Guard-Logs sind grep-freundlich: [data_prep] effective_config, [model_training] effective_config, [xcp_copy] effective_config, und [checkpoint] resume_summary. Diese Einträge können überprüft werden, um die Transformations-Engine, das ausgewählte XCP-Ziel, die Trainingsquelle und die Entscheidung zur Checkpoint-Wiederverwendung für jeden Lauf zu validieren.

[[9-3-troubleshooting-quick-reference]]
== 9.3 Kurzanleitung zur Fehlerbehebung

Anhand dieser Tabelle lässt sich häufigen Aufgabenfehlern die erste Korrekturmaßnahme zuordnen. Probleme mit der Quellverbindung und der Einbindung sollten vor einem erneuten Lauf behoben werden; ein erneuter Versuch ohne Korrektur einer ungültigen Konfiguration oder eines nicht verfügbaren Endpunkts führt zum gleichen Fehler.

Symptom Wahrscheinliche Ursache Auflösung

Could not resolve XCP S3 credentials

Fehlend/falsch xcp_s3_profile in xcp_s3_profiles

Profilname und Anmeldeinformationen zuordnen überprüfen

no readable Lustre source directory

LustreFS ist nicht eingebunden oder fehlerhaft xcp_lustrefs_dest_path

Überprüfen Sie den Dateisystemtyp mit findmnt -T /mnt/lustre/client -o FSTYPE,TARGET -n; korrekter Pfad

Missing required text dataset files

Text-JSONs fehlen im Rohdaten-S3-Präfix

Hochladen text_base.json, text_finetune.json, text_infer.json

Preflight Exit-Code 1

SSH nicht erreichbar

Verbindung und Host/Benutzer ssh_default überprüfen

Preflight Exit-Code 2

NFS Pfad nicht exportiert/sichtbar

Export prüfen mit xcp show <ip>

[[9-4-checkpoint-operations]]
== 9.4 Checkpoint Vorgänge

Die Checkpoint-Funktion gilt nur für model_training. training_checkpoint_reuse_mode=resume_if_exists dient dazu, ein gültiges abgeschlossenes Trainingsergebnis wiederzuverwenden und redundantes Modelltraining zu überspringen, oder verify_only zur Überprüfung der Checkpoint-Eignung, ohne das Überspringen auszuführen. Halten Sie die Wiederverwendung während der ersten Tests oder immer dann deaktiviert (off, wenn sich Trainingseingaben, Konfiguration oder erwartete Artefakte geändert haben.

[[9-5-manual-archive-operations]]
== 9.5 Manuelle Archivierungsvorgänge

Legen Sie manual_archive_enabled=true fest und wählen Sie manual_archive_stage bewusst aus. Verwenden Sie model_training, wenn die Governance die Baseline des Kernmodells unmittelbar nach erfolgreichem Training erfordert; verwenden Sie inferencing, wenn das Archiv die finalen Vorhersagen enthalten muss. Ein Lauf mit ausgewähltem model_training wird nach dem Archivierungszweig mit Feinabstimmung und Inferenz fortgesetzt; die späteren Ausgaben werden dabei lediglich nicht archiviert. Uploads unter dem mit dem Laufstempel versehenen StorageGRID Präfix sowie [manual_archive] Protokolle für die ausgewählte Phase, die gefundenen Dateien und die Anzahl der Uploads sollten überprüft werden.

[[9-6-scaling-guidance]]
== 9.6 Skalierungsleitfaden

Die Parameter sample_count, spark_driver_memory, spark_executor_memory und spark_timeout_secs werden an das Eingabevolumen und das Servicelevel-Ziel angepasst. Es wird mit begrenzten Stichproben begonnen, um Datenstruktur und Routing zu validieren; anschließend wird sample_count=0 für Läufe mit allen Zeilen verwendet, nachdem StorageGRID, ONTAP NAS, XCP und die ausgewählte Trainingsstufe über ausreichende Kapazität und ausreichenden Durchsatz verfügen.

[[9-7-backup-and-recovery]]
== 9.7 Datensicherung und Wiederherstellung

Der ONTAP NAS-Datenspeicher für vorbereitete Daten wird mit ONTAP Snapshot und Backup geschützt. StorageGRID Schutz- und Aufbewahrungsrichtlinien werden auf Rohdaten- und Archivdatenspeicher angewendet; der Archivdatenspeicher behält den Verlauf unabhängig von einer erneuten Pipeline-Ausführung bei. Diese Speicherschutzmaßnahmen werden mit dem Trainings-Checkpoint-Datensatz kombiniert, um nach einer Unterbrechung auf Aufgaben-, Host- oder Standortebene die korrekten, laufbezogenen Daten und Baseline-Artefakte wiederherzustellen.