9. Guide opérationnel
Karthikeyan Nagalingam, NetApp
Ce guide couvre l'exécution de routine, la surveillance, le triage des incidents, la reprise des entraînements, la vérification des archives, l'optimisation de la capacité et la protection des données. Utilisez-le avec les scénarios de configuration de la section 8 pour exploiter le même pipeline de manière cohérente dans les modes d'entraînement local, ONTAP S3 et LustreFS.
[[9-1-execution-walkthrough]]
== 9.1 Procédure d'exécution
Déclenchez une exécution via trigger_and_wait_ai_pipeline_sklearn.sh avec une CONF_JSON charge utile. Le script soumet une exécution manuelle nommée de manière unique, interroge le système jusqu'à ce qu'elle atteigne un état terminal et affiche les fins de journaux locaux des tâches ayant échoué, le cas échéant. Chaque tâche principale génère un effective_config enregistrement au démarrage afin que les opérateurs puissent vérifier la configuration évaluée plutôt que de se fier uniquement à la charge utile soumise.
[[9-2-monitoring-and-observability]]
== 9.2 Surveillance et observabilité
Surveillez l'état du DAG dans l'interface utilisateur ou la ligne de commande d'Airflow et faites-le correspondre à l'ID d'exécution et run_stamp. Les journaux de garde sont compatibles avec grep [data_prep] effective_config, [model_training] effective_config, [xcp_copy] effective_config et [checkpoint] resume_summary. Consultez ces entrées pour valider le moteur de transformation, la destination XCP sélectionnée, la source d'entraînement et la décision de réutilisation du point de contrôle pour chaque exécution.
[[9-3-troubleshooting-quick-reference]]
== 9.3 Guide de dépannage rapide
Utilisez ce tableau pour associer les échecs de tâches courants à la première action corrective. Résolvez les problèmes de connectivité et de montage de la source avant de relancer une exécution ; relancer sans corriger une configuration non valide ou un endpoint indisponible reproduira le même échec.
| Symptôme | Cause probable | Résolution |
|---|---|---|
|
Manquant/incorrect |
Vérifiez le nom du profil et la correspondance des identifiants |
|
LustreFS non monté ou incorrect |
Vérifiez le type de système de fichiers avec |
|
Textes JSON absents du préfixe S3 brut |
Télécharger |
Code de sortie de la vérification préalable 1 |
SSH inaccessible |
Vérifiez |
Code de sortie de la vérification préalable 2 |
Chemin NFS non exporté/visible |
Vérifiez l'exportation avec |
[[9-4-checkpoint-operations]]
== 9.4 Opérations de point de contrôle
La création de points de contrôle s'applique uniquement à model_training. Définissez training_checkpoint_reuse_mode=resume_if_exists pour réutiliser un résultat d'entraînement terminé valide et ignorer l'entraînement redondant du modèle, ou utilisez verify_only pour valider l'éligibilité au point de contrôle sans l'ignorer. Laissez la réutilisation désactivée (off) lors des tests initiaux ou chaque fois que les entrées d'entraînement, la configuration ou les artefacts attendus ont changé.
[[9-5-manual-archive-operations]]
== 9.5 Opérations d'archivage manuel
Définissez manual_archive_enabled=true et choisissez manual_archive_stage délibérément. Utilisez model_training lorsque la gouvernance exige la référence du modèle principal dès que l’entraînement réussit ; utilisez inferencing lorsque l’archive doit inclure les prédictions finales. Une exécution avec model_training sélectionné se poursuit avec l’ajustement fin et l’inférence après la branche d’archivage ; elle n’archive simplement pas leurs sorties ultérieures. Vérifiez les chargements sous le préfixe StorageGRID horodaté de l’exécution et consultez [manual_archive] les journaux pour l’étape sélectionnée, les fichiers trouvés et le nombre de chargements.
[[9-6-scaling-guidance]]
== 9.6 Conseils de dimensionnement
Ajustez sample_count, spark_driver_memory, spark_executor_memory, et spark_timeout_secs en fonction du volume d'entrée et de l'objectif de niveau de service. Commencez par des échantillons limités pour valider la structure et le routage des données, puis utilisez sample_count=0 pour des exécutions sur l'ensemble des lignes une fois que StorageGRID, ONTAP NAS, XCP et le niveau d'entraînement sélectionné disposent d'une capacité et d'un débit suffisants.
[[9-7-backup-and-recovery]]
== 9.7 Sauvegarde et récupération
Protégez le compartiment de données préparées ONTAP NAS avec ONTAP Snapshot et la sauvegarde. Appliquez les stratégies de protection et de conservation StorageGRID aux compartiments de données brutes et d'archivage; le compartiment d'archivage conserve l'historique indépendamment de la réexécution du pipeline. Combinez ces protections de stockage avec l'enregistrement du point de contrôle d'entraînement pour récupérer les données et les artefacts de référence associés à l'exécution correcte après une interruption au niveau d'une tâche, d'un hôte ou d'un site.