Skip to main content
NetApp artificial intelligence solutions
O português é fornecido por meio de tradução automática para sua conveniência. O inglês precede o português em caso de inconsistências.

9. Guia operacional

Colaboradores nkarthik

Karthikeyan Nagalingam, NetApp

Este guia abrange execução de rotina, monitoramento, triagem de incidentes, recuperação de treinamento, verificação de arquivo, ajuste de capacidade e proteção de dados. Use-o com os cenários de configuração na Seção 8 para operar o mesmo pipeline de forma consistente nos modos de treinamento local, ONTAP S3 e LustreFS.

[[9-1-execution-walkthrough]]
== 9.1 Passo a passo da execução

Acione uma execução por meio de trigger_and_wait_ai_pipeline_sklearn.sh com uma CONF_JSON carga. O script envia uma execução manual com nome exclusivo, verifica até atingir um estado final e imprime os trechos finais dos logs locais para tarefas com falha, quando disponíveis. Cada tarefa principal emite um registro effective_config na inicialização para que os operadores possam verificar a configuração avaliada, em vez de depender apenas da carga enviada.

[[9-2-monitoring-and-observability]]
== 9.2 Monitoramento e observabilidade

Monitore o estado do DAG na UI ou na CLI do Airflow e correlacione-o com o ID da execução e run_stamp. Os logs de guarda são compatíveis com grep: [data_prep] effective_config, [model_training] effective_config, [xcp_copy] effective_config e [checkpoint] resume_summary. Analise essas entradas para validar o mecanismo de transformação, o destino XCP selecionado, a fonte de treinamento e a decisão de reutilização do checkpoint para cada execução.

[[9-3-troubleshooting-quick-reference]]
== 9.3 Guia rápido de solução de problemas

Use esta tabela para associar falhas comuns de tarefas à primeira ação corretiva. Resolva problemas de conectividade de origem e de montagem antes de tentar executar novamente; tentar novamente sem corrigir uma configuração inválida ou um endpoint indisponível reproduzirá a mesma falha.

Sintoma Causa provável Resolução

Could not resolve XCP S3 credentials

Ausente/incorreto xcp_s3_profile em xcp_s3_profiles

Verifique o nome do perfil e o mapa de credenciais

no readable Lustre source directory

LustreFS não está montado ou incorreto xcp_lustrefs_dest_path

Verifique o tipo de sistema de arquivos com findmnt -T /mnt/lustre/client -o FSTYPE,TARGET -n; caminho correto

Missing required text dataset files

JSONs de texto ausentes no prefixo bruto do S3

Carregar text_base.json, text_finetune.json, text_infer.json

Código de saída de pré-verificação 1

SSH inacessível

Verifique ssh_default a conexão e o host/usuário

Código de saída da verificação preliminar 2

Caminho NFS não exportado/visível

Verificar a exportação com xcp show <ip>

[[9-4-checkpoint-operations]]
== 9.4 Operações de Checkpoint

O recurso de checkpoint se aplica somente a model_training. Defina training_checkpoint_reuse_mode=resume_if_exists para reutilizar um resultado de treinamento válido e concluído e ignorar o treinamento redundante do modelo, ou use verify_only para validar a elegibilidade do checkpoint sem ignorá-lo. Mantenha a reutilização desativada (off durante os testes iniciais ou sempre que as entradas de treinamento, a configuração ou os artefatos esperados tiverem mudado.

[[9-5-manual-archive-operations]]
== 9.5 Operações manuais de arquivamento

Defina manual_archive_enabled=true e escolha manual_archive_stage criteriosamente. Use model_training quando a governança exigir a linha de base do modelo principal assim que o treinamento for concluído com sucesso; use inferencing quando o arquivo precisar incluir as previsões finais. Uma execução com model_training selecionado continua para o ajuste fino e a inferência após a ramificação de arquivamento; ela simplesmente não arquiva as saídas posteriores. Verifique os uploads no prefixo do StorageGRID com carimbo de execução e revise [manual_archive] os logs do estágio selecionado, os arquivos encontrados e a contagem de uploads.

[[9-6-scaling-guidance]]
== 9.6 Orientações de dimensionamento

Ajuste sample_count, spark_driver_memory, spark_executor_memory e spark_timeout_secs ao volume de entrada e ao objetivo de nível de serviço. Comece com amostras limitadas para validar o formato e o roteamento dos dados e, em seguida, use sample_count=0 para execuções de todas as linhas depois que o StorageGRID, o ONTAP NAS, o XCP e a camada de treinamento selecionada tiverem capacidade e taxa de transferência suficientes.

[[9-7-backup-and-recovery]]
== 9.7 Backup e Recuperação

Proteja o bucket de dados preparados do ONTAP NAS com o ONTAP Snapshot e backup. Aplique as políticas de proteção e retenção do StorageGRID aos buckets de dados brutos e de arquivamento; o bucket de arquivamento retém o histórico independentemente da reexecução do pipeline. Combine essas proteções de storage com o registro de checkpoint de treinamento para recuperar os dados corretos com escopo de execução e os artefatos de linha de base após uma interrupção em nível de tarefa, host ou site.