Decommissionare i nodi StorageGRID disconnessi
Potresti dover decommissionare un nodo che non è attualmente connesso alla grid (uno il cui stato di salute è Sconosciuto o Amministrativamente Down).
-
Hai compreso le considerazioni per decommissionare "Nodi di amministrazione e gateway" e le considerazioni per decommissionare "Nodi di storage".
-
Hai ottenuto tutti i prerequisiti.
-
Hai verificato che non siano attivi processi di riparazione dati. Vedi "Verifica i lavori di riparazione dei dati".
-
Hai confermato che il recovery dello Storage Node non è in corso in nessuna parte della grid. Se invece lo è, devi aspettare che qualsiasi rebuild di Cassandra eseguito come parte del recovery sia completato. A quel punto puoi procedere con il decommissioning.
-
Hai verificato che nessun'altra procedura di manutenzione venga eseguita mentre è in corso la procedura di decommission del nodo, a meno che la procedura di decommission non venga messa in pausa.
-
La colonna Decommission Possible per il nodo o i nodi disconnessi che vuoi decommissionare include un segno di spunta verde.
-
${post_edited_translations.segment}
Puoi identificare i nodi disconnessi cercando l'icona blu "Sconosciuto"
o l'icona grigia "Amministrativamente non disponibile"
nella colonna Integrità.
Prima di decommissionare un nodo disconnesso, tieni presente quanto segue:
-
Questa procedura è pensata principalmente per la rimozione di un singolo nodo disconnesso. Se la tua grid contiene più nodi disconnessi, il software richiede di decommissionarli tutti contemporaneamente, il che aumenta la possibilità di risultati imprevisti.
Potresti perdere dati se decommissioni più di un nodo di archiviazione disconnesso alla volta. Vedi "Considerazioni per i nodi di storage disconnessi". Presta attenzione quando decommissioni i Storage Node in un grid che contiene nodi basati su software di soli metadati. Se decommissioni tutti i nodi configurati per memorizzare sia oggetti che metadati, la capacità di memorizzare oggetti viene rimossa dal grid. Consulta "Tipi di nodi di archiviazione" per ulteriori informazioni sui Storage Node di soli metadati. -
Se un nodo disconnesso non può essere rimosso (ad esempio, un Storage Node che è necessario per il quorum dell'ADC), nessun altro nodo disconnesso può essere rimosso.
-
A meno che tu non stia decommissionando un nodo di archivio (che deve essere disconnesso), prova a riportare online o a recuperare i nodi della griglia disconnessi.
Vedere "Procedure di ripristino del nodo della griglia" per le istruzioni.
-
Se non riesci a ripristinare un nodo della griglia disconnesso e desideri decommissionarlo mentre è disconnesso, seleziona la casella di controllo corrispondente a tale nodo.
Se la tua grid contiene più nodi disconnessi, il software richiede di decommissionarli tutti contemporaneamente, il che aumenta la possibilità di risultati imprevisti. Fai attenzione quando scegli di decommissionare più di un nodo di griglia disconnesso alla volta, soprattutto se selezioni più nodi di Storage disconnessi. Se hai più di un nodo di Storage disconnesso che non puoi recuperare, contatta il supporto tecnico per determinare la soluzione migliore. -
${post_edited_translations.segment}
Il pulsante Avvia decommission è abilitato.
-
Fai clic su Avvia decommission.
Viene visualizzato un avviso che indica che hai selezionato un nodo disconnesso e che i dati dell'oggetto andranno persi se il nodo ha l'unica copia di un oggetto.
-
Esamina l'elenco dei nodi e fai clic su OK.
La procedura di decommission ha inizio e l'avanzamento viene visualizzato per ciascun nodo. Durante la procedura, viene generato un nuovo pacchetto di ripristino contenente la modifica della configurazione della grid.
-
Non appena il nuovo pacchetto di ripristino sarà disponibile, fai clic sul collegamento oppure seleziona Manutenzione > Sistema > Pacchetto di ripristino per accedere alla pagina del pacchetto di ripristino. Quindi, scarica il
.zipfile.Vedi le istruzioni per "download del pacchetto di ripristino".
Scarica il pacchetto di ripristino il prima possibile per assicurarti di poter ripristinare la tua grid se qualcosa va storto durante la procedura di decommission. Il file del pacchetto di ripristino deve essere protetto perché contiene chiavi di crittografia e password che possono essere utilizzate per ottenere dati dal sistema StorageGRID. -
Controlla periodicamente la pagina di decommission per assicurarti che tutti i nodi selezionati siano stati decommissionati correttamente.
I nodi di storage possono richiedere giorni o settimane per essere decommissionati. Quando tutte le operazioni sono complete, l'elenco di selezione dei nodi viene visualizzato nuovamente con un messaggio di successo. Se hai decommissionato un nodo di storage disconnesso, un messaggio informativo indica che i job di riparazione sono stati avviati.
-
Dopo che i nodi si sono arrestati automaticamente come parte della procedura di decommission, rimuovi tutte le macchine virtuali o altre risorse rimanenti associate al nodo decommissionato.
Non eseguire questo passaggio finché i nodi non si sono arrestati automaticamente. -
Se stai decommissionando un nodo di archiviazione Storage Node, monitora lo stato dei processi di riparazione dei dati replicati e dei dati con codifica di cancellazione (EC) che vengono avviati automaticamente durante il processo di decommissionamento.
-
Per ottenere una stima della % di completamento della riparazione replicata, aggiungi l' `show-replicated-repair-status`opzione al comando repair-data.
repair-data show-replicated-repair-status -
Per verificare se le riparazioni sono complete:
-
Seleziona Nodes > Storage Node being repaired > ILM.
-
Esamina gli attributi nella sezione Valutazione. Quando le riparazioni sono complete, l'attributo In attesa - Tutti indica 0 oggetti.
-
-
Per monitorare la riparazione in modo più dettagliato:
-
Selezionare Nodi.
-
Seleziona grid name > ILM.
-
Posiziona il cursore sul grafico della coda ILM per visualizzare il valore dell'attributo Frequenza di scansione (oggetti/sec), che indica la velocità con cui gli oggetti nella griglia vengono scansionati e messi in coda per ILM.
-
Nella sezione Coda ILM, guarda i seguenti attributi:
-
Periodo di scansione - stimato: Tempo stimato per completare una scansione ILM completa di tutti gli oggetti.
Una scansione completa non garantisce che ILM sia stato applicato a tutti gli oggetti.
-
Tentativi di riparazione: il numero totale di operazioni di riparazione di oggetti tentate per i dati replicati considerati ad alto rischio. Gli oggetti ad alto rischio sono tutti gli oggetti di cui rimane una sola copia, sia che sia specificato dalla policy ILM sia a seguito della perdita di copie. Questo conteggio aumenta ogni volta che un nodo di storage tenta di riparare un oggetto ad alto rischio. Le riparazioni ILM ad alto rischio hanno la priorità se la grid diventa occupata.
Lo stesso oggetto di riparazione potrebbe incrementare nuovamente se la replica non riesce dopo la riparazione. Questi attributi possono essere utili quando monitori l'avanzamento del ripristino del volume dello Storage Node. Se il numero di riparazioni tentate ha smesso di aumentare ed è stata completata una scansione completa, la riparazione probabilmente è terminata.
-
-
In alternativa, invia una query Prometheus per
storagegrid_ilm_scan_period_estimated_minutesestoragegrid_ilm_repairs_attempted.
-
Per monitorare la riparazione dei dati codificati con erasure coding e riprovare eventuali richieste che potrebbero non essere andate a buon fine:
-
Determina lo stato delle riparazioni dei dati codificati per la cancellazione:
-
Seleziona Support > Tools > Metrics per visualizzare il tempo stimato di completamento e la % di completamento per il lavoro corrente. Quindi, seleziona EC Overview nella sezione Grafana. Consulta le dashboard Grid EC Job Estimated Time to Completion e Grid EC Job Percentage Completed.
-
Utilizza questo comando per vedere lo stato di una specifica
repair-dataoperazione:repair-data show-ec-repair-status --repair-id repair ID -
Utilizza questo comando per elencare tutte le riparazioni:
repair-data show-ec-repair-status
L'output elenca le informazioni, tra cui
repair ID, per tutte le riparazioni eseguite in precedenza e quelle attualmente in corso. -
-
Se l'output indica che l'operazione di riparazione non è riuscita, usa l'opzione
--repair-idper riprovare la riparazione.Questo comando riprova una riparazione del nodo non riuscita, utilizzando l'ID di riparazione 6949309319275667690:
repair-data start-ec-node-repair --repair-id 6949309319275667690Questo comando riprova una riparazione del volume non riuscita, usando l'ID di riparazione 6949309319275667690:
repair-data start-ec-volume-repair --repair-id 6949309319275667690
Non appena i nodi disconnessi sono stati decommissionati e tutti i job di riparazione dei dati sono stati completati, puoi decommissionare qualsiasi nodo della griglia connesso, se necessario.
Poi, completa questi passaggi dopo aver completato la procedura di decommission:
-
Assicurati che le unità del nodo di grid decommissionato vengano completamente cancellate. Usa uno strumento o un servizio di cancellazione dati disponibile in commercio per rimuovere in modo permanente e sicuro i dati dalle unità.
-
Se hai decommissionato un nodo appliance e i dati sull'appliance erano protetti tramite crittografia del nodo, usa StorageGRID Appliance Installer per cancellare la configurazione del server di gestione delle chiavi (Clear KMS). Devi cancellare la configurazione KMS se vuoi aggiungere l'appliance a un'altra grid. Per istruzioni, vedi "Monitora la crittografia del nodo in modalità di manutenzione".