Supervisa los trabajos de reparación de StorageGRID
Puedes supervisar el estado de los trabajos de reparación utilizando el script repair-data desde la línea de comandos.
Entre ellos se incluyen los trabajos que iniciaste manualmente o los que StorageGRID inició automáticamente como parte de un procedimiento de decomisionar.
|
|
Si estás ejecutando tareas de restauración de volúmenes, utiliza "supervisar el progreso y consultar el historial de esos trabajos en el Grid Manager" en su lugar. |
Supervisa el estado de los trabajos de repair-data según si usas datos replicados, datos con código de borrado (EC) o ambos.
-
Para obtener un porcentaje estimado de finalización de la reparación replicada, añade la opción
show-replicated-repair-statusal comando repair-data.repair-data show-replicated-repair-status -
${post_edited_translations.segment}
-
Selecciona Nodos > Nodo de almacenamiento en reparación > ILM.
-
Revisa los atributos en la sección de evaluación. Cuando se completen las reparaciones, el atributo Awaiting - All indica 0 objetos.
-
-
Para monitorear la reparación con más detalle:
-
Selecciona Nodos.
-
Selecciona nombre de la cuadrícula > ILM.
-
${post_edited_translations.segment}
-
En la sección Cola de ILM, fíjate en los siguientes atributos:
-
Duración del escaneo - estimada: El tiempo estimado para completar un escaneo ILM completo de todos los objetos.
Un análisis completo no garantiza que se haya aplicado ILM a todos los objetos.
-
Reparaciones intentadas: el número total de operaciones de reparación de objetos intentadas para datos replicados que se consideran de alto riesgo. Los objetos de alto riesgo son aquellos a los que les queda una sola copia, ya sea porque así lo especifica la política de ILM o como resultado de la pérdida de copias. Este recuento se incrementa cada vez que un Storage Node intenta reparar un objeto de alto riesgo. Las reparaciones de ILM de alto riesgo se priorizan si el grid se ocupa.
La misma reparación de objetos podría volver a incrementarse si la replicación falló después de la reparación. + Estos atributos pueden ser útiles cuando estés monitorizando el progreso de la recuperación de volúmenes del Storage Node. Si el número de intentos de reparación ha dejado de aumentar y se ha completado un escaneo completo, es probable que la reparación haya finalizado.
-
-
Como alternativa, envía una consulta de Prometheus para
storagegrid_ilm_scan_period_estimated_minutesystoragegrid_ilm_repairs_attempted.
-
Para supervisar la reparación de los datos con código de borrado y volver a intentar cualquier solicitud que haya podido fallar:
-
Determina el estado de las reparaciones de los datos con código de borrado:
-
Selecciona Support > Tools > Metrics para ver el tiempo estimado hasta la finalización y el porcentaje de finalización del trabajo actual. Luego, selecciona EC Overview en la sección de Grafana. Consulta los paneles Grid EC Job Estimated Time to Completion y Grid EC Job Percentage Completed.
-
Usa este comando para ver el estado de una operación
repair-dataespecífica:repair-data show-ec-repair-status --repair-id repair ID -
Utiliza este comando para listar todas las reparaciones:
repair-data show-ec-repair-status
El resultado muestra información, incluida
repair ID, sobre todas las reparaciones que se han realizado anteriormente y las que se están llevando a cabo actualmente. -
-
Si el resultado indica que la operación de reparación ha fallado, utiliza la opción
--repair-idpara volver a intentar la reparación.${post_edited_translations.segment}
repair-data start-ec-node-repair --repair-id 6949309319275667690${post_edited_translations.segment}
repair-data start-ec-volume-repair --repair-id 6949309319275667690