Skip to main content
Eine neuere Version dieses Produkts ist erhältlich.
Die deutsche Sprachversion wurde als Serviceleistung für Sie durch maschinelle Übersetzung erstellt. Bei eventuellen Unstimmigkeiten hat die englische Sprachversion Vorrang.

Überwachen Sie StorageGRID repair-data-Jobs

Änderungen vorschlagen

Der Status von Reparaturaufträgen lässt sich mithilfe des repair-data Skripts über die Befehlszeile überwachen.

Dazu gehören Aufträge, die Sie manuell initiiert haben, oder Aufträge, die StorageGRID automatisch im Rahmen eines Stilllegungsverfahrens initiiert hat.

Hinweis Wenn Volumenwiederherstellungsaufträge ausgeführt werden, "Der Fortschritt kann überwacht und der Verlauf dieser Aufträge im Grid Manager angezeigt werden."stattdessen.

Der Status von `repair-data`Aufträgen kann überwacht werden, abhängig davon, ob replizierte Daten, erasure-coded (EC) Daten oder beides verwendet werden.

Replizierte Daten
  • Um eine geschätzte prozentuale Fertigstellung für die replizierte Reparatur zu erhalten, kann die show-replicated-repair-status Option zum Befehl repair-data hinzugefügt werden.

    repair-data show-replicated-repair-status

  • Zur Feststellung, ob die Reparaturen abgeschlossen sind:

    1. Wählen Sie Knoten > Speicherknoten, der repariert wird > ILM.

    2. Die Attribute im Abschnitt „Auswertung“ können überprüft werden. Nach Abschluss der Reparaturen zeigt das Attribut „Warten – Alle“ 0 Objekte an.

  • Um die Reparatur genauer zu überwachen:

    1. Wählen Sie Knoten.

    2. grid name > ILM auswählen.

    3. Fahren Sie mit dem Cursor über das ILM-Warteschlangendiagramm, um den Wert des Attributs Scan rate (Objekte/Sek) zu sehen, der die Rate angibt, mit der Objekte im Grid gescannt und für ILM in die Warteschlange gestellt werden.

    4. Im Abschnitt „ILM-Warteschlange“ sind die folgenden Attribute zu beachten:

      • Scandauer - geschätzt: Die geschätzte Zeit für einen vollständigen ILM-Scan aller Objekte.

        Ein vollständiger Scan garantiert nicht, dass ILM auf alle Objekte angewendet wurde.

      • Reparaturversuche: Die Gesamtzahl der versuchten Objektreparaturvorgänge für replizierte Daten, die als risikoreich gelten. Risikoreiche Objekte sind alle Objekte, von denen nur noch eine Kopie vorhanden ist, unabhängig davon, ob dies durch die ILM-Richtlinie festgelegt wurde oder als Folge verlorener Kopien auftritt. Dieser Zähler wird jedes Mal erhöht, wenn ein Storage Node versucht, ein risikoreiches Objekt zu reparieren. Risikoreiche ILM-Reparaturen erhalten Priorität, wenn das Grid ausgelastet ist.

        Die Reparatur desselben Objekts kann erneut erfolgen, wenn die Replikation nach der Reparatur fehlschlägt. + Diese Attribute können nützlich sein, wenn der Fortschritt der Storage Node Volume-Wiederherstellung überwacht wird. Wenn die Anzahl der durchgeführten Reparaturen nicht mehr ansteigt und ein vollständiger Scan abgeschlossen wurde, ist die Reparatur wahrscheinlich abgeschlossen.

    5. Alternativ lässt sich eine Prometheus-Abfrage für storagegrid_ilm_scan_period_estimated_minutes und storagegrid_ilm_repairs_attempted einreichen.

Löschcodierte (EC) Daten

Zur Überwachung der Reparatur von erasure-coded Daten und zum erneuten Versuch aller Anfragen, die möglicherweise fehlgeschlagen sind:

  1. Status der Reparaturen von löschcodierten Daten bestimmen:

    • Support > Tools > Metrics auswählen, um die geschätzte Restlaufzeit und den Fertigstellungsgrad des aktuellen Auftrags anzuzeigen. Anschließend im Grafana-Bereich EC Overview auswählen. Die Dashboards Grid EC Job Estimated Time to Completion und Grid EC Job Percentage Completed anzeigen.

    • Mit diesem Befehl wird der Status eines bestimmten `repair-data`Vorgangs angezeigt:

      repair-data show-ec-repair-status --repair-id repair ID

    • Mit diesem Befehl werden alle Reparaturen aufgelistet:

      repair-data show-ec-repair-status

    Die Ausgabe listet Informationen auf, einschließlich `repair ID`zu allen zuvor und aktuell laufenden Reparaturen.

  2. Wenn die Ausgabe anzeigt, dass der Reparaturvorgang fehlgeschlagen ist, kann die Reparatur mit der --repair-id Option erneut versucht werden.

    Dieser Befehl versucht eine fehlgeschlagene Knotenreparatur erneut, wobei die Reparatur-ID 6949309319275667690 verwendet wird:

    repair-data start-ec-node-repair --repair-id 6949309319275667690

    Dieser Befehl versucht eine fehlgeschlagene Volume-Reparatur erneut, wobei die Reparatur-ID 6949309319275667690 verwendet wird:

    repair-data start-ec-volume-repair --repair-id 6949309319275667690