驗證 StorageGRID 中物件資料的完整性
StorageGRID 系統驗證 Storage Nodes 上物件資料的完整性,檢查是否有毀損或遺失的物件。
驗證程序分為兩種:背景驗證和物件存在性檢查(以前稱為前景驗證)。兩者協同運作以確保資料完整性。背景驗證會自動執行,並持續檢查物件資料的正確性。使用者可觸發物件存在性檢查,以更快速驗證物件是否存在(但無法驗證其正確性)。
什麼是背景驗證?
背景驗證程序會自動持續檢查儲存節點是否有毀損的物件資料複本,並自動嘗試修復發現的任何問題。
背景驗證會檢查複寫物件和銷毀編碼物件的完整性,如下所示:
-
複製物件:如果背景驗證程序發現某個複製物件毀損,則會將該毀損的複本從其原始位置移除,並隔離到儲存節點上的其他位置。然後,系統會產生一個新的未毀損複本,並將其放置在符合使用中 ILM 原則的位置。新複本可能不會放置在用於原始複本的儲存節點上。
|
|
毀損的物件資料會被隔離而非從系統中刪除,以便仍可存取。如需存取隔離物件資料的詳細資訊,請聯絡技術支援。 |
-
糾刪碼物件:如果背景驗證程序偵測到糾刪碼物件的某個片段毀損,StorageGRID 會自動嘗試使用剩餘的資料片段和同位元檢查片段,在同一儲存節點上重新建置缺少的片段。如果無法重新建置毀損的片段,則會嘗試擷取該物件的另一個複本。如果擷取成功,則會執行 ILM 評估,以建立糾刪碼物件的替換複本。
背景驗證程序僅檢查 Storage Nodes 上的物件。不會檢查 Cloud Storage Pool 中的物件。物件必須超過四天才能符合背景驗證的條件。
背景驗證以持續的速率執行,旨在不干擾正常的系統活動。背景驗證無法停止。但是,如果您懷疑有問題,可以提高背景驗證速率,以便更快驗證儲存節點的內容。
與背景驗證相關的警示
如果系統偵測到無法自動修正的毀損物件(因為毀損導致無法辨識該物件),則會觸發「偵測到未識別的毀損物件」警示。
如果背景驗證無法取代毀損的物件(因為找不到另一個複本),則會觸發 Objects potentially lost 警示。
什麼是物件存在性檢查?
物件存在性檢查用於驗證儲存節點上是否存在所有預期的物件複本和銷除編碼片段。物件存在性檢查並不驗證物件資料本身(背景驗證負責執行此作業);而是提供一種驗證儲存設備完整性的方法,尤其是在近期硬體問題可能影響資料完整性的情況下。
與自動進行的背景驗證不同,您必須手動啟動物件存在性檢查作業。
物件存在性檢查會讀取 StorageGRID 中儲存的每個物件的中繼資料,並驗證複製物件複本和銷毀編碼物件片段是否存在。任何遺失的資料將依下列方式處理:
-
複製複本:如果複製物件資料的複本遺失,StorageGRID 會自動嘗試從系統中其他位置儲存的複本進行替換。儲存節點會對現有複本執行 ILM 評估,評估結果會確定由於缺少其他複本,目前的 ILM 原則不再適用於該物件。系統會產生新複本並加以放置,以滿足系統的現行 ILM 原則。新複本的位置可能與遺失複本的儲存位置不同。
-
糾刪碼片段:如果糾刪碼物件的某個片段遺失,StorageGRID 會自動嘗試使用剩餘片段在同一儲存節點上原地重新建置遺失的片段。如果無法重新建置遺失的片段(因為遺失的片段過多),ILM 會嘗試尋找該物件的另一個複本,並使用該複本產生新的糾刪碼片段。
執行物件存在性檢查
您一次只能建立並執行一個物件存在性檢查作業。建立作業時,您需要選擇要驗證的 Storage Nodes 和 Volume。您也可以選擇作業的一致性。
-
您已使用 "支援的網頁瀏覽器" 登入 Grid Manager。
-
您已確認要檢查的 Storage Node 均處於線上。選取 Nodes 以檢視節點表。請確保要檢查的節點名稱旁邊沒有顯示任何警示圖示。
-
您已確保以下程式未在要檢查的節點上執行:
-
網格擴展,新增儲存節點
-
儲存節點退役
-
恢復故障儲存設備 Volume
-
恢復系統磁碟機發生故障的儲存節點
-
EC 重新平衡
-
設備節點 Clone
-
在這些程序進行期間,物件存在性檢查無法提供有用的資訊。
物件存在性檢查作業可能需要數天甚至數週才能完成,具體取決於網格中的物件數量、所選的儲存設備節點和 Volume 以及所選的一致性等級。一次只能執行一個作業,但可以同時選擇多個 Storage Node 和 Volume。
-
選擇 Maintenance > Tasks > Object existence check。
-
選擇「建立作業」。此時將顯示「建立物件存在性檢查作業精靈」。
-
選擇包含要驗證 Volume 的節點。若要選取所有線上節點,請選取欄標題中的「節點名稱」核取方塊。
您可以依節點名稱或站台進行搜尋。
您無法選擇未連接到網格的節點。
-
選擇 Continue 。
-
從清單中為每個節點選擇一個或多個 Volume。您可以使用儲存設備 Volume 編號或節點名稱搜尋 Volume。
若要選取所選每個節點的所有 Volume,請選取欄標題中的「儲存 Volume」核取方塊。
-
選擇 Continue 。
-
選擇工作的一致性。
一致性決定了用於物件存在性檢查的物件中繼資料複本數量。
-
Strong-site:單一站點上存有兩份中繼資料複本。
-
Strong-global:每個站台有兩份中繼資料複本。
-
全部(預設):每個站台上的所有三個中繼資料複本。
如需一致性的詳細資訊,請參閱精靈中的說明。
-
-
選擇 Continue 。
-
審查並確認您的選擇。您可以選取 Previous 返回精靈的上一個步驟以更新您的選擇。
系統會產生一個物件存在性檢查工作,並且持續執行,直到發生以下情況之一:
-
工作完成。
-
您暫停或取消工作。您可以恢復已暫停的工作,但無法恢復已取消的工作。
-
作業停滯。系統觸發「物件存在性檢查已停滯」警報。請按照警報中指定的修正措施進行操作。
-
作業失敗。系統觸發「物件存在性檢查失敗」警報。請按照警報中指定的修正措施進行操作。
-
頁面顯示「Service unavailable」或「Internal server error」訊息。一分鐘後,重新整理頁面以繼續監控作業。
如有需要,您可以離開物件存在性檢查頁面,然後返回繼續監控作業。
-
-
作業執行時,檢視 Active job 索引標籤,並記下「偵測到的遺失物件副本」的值。
此值代表遺失複本的複寫物件,以及遺失一個或多個片段的銷毀編碼物件的總數。
如果偵測到的缺失物件副本數大於 100,則儲存節點的儲存設備可能有問題。
-
工作完成後,採取任何其他必要的行動:
-
如果偵測到的缺失物件副本數為零,則表示未發現任何問題。無需採取任何行動。
-
如果偵測到的缺失物件副本數大於零,且未觸發 Objects potentially lost 警示,則表示系統已修復所有缺少的副本。請確認所有硬體問題均已解決,以防止將來對物件副本造成損壞。
-
如果偵測到的缺失物件副本數大於零,且已觸發「物件可能遺失」警報,則資料完整性可能會受到影響。請聯絡技術支援。
-
您可以使用 grep 指令擷取 LLST 稽核訊息,從而調查可能遺失的物件副本:
grep LLST audit_file_name。此程序與 "調查可能遺失的物件" 的程序類似,但對於物件複本,您搜尋的是
LLST而非OLST。
-
-
如果您為該工作選擇了強站台一致性或強全域一致性,請等待約三週以使中繼資料保持一致,然後再在相同的磁碟區上重新執行該工作。
當 StorageGRID 有時間實現作業中所含節點和磁碟區的中繼資料一致性後,重新執行作業可能會清除錯誤報告的遺失物件副本,或在遺漏其他物件副本時導致系統對這些副本進行檢查。
-
${post_edited_translations.segment}
-
確定哪些工作已準備好重新執行:
-
查看「結束時間」欄,確定哪些工作是在三週前以上執行的。
-
對於這些工作,請檢查「一致性」控制欄中是否存在 strong-site 或 strong-global。
-
-
選取要重新執行的每個工作的核取方塊,然後選取 Rerun。
-
在「重新執行工作」精靈中,審查所選節點和磁碟區以及一致性。
-
準備好重新執行工作時,請選擇 Rerun。
-
「Active job」索引標籤隨即顯示。您選擇的所有工作將以 strong-site 一致性重新執行為一個工作。詳細資料區段中的 Related jobs 欄位列出原始工作的工作 ID。