Skip to main content
此產品有較新版本可以使用。
本繁體中文版使用機器翻譯,譯文僅供參考,若與英文版本牴觸,應以英文版本為準。

疑難排解 StorageGRID 系統

如果您在使用 StorageGRID 系統時遇到問題,請參閱本節中的提示和指南,以協助您判斷並解決問題。

通常情況下,您可以自行解決問題;但是,您可能需要將某些問題提報給技術支援。

定義問題

解決問題的第一步是明確定義問題。

下表列舉了一些為定義問題而可能需要收集的資訊類型範例:

問題 範例回應

StorageGRID 系統正在做什麼或沒有做什麼?它有哪些症狀?

用戶端應用程式報告無法將物件擷取至 StorageGRID。

問題是什麼時候開始出現的?

2020 年 1 月 8 日 14:50 左右,物件擷取首次遭到拒絕。

您最初是如何發現此問題的?

用戶端應用程式已發出通知。同時也收到了警報郵件通知。

這個問題是經常發生,還是偶爾發生?

問題仍在持續中。

如果問題經常發生,是哪些步驟導致此問題發生

每次用戶端嘗試擷取物件時都會出現問題。

如果問題是間歇性發生的,它何時發生?請記錄您所知道的每次事件發生的時間。

問題並非間歇性出現。

您以前曾遇過這個問題嗎?過去您遇到這個問題的頻率為何?

這是我第一次遇到這個問題。

評估風險及對系統的影響

在明確問題之後,評估其風險以及對 StorageGRID 系統的影響。例如,出現關鍵警示並不一定表示系統無法提供核心服務。

下表總結了範例問題對系統運作的影響:

問題 範例回應

StorageGRID 系統可以擷取內容嗎?

${post_edited_translations.segment}

用戶端應用程式能否擷取內容?

有些物件可以擷取,有些則不能。

資料是否有風險?

${post_edited_translations.segment}

開展業務的能力是否受到嚴重影響?

是的,因為用戶端應用程式無法將物件儲存到 StorageGRID 系統中,因此無法一致地擷取資料。

收集資料

在明確問題並評估其風險和影響之後,收集資料進行分析。最有用的資料類型取決於問題的性質。

要收集的資料類型 為什麼要收集這些資料 指示

建立近期變更時間線

StorageGRID 系統、其組態或其環境的變更可能會導致新的行為。

審查警示

警報可協助您快速判斷問題的根本原因,提供可能導致問題的潛在問題的重要線索。

查看目前警示清單,看看 StorageGRID 是否已為您找到問題的根本原因。

審查過去觸發的警示,以獲取更多資訊。

建立基線

收集各項運作指標正常水準的資訊。這些基準值及其偏差可以提供有價值的線索。

執行擷取和檢索測試

若要疑難排解擷取和檢索方面的效能問題,請使用工作站儲存和擷取物件。將結果與使用用戶端應用程式時所見的結果進行比較。

審查稽核訊息

審查稽核訊息,詳細了解 StorageGRID 的操作。稽核訊息中的詳細資訊有助於疑難排解多種問題,包括效能問題。

檢查物件位置和儲存設備完整性

如果遇到儲存設備問題,請確認物件是否放置在預期位置。檢查儲存節點上物件資料的完整性。

收集技術支援資料

技術支援可能會要求您收集資料或審查特定資訊,以協助疑難排解問題。

建立近期變更時間線

當發生問題時,您應該考慮最近發生了哪些變更,以及這些變更是何時發生的。

  • StorageGRID 系統、其組態或其環境的變更可能會導致新的行為。

  • 變更時間軸可以幫助您確定哪些變更可能導致了某個問題,以及每項變更如何影響了問題的發展。

建立一張表格,記錄系統最近的變更,包括每次變更發生的時間以及與變更相關的任何詳細資訊,例如變更進行期間發生的其他情況:

變革的時代 變更類型 詳細資料

例如:

  • 您何時開始節點恢復?

  • 軟體升級何時完成?

  • 您是否中斷了此程序?

發生了什麼事?您做了什麼?

記錄與變更相關的任何詳細資訊。例如:

  • 網路變更詳情。

  • 安裝了哪個 Hotfix。

  • 用戶端工作負載發生了哪些變化?

務必附註是否同時發生了多項變更。例如,此變更是否在升級過程中進行?

近期重大變更範例

以下是一些可能發生重大變化的例子:

  • StorageGRID 系統是最近安裝、擴充還是恢復的?

  • 系統最近升級過嗎?是否套用了 Hotfix?

  • 最近是否有任何硬體進行過維修或更換?

  • ILM 原則是否已更新?

  • 用戶端的工作負載是否改變了?

  • 用戶端應用程式或其行為是否發生了變化?

  • 您是否更改了負載平衡器,或新增或移除了管理節點或閘道節點的高可用度群組?

  • 是否有任何已啟動但可能需要很長時間才能完成的任務?例如:

    • 恢復故障儲存節點

    • 儲存節點退役

  • 使用者身分驗證方面是否進行了任何變更,例如新增租戶或變更 LDAP 組態?

  • 資料移轉正在進行嗎?

  • 平台服務最近是否啟用或更改?

  • 最近是否啟用了法規遵循功能?

  • 雲端儲存池是否已新增或移除?

  • 儲存設備壓縮或加密是否有任何變更?

  • 網路基礎架構是否有任何變更?例如,VLAN、路由器或 DNS。

  • NTP 來源是否有任何變更?

  • 網格、管理或用戶端網路介面是否有任何變更?

  • StorageGRID 系統或其環境是否有其他變更?

建立基線

您可以透過記錄各種運作值的正常等級來建立系統的基線。將來,您可以將目前值與這些基線進行比較,以協助偵測及解決異常值。

屬性 價值 如何獲得

平均儲存設備消耗量

每日消耗GB數

每日消耗百分比

前往 Grid Manager。在「節點」頁面上,選擇整個網格或站台,然後前往「儲存設備」標籤。

在「已使用儲存設備 - 物件資料」圖表中,找到線條相對穩定的時期。將遊標懸停在圖表上,估算每天消耗的儲存設備量。

您可以收集整個系統或特定資料中心的此類資訊。

平均中繼資料消耗量

每日消耗GB數

每日消耗百分比

前往 Grid Manager。在「節點」頁面上,選擇整個網格或站台,然後前往「儲存設備」標籤。

在「已使用儲存設備 - 物件中繼資料」圖表中,找到線條相對穩定的時期。將遊標停留在圖表上,即可估算每天消耗的中繼資料儲存設備容量。

您可以收集整個系統或特定資料中心的此類資訊。

S3 操作速率

每秒運算元

在 Grid Manager 儀表板上,選擇 效能 > 儲存節點的 S3 操作

若要查看特定站台或節點的擷取和擷取速率及計數,請選擇 Nodes > site or Storage Node > Objects。將游標停留在 S3 擷取和擷取圖表上。

ILM 評估率

每秒物件數

從「節點」頁面中,選擇 grid > ILM

在 ILM 佇列圖表中,找出一段線條相對穩定的時間段。將游標停留在圖表上,以估算系統的*評估率*基準值。

ILM 掃描速率

每秒物件數

選擇 節點 > grid > ILM

在 ILM 佇列圖表上,找出線條相對穩定的時期。將遊標停留在圖表上,以估算系統的*掃描速率*基準值。

用戶端操作佇列中的物件

每秒物件數

選擇 節點 > grid > ILM

在 ILM 佇列圖表中,找到線條相對穩定的時期。將游標停留在圖表上,以估算系統中「已排隊物件(來自用戶端操作)」的基準值。

平均查詢延遲

毫秒

選取 Nodes > Storage Node > Objects。在 Queries 表中,檢視 Average Latency 的值。

分析資料

利用收集到的資訊來確定問題的原因和潛在的解決方案。

分析方法取決於具體問題,但總體而言:

  • 利用警示找出故障點和瓶頸。

  • 利用警示歷史記錄和圖表重建問題歷史。

  • 使用圖表尋找異常情況,並將問題狀況與正常運作情況進行比較。

升級資訊核對清單

如果您無法自行解決問題,請聯絡技術支援。在聯絡技術支援之前,請收集下表所列資訊,以利問題解決。

對勾標記 項目 附註

問題聲明

問題症狀是什麼?問題是什麼時候開始出現的?是持續發生還是間歇性發生?如果是間歇性發生,具體發生在哪些時候?

影響評估

問題的嚴重程度如何?對用戶端應用程式有何影響?

  • 用戶端之前是否成功連線過?

  • 用戶端可以擷取、讀取和刪除資料嗎?

StorageGRID 系統 ID

選擇 Maintenance > System > License。StorageGRID 系統 ID 會顯示為目前授權的一部分。

軟體版本

從 Grid Manager 頂端選取說明圖示,然後選取 關於 以查看 StorageGRID 版本。

客製化

請簡要概述您的 StorageGRID 系統配置。例如,列出以下內容:

  • 網格是否使用儲存設備壓縮、儲存設備加密或法規遵循?

  • ILM 是否建立複製物件或糾刪碼物件?ILM 是否確保網站備援?ILM 規則是否使用平衡、嚴格或雙重提交的擷取行為?

日誌檔案和系統資料

收集系統的日誌檔案和系統資料。選擇 Support > Tools > Log collection

您可以收集整個網格的日誌,也可以收集選定節點的日誌。

如果您僅收集特定節點的日誌,請確保至少包含一個具有 ADC 服務的 Storage Node。站台上安裝的前三個 Storage Node 均包含 ADC 服務。

基線資訊

收集有關擷取作業、擷取作業和儲存設備消耗的基準資訊。

近期變更時間表

建立時間表,彙整系統或其環境的近期變更。

診斷該問題的歷史嘗試

如果您已採取措施自行診斷或排除問題,請務必記錄您採取的步驟和結果。