疑難排解 StorageGRID 平台服務
平台服務中使用的端點由租用戶使用者在 Tenant Manager 中建立和維護。但是,如果租用戶在設定或使用平台服務時遇到問題,您可以嘗試使用 Grid Manager 來協助解決問題。
${post_edited_translations.segment}
租戶必須先使用租戶管理器建立一個或多個終端節點,才能使用平台服務。每個終端節點代表一個平台服務的外部目的地,例如 StorageGRID S3 儲存桶、Amazon Web Services 儲存桶、Amazon Simple Notification Service 主題、Kafka 主題或託管在本機或 AWS 上的 Elasticsearch 叢集。每個終端節點都包含外部資源的位置以及存取該資源所需的憑證。
當租戶建立端點時,StorageGRID 系統會驗證該端點是否存在,以及是否可以使用指定的認證資訊進行連線。至端點的連線會從每個站台的一個節點進行驗證。
如果端點驗證失敗,系統會出現錯誤訊息說明端點驗證失敗的原因。租戶使用者應解決該問題,然後嘗試重新建立端點。
|
|
${post_edited_translations.segment} |
現有端點存在問題
如果 StorageGRID 嘗試連線到現有端點時發生錯誤,則會在 Tenant Manager 的儀表板上顯示一則訊息。

租用戶使用者可以前往「端點」頁面,查看每個端點的最新錯誤訊息,並確認錯誤發生的時間。「上次錯誤」欄位顯示每個端點的最新錯誤訊息,並指示錯誤發生的時間。包含
圖示的錯誤表示過去 7 天內發生的錯誤。

|
|
「上次錯誤」欄位中的某些錯誤訊息可能包含括號內的日誌 ID。網格系統管理員或技術支援可以使用此 ID 在 bycast.log 中找到有關該錯誤的更多詳細資訊。 |
與 Proxy 伺服器相關的問題
如果您已在儲存節點和平台服務端點之間設定了 "${post_edited_translations.segment}",則當您的 Proxy 服務不允許來自 StorageGRID 的訊息時,可能會發生錯誤。若要解決這些問題,請檢查 Proxy 伺服器的設定,確保與平台服務相關的訊息未被封鎖。
確定是否發生錯誤
如果過去 7 天內發生任何端點錯誤,Tenant Manager 中的儀表板會顯示警示訊息。您可以前往端點頁面,檢視有關該錯誤的更多詳細資料。
${post_edited_translations.segment}
某些平台服務問題可能會導致用戶端對 S3 儲存桶的操作失敗。例如,如果內部複製狀態機 (RSM) 服務停止運行,或待發送的平台服務訊息佇列過長,則 S3 用戶端操作將會失敗。
查看服務狀態:
-
選擇 節點 > site > Storage Node > 概覽。
-
檢查「警報」表中是否有活躍警報。
-
解決任何作用中的警示。視需要聯絡技術支援。
可恢復和不可恢復的端點錯誤
建立端點之後,可能會因為各種原因而發生平台服務要求錯誤。某些錯誤可在使用者介入後恢復。例如,可能會因為下列原因而發生可恢復的錯誤:
-
使用者的憑證已刪除或已過期。
-
${post_edited_translations.segment}
-
通知無法送達。
${post_edited_translations.segment}
其他類型的錯誤則無法恢復。例如,以下原因可能導致無法復原的錯誤:
-
${post_edited_translations.segment}
-
webhook 端點目的地對通知請求的回應出現 `400 Bad Request`錯誤。
如果 StorageGRID 遇到無法復原的端點錯誤:
-
在 Grid Manager 中,請前往 Support > Tools > Metrics > Grafana > Platform Services Overview 以檢視錯誤詳細資料。
-
在租戶管理員中,前往 STORAGE (S3) > Platform Services Endpoints 以檢視錯誤詳細資料。
-
檢查 `/var/local/log/bycast-err.log`是否有相關錯誤。具有 ADC 服務的儲存節點包含此日誌檔。
${post_edited_translations.segment}
如果目的地遇到無法接收平台服務訊息的問題,則用戶端對儲存桶的操作會成功,但平台服務訊息無法送達。例如,如果目的地上的憑證更新,導致 StorageGRID 無法再向目的地服務進行驗證,則可能會發生此錯誤。
查看相關警報。
平台服務請求效能下降
如果請求發送速率超過目的地端點接收速率,StorageGRID 軟體可能會限制對某個儲存桶的 S3 請求速率。只有當有大量請求積壓等待發送到目的地端點時,才會發生限速。
唯一可見的影響是傳入的 S3 請求執行時間會延長。如果效能明顯下降,則應降低擷取速率或使用容量更大的端點。如果請求積壓持續成長,用戶端的 S3 操作(例如 PUT 請求)最終會失敗。
CloudMirror 要求更容易受到目的地端點效能的影響,因為這些要求通常比搜尋整合或事件通知要求涉及更多的資料傳輸。
平台服務請求失敗
檢視平台服務的請求故障率:
-
選取 Nodes 。
-
選擇 site > 平台服務。
-
檢視請求錯誤率圖表。

${post_edited_translations.segment}
*平台服務無法使用*警示表示由於執行或可用的含 RSM 服務的儲存節點太少,因此無法在站台上執行任何平台服務操作。
RSM 服務確保平台服務請求傳送至各自的端點。
若要解決此警示,請確定站台中哪些儲存節點包含 RSM 服務。(RSM 服務存在於也包含 ADC 服務的儲存節點上。)然後,確保這些儲存節點中的簡單多數正在運作且可用。
|
|
${post_edited_translations.segment} |