停用已断开连接的 StorageGRID 节点
您可能需要停用当前未连接到网格的节点(运行状况未知或管理性关闭的节点)。
-
您已获得所有先决条件项目。
-
您已确保没有数据修复作业处于活动状态。请参阅 "检查数据修复作业"。
-
您已确认存储节点恢复未在网格中的任何位置进行。如果是,则必须等待在恢复过程中执行的任何 Cassandra 重建完成。然后,您可以继续退役。
-
您已确保在运行节点停用过程时不会运行其他维护过程,除非暂停节点停用过程。
-
要停用的一个或多个断开连接的节点的*停用可能*列包含绿色复选标记。
-
您有配置密码短语。
您可以通过在*健康*列中查找蓝色未知图标
或灰色管理关闭图标
来识别断开连接的节点。
在停用任何断开连接的节点之前,请注意以下事项:
-
本程序主要用于移除单个断开连接的节点。如果您的网格包含多个断开连接的节点,软件要求您同时停用所有节点,这会增加出现意外结果的可能性。
如果一次停用多个断开连接的存储节点,可能会发生数据丢失。请参阅"断开连接的存储节点的注意事项"。 在包含基于软件的仅元数据节点的网格中停用存储节点时,请谨慎操作。如果取消配置为同时存储对象和元数据的所有节点,则存储对象的功能将从网格中删除。有关仅元数据存储节点的详细信息,请参见 "存储节点类型"。 -
如果无法删除已断开连接的节点(例如,ADC 仲裁所需的 Storage Node),则无法删除其他已断开连接的节点。
-
除非您要停用存档节点(必须断开连接),否则请尝试使任何断开连接的网格节点重新联机或恢复它们。
有关说明,请参阅 "网格节点恢复过程"。
-
如果无法恢复断开的网格节点,并且希望在断开连接时将其停用,请选中该节点的复选框。
如果您的网格包含多个断开连接的节点,软件要求您同时停用所有这些节点,这会增加出现意外结果的可能性。 在选择一次停用多个断开连接的网格节点时要小心,特别是在选择多个断开连接的存储节点时。如果有多个断开连接的存储节点无法恢复,请联系技术支持以确定最佳操作方案。 -
输入配置密码。
*开始停用*按钮已启用。
-
单击*开始停用*。
将显示警告,指示您选择了断开连接的节点,并且如果该节点具有对象的唯一副本,则对象数据将丢失。
-
查看节点列表,然后单击*确定*。
停用过程开始,并显示每个节点的进度。在此过程中,将生成一个新的恢复包,其中包含网格配置更改。
-
新的恢复包可用后,单击链接或选择*维护* > 系统 > *恢复包*以访问恢复包页面。然后,下载 `.zip`文件。
尽快下载恢复包,以确保在停用过程中出现问题时可以恢复网格。 必须保护恢复包文件,因为它包含可用于从 StorageGRID 系统获取数据的加密密钥和密码。 -
定期监控"停用"页面,以确保所有选定节点均已成功停用。
存储节点可能需要数天或数周才能停用。当所有任务完成时,节点选择列表将重新显示成功消息。如果停用了已断开连接的存储节点,则会显示一条信息消息,指示修复作业已启动。
-
在节点作为停用过程的一部分自动关闭后,删除与停用节点相关联的任何剩余虚拟机或其他资源。
在节点自动关闭之前,请勿执行此步骤。 -
如果要停用存储节点,请监控在停用过程中自动启动的*已复制数据*和*纠删编码 (EC) 数据*修复作业的状态。
-
要获得已复制修复的估计完成百分比,请将 `show-replicated-repair-status`选项添加到 repair-data 命令中。
repair-data show-replicated-repair-status -
要确定维修是否已完成:
-
选择*节点* > 正在修复的存储节点 > ILM。
-
查看"评估"部分中的属性。修复完成后,*等待 - 所有*属性指示 0 个对象。
-
-
要更详细地监控修复过程:
-
选择 Nodes。
-
选择 网格名称 > ILM。
-
将光标放在 ILM 队列图上,以查看 扫描速率(对象/秒) 属性的值,该属性是扫描网格中的对象并将其排入 ILM 队列的速率。
-
在 ILM 队列部分,查看以下属性:
-
扫描周期 - 估计:完成所有对象的完整 ILM 扫描的预计时间。
完全扫描并不能保证已将 ILM 应用于所有对象。
-
尝试修复:针对被认为是高风险的复制数据尝试的对象修复操作的总数。高风险对象是具有剩余一个副本的任何对象,无论是由 ILM 策略指定还是由于丢失副本。每次存储节点尝试修复高风险对象时,此计数都会增加。如果网格变得繁忙,则优先处理高风险 ILM 修复。
如果修复后复制失败,相同的对象修复可能会再次增加。+ 当您监控存储节点卷恢复的进度时,这些属性非常有用。如果尝试修复的次数已停止增加,并且已完成完全扫描,则修复可能已完成。
-
-
或者,为 `storagegrid_ilm_scan_period_estimated_minutes`和 `storagegrid_ilm_repairs_attempted`提交 Prometheus 查询。
-
要监控擦除编码数据的修复并重试可能失败的任何请求,请执行以下操作:
-
确定擦除编码数据修复的状态:
-
选择 Support > Tools > Metrics 以查看当前作业的预计完成时间和完成百分比。然后,在 Grafana 部分中选择 EC Overview。查看 Grid EC Job Estimated Time to Completion 和 Grid EC Job Percentage Completed 仪表板。
-
使用此命令可查看特定 `repair-data`操作的状态:
repair-data show-ec-repair-status --repair-id repair ID -
使用此命令可列出所有维修:
repair-data show-ec-repair-status
输出列出了所有以前和当前正在运行的修复的信息,包括
repair ID。 -
-
如果输出显示修复操作失败,请使用 `--repair-id`选项重试修复。
此命令使用修复 ID 6949309319275667690 重试失败的节点修复:
repair-data start-ec-node-repair --repair-id 6949309319275667690此命令使用修复 ID 6949309319275667690 重试失败的卷修复:
repair-data start-ec-volume-repair --repair-id 6949309319275667690
一旦断开的节点已退役,并且所有数据修复作业已完成,您可以根据需要退役任何已连接的网格节点。
然后,完成退役过程后,请完成以下步骤:
-
确保已退役网格节点的驱动器已擦拭干净。使用市售的数据擦除工具或服务从驱动器中永久安全地删除数据。
-
如果您停用了设备节点,并且使用节点加密保护了设备上的数据,请使用 StorageGRID Appliance Installer 清除密钥管理服务器配置(清除 KMS)。如果要将设备添加到另一个网格,则必须清除 KMS 配置。有关说明,请参见 "在维护模式下监控节点加密"。