简体中文版经机器翻译而成,仅供参考。如与英语版出现任何冲突,应以英语版为准。

更换 NVMEM 电池— FAS8200

要更换系统中的 NVMEM 电池,您必须从系统中卸下控制器模块,打开该模块,更换电池,然后关闭并更换控制器模块。

系统中的所有其他组件必须正常运行;否则,您必须联系技术支持。

第 1 步:关闭受损控制器

根据存储系统硬件配置的不同,您可以使用不同的过程关闭或接管受损的控制器。

选项 1 :大多数配置

要关闭受损控制器,您必须确定控制器的状态,并在必要时接管控制器,以便运行正常的控制器继续从受损控制器存储提供数据。

关于此任务
  • 如果您使用的是 NetApp 存储加密,则必须按照 _ONTAP 9 NetApp 加密高级指南 _ 的 "`将 SED 返回到未受保护的模式` " 一节中的说明重置 MSID 。

  • 如果您使用的是 SAN 系统,则必须已检查受损控制器 SCSI 刀片式服务器的事件消息(事件日志显示)。

    每个 SCSI 刀片式服务器进程应与集群中的其他节点保持仲裁关系。在继续更换之前,必须先解决所有问题。

  • If you have a cluster with more than two nodes, it must be in quorum.如果集群未达到仲裁或运行状况良好的控制器在资格和运行状况方面显示 false ,则必须在关闭受损控制器之前更正问题描述 ;请参见 "CLI 管理概述"

  • 如果您使用的是 MetroCluster 配置,则必须确认已配置 MetroCluster 配置状态,并且节点处于已启用且正常的状态(MetroCluster node show )。

步骤
  1. 如果启用了 AutoSupport ,则通过调用 AutoSupport 消息禁止自动创建案例: ssystem node AutoSupport invoke -node * -type all -message MAINT=number_of_hours_downh

    以下 AutoSupport 消息禁止自动创建案例两小时: cluster1 : * > system node AutoSupport invoke -node * -type all -message MAINT=2h

  2. 从运行正常的控制器的控制台禁用自动交还: storage failover modify – node local -auto-giveback false

  3. 将受损控制器显示为 LOADER 提示符:

    如果受损控制器显示 …​ 那么 …​

    LOADER 提示符

    转至 "Remove controller module" 。

    正在等待交还

    按 Ctrl-C ,然后在出现提示时回答 y

    系统提示符或密码提示符(输入系统密码)

    从运行正常的控制器接管或暂停受损的控制器: storage failover takeover -ofnode impaired_node_name

    当受损控制器显示 Waiting for giveback…​ 时,按 Ctrl-C ,然后回答 y

选项 2 :控制器位于双节点 MetroCluster 中

要关闭受损控制器,您必须确定控制器的状态,并在必要时切换控制器,以便运行正常的控制器继续从受损控制器存储提供数据。

关于此任务
  • 如果您使用的是 NetApp 存储加密,则必须按照的 " 将 FIPS 驱动器或 SED 返回到未受保护的模式 " 一节中的说明重置 MSID "使用命令行界面概述 NetApp 加密"

  • 您必须在此操作步骤 末尾保持电源处于打开状态,以便为运行正常的控制器供电。

步骤
  1. 检查 MetroCluster 状态以确定受损控制器是否已自动切换到运行正常的控制器: MetroCluster show

  2. 根据是否发生了自动切换,按照下表继续操作:

    如果控制器受损 …​ 那么 …​

    已自动切换

    继续执行下一步。

    未自动切换

    从运行正常的控制器执行计划内切换操作: MetroCluster switchover

    未自动切换,您尝试使用 MetroCluster switchover 命令进行切换,并且切换已被否决

    查看否决消息,如果可能,请解决问题描述并重试。如果无法解决问题描述问题,请联系技术支持。

  3. 在运行正常的集群中运行 MetroCluster heal -phase aggregates 命令,以重新同步数据聚合。

    controller_A_1::> metrocluster heal -phase aggregates
    [Job 130] Job succeeded: Heal Aggregates is successful.

    如果修复被否决,您可以使用 ` override-vetoes` 参数重新发出 MetroCluster heal 命令。如果使用此可选参数,则系统将覆盖任何阻止修复操作的软否决。

  4. 使用 MetroCluster operation show 命令验证操作是否已完成。

    controller_A_1::> metrocluster operation show
        Operation: heal-aggregates
          State: successful
    Start Time: 7/25/2016 18:45:55
       End Time: 7/25/2016 18:45:56
         Errors: -
  5. 使用 storage aggregate show 命令检查聚合的状态。

    controller_A_1::> storage aggregate show
    Aggregate     Size Available Used% State   #Vols  Nodes            RAID Status
    --------- -------- --------- ----- ------- ------ ---------------- ------------
    ...
    aggr_b2    227.1GB   227.1GB    0% online       0 mcc1-a2          raid_dp, mirrored, normal...
  6. 使用 MetroCluster heal -phase root-aggregates 命令修复根聚合。

    mcc1A::> metrocluster heal -phase root-aggregates
    [Job 137] Job succeeded: Heal Root Aggregates is successful

    如果修复被否决,您可以使用 -override-vetoes 参数重新发出 MetroCluster heal 命令。如果使用此可选参数,则系统将覆盖任何阻止修复操作的软否决。

  7. 在目标集群上使用 MetroCluster operation show 命令验证修复操作是否已完成:

    mcc1A::> metrocluster operation show
      Operation: heal-root-aggregates
          State: successful
     Start Time: 7/29/2016 20:54:41
       End Time: 7/29/2016 20:54:42
         Errors: -
  8. 在受损控制器模块上,断开电源。

第 2 步:打开控制器模块

要访问控制器内部的组件,您必须先从系统中卸下控制器模块,然后再卸下控制器模块上的盖板。

  1. 如果您尚未接地,请正确接地。

  2. 松开将缆线绑在缆线管理设备上的钩环带,然后从控制器模块上拔下系统缆线和 SFP (如果需要),并跟踪缆线的连接位置。

    将缆线留在缆线管理设备中,以便在重新安装缆线管理设备时,缆线排列有序。

  3. 从控制器模块的左右两侧卸下缆线管理设备并将其放在一旁。

    DRW 32xx 电缆管理臂
  4. 松开控制器模块凸轮把手上的翼形螺钉。

    DRW 8020 凸轮把手翼形螺钉

    翼形螺钉

    凸轮把手

  5. 向下拉凸轮把手,开始将控制器模块滑出机箱。

    将控制器模块滑出机箱时,请确保您支持控制器模块的底部。

第 3 步:更换 NVMEM 电池

要更换系统中的 NVMEM 电池,您必须从系统中取出发生故障的 NVMEM 电池,并将其更换为新的 NVMEM 电池。

  1. 检查 NVMEM LED :

    • 如果您的系统采用 HA 配置,请转至下一步。

    • 如果您的系统采用独立配置,请完全关闭控制器模块,然后检查 NV 图标标识的 NVRAM LED 。

      DRW 硬件 NVRAM 图标
      注 在暂停系统时, NVRAM LED 会闪烁,同时将内容存入闪存。目标值完成后,此 LED 将熄灭。
      • 如果在未完全关闭的情况下断电, NVMEM LED 将闪烁,直到目标完成,然后 LED 将熄灭。

      • 如果 LED 亮起且电源打开,则未写入的数据将存储在 NVMEM 上。

        此问题通常发生在 ONTAP 成功启动后不受控制的关闭期间。

  2. 打开 CPU 通风管并找到 NVMEM 电池。

    DRW rxl nvmem 电池

    电池锁定卡舌

    NVMEM 电池组

  3. 抓住电池并按下标记为推送的蓝色锁定卡舌,然后将电池从电池架和控制器模块中提出。

  4. 从包装中取出更换用电池。

  5. 将电池架上的卡舌或卡舌与控制器模块侧的槽口对齐,然后向下轻推电池外壳,直到电池外壳卡入到位。

  6. 关闭 CPU 通风管。

    确保插头锁定到插槽。

第 4 步:重新安装控制器

更换控制器模块中的组件后,您必须在系统机箱中重新安装控制器模块,并将其启动到可以对更换后的组件运行诊断测试的状态。

  1. 将控制器模块的末端与机箱中的开口对齐,然后将控制器模块轻轻推入系统的一半。

    注 请勿将控制器模块完全插入机箱中,除非系统指示您这样做。
  2. 根据需要重新对系统进行布线。

    如果您已卸下介质转换器( QSFP 或 SFP ),请记得在使用光缆时重新安装它们。

  3. 完成控制器模块的重新安装:

    控制器模块一旦完全固定在机箱中,就会开始启动。准备中断启动过程。

    1. 在凸轮把手处于打开位置的情况下,用力推入控制器模块,直到它与中板并完全就位,然后将凸轮把手合上到锁定位置。

      注 将控制器模块滑入机箱时,请勿用力过大,以免损坏连接器。
    2. 拧紧控制器模块背面凸轮把手上的翼形螺钉。

    3. 如果尚未重新安装缆线管理设备,请重新安装该设备。

    4. 使用钩环带将缆线绑定到缆线管理设备。

    5. 在每个控制器开始启动时,如果您看到消息 Press Ctrl-C for Boot Menu ,请按 Ctrl-C 以中断启动过程。

    6. 从显示的菜单中选择启动至维护模式的选项。

第 5 步:运行系统级诊断

安装新的 NVMEM 电池后,您应运行诊断。

您的系统必须处于 LOADER 提示符处,才能启动系统级诊断。

诊断过程中的所有命令都是从要更换组件的控制器发出的。

  1. 如果要维护的控制器不在 LOADER 提示符处,请执行以下步骤:

    1. 从显示的菜单中选择维护模式选项。

    2. 控制器启动到维护模式后,暂停控制器: halt

      问题描述命令后,您应等待系统停留在 LOADER 提示符处。

      注 在启动过程中,您可以安全地响应 y 提示:
      • 一条提示,警告您在 HA 配置中进入维护模式时,必须确保运行正常的控制器保持关闭状态。

  2. 在 LOADER 提示符处,访问专为系统级诊断而设计的特殊驱动程序以正常运行: boot_diags

    在启动过程中,您可以安全地对提示 y 做出响应,直到显示维护模式提示符( * > )为止。

  3. 对 NVMEM 内存运行诊断: sldiag device run -dev nvmem

  4. 验证更换 NVMEM 电池是否未导致硬件问题: sldiag device status -dev nvmem -long -state failed

    如果没有测试失败,则系统级诊断会返回到提示符,或者会列出因测试组件而导致的失败的完整状态。

  5. 根据上一步的结果继续操作:

    如果系统级诊断测试 …​ 那么 …​

    已完成,无任何故障

    1. 清除状态日志: sldiag device clearstatus

    2. 验证是否已清除日志: sldiag device status

      此时将显示以下默认响应:

      SLDIAG :不存在日志消息。

    3. 退出维护模式: halt

      控制器将显示 LOADER 提示符。

    4. 从 LOADER 提示符处启动控制器: bye

    5. 使控制器恢复正常运行:

    如果控制器位于 …​ 那么 …​

    HA 对

    执行交还: storage failover giveback -ofnode replacement_node_name

    注 如果禁用了自动交还,请使用 storage failover modify 命令重新启用它。

    双节点 MetroCluster 配置

    继续执行下一步。MetroCluster 切回操作步骤将在更换过程的下一任务中完成。

    一种独立配置

    继续执行下一步。无需执行任何操作。您已完成系统级诊断。

    导致某些测试失败

    确定问题的发生原因:

    1. 退出维护模式: halt

      问题描述命令后,请等待,直到系统停留在 LOADER 提示符处。

    2. 根据机箱中的控制器模块数量,关闭或保持电源打开状态:

      • 如果机箱中有两个控制器模块,请保持电源处于打开状态,以便为另一个控制器模块供电。

      • 如果机箱中有一个控制器模块,请关闭电源并拔下电源插头。

    3. 验证您是否已遵循在运行系统级诊断时确定的所有注意事项,缆线是否已牢固连接以及硬件组件是否已正确安装在存储系统中。

    4. 启动您正在维护的控制器模块,在系统提示您进入启动菜单时按 Ctrl-C 以中断启动:

      • 如果机箱中有两个控制器模块,请将您正在维护的控制器模块完全固定在机箱中。

        控制器模块在完全就位后启动。

      • 如果机箱中有一个控制器模块,请连接电源,然后将其打开。

    5. 从菜单中选择 Boot to maintenance mode 。

    6. 输入以下命令退出维护模式: halt

      问题描述命令后,请等待,直到系统停留在 LOADER 提示符处。

    7. 重新运行系统级诊断测试。

第 6 步:切回双节点 MetroCluster 配置中的聚合

在双节点 MetroCluster 配置中完成 FRU 更换后,您可以执行 MetroCluster 切回操作。这样会将配置恢复到其正常运行状态,以前受损站点上的 sync-source Storage Virtual Machine ( SVM )现在处于活动状态,并从本地磁盘池提供数据。

此任务仅限适用场景双节点 MetroCluster 配置。

步骤
  1. 验证所有节点是否处于 enabled 状态: MetroCluster node show

    cluster_B::>  metrocluster node show
    
    DR                           Configuration  DR
    Group Cluster Node           State          Mirroring Mode
    ----- ------- -------------- -------------- --------- --------------------
    1     cluster_A
                  controller_A_1 configured     enabled   heal roots completed
          cluster_B
                  controller_B_1 configured     enabled   waiting for switchback recovery
    2 entries were displayed.
  2. 验证所有 SVM 上的重新同步是否已完成: MetroCluster SVM show

  3. 验证修复操作正在执行的任何自动 LIF 迁移是否已成功完成: MetroCluster check lif show

  4. 在运行正常的集群中的任何节点上使用 MetroCluster switchback 命令执行切回。

  5. 验证切回操作是否已完成: MetroCluster show

    当集群处于 waiting for-switchback 状态时,切回操作仍在运行:

    cluster_B::> metrocluster show
    Cluster              Configuration State    Mode
    --------------------	------------------- 	---------
     Local: cluster_B configured       	switchover
    Remote: cluster_A configured       	waiting-for-switchback

    当集群处于 normal 状态时,切回操作完成。:

    cluster_B::> metrocluster show
    Cluster              Configuration State    Mode
    --------------------	------------------- 	---------
     Local: cluster_B configured      		normal
    Remote: cluster_A configured      		normal

    如果切回需要很长时间才能完成,您可以使用 MetroCluster config-replication resync-status show 命令检查正在进行的基线的状态。

  6. 重新建立任何 SnapMirror 或 SnapVault 配置。

第 7 步:将故障部件退回 NetApp

按照套件随附的 RMA 说明将故障部件退回 NetApp 。请参见 "部件退回和放大器;更换" 第页,了解更多信息。