复制的 NVRAM 和 HA 故障转移行为
NetApp AFX 将 NVRAM 复制移至后端集群网络,并在节点发生故障后使用零拷贝卷移动性重新平衡工作负载。
NVRAM 从直接连接转移到交换复制
ONTAP 使用 NVRAM 作为暂存来保护对集群的传入写入。ONTAP 集群中的每个节点都有一个电池供电的 NVRAM 卡。当从客户端向卷发送写入时,它首先存储在 NVRAM 中。当 NVRAM 填满或 10 秒计时器到期时(以先到者为准),NVRAM 内容将刷新到磁盘。这被称为一致性点。
NVRAM 内容也会在 HA 对之间不断复制,这进一步有助于保护数据一致性,因为在发生节点故障时,NVRAM 内容将保留在幸存节点上并提交到磁盘。
在统一的 ONTAP 集群中,HA 对之间的 NVRAM 卡直接相互连接。NetApp AFX 将 NVRAM 复制移动到后端集群网络。因此,HA 合作伙伴节点对节点没有如此严格的距离要求。相反,HA 对可以在以太网的最大距离内分离。
NetApp AFX NVRAM 复制

HA 故障转移行为
在统一 ONTAP 中,节点拥有磁盘和聚合,其中数据通过卷提供服务。写入操作使用本地节点的 NVRAM 执行,以刷新到节点拥有的磁盘。当节点重新启动或发生故障时,ONTAP 将触发对故障节点资源的接管,其中磁盘和聚合所有权转移到配对节点。网络接口也故障切换到 IP 空间中的端口,并且由于 NVRAM 内容在 HA 对中不断复制,因此节点将刷新 NVRAM 内容,以提交故障节点对磁盘的写入。之后,幸存节点将拥有故障节点的聚合和卷,直到发生节点回馈。这意味着,这些卷的所有流量以及幸存节点已拥有的卷都将在单个节点上进行处理,直到故障转移问题得到解决。
作为初始统一 ONTAP 集群部署的一部分,建议提前规划故障转移,以帮助避免单个节点使其合作伙伴过载。这本身就是一个挑战,因为很难预测哪些卷可能是性能瓶颈,但无中断卷移动和卷服务质量策略等功能可以帮助缓解。
下图显示了统一 ONTAP 集群如何在节点之间产生不均匀的性能平衡,以及在某些情况下,故障转移如何会导致性能下降。
Unified ONTAP – 节点利用率的潜在不平衡

当 HA 对的节点与卷计数和性能利用率不平衡时,节点故障转移将影响整体性能,因为幸存的节点现在将拥有失败节点的所有卷。同时,集群中的其他节点可能有空间承担额外的工作。
Unified ONTAP – 故障转移对节点利用率的影响

在上文中,当 HA 合作伙伴必须承担额外的工作时,它可能会过载并影响该节点上所有卷的性能。卷移动可以帮助缓解这种情况,但这需要跨节点的副本(这需要可用的可用空间),并且所需的时间可能超过节点故障回复所需的时间。此外,如果重新定位卷,它不会故障回复到原始节点。相反,它将保留在您将其移动到的节点上。
使用 NetApp AFX,节点故障转移会采取一些不同的行为。
-
由于节点不拥有磁盘并且没有物理聚合,因此节点故障转移不需要传输这些资源。相反,只有网络接口和卷所有权转移到其他节点。
-
NVRAM 提交仍然会发生,但通过 HA 网络而不是直接连接。
-
一旦卷执行到合作伙伴节点的初始故障转移,AFX 将跨集群中的其他幸存节点重新分配卷。这是通过零拷贝卷移动实现的。
-
节点恢复后,卷将移回原始节点。
NetApp AFX 已经在集群中的节点之间保持性能平衡,以保持相对均匀的利用率,因此当发生故障转移并重新平衡卷时,整个集群的节点利用率应该大致相同。
NetApp AFX - 故障转移后的卷重新平衡
