在 NetApp Console 本地部署中调查卷上的高延迟
在 NetApp Console 本地部署中使用 Workload Analyzer 查找卷响应时间缓慢的根源。
如果您从警报或卷清单中打开分析器,则已选择卷,您可以专注于时间范围和图表细分。
当应用程序性能下降时,请确定 I/O 路径的哪一部分导致了速度下降。延迟分析部分按延迟中心分解响应时间,以便您可以区分网络问题、数据处理开销、聚合争用和其他影响因素。
-
使用以下方法之一打开 Workload Analyzer:
-
从 Health 菜单中,选择 Workload Analyzer,然后在 Volume 字段中搜索并选择要调查的卷。
-
从 Storage > Fleets > Inventory 页面,导航到要分析的卷,然后从操作菜单中选择 Analyze。
-
在*警报 > 概览*页面中,为要调查的卷选择与容量相关的警报,然后从警报详细信息中选择*分析*。
-
-
将*时间范围*设置为涵盖性能问题发生的时间段,然后选择*分析*。
-
查看*事件时间轴*部分,了解与延迟增加相关的配置更改和警报。
分析器沿着与延迟图表相同的时间轴绘制配置更改事件(扳手图标)和警报事件(警告和关键图标),以便于查看更改是否先于降级。
-
在*延迟*部分,打开*视图*下拉列表,然后选择*按延迟中心细分*。该图表显示了每个延迟中心在一段时间内对总延迟的贡献。延迟中心包括:
-
读取延迟
-
写入延迟
-
其他延迟
-
-
将鼠标悬停在图表中延迟最高的点上,以查看每个延迟中心的值及其占总延迟的百分比。
最大的延迟中心通常指向争用的资源。当共享资源无法满足需求时,使用它的卷会等待更长时间的 I/O。通过移动工作负载或调整 QoS 限制等方式减少该资源的负载,从而降低延迟。
-
确定主要贡献者,并使用该值确定后续步骤:
-
高*读取延迟*可能表示磁盘争用。请检查*资源利用率*部分以确认聚合繁忙百分比。
-
高*写入延迟*可能表示集群外的 NIC 饱和度或网络路径问题。
-
高*其他延迟*可能表明内联效率设置消耗的 CPU 超出了工作负载的容忍范围。请考虑调整效率设置或 QoS。
-
高*云延迟*可能表示工作负载正在频繁访问容量层上的冷数据。请考虑调整分层策略。
-
-
如果延迟中心未能解释性能下降的原因,请查看*容量分析*部分。当 ONTAP 系统使用率超过 85% 时,无论延迟中心细分情况如何,高利用率都可能导致性能问题。
-
如果延迟在更改事件后立即增加,请同时使用事件详细信息和相关图表来验证可能的原因:
-
对于 QoS 更改,将延迟线与 QoS 限制线进行比较,并查看吞吐量图表,以确认需求是否达到策略上限。
-
对于聚合或卷移动,请将延迟峰值与相同时间范围内显示的节点和聚合利用率值进行比较。
-
对于分层策略更改,请查看云延迟贡献,以确定更改后冷数据访问是否增加。
-
如果配置或放置问题导致此问题,并且 Console 本地部署可以解决此问题,则卷上的警报可能会提供 Fix-It 选项。