分析 Workload Factory for EDA 中的延迟问题
查看检测到的延迟,并使用自动化工具查找原因,修复 FSx for ONTAP 卷中的性能缓慢问题。
开始之前
在可以查看和分析延迟事件之前,您必须具有 "已配置延迟监控"。
查看延迟高于阈值的卷
"延迟高于阈值的卷"表显示过去 72 小时内违反警告或严重延迟阈值的卷。
-
仅显示每个卷的最新违规行为。相同卷的早期违规行为不会显示。
-
事件将在 72 小时后自动删除。
-
最多显示 200 个事件。随着新事件的添加,旧事件将被删除。
-
即使没有文件系统链接,也会出现事件。要查看基本分析详细信息或运行 AI 分析,需要链接。
-
使用以下任一方式登录 "主机体验"。
-
选择菜单
,然后选择 EDA。 -
选择 Latency 选项卡。
-
查看表中每个事件的信息。
-
要查看延迟事件的详细信息,请在 Severity 列中选择该事件。这将打开该事件的延迟分析面板。
-
要对表格进行排序,请选择任意列标题。默认情况下,将首先显示按时间排序的关键事件,然后显示按时间排序的警告事件。
-
要关闭一个或多个事件,请在每个事件旁边选择
Dismiss。 -
要向表中添加列,请选择
,选择列,然后选择 Apply。 -
延迟分析面板提供违规行为的快速视图,包括延迟图表以及时间范围和类型的控制。选择 查看完整分析 以打开包含基本分析、AI 分析(可选)和其他图表的详细延迟分析页面。有关详细信息,请参阅 "分析延迟趋势"。
分析延迟事件
在 Workload Factory 设置中配置 Amazon Bedrock 模型 ARN,请参见"基本 GenAI 要求"。
基本分析可帮助您快速找到导致速度变慢的原因,而无需手动调查。
延迟分析面板
在 严重性 列中选择一个延迟事件,以打开该事件的延迟分析面板。该面板包括提供延迟事件不同视图的选项卡。
如果配置了 Amazon Bedrock 模型 ARN,则可以对数据和集群场景运行 AI 分析。如果未配置 Bedrock,则会提供指向该文件系统的 Storage Workloads 配置页面的链接,您可以在其中设置 Bedrock 访问权限。
-
Basic:显示自动分析的结果。如果链接到文件系统,它会显示组件的细分,并显示导致延迟的组件。如果不存在链接,系统会提示您添加链接。此时将显示受影响卷的 CloudWatch 指标交互式延迟图。它显示读取或写入指标,具体取决于触发事件的警报。您可以选择不同的时间范围,并使用筛选器查看所有、读取、写入或元数据操作。
-
AI analysis:显示更深入的调查,以确定特定的根本原因和潜在的补救步骤。
-
详细延迟分析:显示受影响卷的 CloudWatch 指标的交互式图形。这些图表显示一段时间内的延迟、IOPS 和吞吐量。它们显示读取或写入指标,具体取决于触发事件的警报。您可以选择不同的时间范围,并使用筛选器查看所有、读取、写入或元数据操作。
有关使用图形的详细说明,请参见 "分析延迟趋势"。
步骤
-
在 延迟 选项卡中,找到要分析的事件。
-
在 Severity 列中,选择一个延迟事件以打开该事件的分析面板。
-
查看*基本*选项卡。如果链接已连接,请打开组件细分,查看延迟的来源。如果没有链接,请选择提示以链接一个链接,以便分析组件。
-
在 AI analysis 选项卡中,选择 Analyze 以查看更深入调查的结果,例如可能的数据或集群问题。这有助于确定具体的根本原因和可能的补救措施。
查看结果,包括:
-
潜在根本原因解释
-
受影响的 EC2 客户端列表
-
建议的修复步骤
-
-
选择*查看完整分析*以查看 AI 分析的完整结果,包括显示选定时间段内 CloudWatch 指标的卷延迟、IOPS 和吞吐量的性能图表。
-
按照建议的步骤修复延迟问题。
-
进行更改后,请检查延迟事件表以确认此问题已修复。
最佳实践
在分析延迟问题时,请考虑以下建议:
-
监控趋势:定期检查延迟高于阈值的卷表,以发现可能指向配置问题的模式或重复问题。
-
战略性地使用 AI 分析:如果基本分析提示,则在审查数据时使用 AI 分析。AI 分析可以为需要详细故障排除的复杂性能问题提供更深入的见解。
-
审查已驳回的事件:定期审查事件被驳回的原因,以确定是否应调整阈值或改进系统。
有关分析延迟趋势的最佳实践,请参见 "图形解释"。