ONTAP SVM 数据收集器故障排除
工作负载安全使用数据收集器从设备收集文件和用户访问数据。您可以在这里找到解决此收集器问题的提示。
查看"配置 SVM 收集器"页面以获取有关配置此收集器的说明。
如果出现错误,您可以单击“已安装的数据收集器”页面的“状态”列中的“更多详细信息”来了解有关错误的详细信息。

已知问题及其解决方案如下所述。
问题:*数据收集器运行一段时间后在随机时间后停止,并出现故障:“错误消息:连接器处于错误状态。服务名称:审计。失败原因:外部 fpolicy 服务器超载。”*尝试一下: ONTAP的事件率远远高于代理盒可以处理的事件率。因此连接被终止。
检查断开连接时 CloudSecure 中的峰值流量。您可以从 CloudSecure > Activity Forensics > All Activity 页面进行检查。
如果峰值聚合流量高于代理箱可以处理的流量,请参阅事件速率检查器页面,了解如何确定代理箱中收集器的部署规模。
如果代理是在 2021 年 3 月 4 日之前安装在代理框中的,请在代理框中运行以下命令:
echo 'net.core.rmem_max=8388608' >> /etc/sysctl.conf echo 'net.ipv4.tcp_rmem = 4096 2097152 8388608' >> /etc/sysctl.conf sysctl -p
调整大小后从 UI 重新启动收集器。
{空的}
*问题:*收集器报告错误消息:“在连接器上未找到可以到达 SVM 数据接口的本地 IP 地址”。 *尝试一下:*这很可能是由于ONTAP端的网络问题造成的。请按照以下步骤操作:
-
确保 SVM 数据生命周期或管理生命周期上没有防火墙阻止来自 SVM 的连接。
-
通过集群管理 IP 添加 SVM 时,请确保 SVM 的数据 lif 和管理 lif 可以从代理 VM ping 通。如果出现问题,请检查网关、网络掩码和路由。
您还可以尝试使用集群管理 IP 通过 ssh 登录集群,并 ping 代理 IP。确保代理 IP 可 ping 通:
network ping -vserver <vserver name> -destination <Agent IP> -lif <Lif Name> -show-detail
如果无法 ping 通,请确保ONTAP中的网络设置正确,以便 Agent 机器可以 ping 通。
-
如果您尝试通过 Cluster IP 连接但不成功,请尝试直接通过 SVM IP 连接。请参阅上文了解通过 SVM IP 连接的步骤。
-
通过 SVM IP 和 vsadmin 凭据添加收集器时,检查 SVM Lif 是否启用了数据加管理角色。在这种情况下,ping 到 SVM Lif 将会起作用,但是 SSH 到 SVM Lif 将不起作用。如果是,请创建一个 SVM Mgmt Only Lif 并尝试通过此 SVM 管理专用 Lif 进行连接。
-
如果仍然不起作用,请创建一个新的 SVM Lif 并尝试通过该 Lif 进行连接。确保子网掩码设置正确。
-
高级调试:
-
在ONTAP中启动数据包跟踪。
-
尝试从 CloudSecure UI 将数据收集器连接到 SVM。
-
等待直到错误出现。在ONTAP中停止数据包跟踪。
-
从ONTAP打开数据包跟踪。可在此位置获取
https://<cluster_mgmt_ip>/spi/<clustername>/etc/log/packet_traces/ .. 确保从ONTAP到代理框有一个 SYN。 .. 如果没有来自ONTAP的 SYN,那么这是ONTAP中的防火墙存在问题。 .. 在ONTAP中打开防火墙,以便ONTAP能够连接代理盒。
-
-
如果仍然不起作用,请咨询网络团队,以确保没有外部防火墙阻止从ONTAP到代理盒的连接。
-
如果以上方法都无法解决问题,请提交案例"Netapp 支持"以获得进一步的帮助。
{空的}
问题:*消息:“无法确定 [主机名:<IP 地址>] 的ONTAP类型。原因:与存储系统 <IP 地址> 的连接错误:主机无法访问(主机无法访问)”*尝试此操作:
-
验证是否提供了正确的 SVM IP 管理地址或集群管理 IP。
-
通过 SSH 连接到您要连接的 SVM 或集群。连接后,请确保 SVM 或集群名称正确。
{空的}
问题:*错误消息:“连接器处于错误状态。服务名称:审计。失败原因:外部 fpolicy 服务器终止。” *试试这个:
-
最有可能的是防火墙阻止了代理机器中的必要端口。验证端口范围 35000-55000/tcp 是否已打开,以便代理计算机从 SVM 进行连接。还要确保ONTAP端没有启用防火墙来阻止与代理机器的通信。
-
在代理框中输入以下命令并确保端口范围是开放的。
sudo iptables-save | grep 3500*
示例输出应如下所示:
-A IN_public_allow -p tcp -m tcp --dport 35000 -m conntrack -ctstate NEW -j ACCEPT . 登录 SVM,输入以下命令并检查是否没有设置防火墙来阻止与ONTAP 的通信。
system services firewall show system services firewall policy show
"检查防火墙命令"在ONTAP方面。
-
通过 SSH 连接到您要监控的 SVM/集群。从 SVM 数据生命周期 (支持 CIFS、NFS 协议) 对代理盒执行 ping 操作,并确保 ping 操作正常:
network ping -vserver <vserver name> -destination <Agent IP> -lif <Lif Name> -show-detail
如果无法 ping 通,请确保ONTAP中的网络设置正确,以便 Agent 机器可以 ping 通。
-
如果通过 2 个数据收集器将单个 SVM 两次添加到租户,则会显示此错误。通过 UI 删除其中一个数据收集器。然后通过 UI 重新启动其他数据收集器。然后数据收集器将显示“RUNNING”状态并开始从 SVM 接收事件。
基本上,在一个租户中,应该只通过 1 个数据收集器添加 1 个 SVM 一次。 1 个 SVM 不应通过 2 个数据收集器添加两次。
-
如果在两个不同的工作负载安全环境(租户)中添加了相同的 SVM,则最后一个 SVM 始终会成功。第二个收集器将使用自己的 IP 地址配置 fpolicy,并踢出第一个收集器。因此第一个收集器将停止接收事件,并且其“审计”服务将进入错误状态。为防止这种情况,请在单个环境上配置每个 SVM。
-
如果服务策略配置不正确,也可能会出现此错误。使用ONTAP 9.8 或更高版本时,为了连接到数据源收集器,需要 data-fpolicy-client 服务以及数据服务 data-nfs 和/或 data-cifs 。此外,data-fpolicy-client 服务必须与受监控 SVM 的数据生命周期相关联。
{空的}
问题:*活动页面中未显示任何事件。 *试试这个:
-
检查ONTAP收集器是否处于“正在运行”状态。如果是,则通过打开一些文件确保在 cifs 客户端虚拟机上生成一些 cifs 事件。
-
如果没有看到任何活动,请登录 SVM 并输入以下命令。
<SVM>event log show -source fpolicy
请确保没有与 fpolicy 相关的错误。
-
如果没有看到任何活动,请登录 SVM。输入以下命令:
<SVM>fpolicy show
检查以“cloudsecure_”为前缀的 fpolicy 策略是否已设置且状态为“on”。如果未设置,那么代理很可能无法执行 SVM 中的命令。请确保已遵循页面开头所述的所有先决条件。
{空的}
问题: SVM 数据收集器处于错误状态,错误消息为“代理无法连接到收集器” 尝试以下操作:
-
最有可能的是代理超载并且无法连接到数据源收集器。
-
检查有多少个数据源收集器连接到代理。
-
还可以检查 UI 中“所有活动”页面的数据流量。
-
如果每秒的活动数量非常高,请安装另一个代理并将一些数据源收集器移动到新的代理。
{空的}
问题: SVM 数据收集器显示错误消息为“fpolicy.server.connectError:节点无法与 FPolicy 服务器“12.195.15.146”建立连接(原因:“选择超时”)” 尝试此操作: SVM/Cluster 中启用了防火墙。因此 fpolicy 引擎无法连接到 fpolicy 服务器。 ONTAP中可用于获取更多信息的 CLI 包括:
event log show -source fpolicy which shows the error event log show -source fpolicy -fields event,action,description which shows more details.
"检查防火墙命令"在ONTAP方面。
{空的}
*问题:*错误消息:“连接器处于错误状态。服务名称:审计。失败原因:在 SVM 上未找到有效的数据接口(角色:数据、数据协议:NFS 或 CIFS 或两者、状态:启动)。 *尝试一下:*确保有一个操作接口(具有数据角色和 CIFS/NFS 数据协议)。
{空的}
*问题:*数据收集器进入错误状态,一段时间后进入运行状态,然后再次返回错误状态。如此循环往复。 *尝试一下:*这通常发生在以下场景中:
-
添加了多个数据收集器。
-
表现出这种行为的数据收集器将会有 1 个 SVM 添加到这些数据收集器中。意思是 2 个或更多数据收集器连接到 1 个 SVM。
-
确保 1 个数据收集器仅连接到 1 个 SVM。
-
删除连接到同一 SVM 的其他数据收集器。
{空的}
问题:*连接器处于错误状态。服务名称:审计。失败原因:无法配置(SVM svmname 上的策略)。原因:在“fpolicy.policy.scope-modify: "Federal" 中为“shares-to-include”元素指定的值无效 *尝试此操作: *共享名称需要不带任何引号。编辑ONTAP SVM DSC 配置以更正共享名称。
_包括和排除共享_不适用于较长的共享名称列表。如果您需要包含或排除大量股票,请使用按数量过滤。
{空的}
*问题:*集群中存在未使用的现有 fpolicies。在安装 Workload Security 之前应该做什么? *尝试一下:*建议删除所有现有的未使用的 fpolicy 设置,即使它们处于断开连接状态。工作负载安全将创建带有前缀“cloudsecure_”的 fpolicy。所有其他未使用的 fpolicy 配置都可以删除。
显示 fpolicy 列表的 CLI 命令:
fpolicy show 删除 fpolicy 配置的步骤:
fpolicy disable -vserver <svmname> -policy-name <policy_name> fpolicy policy scope delete -vserver <svmname> -policy-name <policy_name> fpolicy policy delete -vserver <svmname> -policy-name <policy_name> fpolicy policy event delete -vserver <svmname> -event-name <event_list> fpolicy policy external-engine delete -vserver <svmname> -engine-name <engine_name>
{空的}
*问题:*启用工作负载安全后, ONTAP性能受到影响:延迟偶尔会升高,IOPS 偶尔会降低。 *试试这个:*在使用ONTAP和工作负载安全时,有时会在ONTAP中看到延迟问题。造成这种情况可能有以下几个原因:"1372994" , "1415152" , "1438207" , "1479704" , "1354659" 。所有这些问题均已在ONTAP 9.13.1 及更高版本中修复;强烈建议使用其中一个更高版本。
{空的}
问题:*数据收集器显示错误消息:“错误:两次重试后无法确定收集器的健康状况,请尝试重新启动收集器(错误代码:AGENT008)”。 *试试这个:
-
在数据收集器页面上,滚动到出现错误的数据收集器的右侧,然后单击 3 个点菜单。选择“编辑”。再次输入数据采集器的密码。按下“保存”按钮保存数据收集器。数据收集器将重新启动并且错误应该得到解决。
-
代理机器可能没有足够的 CPU 或 RAM 空间,这就是 DSC 失败的原因。请检查机器中添加到代理的数据收集器的数量。如果超过20,请增加Agent机器的CPU和RAM容量。一旦 CPU 和 RAM 增加,DSC 将自动进入初始化状态,然后进入运行状态。查看尺码指南"本页"。
{空的}
*问题:*选择 SVM 模式时数据收集器出错。 *尝试一下:*在 SVM 模式下连接时,如果使用集群管理 IP 而不是 SVM 管理 IP 进行连接,则连接将出错。确保使用正确的 SVM IP。
{空的}
*问题:*启用“拒绝访问”功能时,数据收集器显示一条错误消息:“连接器处于错误状态。服务名称:审计。失败原因:无法在 SVM test_svm 上配置 fpolicy。原因:用户未获得授权。” *尝试一下:*用户可能缺少“拒绝访问”功能所需的 REST 权限。请按照"本页"设置权限。
设置权限后重新启动收集器。
{空的}
问题: 收集器处于错误状态,消息为:连接器处于错误状态。 失败原因:无法在 SVM <SVM 名称> 上配置持久存储。 原因:无法在 SVM“<SVM 名称>”中找到卷“<volumeName>”的合适聚合。 原因:聚合“<aggregateName>”的性能信息目前不可用。服务名称:审计。失败原因: 无法在 SVM 上配置持久性存储<SVM Name>。原因: 无法为卷“找到合适的聚合”<volumeName> “ 在 SVM 中”<SVM Name> ”。原因: 聚合的性能信息 "<aggregateName> " 当前不可用。请稍等几分钟,然后重试此命令。
*试试这个方法:*等待几分钟,然后重新启动收集器。
{空的}
问题: 添加或升级 ONTAP SVM 数据收集器(Workload Security)后,租户显示过度配置或订阅违规警报。即使没有添加新硬件,原始存储容量也增加了。
请尝试此操作: 同一存储可能会被计数两次——一次由 Observability ONTAP 集群收集器计数,另一次由同一集群上的 Workload Security SVM 收集器计数。
比较 Observability ONTAP 收集器和 Workload Security SVM 收集器报告的原始存储容量。对于每个 SVM 收集器,检查其父集群是否已被 Observability ONTAP 收集器监控。如果是,则只有集群容量应计入订阅使用量。
确认最近是否跨集群进行了 SVM 迁移。迁移 SVM 后,容量指标可能会保持与上一个集群关联,直到 Workload Security 从收集器接收到更新的信息。
确保已迁移 SVM 的 ONTAP SVM 数据收集器处于 RUNNING 状态。如果需要,请重新启动收集器,以便 Workload Security 可以在迁移后收集正确的集群和容量指标。
如果集群和 SVM 容量都出现在总容量中,则可能会重复计算容量。这通常在添加、升级、重新启动 SVM 收集器或在集群之间迁移 SVM 后不久发生。
如果使用量仍然超过您的订阅,请提交一个 NetApp 支持案例,其中包含警报前后的订阅使用量,以及包含其报告的原始存储容量的 Observability 和 SVM 收集器列表。
{空的}
Problem:即使收集器服务已启动,一个或多个数据收集器仍显示"已降级"而不是"正在运行"。
Try This:当节点上的一个或多个 FPolicy 连接断开时,SWS 报告已降级。这不是中断——收集器仍在运行——但在恢复连接之前,这些节点的审核事件可能会丢失。
ONTAP 从具有 SVM 操作数据 LIF 的每个节点建立 FPolicy 控制通道连接。没有本地数据 LIF 的节点无法连接。请参阅:
在UI中,记下哪些节点已断开连接,然后检查这些节点是否具有用于SVM的数据LIF。
-
列出的节点上没有数据 LIF:忽略已降级状态。当本地数据 LIF 不存在时,ONTAP 可以显示 FPolicy 已断开连接,原因为"没有本地 LIF 存在以连接到 FPolicy 服务器";这是预期的。请参阅"KB:由于"no local lif present",Fpolicy 服务器未连接"。未来的 SWS 版本将在这种情况下停止将收集器标记为已降级。
-
列出的节点上存在数据 LIF:调查 FPolicy 断开连接的原因(LIF 关闭/缺少 data-fpolicy-client、网络/防火墙或临时重新启动/故障转移)。
{空的}
如果您仍然遇到问题,请联系*帮助>支持*页面中提到的支持链接。