【APM】通过 SNMP 监控的服务器、虚拟机发出重启告警的原因

【APM】通过 SNMP 监控的服务器、虚拟机发出重启告警的原因

问题描述:
监控服务器发出重启告警,实际上服务器并未重启。
监控使用 SNMP 凭证。

问题原因:
因受到 SNMP 协议 sysUptime 本身位数(32 位)和返回值最小颗粒度(1/100s)限制,当系统运行时间
2^32/(24*60*60*100)≈497
超过 497 天后,超过最大位数,该值会重新开始累计,与服务器重启表象一致,故会产生服务器重启告警。
只有通过 SNMP 监控的设备才会有此问题,通过 WMI/CLI 方式监控不会有此问题。
此监视项原理为通过本次轮询获取的值与上一次轮询获取的值做比较,小于之前的值就会告警。

解决办法:
管理->性能轮询->服务器->勾选 Linux 与 Windows->下划到“服务器错误告警设置”栏->取消“在轮询间隔中服务器被重启则告警”项的勾选->下划并保存:



注意:
1.取消此项勾选后,正常的服务器重启一样不会产生告警信息。
2.不会影响可用性监控。
3.如企业版,需要在每个探针上都做相同的操作。