Linux服务器硬件运行状态及故障邮件提醒的监控脚本分享

作者:傲雪星枫 时间:2023-02-15 21:27:43 

监控硬件运行状况

shell 监控cpu,memory,load average,记录到log,当负载压力时,发电邮通知管理员。
原理:
1.获取cpu,memory,load average的数值
2.判断数值是否超过自定义的范围,例如(CPU>90%,Memory<10%,load average>2)
3.如数值超过范围,发送电邮通知管理员。发送有时间间隔,每小时只会发送一次。
4.将数值写入log。
5.设置crontab 每30秒运行一次。

ServerMonitor.sh


#!/bin/bash

# 系统监控,记录cpu、memory、load average,当超过规定数值时发电邮通知管理员

# *** config start ***

# 当前目录路径
ROOT=$(cd "$(dirname "$0")"; pwd)

# 当前服务器名
HOST=$(hostname)

# log 文件路径
CPU_LOG="${ROOT}/logs/cpu.log"
MEM_LOG="${ROOT}/logs/mem.log"
LOAD_LOG="${ROOT}/logs/load.log"

# 通知电邮列表
NOTICE_EMAIL='admin@admin.com'

# cpu,memory,load average 记录上一次发送通知电邮时间
CPU_REMARK='/tmp/servermonitor_cpu.remark'
MEM_REMARK='/tmp/servermonitor_mem.remark'
LOAD_REMARK='/tmp/servermonitor_loadaverage.remark'

# 发通知电邮间隔时间
REMARK_EXPIRE=3600
NOW=$(date +%s)

# *** config end ***

# *** function start ***

# 获取CPU占用
function GetCpu() {
 cpufree=$(vmstat 1 5 |sed -n '3,$p' |awk '{x = x + $15} END {print x/5}' |awk -F. '{print $1}')
 cpuused=$((100 - $cpufree))
 echo $cpuused

local remark
 remark=$(GetRemark ${CPU_REMARK})

# 检查CPU占用是否超过90%
 if [ "$remark" = "" ] && [ "$cpuused" -gt 90 ]; then
   echo "Subject: ${HOST} CPU uses more than 90% $(date +%Y-%m-%d' '%H:%M:%S)" | sendmail ${NOTICE_EMAIL}
   echo "$(date +%s)" > "$CPU_REMARK"
 fi
}

# 获取内存使用情况
function GetMem() {
 mem=$(free -m | sed -n '3,3p')
 used=$(echo $mem | awk -F ' ' '{print $3}')
 free=$(echo $mem | awk -F ' ' '{print $4}')
 total=$(($used + $free))
 limit=$(($total/10))
 echo "${total} ${used} ${free}"

local remark
 remark=$(GetRemark ${MEM_REMARK})

# 检查内存占用是否超过90%
 if [ "$remark" = "" ] && [ "$limit" -gt "$free" ]; then
   echo "Subject: ${HOST} Memory uses more than 90% $(date +%Y-%m-%d' '%H:%M:%S)" | sendmail ${NOTICE_EMAIL}
   echo "$(date +%s)" > "$MEM_REMARK"
 fi
}

# 获取load average
function GetLoad() {
 load=$(uptime | awk -F 'load average: ' '{print $2}')
 m1=$(echo $load | awk -F ', ' '{print $1}')
 m5=$(echo $load | awk -F ', ' '{print $2}')
 m15=$(echo $load | awk -F ', ' '{print $3}')
 echo "${m1} ${m5} ${m15}"

m1u=$(echo $m1 | awk -F '.' '{print $1}')

local remark
 remark=$(GetRemark ${LOAD_REMARK})

# 检查是否负载是否有压力
 if [ "$remark" = "" ] && [ "$m1u" -gt "2" ]; then
   echo "Subject: ${HOST} Load Average more than 2 $(date +%Y-%m-%d' '%H:%M:%S)" | sendmail ${NOTICE_EMAIL}
   echo "$(date +%s)" > "$LOAD_REMARK"
 fi
}

# 获取上一次发送电邮时间
function GetRemark() {
 local remark

if [ -f "$1" ] && [ -s "$1" ]; then
   remark=$(cat $1)

if [ $(( $NOW - $remark )) -gt "$REMARK_EXPIRE" ]; then
     rm -f $1
     remark=""
   fi
 else
   remark=""
 fi

echo $remark
}

# *** function end ***

cpuinfo=$(GetCpu)
meminfo=$(GetMem)
loadinfo=$(GetLoad)

echo "cpu: ${cpuinfo}" >> "${CPU_LOG}"
echo "mem: ${meminfo}" >> "${MEM_LOG}"
echo "load: ${loadinfo}" >> "${LOAD_LOG}"

exit 0


监控网站是否异常
shell 监控网站是否异常的脚本,如有异常自动发电邮通知管理员。
流程:
1.检查网站返回的http_code是否等于200,如不是200视为异常。
2.检查网站的访问时间,超过MAXLOADTIME(10秒)视为异常。
3.发送通知电邮后,在/tmp/monitor_load.remark记录发送时间,在一小时内不重复发送,如一小时后则清空/tmp/monitor_load.remark。


#!/bin/bash

SITES=("http://web01.example.com" "http://web02.example.com") # 要监控的网站
NOTICE_EMAIL='me@example.com'                 # 管理员电邮
MAXLOADTIME=10                        # 访问超时时间设置
REMARKFILE='/tmp/monitor_load.remark'             # 记录时否发送过通知电邮,如发送过则一小时内不再发送
ISSEND=0                           # 是否有发送电邮
EXPIRE=3600                          # 每次发送电邮的间隔秒数
NOW=$(date +%s)

if [ -f "$REMARKFILE" ] && [ -s "$REMARKFILE" ]; then
 REMARK=$(cat $REMARKFILE)

# 删除过期的电邮发送时间记录文件
 if [ $(( $NOW - $REMARK )) -gt "$EXPIRE" ]; then
   rm -f ${REMARKFILE}
   REMARK=""
 fi
else
 REMARK=""
fi

# 循环判断每个site
for site in ${SITES[*]}; do

printf "start to load ${site}\n"
 site_load_time=$(curl -o /dev/null -s -w "time_connect: %{time_connect}\ntime_starttransfer: %{time_starttransfer}\ntime_total: %{time_total}" "${site}")
 site_access=$(curl -o /dev/null -s -w %{http_code} "${site}")
 time_total=${site_load_time##*:}

printf "$(date '+%Y-%m-%d %H:%M:%S')\n"
 printf "site load time\n${site_load_time}\n"
 printf "site access:${site_access}\n\n"

# not send
 if [ "$REMARK" = "" ]; then
   # check access
   if [ "$time_total" = "0.000" ] || [ "$site_access" != "200" ]; then
     echo "Subject: ${site} can access $(date +%Y-%m-%d' '%H:%M:%S)" | sendmail ${NOTICE_EMAIL}
     ISSEND=1
   else
     # check load time
     if [ "${time_total%%.*}" -ge ${MAXLOADTIME} ]; then
       echo "Subject: ${site} load time total:${time_total} $(date +%Y-%m-%d' '%H:%M:%S)" | sendmail ${NOTICE_EMAIL}
       ISSEND=1
     fi
   fi
 fi

done

# 发送电邮后记录发送时间
if [ "$ISSEND" = "1" ]; then
 echo "$(date +%s)" > $REMARKFILE
fi

exit 0
标签:监控,shell
0
投稿

猜你喜欢

  • 企业网站改版需要把握思考的几个问题

    2008-05-27 12:32:00
  • 提高Web页面的性能(二)

    2008-04-08 12:44:00
  • docker run -d和docker run -it的区别详解

    2021-07-29 14:05:39
  • 访问本页面 您的浏览器需要支持JavaScript的解决办法

    2010-08-12 21:06:00
  • 网秦发布流氓克星软件 日新增用户突破五万

    2009-10-10 17:22:00
  • 中国网通成立运营机构 专营IDC市场

    2008-04-04 16:31:00
  • 英国网游开“网眼” 借监控探头抓坏人赚钱

    2009-10-09 09:02:00
  • Docker容器数据卷介绍及操作示例

    2022-04-03 07:53:30
  • 苹果市值超越Google 目标瞄准微软宝座

    2009-10-14 10:59:00
  • Windows 2003 架设用户隔离FTP站点

    2009-12-22 19:20:00
  • 基础学习:网络广告的种类和形式

    2009-01-17 14:04:00
  • 教你五点被dmoz收录的方法

    2008-12-19 13:19:00
  • 开发环境Ubuntu16安装以后的初始化设置

    2021-02-19 15:53:23
  • 站长,请不要做垃圾站了

    2008-03-05 11:31:00
  • Logrotate实现Catalina.out日志每俩小时切割示例

    2021-10-06 04:20:12
  • vmware Esxi 5.0 忘记密码重置的方法

    2022-09-02 20:37:20
  • Linux如何使用 MyCat 实现 MySQL 主从读写分离

    2023-08-19 11:10:21
  • 服务器防火墙的选择

    2011-07-12 15:12:54
  • Linux unlink函数和删除文件的操作方法

    2023-10-05 06:27:51
  • 如何做一个人气旺的站 我的四个做站经验

    2008-12-23 11:21:00
  • asp之家 网站运营 m.aspxhome.com