shell编程实战1-告警系统

需求:使用shell定制各种个性化告警工具,但需要统一化管理、规范化管理。

          我们的机器角色多种多样,但是所有机器上都要部署同样的监控系统,也就说所有机器不管什么角色,整个程序框架都是一致的,不同的地方在于根据不同的角色,定制不同的配置文件。

1. 思路:指定一个脚本包,包含主程序、子程序、配置文件、邮件引擎、输出日志等

               主程序:作为整个脚本的入口,是整个系统的命脉

               配置文件:是一个控制中心,定义各个子程序的监控开关;并指定应用的各个相关联的日志文件。

              子程序:这个才是真正的监控脚本,用来监控各个指标。

              邮件引擎:是由一个python程序来实现,它可以定义发邮件的服务器、发邮件人 以及发件人密码

              输出日志:整个监控系统要有日志输出。便于调试和排错

2. 程序架构

     

  • bin下是主程序
  • conf下是配置文件
  • shares下是各个监控子脚本
  • mail下是邮件引擎
  • log下是日志。

3. 程序

 1)bin/main.sh

#!/bin/bash

# 是否发送邮件的开关
export send=1
# 过滤ip地址
export addr=`/sbin/ifconfig |grep -A1 "eth0"|awk -F '[ :]+' '/inet/ {print $4}'`
# 只需要最后一级目录名
dir=`pwd`
last_dir=`echo $dir|awk -F'/' '{print $NF}'`

# 下面的判断目的是,保证执行脚本的时候我们在bin目录里,不然监控脚本、邮件和日志很有可能找不到
if [ $last_dir == "bin" ] || [ $last_dir == "bin/" ]; then
conf_file="../conf/mon.conf"
else
echo "you shoud cd bin dir"
exit
fi

exec 1>>../log/mon.log 2>>../log/err.log
# 执行监控负载的子shell
echo "`date +"%F %T"` load average"
/bin/bash ../shares/load.sh

# 执行监控web服务器502的子shell
##先检查配置文件中是否需要监控502
if grep -q 'to_mon_502=1' $conf_file; then
##调用mon.conf中的log目录路径,作为全局变量,502子shell中可以调用
export log=`grep 'logfile=' $conf_file |awk -F '=' '{print $2}' |sed 's/ //g'`
/bin/bash ../shares/502.sh
fi

 2)  conf/mon.conf

# 定义mysql的服务器地址、端口以及user、password
to_mon_cdb=0 ##0 or 1, default 0,0 not monitor, 1 monitor
db_ip=10.20.3.13
db_port=3315
db_user=username
db_pass=passwd

# httpd 如果是1则监控,为0不监控
to_mon_httpd=0

# php
to_mon_php_socket=0

# http_code_502 需要定义访问日志的路径
to_mon_502=0
logfile=/data/log/xxx.xxx.com/access.log

# request_count 定义日志路径以及域名
to_mon_request_count=0
req_log=/data/log/www.discuz.net/access.log
domainname=www.discuz.net

3)  mail/mail.sh

log=$1 #mail.sh的第1个参数
t_s=`date +%s`
# 定义2个小时之前的时间戳,只是为了满足$v -gt 3600,即mail.sh被调用时,能够发送邮件
t_s2=`date -d "2 hours ago" +%s`

if [ ! -f /tmp/$log ]
then
echo $t_s2 > /tmp/$log
fi
# 第一次使用2个小时之前的时间戳,第二次使用刚刚执行mail.sh时的时间戳
t_s2=`tail -1 /tmp/$log|awk '{print $1}'`
echo $t_s>>/tmp/$log

v=$[$t_s-$t_s2]
echo $v
# 1个小时之内,执行else后面的语句,告警超过10次,发送邮件,计数器清零
if [ $v -gt 3600 ]
then
./mail.py $1 $2 $3
echo "0" > /tmp/$log.txt #如果存在,必须清空该文件的内容,并写入计数器的初始值0
else
if [ ! -f /tmp/$log.txt ]
then
echo "0" > /tmp/$log.txt
fi
nu=`cat /tmp/$log.txt`
nu2=$[$nu+1]
echo $nu2>/tmp/$log.txt
if [ $nu2 -gt 10 ]
then
./mail.py $1 "trouble continue 10 min $2" "$3"
echo "0" > /tmp/$log.txt
fi
fi

4)shares/load.sh

#! /bin/bash

load=`uptime |awk -F 'average:' '{print $2}'|cut -d',' -f1|sed 's/ //g' |cut -d. -f1`
if [ $load -gt 10 ] && [ $send -eq "1" ]
then
echo "$addr `date +%T` load is $load" >../log/load.tmp
/bin/bash ../mail/mail.sh [email protected] "$addr\_load:$load" `cat ../log/load.tmp`
fi
echo "`date +%T` load is $load"

5)shares/502.sh

#! /bin/bash

d=`date -d "-1 min" +%H:%M`
c_502=`grep :$d: $log|grep '502'|wc -l`
if [ $c_502 -gt 10 ] && [ $send == 1 ]; then
echo "$addr $d 502 count is $c_502">../log/502.tmp
/bin/bash ../mail/mail.sh $addr\_502 $c_502 ../log/502.tmp
fi
echo "`date +%T` 502 $c_502"

猜你喜欢

转载自www.cnblogs.com/tanzhirong/p/11415583.html