來源:http://www.jb51.net/article/58799.htmlinux
這篇文章主要介紹了shell腳本監控系統負載、CPU和內存使用狀況,本文分別給出監控服務器系統負載狀況、監控系統cpu使用狀況、、監控系統內存狀況、監控系統交換分區swap使用狀況的腳本,須要的朋友能夠參考下ios
在沒有nagios監控軟件的狀況下,只要服務器能上互聯網,就可經過發郵件的方式來提醒管理員系統負載與CPU佔用的使用狀況。
1、安裝linux下面的一個郵件客戶端msmtp軟件(相似於一個foxmail的工具)
一、下載安裝:
http://downloads.sourceforge.net/msmtp/msmtp-1.4.16.tar.bz2?modtime=1217206451&big_mirror=0
代碼以下:shell
# tar jxvf msmtp-1.4.16.tar.bz2 # cd msmtp-1.4.16 # ./configure --prefix=/usr/local/msmtp # make && make install
二、建立msmtp配置文件和日誌文件(host爲郵件域名,郵件用戶名fuquanjun,密碼fuquanjun)
代碼以下:vim
# vim /root/.msmtprc account default host xxxxx.com from fuquanjun@xxxx.com auth login user fuquanjun password fuquanjun logfile ~/.msmtp.log # chmod 600 /root/.msmtprc # touch ~/.msmtp.log
三、mutt安裝配置:(通常linux下有默認安裝mutt)
若是沒有安裝,則使用yum安裝
代碼以下:bash
yum -y install mutt # vim /root/.muttrc set sendmail="/usr/local/msmtp/bin/msmtp" set use_from=yes set realname="moniter" set from=fuquanjun@xxx.com set envelope_from=yes set rfc2047_parameters=yes set charset="utf-8"
四、郵件發送測試(-s郵件標題,-a表加附件)
代碼以下:服務器
# echo "郵件內容123456" | mutt -s "郵件標題測試郵件" -a /scripts/test.txt fuquanjun@xxxx.com
出現下面報錯信息:
代碼以下:工具
msmtp: account default not found: no configuration file available
發送信件出錯,子進程已退出 78 ()。
沒法發送此信件。
解決方法:
單獨使用msmtp發送測試:/usr/local/msmtp/bin/msmtp -S 發現是配置文件沒找到
代碼以下:測試
msmtp: account default not found: no configuration file availableui
查看當前的配置文件路徑:/usr/local/msmtp/bin/msmtp -P
代碼以下:spa
ignoring system configuration file/work/target/etc/msmtprc: No such file or directory ignoring user configuration file /root/.msmtprc: No such file ordirectory falling back to default account msmtp: account default not found: no configuration file available
故將/usr/local/etc/msmtprc 複製爲/root/.msmtprc
查看一下mutt文件安裝目錄狀況
代碼以下:
rpm -ql mutt
故將/etc/Muttrc 複製爲/root/.muttrc便可發送郵件。
2、監控服務器系統負載狀況:
一、用uptime命令查看當前負載狀況(1分鐘,5分鐘,15分鐘平均負載狀況)在蘋果公司的Mac電腦上也適用
代碼以下:
# uptime 15:43:59 up 186 days, 20:04, 1 user, load average: 0.01, 0.02, 0.00
"load average"意思分別是1分鐘、5分鐘、15分鐘內系統的平均負荷。
(1) 主要觀察"15分鐘系統負荷",將它做爲電腦正常運行的指標。
(2) 若是15分鐘內,(系統負荷除以CPU核心數目以後的)平均負荷大於1.0,代表問題持續存在,不是暫時現象。
(3) 當系統負荷持續大於0.7,你必須開始調查了,問題出在哪裏,防止狀況惡化。
(4) 當系統負荷持續大於1.0,你必須動手尋找解決辦法,把這個值降下來。
(5) 當系統負荷達到5.0,就代表你的系統有很嚴重的問題,長時間沒有響應,或者接近死機了。
假設你的電腦只有1個CPU。若是你的電腦裝了2個CPU,意味着電腦的處理能力翻了一倍,可以同時處理的進程數量也翻了一倍。
2個CPU代表系統負荷能夠達到2.0,此時每一個CPU都達到100%的工做量。推廣開來,n個CPU的電腦,可接受的系統負荷最大爲n.0。
二、查看服務器cpu的總核數
代碼以下:
# grep -c 'model name' /proc/cpuinfo 或者 cat /proc/cpuinfo
三、截取服務器1分鐘、5分鐘、15分鐘的負載狀況
代碼以下:
# uptime | awk '{print $8,$9,$10,$11,$12}' load average: 0.01, 0.02, 0.00
四、查看截取15分鐘的平均負載
代碼以下:
# uptime | awk '{print $12}' (用 '{print $12}' 這個獲取的不夠準確,若是都用awk取第12個字段的話,結果有可能爲空了。而用$NF表輸出最後一段的內容)
# uptime | awk '{print $NF}'
五、編寫系統負載監控的腳本文件:
代碼以下:
# vim /scripts/load-check.sh [code] #!/bin/bash #使用uptime命令監控linux系統負載變化 #取系統當前時間(以追加的方式寫入文件>>) date >> /scripts/datetime-load.txt #提取服務器1分鐘、5分鐘、15分鐘的負載狀況 uptime | awk '{print $8,$9,$10,$11,$12}' >> /scripts/load.txt #逐行鏈接上面的時間和負載相關行數據(每次從新寫入文件>) paste /scripts/datetime-load.txt /scripts/load.txt > /scripts/load_day.txt # chmod a+x /scripts/load-check.sh
六、編寫系統負載結果文件郵件發送腳本:
代碼以下:
# vim /scripts/sendmail-load.sh #!/bin/bash #把系統負載監控生成的load_day.txt文件經過郵件發送給用戶 #提取本服務器的IP地址信息 IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "` #提取當前日期 today=`date -d "0 day" +%Y年%m月%d日` #發送系統負載監控結果郵件 echo "這是$IP服務器$today的系統負載監控報告,請下載附件。" | mutt -s "$IP服務器$today的系統負載監控報告" -a /scripts/load_day.txt fuquanjun@xxx.com # chmod a+x /scripts/sendmail-load.sh
七、編寫系統負載監控的腳本文件:
代碼以下:
# vim /scripts/load-warning.sh #!/bin/bash #使用uptime命令監控linux系統負載變化 #提取本服務器的IP地址信息 IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "` #抓取cpu的總核數 cpu_num=`grep -c 'model name' /proc/cpuinfo` #抓取當前系統15分鐘的平均負載值 load_15=`uptime | awk '{print $NF}'` #計算當前系統單個核心15分鐘的平均負載值,結果小於1.0時前面個位數補0。 average_load=`echo "scale=2;a=$load_15/$cpu_num;if(length(a)==scale(a)) print 0;print a" | bc` #取上面平均負載值的個位整數 average_int=`echo $average_load | cut -f 1 -d "."` #設置系統單個核心15分鐘的平均負載的告警值爲0.70(即便用超過70%的時候告警)。 load_warn=0.70 #當單個核心15分鐘的平均負載值大於等於1.0(即個位整數大於0) ,直接發郵件告警;若是小於1.0則進行二次比較 if (($average_int > 0)); then echo "$IP服務器15分鐘的系統平均負載爲$average_load,超過警惕值1.0,請當即處理!!!" | mutt -s "$IP 服務器系統負載嚴重告警!!!" fuquanjun@xxx.com else #當前系統15分鐘平均負載值與告警值進行比較(當大於告警值0.70時會返回1,小於時會返回0 ) load_now=`expr $average_load \> $load_warn` #若是系統單個核心15分鐘的平均負載值大於告警值0.70(返回值爲1),則發郵件給管理員 if (($load_now == 1)); then echo "$IP服務器15分鐘的系統平均負載達到 $average_load,超過警惕值0.70,請及時處理。" | mutt -s "$IP 服務器系統負載告警" fuquanjun@xxx.com fi fi # chmod a+x /scripts/load-warning.sh
3、監控服務器系統cpu佔用狀況:
一、使用top命令查看linux系統cpu使用狀況:
代碼以下:
# top -b -n 1 | grep Cpu (-b -n 1 表只須要1次的輸出結果) Cpu(s): 0.0%us, 0.0%sy, 0.0%ni, 99.9%id, 0.0%wa, 0.0%hi, 0.0%si, 0.0%st
二、查看截取空閒cpu的百分比數值命令(只取整數部分):
代碼以下:
# top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."
三、編寫cpu監控的腳本文件:
代碼以下:
# vim /scripts/cpu-check.sh #!/bin/bash #使用top命令監控linux系統cpu變化 #取系統當前時間(以追加的方式寫入文件>>) date >> /scripts/datetime-cpu.txt #抓取當前cpu的值(以追加的方式寫入文件>>) top -b -n 1 | grep Cpu >> /scripts/cpu-now.txt #逐行鏈接上面的時間和cpu相關行數據(每次從新寫入文件>) paste /scripts/datetime-cpu.txt /scripts/cpu-now.txt > /scripts/cpu.txt # chmod a+x /scripts/cpu-check.sh
四、查看CPU監控的結果文件:
代碼以下:
# cat /scripts/cpu.txt
五、編寫cpu結果文件郵件發送腳本:
代碼以下:
# vim /scripts/sendmail-cpu.sh #!/bin/bash #把生成的cpu.txt文件經過郵件發送給用戶 #提取本服務器的IP地址信息 IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "` #提取當前日期 today=`date -d "0 day" +%Y年%m月%d日` #發送cpu監控結果郵件 echo "這是$IP服務器$today的cpu監控報告,請下載附件。" | mutt -s "$IP服務器$today的CPU監控報告" -a /scripts/cpu.txt fuquanjun@xxx.com # chmod a+x /scripts/sendmail-cpu.sh
4、監控系統cpu的狀況,當使用超過80%的時候發告警郵件:
代碼以下:
# vim /scripts/cpu-warning.sh #!/bin/bash #監控系統cpu的狀況腳本程序 #提取本服務器的IP地址信息 IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "` #取當前空閒cpu百份比值(只取整數部分) cpu_idle=`top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."` #設置空閒cpu的告警值爲20%,若是當前cpu使用超過80%(即剩餘小於20%),當即發郵件告警 if (($cpu_idle < 20)); then echo "$IP服務器cpu剩餘$cpu_idle%,使用率已經超過80%,請及時處理。" | mutt -s "$IP 服務器CPU告警" fuquanjun@xxx.com fi # chmod a+x /scripts/cpu-warning.sh
5、使用free命令監控系統內存:
一、使用free命令查看linux系統內存使用狀況:(以M爲單位)
代碼以下:
# free -m total used free shared buffers cached Mem: 3952 3414 538 0 168 484 -/+ buffers/cache: 2760 1191 Swap: 8191 86 8105
二、查看截取剩餘內存free的數值命令:
(1) 物理內存free值: # free -m | grep Mem | awk '{print $4}'
(2) 緩衝區的free值: # free -m | grep - | awk '{print $4}'
(3) Swap分區free值: # free -m | grep Swap | awk '{print $4}'
三、編寫內存監控的腳本文件:
代碼以下:
# vim /scripts/free-mem.sh #!/bin/bash #使用free命令監控linux系統內存變化 #取系統當前時間(以追加的方式寫入文件>>) date >> /scripts/date-time.txt #抓取物理內存free值(以追加的方式寫入文件>>) echo Mem-free: `free -m | grep Mem | awk '{print $4}'`M >> /scripts/mem-free.txt #抓取緩衝區的free值(以追加的方式寫入文件>>) echo buffers/cache-free: `free -m | grep - | awk '{print $4}'`M >> /scripts/buffers-free.txt #抓取Swap分區free值(以追加的方式寫入文件>>) echo Swap-free: `free -m | grep Swap | awk '{print $4}'`M >> /scripts/swap-free.txt #逐行鏈接上面的時間和內存相關行數據(每次從新寫入文件>) paste /scripts/date-time.txt /scripts/mem-free.txt /scripts/buffers-free.txt /scripts/swap-free.txt > /scripts/freemem.txt # chmod a+x /scripts/free-mem.sh
四、查看內存監控的結果文件:
代碼以下:
# cat /scripts/freemem.txt
五、編寫free結果文件郵件發送腳本:
代碼以下:
# vim /scripts/sendmail-mem.sh #!/bin/bash #把生成的freemem.txt文件經過郵件發送給用戶 #提取本服務器的IP地址信息 IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "` #提取當前日期時間 today=`date -d "0 day" +%Y年%m月%d日` #發送內存監控結果郵件 echo "這是$IP服務器$today的內存監控報告,請下載附件。" | mutt -s "$IP服務器$today內存監控報告" -a /scripts/freemem.txt fuquanjun@xxx.com # chmod a+x /scripts/sendmail-mem.sh
6、監控系統交換分區swap的狀況,當使用超過80%的時候發告警郵件:
代碼以下:
# vim /scripts/swap-warning.sh #!/bin/bash #提取本服務器的IP地址信息 IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "` #系統分配的交換分區總量 swap_total=`free -m | grep Swap | awk '{print $2}'` #當前剩餘的交換分區free大小 swap_free=`free -m | grep Swap | awk '{print $4}'` #當前已使用的交換分區used大小 swap_used=`free -m | grep Swap | awk '{print $3}'` if (($swap_used != 0)); then #若是交換分區已被使用,則計算當前剩餘交換分區free所佔總量的百分比,用小數來表示,要在小數點前面補一個整數位0 swap_per=0`echo "scale=2;$swap_free/$swap_total" | bc` #設置交換分區的告警值爲20%(即便用超過80%的時候告警)。 swap_warn=0.20 #當前剩餘交換分區百分比與告警值進行比較(當大於告警值(即剩餘20%以上)時會返回1,小於(即剩餘不足20%)時會返回0 ) swap_now=`expr $swap_per \> $swap_warn` #若是當前交換分區使用超過80%(即剩餘小於20%,上面的返回值等於0),當即發郵件告警 if (($swap_now == 0)); then echo "$IP服務器swap交換分區只剩下 $swap_free M 未使用,剩餘不足20%,使用率已經超過80%,請及時處理。" | mutt -s "$IP 服務器內存告警" fuquanjun@xxx.com fi fi # chmod a+x /scripts/swap-warning.sh
7、加入任務計劃:系統負載與CPU佔用率每十分鐘檢測一次,有告警則當即發郵件(十分鐘發一次),負載與CPU檢測結果郵件天天早上8點發
一次。
代碼以下:
# crontab -e */10 * * * * /scripts/load-check.sh > /dev/null 2>&1 */10 * * * * /scripts/load-warning.sh 0 8 * * * /scripts/sendmail-load.sh */10 * * * * /scripts/cpu-check.sh */10 * * * * /scripts/cpu-warning.sh 0 8 * * * /scripts/sendmail-cpu.sh */10 * * * * /scripts/free-mem.sh */10 * * * * /scripts/swap-warning.sh 0 8 * * * /scripts/sendmail-mem.sh # service crond restart