shell腳本監控系統負載、CPU和內存使用狀況

時間 2019-11-08

標籤 shell 腳本監控系統負載 cpu 內存使用狀況欄目 Unix 简体版

原文原文鏈接

shell腳本監控系統負載、CPU和內存使用狀況
在沒有nagios監控軟件的狀況下，只要服務器能上互聯網，就可經過發郵件的方式來提醒管理員系統負載與CPU佔用的使用狀況。linux

1、安裝linux下面的一個郵件客戶端msmtp軟件(相似於一個foxmail的工具)ios

一、下載安裝：
http://downloads.sourceforge.net/msmtp/msmtp-1.4.16.tar.bz2?modtime=1217206451&big_mirror=0 shell

複製代碼代碼以下:vim

tar jxvf msmtp-1.4.16.tar.bz2

cd msmtp-1.4.16

./configure --prefix=/usr/local/msmtp

make && make install

二、建立msmtp配置文件和日誌文件（host爲郵件域名，郵件用戶名fuquanjun，密碼fuquanjun）bash

複製代碼代碼以下:服務器

vim /root/.msmtprc

account default
host xxxxx.com
from fuquanjun@xxxx.com
auth login
user fuquanjun
password fuquanjun
logfile ~/.msmtp.logide

chmod 600 /root/.msmtprc

touch ~/.msmtp.log

三、mutt安裝配置：（通常linux下有默認安裝mutt）工具

若是沒有安裝，則使用yum安裝測試

複製代碼代碼以下:
yum -y install muttui

vim /root/.muttrc

set sendmail="/usr/local/msmtp/bin/msmtp"
set use_from=yes
set realname="moniter"
set from=fuquanjun@xxx.com
set envelope_from=yes
set rfc2047_parameters=yes
set charset="utf-8

四、郵件發送測試（-s郵件標題，-a表加附件）

複製代碼代碼以下:

echo "郵件內容123456" | mutt -s "郵件標題測試郵件" -a /scripts/test.txt fuquanjun@xxxx.com

出現下面報錯信息：

複製代碼代碼以下:
msmtp: account default not found: no configuration file available

發送信件出錯，子進程已退出 78 ()。
沒法發送此信件。
解決方法：

單獨使用msmtp發送測試：/usr/local/msmtp/bin/msmtp -S 發現是配置文件沒找到

複製代碼代碼以下:
msmtp: account default not found: no configuration file available

查看當前的配置文件路徑：/usr/local/msmtp/bin/msmtp -P

複製代碼代碼以下:
ignoring system configuration file/work/target/etc/msmtprc: No such file or directory
ignoring user configuration file /root/.msmtprc: No such file ordirectory
falling back to default account
msmtp: account default not found: no configuration file available

故將/usr/local/etc/msmtprc 複製爲/root/.msmtprc
查看一下mutt文件安裝目錄狀況

複製代碼代碼以下:
rpm -ql mutt

故將/etc/Muttrc 複製爲/root/.muttrc便可發送郵件。

2、監控服務器系統負載狀況：

一、用uptime命令查看當前負載狀況（1分鐘，5分鐘，15分鐘平均負載狀況）在蘋果公司的Mac電腦上也適用

複製代碼代碼以下:

uptime

15:43:59 up 186 days, 20:04, 1 user, load average: 0.01, 0.02, 0.00

"load average"意思分別是1分鐘、5分鐘、15分鐘內系統的平均負荷。
(1) 主要觀察"15分鐘系統負荷"，將它做爲電腦正常運行的指標。
(2) 若是15分鐘內，（系統負荷除以CPU核心數目以後的）平均負荷大於1.0，代表問題持續存在，不是暫時現象。
(3) 當系統負荷持續大於0.7，你必須開始調查了，問題出在哪裏，防止狀況惡化。
(4) 當系統負荷持續大於1.0，你必須動手尋找解決辦法，把這個值降下來。
(5) 當系統負荷達到5.0，就代表你的系統有很嚴重的問題，長時間沒有響應，或者接近死機了。
假設你的電腦只有1個CPU。若是你的電腦裝了2個CPU,意味着電腦的處理能力翻了一倍，可以同時處理的進程數量也翻了一倍。
2個CPU代表系統負荷能夠達到2.0，此時每一個CPU都達到100%的工做量。推廣開來，n個CPU的電腦，可接受的系統負荷最大爲n.0。

二、查看服務器cpu的總核數

複製代碼代碼以下:

grep -c 'model name' /proc/cpuinfo 或者 cat /proc/cpuinfo

三、截取服務器1分鐘、5分鐘、15分鐘的負載狀況

複製代碼代碼以下:

uptime | awk '{print $8,$9,$10,$11,$12}'

load average: 0.01, 0.02, 0.00

四、查看截取15分鐘的平均負載

複製代碼代碼以下:

uptime | awk '{print $12}' （用 '{print $12}' 這個獲取的不夠準確，若是都用awk取第12個字段的話，結果有可能爲空了。而用$NF表輸出最後一段的內容）

uptime | awk '{print $NF}'

五、編寫系統負載監控的腳本文件：

複製代碼代碼以下:

vim /scripts/load-check.sh

[code]
#!/bin/bash
#使用uptime命令監控linux系統負載變化

#取系統當前時間（以追加的方式寫入文件>>）
date >> /scripts/datetime-load.txt

#提取服務器1分鐘、5分鐘、15分鐘的負載狀況
uptime | awk '{print $8,$9,$10,$11,$12}' >> /scripts/load.txt

#逐行鏈接上面的時間和負載相關行數據（每次從新寫入文件>）
paste /scripts/datetime-load.txt /scripts/load.txt > /scripts/load_day.txt

chmod a+x /scripts/load-check.sh

六、編寫系統負載結果文件郵件發送腳本：

複製代碼代碼以下:

vim /scripts/sendmail-load.sh

#!/bin/bash
#把系統負載監控生成的load_day.txt文件經過郵件發送給用戶

#提取本服務器的IP地址信息
IP=ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "

#提取當前日期
today=date -d "0 day" +%Y年%m月%d日

#發送系統負載監控結果郵件
echo "這是$IP服務器$today的系統負載監控報告，請下載附件。" | mutt -s "$IP服務器$today的系統負載監控報告" -a /scripts/load_day.txt fuquanjun@xxx.com

chmod a+x /scripts/sendmail-load.sh

七、編寫系統負載監控的腳本文件：

複製代碼代碼以下:

vim /scripts/load-warning.sh

#!/bin/bash
#使用uptime命令監控linux系統負載變化

#提取本服務器的IP地址信息
IP=ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "

#抓取cpu的總核數
cpu_num=grep -c 'model name' /proc/cpuinfo

#抓取當前系統15分鐘的平均負載值
load_15=uptime | awk '{print $NF}'

#計算當前系統單個核心15分鐘的平均負載值，結果小於1.0時前面個位數補0。
average_load=echo "scale=2;a=$load_15/$cpu_num;if(length(a)==scale(a)) print 0;print a" | bc

#取上面平均負載值的個位整數
average_int=echo $average_load | cut -f 1 -d "."

#設置系統單個核心15分鐘的平均負載的告警值爲0.70(即便用超過70%的時候告警)。
load_warn=0.70

#當單個核心15分鐘的平均負載值大於等於1.0（即個位整數大於0），直接發郵件告警；若是小於1.0則進行二次比較
if (($average_int > 0)); then
echo "$IP服務器15分鐘的系統平均負載爲$average_load，超過警惕值1.0，請當即處理！！！" | mutt -s "$IP 服務器系統負載嚴重告警！！！" fuquanjun@xxx.com
else
#當前系統15分鐘平均負載值與告警值進行比較（當大於告警值0.70時會返回1，小於時會返回0 ）
load_now=expr $average_load \> $load_warn

#若是系統單個核心15分鐘的平均負載值大於告警值0.70（返回值爲1），則發郵件給管理員
if (($load_now == 1)); then
echo "$IP服務器15分鐘的系統平均負載達到 $average_load，超過警惕值0.70，請及時處理。" | mutt -s "$IP 服務器系統負載告警" fuquanjun@xxx.com
fi
fi

chmod a+x /scripts/load-warning.sh

3、監控服務器系統cpu佔用狀況：

一、使用top命令查看linux系統cpu使用狀況：

複製代碼代碼以下:

top -b -n 1 | grep Cpu （-b -n 1 表只須要1次的輸出結果）

Cpu(s):  0.0%us,  0.0%sy,  0.0%ni, 99.9%id,  0.0%wa,  0.0%hi,  0.0%si,  0.0%st

二、查看截取空閒cpu的百分比數值命令（只取整數部分）：

複製代碼代碼以下:

top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."

三、編寫cpu監控的腳本文件：

複製代碼代碼以下:

vim /scripts/cpu-check.sh

#!/bin/bash
#使用top命令監控linux系統cpu變化

#取系統當前時間（以追加的方式寫入文件>>）
date >> /scripts/datetime-cpu.txt

#抓取當前cpu的值（以追加的方式寫入文件>>）
top -b -n 1 | grep Cpu >> /scripts/cpu-now.txt

#逐行鏈接上面的時間和cpu相關行數據（每次從新寫入文件>）
paste /scripts/datetime-cpu.txt /scripts/cpu-now.txt > /scripts/cpu.txt

chmod a+x /scripts/cpu-check.sh

四、查看CPU監控的結果文件：

複製代碼代碼以下:

cat /scripts/cpu.txt

五、編寫cpu結果文件郵件發送腳本：

複製代碼代碼以下:

vim /scripts/sendmail-cpu.sh

#!/bin/bash
#把生成的cpu.txt文件經過郵件發送給用戶

#提取本服務器的IP地址信息
IP=ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "

#提取當前日期
today=date -d "0 day" +%Y年%m月%d日

#發送cpu監控結果郵件
echo "這是$IP服務器$today的cpu監控報告，請下載附件。" | mutt -s "$IP服務器$today的CPU監控報告" -a /scripts/cpu.txt fuquanjun@xxx.com

chmod a+x /scripts/sendmail-cpu.sh

4、監控系統cpu的狀況，當使用超過80%的時候發告警郵件：

複製代碼代碼以下:

vim /scripts/cpu-warning.sh

#!/bin/bash
#監控系統cpu的狀況腳本程序

#提取本服務器的IP地址信息
IP=ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "

#取當前空閒cpu百份比值（只取整數部分）
cpu_idle=top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."

#設置空閒cpu的告警值爲20%，若是當前cpu使用超過80%（即剩餘小於20%），當即發郵件告警
if (($cpu_idle < 20)); then
echo "$IP服務器cpu剩餘$cpu_idle%，使用率已經超過80%，請及時處理。" | mutt -s "$IP 服務器CPU告警" fuquanjun@xxx.com
fi

chmod a+x /scripts/cpu-warning.sh

5、使用free命令監控系統內存：

一、使用free命令查看linux系統內存使用狀況：（以M爲單位）

複製代碼代碼以下:

free -m

total       used       free     shared    buffers     cached

Mem: 3952 3414 538 0 168 484
-/+ buffers/cache: 2760 1191
Swap: 8191 86 8105

二、查看截取剩餘內存free的數值命令：

(1) 物理內存free值： # free -m | grep Mem | awk '{print $4}'
(2) 緩衝區的free值： # free -m | grep - | awk '{print $4}'
(3) Swap分區free值： # free -m | grep Swap | awk '{print $4}'

三、編寫內存監控的腳本文件：

複製代碼代碼以下:

vim /scripts/free-mem.sh

#!/bin/bash
#使用free命令監控linux系統內存變化

#取系統當前時間（以追加的方式寫入文件>>）
date >> /scripts/date-time.txt

#抓取物理內存free值（以追加的方式寫入文件>>）
echo Mem-free: free -m | grep Mem | awk '{print $4}'M >> /scripts/mem-free.txt

#抓取緩衝區的free值（以追加的方式寫入文件>>）
echo buffers/cache-free: free -m | grep - | awk '{print $4}'M >> /scripts/buffers-free.txt

#抓取Swap分區free值（以追加的方式寫入文件>>）
echo Swap-free: free -m | grep Swap | awk '{print $4}'M >> /scripts/swap-free.txt

#逐行鏈接上面的時間和內存相關行數據（每次從新寫入文件>）
paste /scripts/date-time.txt /scripts/mem-free.txt /scripts/buffers-free.txt /scripts/swap-free.txt > /scripts/freemem.txt

chmod a+x /scripts/free-mem.sh

四、查看內存監控的結果文件：

複製代碼代碼以下:

cat /scripts/freemem.txt

五、編寫free結果文件郵件發送腳本：

複製代碼代碼以下:

vim /scripts/sendmail-mem.sh

#!/bin/bash
#把生成的freemem.txt文件經過郵件發送給用戶

#提取本服務器的IP地址信息
IP=ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "

#提取當前日期時間
today=date -d "0 day" +%Y年%m月%d日

#發送內存監控結果郵件
echo "這是$IP服務器$today的內存監控報告，請下載附件。" | mutt -s "$IP服務器$today內存監控報告" -a /scripts/freemem.txt fuquanjun@xxx.com

chmod a+x /scripts/sendmail-mem.sh

6、監控系統交換分區swap的狀況，當使用超過80%的時候發告警郵件：

複製代碼代碼以下:

vim /scripts/swap-warning.sh

#!/bin/bash

#提取本服務器的IP地址信息
IP=ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "

#系統分配的交換分區總量
swap_total=free -m | grep Swap | awk '{print $2}'

#當前剩餘的交換分區free大小
swap_free=free -m | grep Swap | awk '{print $4}'

#當前已使用的交換分區used大小
swap_used=free -m | grep Swap | awk '{print $3}'

if (($swap_used != 0)); then

#若是交換分區已被使用，則計算當前剩餘交換分區free所佔總量的百分比，用小數來表示，要在小數點前面補一個整數位0
swap_per=0echo "scale=2;$swap_free/$swap_total" | bc

#設置交換分區的告警值爲20%(即便用超過80%的時候告警)。
swap_warn=0.20

#當前剩餘交換分區百分比與告警值進行比較（當大於告警值(即剩餘20%以上)時會返回1，小於(即剩餘不足20%)時會返回0 ）
swap_now=expr $swap_per \> $swap_warn

#若是當前交換分區使用超過80%（即剩餘小於20%，上面的返回值等於0），當即發郵件告警
if (($swap_now == 0)); then
echo "$IP服務器swap交換分區只剩下 $swap_free M 未使用，剩餘不足20%，使用率已經超過80%，請及時處理。" | mutt -s "$IP 服務器內存告警" fuquanjun@xxx.com
fi
fi