国产在线观看精品免费,亚洲日本VA久久一区二区,香蕉久久99综合一区二区三区,久久精品99国产精品蜜桃小说

Linux 系統 CPU 100% 異常問(wèn)題,能否用一個(gè) Shell 腳本完美解決?

2024-07-10 09:04:15 Jinyu
昨天下午突然收到運維郵件報警,顯示數據平臺服務(wù)器cpu利用率達到了98.94%,而且最近一段時(shí)間一直持續在70%以上,看起來(lái)像是硬件資源到瓶頸需要擴容了,但仔細思考就會(huì )發(fā)現咱們的業(yè)務(wù)系統并不是一個(gè)高并發(fā)或者CPU密集型的應用,這個(gè)利用率有點(diǎn)太夸張,硬件瓶頸應該不會(huì )這么快就到了,一定是哪里的業(yè)務(wù)代碼邏輯有問(wèn)題。

2、排查思路

2.1 定位高負載進(jìn)程 pid

首先登錄到服務(wù)器使用top命令確認服務(wù)器的具體情況,根據具體情況再進(jìn)行分析判斷。

圖片

通過(guò)觀(guān)察load average,以及負載評判標準(8核),可以確認服務(wù)器存在負載較高的情況;

圖片

觀(guān)察各個(gè)進(jìn)程資源使用情況,可以看出進(jìn)程id為682的進(jìn)程,有著(zhù)較高的CPU占比

2.2 定位具體的異常業(yè)務(wù)

這里咱們可以使用 pwdx 命令根據 pid 找到業(yè)務(wù)進(jìn)程路徑,進(jìn)而定位到負責人和項目:

圖片

可得出結論:該進(jìn)程對應的就是數據平臺的web服務(wù)。

2.3 定位異常線(xiàn)程及具體代碼行

傳統的方案一般是4步:

1、top oder by with P:1040 // 首先按進(jìn)程負載排序找到 maxLoad(pid)

2、top -Hp 進(jìn)程PID:1073    // 找到相關(guān)負載 線(xiàn)程PID

3、printf “0x%x ”線(xiàn)程PID:0x431  // 將線(xiàn)程PID轉換為 16進(jìn)制,為后面查找 jstack 日志做準備

4、jstack  進(jìn)程PID | vim +/十六進(jìn)制線(xiàn)程PID -        // 例如:jstack 1040|vim +/0x431 -

但是對于線(xiàn)上問(wèn)題定位來(lái)說(shuō),分秒必爭,上面的 4 步還是太繁瑣耗時(shí)了,之前介紹過(guò)淘寶的 oldratlee 同學(xué)就將上面的流程封裝為了一個(gè)工具:show-busy-java-threads.sh,可以很方便的定位線(xiàn)上的這類(lèi)問(wèn)題:

圖片

可得出結論:是系統中一個(gè)時(shí)間工具類(lèi)方法的執行cpu占比較高,定位到具體方法后,查看代碼邏輯是否存在性能問(wèn)題。

※ 如果線(xiàn)上問(wèn)題比較緊急,可以省略 2.1、2.2 直接執行 2.3,這里從多角度剖析只是為了給大家呈現一個(gè)完整的分析思路。

3、根因分析

經(jīng)過(guò)前面的分析與排查,最終定位到一個(gè)時(shí)間工具類(lèi)的問(wèn)題,造成了服務(wù)器負載以及cpu使用率的過(guò)高。

  • 異常方法邏輯:是把時(shí)間戳轉成對應的具體的日期時(shí)間格式;
  • 上層調用:計算當天凌晨至當前時(shí)間所有秒數,轉化成對應的格式放入到set中返回結果;
  • 邏輯層:對應的是數據平臺實(shí)時(shí)報表的查詢(xún)邏輯,實(shí)時(shí)報表會(huì )按照固定的時(shí)間間隔來(lái),并且在一次查詢(xún)中有多次(n次)方法調用。

那么可以得到結論,如果現在時(shí)間是當天上午10點(diǎn),一次查詢(xún)的計算次數就是 10*60*60*n次=36,000*n次計算,而且隨著(zhù)時(shí)間增長(cháng),越接近午夜單次查詢(xún)次數會(huì )線(xiàn)性增加。由于實(shí)時(shí)查詢(xún)、實(shí)時(shí)報警等模塊大量的查詢(xún)請求都需要多次調用該方法,導致了大量CPU資源的占用與浪費。

4、解決方案

定位到問(wèn)題之后,首先考慮是要減少計算次數,優(yōu)化異常方法。排查后發(fā)現,在邏輯層使用時(shí),并沒(méi)有使用該方法返回的set集合中的內容,而是簡(jiǎn)單的用set的size數值。確認邏輯后,通過(guò)新方法簡(jiǎn)化計算(當前秒數-當天凌晨的秒數),替換調用的方法,解決計算過(guò)多的問(wèn)題。上線(xiàn)后觀(guān)察服務(wù)器負載和cpu使用率,對比異常時(shí)間段下降了30倍,恢復至正常狀態(tài),至此該問(wèn)題得已解決。

圖片

5、總結

  • 在編碼的過(guò)程中,除了要實(shí)現業(yè)務(wù)的邏輯,也要注重代碼性能的優(yōu)化。一個(gè)業(yè)務(wù)需求,能實(shí)現,和能實(shí)現的更高效、更優(yōu)雅其實(shí)是兩種截然不同的工程師能力和境界的體現,而后者也是工程師的核心競爭力。
  • 在代碼編寫(xiě)完成之后,多做 review,多思考是不是可以用更好的方式來(lái)實(shí)現。
  • 線(xiàn)上問(wèn)題不放過(guò)任何一個(gè)小細節!細節是魔鬼,技術(shù)的同學(xué)需要有刨根問(wèn)題的求知欲和追求卓越的精神,只有這樣,才能不斷的成長(cháng)和提升。

附上show-busy-java-threads.sh腳本:




















































































































































#!/bin/bash# @Function# Find out the highest cpu consumed threads of java, and print the stack of these threads.## @Usage# $ ./show-busy-java-threads.sh## @author Jerry Lee
readonly PROG=`basename$0`readonly-a COMMAND_LINE=("$0""$@")
usage(){cat<<EOFUsage: ${PROG}[OPTION]...Find out the highest cpu consumed threads of java, and print the stack of these threads.Example: ${PROG}-c 10
Options:-p,--pid find out the highest cpu consumed threads from the specifed java process,default from all java process.-c,--count set the thread count to show, default is 5-h,--helpdisplay this help and exitEOFexit$1}
readonly ARGS=`getopt -n "$PROG" -a -o c:p:h -l count:,pid:,help -- "$@"`[ $?-ne 0]&& usage 1evalset--"${ARGS}"
whiletrue;docase"$1"in-c|--count)count="$2"shift2;;-p|--pid)pid="$2"shift2;;-h|--help)usage;;--)shiftbreak;;esacdonecount=${count:-5}
redEcho(){[-c /dev/stdout ]&&{# if stdout is console, turn on color output.echo-ne "\033[1;31m"echo-n "$@"echo-e "\033[0m"}||echo"$@"}
yellowEcho(){[-c /dev/stdout ]&&{# if stdout is console, turn on color output.echo-ne "\033[1;33m"echo-n "$@"echo-e "\033[0m"}||echo"$@"}
blueEcho(){[-c /dev/stdout ]&&{# if stdout is console, turn on color output.echo-ne "\033[1;36m"echo-n "$@"echo-e "\033[0m"}||echo"$@"}
# Check the existence of jstack command!if!which jstack &>/dev/null;then[-z "$JAVA_HOME"]&&{redEcho "Error: jstack not found on PATH!"exit1}![-f "$JAVA_HOME/bin/jstack"]&&{redEcho "Error: jstack not found on PATH and $JAVA_HOME/bin/jstack file does NOT exists!"exit1}![-x "$JAVA_HOME/bin/jstack"]&&{redEcho "Error: jstack not found on PATH and $JAVA_HOME/bin/jstack is NOT executalbe!"exit1}export PATH="$JAVA_HOME/bin:$PATH"fi
readonly uuid=`date +%s`_${RANDOM}_$$
cleanupWhenExit(){rm/tmp/${uuid}_*&>/dev/null}trap"cleanupWhenExit" EXIT
printStackOfThreads(){local linelocal count=1while IFS=" "read-a line ;dolocal pid=${line[0]}local threadId=${line[1]}local threadId0x="0x`printf %x ${threadId}`"local user=${line[2]}local pcpu=${line[4]}
local jstackFile=/tmp/${uuid}_${pid}
[!-f "${jstackFile}"]&&{{if["${user}"=="${USER}"];thenjstack ${pid}>${jstackFile}elseif[$UID==0];thensudo -u ${user} jstack ${pid}>${jstackFile}elseredEcho "[$((count++))] Fail to jstack Busy(${pcpu}%) thread(${threadId}/${threadId0x}) stack of java process(${pid}) under user(${user})."redEcho "User of java process($user) is not current user($USER), need sudo to run again:"yellowEcho "sudo ${COMMAND_LINE[@]}"echocontinuefifi}||{redEcho "[$((count++))] Fail to jstack Busy(${pcpu}%) thread(${threadId}/${threadId0x}) stack of java process(${pid}) under user(${user})."echorm${jstackFile}continue}}blueEcho "[$((count++))] Busy(${pcpu}%) thread(${threadId}/${threadId0x}) stack of java process(${pid}) under user(${user}):"sed "/nid=${threadId0x} /,/^$/p"-n ${jstackFile}done}
ps -Leo pid,lwp,user,comm,pcpu --no-headers |{[-z "${pid}"]&&awk '$4=="java"{print $0}'||awk -v "pid=${pid}"'$1==pid,$4=="java"{print $0}'}|sort-k5 -r -n |head--lines "${count}"| printStackOfThreads


我要咨詢(xún)