線上LinuxCPU100%故障排查總結

作者:大資料之路

https://my.oschina.net/leejun2005/blog/1602482

工作中當你伺服器CPU達到100%時,該如何排查異常故障呢?文章結尾分享一個shell指令碼,可助你排查Linux 系統 CPU 100% 異常問題。
昨天下午突然收到運維郵件報警,顯示資料平臺伺服器cpu利用率達到了98.94%,而且最近一段時間一直持續在70%以上,看起來像是硬體資源到瓶頸需要擴容了,但仔細思考就會發現咱們的業務系統並不是一個高併發或者CPU密集型的應用,這個利用率有點太誇張,硬體瓶頸應該不會這麼快就到了,一定是哪裡的業務程式碼邏輯有問題。
2、排查思路

2.1 定位高負載程序 pid

首先登入到伺服器使用top命令確認伺服器的具體情況,根據具體情況再進行分析判斷。
透過觀察load average,以及負載評判標準(8核),可以確認伺服器存在負載較高的情況;
觀察各個程序資源使用情況,可以看出程序id為682的程序,有著較高的CPU佔比

2.2 定位具體的異常業務

這裡咱們可以使用 pwdx 命令根據 pid 找到業務程序路徑,進而定位到負責人和專案:
可得出結論:該程序對應的就是資料平臺的web服務。

2.3 定位異常執行緒及具體程式碼行

傳統的方案一般是4步:
1、top oder by with P:1040 // 首先按程序負載排序找到  maxLoad(pid)
2、top -Hp 程序PID:1073    // 找到相關負載 執行緒PID
3、printf “0x%x ”執行緒PID: 0x431  // 將執行緒PID轉換為 16進位制,為後面查詢 jstack 日誌做準備
4、jstack  程序PID | vim +/十六進位制執行緒PID –        // 例如:jstack 1040|vim +/0x431 –
但是對於線上問題定位來說,分秒必爭,上面的 4 步還是太繁瑣耗時了,之前介紹過淘寶的oldratlee 同學就將上面的流程封裝為了一個工具:show-busy-java-threads.sh,可以很方便的定位線上的這類問題:
可得出結論:是系統中一個時間工具類方法的執行cpu佔比較高,定位到具體方法後,檢視程式碼邏輯是否存在效能問題。
※ 如果線上問題比較緊急,可以省略 2.1、2.2 直接執行 2.3,這裡從多角度剖析只是為了給大家呈現一個完整的分析思路。
3、根因分析
經過前面的分析與排查,最終定位到一個時間工具類的問題,造成了伺服器負載以及cpu使用率的過高。
  • 異常方法邏輯:是把時間戳轉成對應的具體的日期時間格式;
  • 上層呼叫:計算當天凌晨至當前時間所有秒數,轉化成對應的格式放入到set中返回結果;
  • 邏輯層:對應的是資料平臺即時報表的查詢邏輯,即時報表會按照固定的時間間隔來,並且在一次查詢中有多次(n次)方法呼叫。
那麼可以得到結論,如果現在時間是當天上午10點,一次查詢的計算次數就是 10*60*60*n次=36,000*n次計算,而且隨著時間增長,越接近午夜單次查詢次數會線性增加。由於即時查詢、即時報警等模組大量的查詢請求都需要多次呼叫該方法,導致了大量CPU資源的佔用與浪費。
4、解決方案
定位到問題之後,首先考慮是要減少計算次數,最佳化異常方法。排查後發現,在邏輯層使用時,並沒有使用該方法返回的set集合中的內容,而是簡單的用set的size數值。確認邏輯後,透過新方法簡化計算(當前秒數-當天凌晨的秒數),替換呼叫的方法,解決計算過多的問題。上線後觀察伺服器負載和cpu使用率,對比異常時間段下降了30倍,恢復至正常狀態,至此該問題得已解決。
5、總結
  • 在編碼的過程中,除了要實現業務的邏輯,也要注重程式碼效能的最佳化。一個業務需求,能實現,和能實現的更高效、更優雅其實是兩種截然不同的工程師能力和境界的體現,而後者也是工程師的核心競爭力。
  • 在程式碼編寫完成之後,多做 review,多思考是不是可以用更好的方式來實現。
  • 線上問題不放過任何一個小細節!細節是魔鬼,技術的同學需要有刨根問題的求知慾和追求卓越的精神,只有這樣,才能不斷的成長和提升。
附上show-busy-java-threads.sh指令碼:
#!/bin/bash# @Function# Find out the highest cpu consumed threads of java, and print the stack of these threads.## @Usage#   $ ./show-busy-java-threads.sh## @author Jerry Leereadonly PROG=`basename$0`readonly -a COMMAND_LINE=("$0""$@")usage() {cat <<EOFUsage: ${PROG} [OPTION]...Find out the highest cpu consumed threads of java, and print the stack of these threads.Example: ${PROG} -c 10Options:    -p, --pid       find out the highest cpu consumed threads from the specifed java process,                    default from all java process.    -c, --count     set the thread count to show, default is 5    -h, --help      display this help and exitEOFexit$1}readonly ARGS=`getopt -n "$PROG" -a -o c:p:h -l count:,pid:,help -- "$@"`[ $? -ne 0 ] && usage 1evalset -- "${ARGS}"whiletruedocase"$1"in    -c|--count)        count="$2"shift 2        ;;    -p|--pid)        pid="$2"shift 2        ;;    -h|--help)        usage        ;;    --)shiftbreak        ;;esacdonecount=${count:-5}redEcho() {    [ -c /dev/stdout ] && {# if stdout is console, turn on color output.echo -ne "\033[1;31m"echo -n "$@"echo -e "\033[0m"    } || echo"$@"}yellowEcho() {    [ -c /dev/stdout ] && {# if stdout is console, turn on color output.echo -ne "\033[1;33m"echo -n "$@"echo -e "\033[0m"    } || echo"$@"}blueEcho() {    [ -c /dev/stdout ] && {# if stdout is console, turn on color output.echo -ne "\033[1;36m"echo -n "$@"echo -e "\033[0m"    } || echo"$@"}# Check the existence of jstack command!if ! which jstack &> /dev/null; then    [ -z "$JAVA_HOME" ] && {        redEcho "Error: jstack not found on PATH!"exit 1    }    ! [ -f "$JAVA_HOME/bin/jstack" ] && {        redEcho "Error: jstack not found on PATH and $JAVA_HOME/bin/jstack file does NOT exists!"exit 1    }    ! [ -x "$JAVA_HOME/bin/jstack" ] && {        redEcho "Error: jstack not found on PATH and $JAVA_HOME/bin/jstack is NOT executalbe!"exit 1    }export PATH="$JAVA_HOME/bin:$PATH"fireadonly uuid=`date +%s`_${RANDOM}_$$cleanupWhenExit() {rm /tmp/${uuid}_* &> /dev/null}trap"cleanupWhenExit" EXITprintStackOfThreads() {local linelocal count=1while IFS=" "read -a line ; dolocal pid=${line[0]}local threadId=${line[1]}local threadId0x="0x`printf %x ${threadId}`"local user=${line[2]}local pcpu=${line[4]}local jstackFile=/tmp/${uuid}_${pid}        [ ! -f "${jstackFile}" ] && {            {if [ "${user}" == "${USER}" ]; then                    jstack ${pid} > ${jstackFile}elseif [ $UID == 0 ]; then                        sudo -u ${user} jstack ${pid} > ${jstackFile}else                        redEcho "[$((count++))] Fail to jstack Busy(${pcpu}%) thread(${threadId}/${threadId0x}) stack of java process(${pid}) under user(${user})."                        redEcho "User of java process($user) is not current user($USER), need sudo to run again:"                        yellowEcho "    sudo ${COMMAND_LINE[@]}"echocontinuefifi            } || {                redEcho "[$((count++))] Fail to jstack Busy(${pcpu}%) thread(${threadId}/${threadId0x}) stack of java process(${pid}) under user(${user})."echorm${jstackFile}continue            }        }        blueEcho "[$((count++))] Busy(${pcpu}%) thread(${threadId}/${threadId0x}) stack of java process(${pid}) under user(${user}):"        sed "/nid=${threadId0x} /,/^$/p" -n ${jstackFile}done}ps -Leo pid,lwp,user,comm,pcpu --no-headers | {    [ -z "${pid}" ] &&    awk '$4=="java"{print $0}' ||    awk -v "pid=${pid}"'$1==pid,$4=="java"{print $0}'} | sort -k5 -r -n | head --lines "${count}" | printStackOfThreads

相關文章