阿里内部的那个牛逼带闪电的Java诊断工具终于开源了

阅读 5180
收藏 82
2018-12-03
原文链接:mp.weixin.qq.com

在阿里巴巴内部,有很多自研工具供开发者使用,其中有一款工具,是几乎每个Java开发都使用过的工具,那就是Arthas,这是一款Java诊断工具,是一款牛逼带闪电的工具。该工具已于2018年9月份开源。

GitHub地址:https://github.com/alibaba/arthas用户文档:https://alibaba.github.io/arthas/

在日常开发中,你是否遇到过以下问题:

这个类从哪个 jar 包加载的?为什么会报各种类相关的 Exception?

我改的代码为什么没有执行到?难道是我没 commit?分支搞错了?

遇到问题无法在线上 debug,难道只能通过加日志再重新发布吗?

线上遇到某个用户的数据处理有问题,但线上同样无法 debug,线下无法重现!

是否有一个全局视角来查看系统的运行状况?

有什么办法可以监控到JVM的实时运行状态?

以上问题,通通可以通过Arthas来进行问题诊断!!!是不是很好很强大。

Arthas支持JDK 6+,采用命令行交互模式,同时提供丰富的 Tab 自动补全功能,进一步方便进行问题的定位和诊断。

Arthas安装

1、使用arthas-boot安装

下载arthas-boot.jar,然后用java -jar的方式启动:

wget https://alibaba.github.io/arthas/arthas-boot.jarjava -jar arthas-boot.jar

打印帮助信息:

java -jar arthas-boot.jar -h

如果下载速度比较慢,可以使用aliyun的镜像:

java -jar arthas-boot.jar --repo-mirror aliyun --use-http

2、使用as.sh安装

Arthas 支持在 Linux/Unix/Mac 等平台上一键安装,请复制以下内容,并粘贴到命令行中,敲 回车 执行即可:

curl -L https://alibaba.github.io/arthas/install.sh | sh

上述命令会下载启动脚本文件 as.sh 到当前目录,你可以放在任何地方或将其加入到 $PATH 中。

直接在shell下面执行./as.sh,就会进入交互界面。

也可以执行./as.sh -h来获取更多参数信息。

快速入门

1. 启动Demo

wget https://alibaba.github.io/arthas/arthas-demo.jarjava -jar arthas-demo.jar

arthas-demo是一个简单的程序,每隔一秒生成一个随机数,再执行质因式分解,并打印出分解结果。

2. 启动arthas

在命令行下面执行:

wget https://alibaba.github.io/arthas/arthas-boot.jarjava -jar arthas-boot.jar
  • 执行该程序的用户需要和目标进程具有相同的权限。比如以admin用户来执行:sudo su admin && java -jar arthas-boot.jar 或 sudo -u admin -EH java -jar arthas-boot.jar

  • 如果attatch不上目标进程,可以查看~/logs/arthas/ 目录下的日志。

  • 如果下载速度比较慢,可以使用aliyun的镜像:java -jar arthas-boot.jar --repo-mirror aliyun --use-http

  • java -jar arthas-boot.jar -h 打印更多参数信息。

选择应用java进程:

$ $ java -jar arthas-boot.jar* [1]: 35542  [2]: 71560 arthas-demo.jar

Demo进程是第2个,则输入2,再输入回车/enter。Arthas会attach到目标进程上,并输出日志:

[INFO] Try to attach process 71560[INFO] Attach process 71560 success.[INFO] arthas-client connect 127.0.0.1 3658  ,---.  ,------. ,--------.,--.  ,--.  ,---.   ,---. /  O  \ |  .--. ''--.  .--'|  '--'  | /  O  \ '   .-'|  .-.  ||  '--'.'   |  |   |  .--.  ||  .-.  |`.  `-.|  | |  ||  |\  \    |  |   |  |  |  ||  | |  |.-'    |`--' `--'`--' '--'   `--'   `--'  `--'`--' `--'`-----'wiki: https://alibaba.github.io/arthasversion: 3.0.5.20181127201536pid: 71560time: 2018-11-28 19:16:24$

3. 查看dashboard

输入dashboard,按enter/回车,会展示当前进程的信息,按ctrl+c可以中断执行。

$ dashboardID     NAME                   GROUP          PRIORI STATE  %CPU    TIME   INTERRU DAEMON17     pool-2-thread-1        system         5      WAITIN 67      0:0    false   false27     Timer-for-arthas-dashb system         10     RUNNAB 32      0:0    false   true11     AsyncAppender-Worker-a system         9      WAITIN 0       0:0    false   true9      Attach Listener        system         9      RUNNAB 0       0:0    false   true3      Finalizer              system         8      WAITIN 0       0:0    false   true2      Reference Handler      system         10     WAITIN 0       0:0    false   true4      Signal Dispatcher      system         9      RUNNAB 0       0:0    false   true26     as-command-execute-dae system         10     TIMED_ 0       0:0    false   true13     job-timeout            system         9      TIMED_ 0       0:0    false   true1      main                   main           5      TIMED_ 0       0:0    false   false14     nioEventLoopGroup-2-1  system         10     RUNNAB 0       0:0    false   false18     nioEventLoopGroup-2-2  system         10     RUNNAB 0       0:0    false   false23     nioEventLoopGroup-2-3  system         10     RUNNAB 0       0:0    false   false15     nioEventLoopGroup-3-1  system         10     RUNNAB 0       0:0    false   falseMemory             used   total max    usage GCheap               32M    155M  1820M  1.77% gc.ps_scavenge.count  4ps_eden_space      14M    65M   672M   2.21% gc.ps_scavenge.time(m 166ps_survivor_space  4M     5M    5M           s)ps_old_gen         12M    85M   1365M  0.91% gc.ps_marksweep.count 0nonheap            20M    23M   -1           gc.ps_marksweep.time( 0code_cache         3M     5M    240M   1.32% ms)Runtimeos.name                Mac OS Xos.version             10.13.4java.version           1.8.0_162java.home              /Library/Java/JavaVir                       tualMachines/jdk1.8.0                       _162.jdk/Contents/Hom                       e/jre

4. 通过sysenv命令来获取到进程的Main Class

$ sysenv | grep MAIN JAVA_MAIN_CLASS_71560              demo.MathGame

5. 通过jad来反编绎Main Class

$ jad demo.MathGameClassLoader:+-sun.misc.Launcher$AppClassLoader@3d4eac69  +-sun.misc.Launcher$ExtClassLoader@66350f69Location:/tmp/arthas-demo.jar/* * Decompiled with CFR 0_132. */package demo;import java.io.PrintStream;import java.util.ArrayList;import java.util.Iterator;import java.util.List;import java.util.Random;import java.util.concurrent.TimeUnit;public class MathGame {    private static Random random = new Random();    private int illegalArgumentCount = 0;    public static void main(String[] args) throws InterruptedException {        MathGame game = new MathGame();        do {            game.run();            TimeUnit.SECONDS.sleep(1L);        } while (true);    }    public void run() throws InterruptedException {        try {            int number = random.nextInt();            List<Integer> primeFactors = this.primeFactors(number);            MathGame.print(number, primeFactors);        }        catch (Exception e) {            System.out.println(String.format("illegalArgumentCount:%3d, ", this.illegalArgumentCount) + e.getMessage());        }    }    public static void print(int number, List<Integer> primeFactors) {        StringBuffer sb = new StringBuffer("" + number + "=");        Iterator<Integer> iterator = primeFactors.iterator();        while (iterator.hasNext()) {            int factor = iterator.next();            sb.append(factor).append('*');        }        if (sb.charAt(sb.length() - 1) == '*') {            sb.deleteCharAt(sb.length() - 1);        }        System.out.println(sb);    }    public List<Integer> primeFactors(int number) {        if (number < 2) {            ++this.illegalArgumentCount;            throw new IllegalArgumentException("number is: " + number + ", need >= 2");        }        ArrayList<Integer> result = new ArrayList<Integer>();        int i = 2;        while (i <= number) {            if (number % i == 0) {                result.add(i);                number /= i;                i = 2;                continue;            }            ++i;        }        return result;    }}Affect(row-cnt:1) cost in 970 ms.

6. watch

通过watch命令来查看demo.MathGame#primeFactors函数的返回值:

$ watch demo.MathGame primeFactors returnObjPress Ctrl+C to abort.Affect(class-cnt:1 , method-cnt:1) cost in 107 ms.ts=2018-11-28 19:22:30; [cost=1.715367ms] result=nullts=2018-11-28 19:22:31; [cost=0.185203ms] result=nullts=2018-11-28 19:22:32; [cost=19.012416ms] result=@ArrayList[    @Integer[5],    @Integer[47],    @Integer[2675531],]ts=2018-11-28 19:22:33; [cost=0.311395ms] result=@ArrayList[    @Integer[2],    @Integer[5],    @Integer[317],    @Integer[503],    @Integer[887],]ts=2018-11-28 19:22:34; [cost=10.136007ms] result=@ArrayList[    @Integer[2],    @Integer[2],    @Integer[3],    @Integer[3],    @Integer[31],    @Integer[717593],]ts=2018-11-28 19:22:35; [cost=29.969732ms] result=@ArrayList[    @Integer[5],    @Integer[29],    @Integer[7651739],]

5. 退出arthas

如果只是退出当前的连接,可以用quit或者exit命令。Attach到目标进程上的arthas还会继续运行,端口会保持开放,下次连接时可以直接连接上。

如果想完全退出arthas,可以执行shutdown命令。

常用命令

基础命令

  • help——查看命令帮助信息

  • cls——清空当前屏幕区域

  • session——查看当前会话的信息

  • reset——重置增强类,将被 Arthas 增强过的类全部还原,Arthas 服务端关闭时会重置所有增强过的类

  • version——输出当前目标 Java 进程所加载的 Arthas 版本号

  • quit——退出当前 Arthas 客户端,其他 Arthas 客户端不受影响

  • shutdown——关闭 Arthas 服务端,所有 Arthas 客户端全部退出

  • keymap——Arthas快捷键列表及自定义快捷键

  

 jvm相关

  • dashboard——当前系统的实时数据面板

  • thread——查看当前 JVM 的线程堆栈信息

  • jvm——查看当前 JVM 的信息

  • sysprop——查看和修改JVM的系统属性

  • New! getstatic——查看类的静态属性

class/classloader相关

  • sc——查看JVM已加载的类信息

  • sm——查看已加载类的方法信息

  • dump——dump 已加载类的 byte code 到特定目录

  • redefine——加载外部的.class文件,redefine到JVM里

  • jad——反编译指定已加载类的源码

  • classloader——查看classloader的继承树,urls,类加载信息,使用classloader去getResource

monitor/watch/trace相关

  • monitor——方法执行监控

  • watch——方法执行数据观测

  • trace——方法内部调用路径,并输出方法路径上的每个节点上耗时

  • stack——输出当前方法被调用的调用路径

  • tt——方法执行数据的时空隧道,记录下指定方法每次调用的入参和返回信息,并能对这些不同的时间下调用进行观测

请注意,这些命令,都通过字节码增强技术来实现的,会在指定类的方法中插入一些切面来实现数据统计和观测,因此在线上、预发使用时,请尽量明确需要观测的类、方法以及条件,诊断结束要执行 shutdown 或将增强过的类执行 reset 命令。

options

  • options——查看或设置Arthas全局开关

管道

        Arthas支持使用管道对上述命令的结果进行进一步的处理,如sm org.apache.log4j.Logger | grep

        

  • grep——搜索满足条件的结果

  • plaintext——将命令的结果去除颜色

  • wc——按行统计输出结果

以上,就是关于Arthas的简单介绍,要想真正的融会贯通,真正的把他作为一个排查问题的利器,还需要自己动手实践下!所谓实践出真知。

Hollis公众号的文章已经授权<维权骑士>进行原创维权,为避免不必要的版权追责问题,转载请注明出处!

2018年最后一个月,Hollis的知识星球限时折扣中。深入理解Java中的并发编程:到底什么是线程安全?欢迎您的加入。

 

直面Java第175期:什么是Java8 中的LocalDate和localTime?

成神之路第015期:深入学习Java中的枚举。

- MORE | 更多精彩文章 -

如果你喜欢本文。

请长按二维码,关注Hollis

转发朋友圈,是对我最大的支持。

评论