现象

相同的代码(commitId相同)部署到不同的环境(测试环境, 虚环境),使用swagger测试,相同输入产生了不同的输出

测试环境的输出有值,虚环境输出无值,测试环境与虚环境也没有抛异常

排查经过

1.最开始怀疑是基础架构问题,实际不同机器部署的是不同的代码

步骤一:安装Arthas, 选择进程

登录测试环境机器和虚环境机器,安装Arthas

curl -O https://arthas.aliyun.com/arthas-boot.jar
java -jar arthas-boot.jar

java Arthas查看网络连接 arthas查看异常_java Arthas查看网络连接


此时会出现容器中可用于arthas监控的java进程, 输入数字选择

启动成功会出现下面的提示

java Arthas查看网络连接 arthas查看异常_反编译_02

步骤二:反编译class文件,比对可能出现不同结果的反编译后的java文件异同

jad 命令来反编译Class文件
找到怀疑造成结果差异的java文件路径,在测试环境和虚环境机器上分别执行

jad     com.zhangyu.test.HuaiyiLei
命令  包名.类名 (不需要.class 尾缀)

执行成功会输出反编译后的class文件

java Arthas查看网络连接 arthas查看异常_jar_03


将代码copy出来,测试环境和虚环境分别粘贴到本地的两个文件上 1.txt 2.txt

本地执行命令

diff 1.txt 2.txt

或将两个环境反编译后的代码粘贴到在线文档对比的网址上,比对是否有差异(在线文档对比工具

结果发现并没有不同

步骤三:观察方法的具体调用信息

由于部署的class完全相同,下面考虑方法的外部依赖不同导致了不同的结果
trace 方法内部调用路径,并输出方法路径上的每个节点上耗时
trace

trace com.zhangyu.test.HuaiyiLei huaiyifangfa
命令 包名.类名 方法名
会输出方法的所有调用信息

java Arthas查看网络连接 arthas查看异常_反编译_04

在测试环境和虚环境分别执行trace命令监测怀疑产生问题的方法

虚环境结果:

java Arthas查看网络连接 arthas查看异常_测试环境_05


测试环境结果

java Arthas查看网络连接 arthas查看异常_jar_06


明显发现两个环境调用的方法链路不同,比对调用链路,发现虚环境从63行之后执行的方法与测试环境不同,虚环境很快就返回了,而测试环境后面还执行了一大串方法

查看代码63行发现是一个用调用其他rpc服务方A结果返回判断的逻辑,如果为true直接return, 看了虚环境的执行方法就是在这里返回了,证明虚环境的服务方A和测试环境的服务方A对相同输入产生的输出不同,这时候我才想起我改了A服务的代码只部署到了虚环境,没有部署到测试环境。才导致了此处的不同

结果

虚环境返回的结果是正常的,是测试环境我的服务的依赖服务A返回的结果不正确,同时没有部署正确的代码,导致我的服务结果出现错误了。

Arthas

经过上面的排查,发现Arthas真的很好用,下面是Arthas的具体命令学习

上面的网址可以在网页上通过编辑器手动执行命令,并有配套的命令说明

watch 包名.类名 方法名 returnObj
watch 查看函数的返回值