参考消息
检查服务器状态可以先确定故障范围,再根据操作系统执行对应命令。🌟Linux 服务器适合使用终端命令查看服务、端口、负载和日志;Windows 服务器可以结合服务管理器、任务管理器、PowerShell 和事件查看器完成相同判断。
服务反复重✨启时,应同时查看服务管理日志和应用日志。服务管理日志能够说明进程是否退出、退出码是什么以及是否触发自动重启;应用日志能够说明进程退出前正在🤔处理什么任务。只重启服务而不记录首次报错时间,容易让原始证据被后续启动日志覆盖。
当网络、服务、资源和日志结果互相印☀️证时,才适合执行重启、回滚、扩容或修改配置。没有证据时不宜连续重启多个组件,也不宜直接删除日志或批量终止进程,否则可能扩大影响并丢失后续定位所需的信息。
服务器资源检查需要同时观察当前值和变化趋势。Linux 服务器可以使用 uptime 查看运行时间与负载,使用 top 或 htop 查看进程消耗,使用 free -h 查看内存,使用 df -h 查看磁盘空间,使用 df -i 查看 inode 使用率。
CPU 负载持续升高时,应进一步确认💫是单个进程占用过高,还是大量请求、定时任务或磁盘等待造成。负载数值不能脱离 CPU 核心📢数量单独判断,短时间的峰值未必代表故障,持续升高并伴随请求变慢才具有更强的排查价值。
服务管理器显示“正在运行”并不等于业务可以访问。服务可🎉能启动后立即进入异常重启,可能只监听本机地址,也可能因为配置错误🤔而无法处理请求。因此,服务状态、进程状态、监听状态和实际访问结果需要互相验证。
应用可用性检查必须从真实请求结果判断。端口处于监听状态,只能说明网络连接已经交给某个进程;应用仍可能因为线程池耗尽、数据库连接池耗尽、后端超时、权限异常或业务数据错误而无法正常返回。