光明日报
Windows常用命令:Get-Process 查看进程;Get-Counter 获取CPU、内存和磁盘计数器;Get-Volume 查看卷空间;Get-NetTCPConnection 查看TCP连接。命令结果需要结合故障发生时间,避免把正常的定时任务误判为异常。
网络连通性检查显示主机可达但业务端口不通时,优先进入服务器内部检查服务是否启动和端口是否监听。网络连通性检查显示端口可通但页面或接口异常时,应停止反复修改防火墙,转🚀而检查应用日志和🌈依赖服务。
Linux常用命令:uptime 查看运行时间和负载;top 或 vmstat 1 5 查看CPU、内存和等待;free -h 查看内存;df -h 与 df -i 查看容量和inode;ss -s 查看连接概况。
检查服务器状态不能只看服务器是否能登录,而应依次确认🎆外部可达性、端口监听、服务进程、CPU与内存、磁盘空间、应用响应和系统日志。远程访问失败时先判断网络路径;可以登录服务器时,再从资源、服务和应用层逐级缩小故障范围。
远程可达性检查可🌺以🔮先区分“请求没有到达服务器”和“请求已经到达但服务没有处理”两类问题。ICMP测试失败不一定代表主机宕机,因为防火墙可能禁止 ping;端口连接失败则需要进一步查看监听状态、访问控制和网络策略。
应用层检查比端口检查更接近用户真实体验,应用层检查应验证请求是否返📌回预期状态、响应时间▶️是否稳定、关键数据是否完整,以及依赖的数据库、缓存、消息队列或第三方服务是否可用。
服务进程检查发现反复重启时,应先查看退出原因、配置变更、权限、证书、依赖组件和资源限制。配置文件有专用语法检查命令时,先进行配置校验,再决定是否重载或重启;不要在没有保留日志的情况下连续重启。
再次检查服务器状态时,应重复验证外部连接、端口监听、服务进程、资源曲线、应用响应和新增日志。短暂恢复不等于故障结束;如果服务恢复后资源继续上涨、错误日志继续增加或响应时间再次恶化,就需要继续追踪触发条件,而不是仅记录一次“服务已启动”。