1. 常见故障包括:网络中断(路由/防火墙/链路)、磁盘或存储I/O瓶颈、CPU/内存资源耗尽、操作系统内核崩溃、虚拟化宿主机问题、云平台控制面异常以及服务配置错误(如安全组、负载均衡错误)。在香港机房,跨境链路波动和运营商互联故障也很常见。
2. 先确认是否全区/单实例/单服务受影响:登录云控制台看实例状态、查看监控面板(CPU/网络/磁盘)、尝试从不同地点ping/traceroute实例。命令示例:ping -c 4
3. 采集要点:云控制台事件日志、实例系统日志(/var/log/messages、journalctl -xe)、dmesg、iostat、vmstat、sar、netstat/ss、tcpdump抓包、负载均衡/防火墙日志、应用日志。命令示例:iostat -x 1 5;vmstat 1 5;ss -tunap;tcpdump -i eth0 -w /tmp/capture.pcap。
4. 步骤:A) 验证网络可达性(外部ping、mtr);B) 若网络可达,检查端口/服务(ss/telnet/ curl);C) 若端口响应慢或断开,抓包确认是否有丢包或RST;D) 检查系统资源(top、free -m);E) 检查磁盘I/O(iostat、iotop)。按层次逐步排除网络、主机、应用三大层面故障。

5. 常用命令与判读:top/htop定位进程CPU占用;free -m看内存;iostat -xz 1 3若%util接近100%说明磁盘瓶颈;sar -n DEV查看网卡流量;dmesg | tail检查内核错误如disk error或network driver error;tcpdump可定位TCP三次握手失败或大量重传。
6. 步骤:1) 从多地做mtr/mtr -b -c 50
7. 步骤:1) 用lsblk、df -h确定挂载与使用;2) iostat -xz查看I/O等待(await高、svctm高);3) 检查文件系统错误:umount后运行fsck -y /dev/vdb;4) 若为云盘故障,建议快照备份后在控制台detach/attach或替换云盘,必要时从快照恢复。
8. 若控制台显示宿主机异常或实例被迁移/重启,立即提交工单并提供实例ID、故障时间、抓取的实例控制台日志。若云厂商允许查看宿主机日志,要求提供宿主机dmesg或hypervisor日志以确认是否存在宿主机硬件故障或内核panic。
9. 应急流程:A) 若业务中断,先切换到备用实例或流量回退至CDN/备份LB;B) 若实例可连但服务异常,先重启服务(systemctl restart xxx),检查是否短时恢复;C) 若重启无效,平滑迁移或从快照恢复新实例;D) 所有操作前做好快照/备份。
10. RCA流程:1)事件定义与时间线(记录发生/检测/修复时间);2)影响范围与受影响资源清单;3)数据与证据汇总(监控图、抓包、日志);4)假设形成与验证(例如“磁盘I/O导致服务超时”→验证iostat/dmesg);5)找到直接原因与根本原因(human error/系统设计/供应商问题);6)提出整改与预防措施并落地。
11. 建议:建立完善的监控告警(磁盘I/O、网络丢包、主机状态、进程异常),自动化故障切换(脚本或云服务),定期备份快照与演练恢复,制定SOP与联动流程并与云厂商签订SLA与支持通道。
12. 提交工单时提供:实例ID、故障时间、监控图、抓包/控制台日志、复现步骤、业务影响描述。明确要求(例如:请求核查宿主机硬件、电源、网络链路或要求临时迁移)。保持工单编号并记录回复与处置时间。
13. 常见误区包括:未先备份就直接重装或格式化磁盘、仅重启而不采集证据、忽视跨境链路问题。避免方法:先采集证据再操作、对生产环境采用蓝绿/滚动更新、定期演练恢复流程。
14. 问:如何快速判断是否为云平台控制面问题?
14. 答:同时多实例或多个客户都出现相似不可达且控制台显示宿主机或网络事件、控制台API请求异常、控制台事件日志有维护公告时,优先判断为控制面或宿主机问题。此时不在实例内做破坏性操作,立即联系厂商并提供控制台日志。
15. 问:发生磁盘I/O瓶颈时如何在不重启的情况下缓解?
15. 答:可先暂停或限流高I/O进程(使用ionice/renice或systemctl stop某服务)、临时扩大缓存(调整应用层缓存或增加swap谨慎使用)、如果云盘支持在线扩容可扩容并在线扩展文件系统(resize2fs或xfs_growfs),同时将部分读写负载迁移到备用实例。
16. 问:出现间歇性网络丢包最佳排查第一步是什么?
16. 答:第一步从多点做mtr或ping测试以确认丢包在本地网络还是跨境或云骨干链路;同时在实例上用tcpdump抓包并记录丢包高峰时间点交给云商,以便查找交换设备或链路错误。