分布式系统线上排障时,我会先检查的 9 件事
遇到复杂故障时,最重要的不是立刻猜根因,而是快速收拢不确定性。
遇到复杂故障时,最重要的不是立刻猜根因,而是快速收拢不确定性。
线上故障最大的风险,往往不是“修得慢”,而是“越修越乱”。
我会先做一轮非常机械的收敛动作:
先确保所有人看的时间区间一致。没有统一时间线,日志与监控很容易各说各话。
受影响的是单机、单可用区、单租户,还是全局?这个信息会极大影响排查顺序。
包括:
例如:
容量问题通常和压力上升相关,行为问题则可能在流量不变时也突然出现。
差异对比几乎总能带来线索,尤其是在配置、负载、调用链和资源利用率上。
很多系统不是主问题最致命,而是降级策略、重试风暴或缓存击穿把事情放大了。
止血不是投降,而是争取分析空间。
结论应该建立在证据链上,而不是建立在“最像”的直觉上。
正在加载互动内容...