分布式存储排障,证据要能回答副本发生了什么

📅 2026/8/19 5:41:46
分布式存储排障,证据要能回答副本发生了什么
分布式存储排障证据要能回答副本发生了什么存储故障排查最怕“日志很多证据不够”。有效证据要能回答发生了什么、影响到哪些副本、系统当时如何决策以及能否复现它也必须避免收集不必要的业务内容和凭据。按事件关联采集优先保留事件 ID、时间戳、节点角色、版本、配置摘要、队列长度、磁盘延迟、网络错误和共识状态。日志使用结构化字段统一时钟来源原始请求、对象名、账号、IP 或 token 只有在排障确实需要且已有访问控制时才采集并应脱敏和设定过期时间。证据要区分事实和推测“leader 切换发生在某个窗口”是事实“切换由慢盘引起”只是待验证假设。排障记录应列出每个假设对应的指标和反证方式。跨节点比较时先确认时钟偏差和采样间隔否则时间线容易误导。{event_id:evt-...,role:follower,disk_latency_bucket:high,replication_lag_bucket:high}示例只保存分桶信息。是否保存更细粒度数据取决于排障价值、权限和数据保留政策。复盘输出复盘至少包含影响范围、已确认事实、未确认假设、缓解动作、恢复验证与后续实验。不要把一次相关性直接写成根因若证据不足明确需要补的观测点或故障演练。