跳转至

AI 集群事故复盘方法

事故复盘应解释系统为什么允许故障扩大,而不是寻找最后执行命令的人。AI 平台还要量化损失的 GPU 小时、训练进度、推理请求和模型发布影响。

1. 推荐结构

  1. 摘要:用户影响、持续时间和严重级别;
  2. 架构:涉及控制面、数据面、模型和外部依赖;
  3. 时间线:检测、判断、缓解、恢复和验证;
  4. 触发因素与根因;
  5. 扩大因素和原有保护;
  6. 哪些信号缺失或误导;
  7. 恢复为何有效,以及是否留下隐患;
  8. 行动项、所有者、截止日期和验证方式。

2. 三个高价值演练题

驱动升级导致推理不可用

检查 Canary 是否覆盖真实模型、节点滚动是否尊重容量、Runtime 与驱动矩阵是否固定、回滚是否需要重建节点。

模型发布打满对象存储或出口

检查是否分批、是否有节点缓存、源站限流、下载重试是否放大流量、Readiness 是否提前成功。

PDB 阻止 GPU 节点维护

检查副本、Topology Spread、优雅终止、长请求、维护容量和强制 Drain 的业务后果。

3. AI 特有损失

  • 丢失的训练步数和 GPU 小时;
  • Checkpoint RPO/RTO;
  • TTFT/TPOT 与失败请求;
  • 错误模型版本或输出质量影响;
  • 重复模型下载、跨区流量和额外成本;
  • 被抢占租户和队列公平性。

4. 行动项必须可验收

“加强监控”“提高意识”不是完整行动项。应写成可测试控制,例如“发布控制器限制每批 10 个节点,CI 故障实验验证源站出流低于阈值”。

延伸阅读:平台运维可靠性安全治理