AI 集群事故复盘方法¶
事故复盘应解释系统为什么允许故障扩大,而不是寻找最后执行命令的人。AI 平台还要量化损失的 GPU 小时、训练进度、推理请求和模型发布影响。
1. 推荐结构¶
- 摘要:用户影响、持续时间和严重级别;
- 架构:涉及控制面、数据面、模型和外部依赖;
- 时间线:检测、判断、缓解、恢复和验证;
- 触发因素与根因;
- 扩大因素和原有保护;
- 哪些信号缺失或误导;
- 恢复为何有效,以及是否留下隐患;
- 行动项、所有者、截止日期和验证方式。
2. 三个高价值演练题¶
驱动升级导致推理不可用¶
检查 Canary 是否覆盖真实模型、节点滚动是否尊重容量、Runtime 与驱动矩阵是否固定、回滚是否需要重建节点。
模型发布打满对象存储或出口¶
检查是否分批、是否有节点缓存、源站限流、下载重试是否放大流量、Readiness 是否提前成功。
PDB 阻止 GPU 节点维护¶
检查副本、Topology Spread、优雅终止、长请求、维护容量和强制 Drain 的业务后果。
3. AI 特有损失¶
- 丢失的训练步数和 GPU 小时;
- Checkpoint RPO/RTO;
- TTFT/TPOT 与失败请求;
- 错误模型版本或输出质量影响;
- 重复模型下载、跨区流量和额外成本;
- 被抢占租户和队列公平性。
4. 行动项必须可验收¶
“加强监控”“提高意识”不是完整行动项。应写成可测试控制,例如“发布控制器限制每批 10 个节点,CI 故障实验验证源站出流低于阈值”。