跳转至

实战、排障与选型

这个系列不再按组件解释“它是什么”,而是从一个具体问题出发,给出证据链、实验变量、验收指标和停止条件。页面中的数字应由目标硬件和真实负载实测,示例值不能替代生产基线。

排障与事故

性能、成本与容量

平台和调度

端到端交付

阅读和复现约定

每个实验至少记录:

  1. Kubernetes、驱动、CUDA/ROCm/CANN 和组件版本;
  2. GPU/NPU/TPU、CPU、内存、磁盘和网络拓扑;
  3. 模型、精度、输入输出长度和并发分布;
  4. 冷缓存/热缓存、失败重试和预热状态;
  5. 原始日志、事件、指标、Trace 和时间戳;
  6. 成功标准、失败标准和结果的不适用范围。

复现实验时先修改 Namespace、镜像、StorageClass、资源名和安全策略,不要直接把示例中的权限、镜像标签或云厂商参数复制到生产。