跳转至

工程案例

这里收录真实环境中的实施与排障记录。专题文档回答“通常应该怎样设计”,案例则保留特定版本、硬件、约束、操作过程和验证结果,用来展示这些方法在具体环境中怎样落地。

查看集群组件清单 查看 K3s 集群升级案例 返回完整技术地图

案例索引

  • AI/LLM 集群组件清单

    按最小 GPU 闭环、多租户训练、Ray、大数据、高可用推理和分离式推理拆分组件包,逐项说明需要什么、为什么需要、什么时候可以不安装,以及如何验收。

    查看组件清单

  • K3s 集群跨版本升级与 DRA 预检

    在一台真实 K3s 单节点集群上,从 v1.32.5+k3s1 逐小版本升级到 v1.36.2+k3s1,记录备份、cgroup v1 兼容、网络组件恢复、工作负载验证,以及 DRA 与异构 GPU 管理预检。

    查看案例概览 · 阅读完整报告

案例与专题的区别

内容类型 主要回答 使用方式
专题文档 架构边界、通用方法、选型条件和生产检查项 用于设计新平台或建立团队标准
实验指南 怎样在受控环境复现一个最小闭环 用于学习、验证组件和建立基线
工程案例 在一个明确环境里发生了什么、怎样处理、结果如何 用于参考路径、识别风险,不能原样照搬

案例中的版本号、地址、资源规模和兼容方案都有环境边界。复用时应先回到对应专题核对当前上游文档,再根据自己的集群版本、数据存储、网络、硬件和回滚要求重新制定步骤。

收录标准

每个案例尽量保留:

  • 背景、目标、时间和适用边界;
  • 升级或变更前的环境基线;
  • 风险评估、备份与回滚方案;
  • 关键操作、异常、判断依据和修复过程;
  • 变更后的功能、性能和工作负载验证;
  • 已完成事项、遗留风险与后续建议;
  • 可复用经验与仅适用于该环境的特殊处理。

案例会与通用专题分开维护,避免把一次成功操作误解为所有环境的标准答案。