跳转至

AI/LLM on Kubernetes 基础设施知识库

Hi~你好👋, 这里是 runzhliu 的工作笔记,我是一名在 AI/LLM/大数据/Kubernetes 领域工作了十年的工程师,同时我也是一个记录狂人🤔,特别爱记笔记,这个站点是我基于这几年在 AI/LLM Infras 的工作经历总结的一些笔记,同时也经过一些大模型的润色发布的,希望和大家一起交流和学习,一起在大模型时代做一点🤏小事,无论是内容本身还是工作,欢迎大家找我交流😄👏!(runzhliu@163.com)

这是一套面向平台工程师、SRE、数据平台、训练和模型服务团队的工程文档,系统整理 AI/LLM 工作负载运行在 Kubernetes 上需要的基础设施知识。

内容从 GPU 节点、异构设备、大数据、调度队列、RDMA 和数据供给开始,延伸到分布式训练、LLM 推理、RAG、Agent 沙箱、可观测性、安全、成本和生产运维。每个专题尽量说明组件边界、选型条件、关键指标、故障路径和上线检查,而不只是罗列项目名称。

进入完整技术地图 查看生产参考架构 实战与排障 浏览工程案例 RSS 订阅

常用官方网站

按技术层次整理的官方文档直达入口。项目能力、版本兼容性和安装方式变化较快,使用时以官方文档与目标版本的 Release Notes 为准。

文档覆盖范围

  • 集群与加速器

    理解 AI 工作负载从 Kubernetes API 到节点驱动、容器运行时和 GPU 的完整路径,建立可重复的节点验收和异构设备管理方式。

    从基础架构开始

  • 大数据、调度与分布式训练

    处理 Spark/Flink/Kafka/Lakehouse、资源声明、队列准入、Gang Scheduling、RDMA、数据加载、Checkpoint 和故障恢复。

    查看大数据基础设施

  • LLM 推理与 RAG

    覆盖推理引擎、批处理、KV Cache、量化、智能路由、Prefill/Decode 分离,以及向量检索和权限过滤。

    查看推理技术地图

  • 平台工程与生产运维

    用版本矩阵、基准测试、SLO、可观测性、安全策略、容量模型和发布门禁保持平台长期可运行。

    查看平台运维体系

按你的任务开始

当前任务 建议阅读路径
第一次系统了解 AI on Kubernetes Kubernetes 如何承载 AI集群架构设计完整技术地图
建设 GPU 或异构算力集群 GPU 节点软件栈设备管理GPU 调度
建设 GPU Notebook 开发平台 Notebook 平台与存储数据与缓存MLOps
建设大数据与 AI 数据平台 大数据 on Kubernetes数据与缓存模型制品MLOps
建设多租户训练平台 队列与多租户分布式训练RDMA 网络可靠性
建设 Ray 大模型平台 Ray 训练与推理分布式训练可靠性
建设 LLM 在线推理平台 推理平台总览引擎选型Serving 框架API 中转与网关选型智能路由Higress 实战
建设 RAG 或 Agent 服务 Agent 现状与趋势Agent HarnessHarnessRouterRAG 基础设施Agent Sandbox 选型安全治理
负责稳定性、成本和容量 可观测性性能基准成本与容量落地路线图

核心专题

计算与集群

调度、网络与数据

训练与推理

应用基础设施与治理

可直接使用的参考材料

实战案例

工程案例 单独收录可执行清单和真实环境记录。其中 AI/LLM 集群组件清单 用于确定建设范围,K3s 集群升级与 DRA 预检 保存了一次真实环境的版本跨度评估、备份、兼容性检查、升级和验证过程。

内容标准

  • 优先使用 Kubernetes SIG、项目官方文档和公开规范等一手资料。
  • 区分稳定原理、快速演进的上游能力和仅用于学习的实验配置。
  • 选型结论必须落到吞吐、延迟、可靠性、成本、安全或运维复杂度。
  • 示例必须能说明验证方法;生产落地还要补齐版本固定、权限、密钥、容量、备份和回滚。
  • 保留已有页面地址,新增内容按主题目录组织,避免链接随导航调整而失效。

建议先进入 完整技术地图,再按当前角色选择一条阅读路径。

关注微信公众号

更多 AI/LLM on Kubernetes 实战、部署记录与性能分析会同步到微信公众号 AI-K8S技术工程。使用微信扫描二维码,或在“微信搜一搜”中搜索 AI-K8S技术工程

扫描二维码或通过微信搜一搜关注公众号 AI-K8S技术工程