<?xml version='1.0' encoding='utf-8'?>
<feed xmlns="http://www.w3.org/2005/Atom">
  <title>AI/LLM on Kubernetes 基础设施</title>
  <id>https://aik8s.run/</id>
  <updated>2026-08-11T09:01:41.531451+00:00</updated>
  <subtitle>GPU、大数据、调度、训练、推理、RAG、Agent 与生产运维</subtitle>
  <link href="https://aik8s.run/" rel="alternate" />
  <link href="https://aik8s.run/atom.xml" rel="self" type="application/atom+xml" />
  <entry>
    <title>GPU Notebook platform evolution figures</title>
    <id>https://aik8s.run/assets/practices/gpu-notebook-platform-evolution/README/</id>
    <link href="https://aik8s.run/assets/practices/gpu-notebook-platform-evolution/README/" />
    <updated>2026-08-11T09:01:01+00:00</updated>
    <summary>The three article figures are generated by scripts/generategpunotebookfigures.py.</summary>
    <category term="assets" />
  </entry>
  <entry>
    <title>大模型时代 GPU 开发平台踩坑记</title>
    <id>https://aik8s.run/ai-k8s/practices/gpu-notebook-platform-evolution/</id>
    <link href="https://aik8s.run/ai-k8s/practices/gpu-notebook-platform-evolution/" />
    <updated>2026-08-11T09:01:01+00:00</updated>
    <summary>从 JupyterHub/KubeSpawner、code-server 和组级八卡共享，走到 Ceph RBD、CephFS、Workspace Operator 与 KubeVirt 根盘的真实演进</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>实战、排障与选型</title>
    <id>https://aik8s.run/ai-k8s/practices/</id>
    <link href="https://aik8s.run/ai-k8s/practices/" />
    <updated>2026-08-11T09:01:01+00:00</updated>
    <summary>用可复现的实验、性能数字、事故证据和决策树回答 AI/LLM on Kubernetes 的高频问题</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>大模型时代的 GPU Notebook 平台与存储选型</title>
    <id>https://aik8s.run/ai-k8s/development/gpu-notebook-platform/</id>
    <link href="https://aik8s.run/ai-k8s/development/gpu-notebook-platform/" />
    <updated>2026-08-11T09:01:01+00:00</updated>
    <summary>从 JupyterHub、Kubeflow 和托管 Workbench，到整卡、MIG、共享 GPU、用户 Home、对象存储与本地缓存的生产选型</summary>
    <category term="development" />
  </entry>
  <entry>
    <title>OpenClaw 作为企业 Agent 平台底座：优缺点与二次开发边界</title>
    <id>https://aik8s.run/ai-k8s/rag-agent/openclaw-enterprise-agent-platform/</id>
    <link href="https://aik8s.run/ai-k8s/rag-agent/openclaw-enterprise-agent-platform/" />
    <updated>2026-08-11T00:00:00+00:00</updated>
    <summary>分析 OpenClaw 的可复用能力、企业平台缺口、安全风险、推荐架构和采用决策</summary>
    <category term="rag-agent" />
  </entry>
  <entry>
    <title>AI Agent、沙箱与工具执行</title>
    <id>https://aik8s.run/ai-k8s/agentic-workloads/</id>
    <link href="https://aik8s.run/ai-k8s/agentic-workloads/" />
    <updated>2026-08-10T16:16:11+00:00</updated>
    <summary>Agent 工作负载的运行时隔离、网络、身份、工具权限和审计设计</summary>
    <category term="ai-k8s" />
  </entry>
  <entry>
    <title>AI/LLM on Kubernetes 基础设施</title>
    <id>https://aik8s.run/ai-k8s/</id>
    <link href="https://aik8s.run/ai-k8s/" />
    <updated>2026-08-10T16:16:11+00:00</updated>
    <summary>从加速器、大数据和集群，到训练、推理、RAG、Agent 与生产运维的完整技术地图</summary>
    <category term="ai-k8s" />
  </entry>
  <entry>
    <title>AI/LLM on Kubernetes 基础设施</title>
    <id>https://aik8s.run/</id>
    <link href="https://aik8s.run/" />
    <updated>2026-08-10T16:16:11+00:00</updated>
    <summary>面向平台工程师、SRE、数据平台和模型服务团队的 AI/LLM 基础设施工程文档</summary>
    <category term="首页" />
  </entry>
  <entry>
    <title>2026 年 AI Agent 现状、实现原理与趋势</title>
    <id>https://aik8s.run/ai-k8s/rag-agent/agent-landscape-2026/</id>
    <link href="https://aik8s.run/ai-k8s/rag-agent/agent-landscape-2026/" />
    <updated>2026-08-10T14:47:14+00:00</updated>
    <summary>主流编程、浏览器与企业 Agent 的产品格局、实现原理、开发框架、风险和演进趋势</summary>
    <category term="rag-agent" />
  </entry>
  <entry>
    <title>DeepSeek-V4-Flash-0731 的 H20 部署与压测</title>
    <id>https://aik8s.run/ai-k8s/practices/deepseek-v4-flash-h20-evaluation/</id>
    <link href="https://aik8s.run/ai-k8s/practices/deepseek-v4-flash-h20-evaluation/" />
    <updated>2026-08-10T12:13:31+00:00</updated>
    <summary>记录 DeepSeek-V4-Flash-0731 在单机八卡 H20 上的资源条件、vLLM 启动流程、性能基线、同 Pod PD 分离实测与 OpenWebUI 对接方法</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>RBG 多角色推理编排：从 CPU 控制面到生产 GPU 实测</title>
    <id>https://aik8s.run/ai-k8s/practices/rbg-existing-cluster/</id>
    <link href="https://aik8s.run/ai-k8s/practices/rbg-existing-cluster/" />
    <updated>2026-08-10T11:58:43+00:00</updated>
    <summary>在 Kubernetes 1.30 集群部署 RoleBasedGroup，实测角色依赖、服务发现、扩缩、自愈、Ray 两机推理和 NIXL P/D 分离，并以相同镜像与模型对比 RBG 和 AIBrix</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>AIBrix 真实 GPU 实测：从两机推理到八节点碎片 GPU</title>
    <id>https://aik8s.run/ai-k8s/practices/aibrix-gpu-multinode-pd-production/</id>
    <link href="https://aik8s.run/ai-k8s/practices/aibrix-gpu-multinode-pd-production/" />
    <updated>2026-08-08T13:22:34+00:00</updated>
    <summary>在生产 Kubernetes 集群使用 NVIDIA L20、AIBrix v0.7.0、RayClusterFleet、StormService 和 vLLM，验证两机模型并行、NIXL P/D 分离、八节点 Qwen3-235B FP8，以及 DeepSeek 70B 的四节点单卡、两节点双卡和单节点四卡拓扑</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>在 Kubernetes 部署 ComfyUI：离线镜像、CephFS 模型与跨集群 Ingress</title>
    <id>https://aik8s.run/ai-k8s/practices/comfyui-minimax-h3-gpu/</id>
    <link href="https://aik8s.run/ai-k8s/practices/comfyui-minimax-h3-gpu/" />
    <updated>2026-08-08T12:42:42+00:00</updated>
    <summary>使用 NVIDIA GPU、只读 CephFS、ComfyUI extra_model_paths、Init Container 模型别名及双层 Ingress，在受限网络 Kubernetes 环境提供 MiniMax-H3 工作流页面</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>在既有 Kubernetes 集群落地 AIBrix：路由、P/D、自动扩缩容与可观测性实测</title>
    <id>https://aik8s.run/ai-k8s/practices/aibrix-existing-cluster/</id>
    <link href="https://aik8s.run/ai-k8s/practices/aibrix-existing-cluster/" />
    <updated>2026-08-08T02:16:47+00:00</updated>
    <summary>在 Kubernetes 1.30 集群安装 AIBrix v0.7.0，用 CPU mock 跑通模型路由、P/D、StormService、自动扩缩容、Prometheus 指标和 Higress 两层网关串联</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>GPU 节点故障图鉴</title>
    <id>https://aik8s.run/ai-k8s/practices/gpu-failure-atlas/</id>
    <link href="https://aik8s.run/ai-k8s/practices/gpu-failure-atlas/" />
    <updated>2026-08-08T02:02:56+00:00</updated>
    <summary>用 XID、ECC、NVLink、掉卡、NCCL、RDMA 和 kubelet 证据定位 GPU 故障</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>Higress AI Gateway：架构、安装与 AIBrix 接入实战</title>
    <id>https://aik8s.run/ai-k8s/inference/higress-ai-gateway/</id>
    <link href="https://aik8s.run/ai-k8s/inference/higress-ai-gateway/" />
    <updated>2026-08-07T21:59:40+00:00</updated>
    <summary>在既有 Kubernetes 集群隔离安装 Higress，理解 Controller、Gateway、Console、AI Proxy 与可观测插件，并设计 Higress 和 AIBrix 的同集群及跨集群链路</summary>
    <category term="inference" />
  </entry>
  <entry>
    <title>SGLang Model Gateway CPU 实战</title>
    <id>https://aik8s.run/ai-k8s/practices/sglang-model-gateway-cpu-lab/</id>
    <link href="https://aik8s.run/ai-k8s/practices/sglang-model-gateway-cpu-lab/" />
    <updated>2026-08-07T09:53:15+00:00</updated>
    <summary>在没有 GPU 的 Kubernetes 1.30 集群部署 SGLang Router 和两个 OpenAI-Compatible Mock Worker，实测动态发现、轮询、摘除恢复与 Prometheus 指标</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>LLM 推理引擎选型</title>
    <id>https://aik8s.run/ai-k8s/inference/engines/</id>
    <link href="https://aik8s.run/ai-k8s/inference/engines/" />
    <updated>2026-08-07T09:53:15+00:00</updated>
    <summary>对比 vLLM、SGLang、TensorRT-LLM、Triton、llama.cpp 等引擎的能力、边界和 Kubernetes 集成方式</summary>
    <category term="inference" />
  </entry>
  <entry>
    <title>多机与分离式 LLM 推理</title>
    <id>https://aik8s.run/ai-k8s/inference/distributed-serving/</id>
    <link href="https://aik8s.run/ai-k8s/inference/distributed-serving/" />
    <updated>2026-08-07T09:53:15+00:00</updated>
    <summary>设计多机模型副本、LeaderWorkerSet、Prefill/Decode 分离和 KV 传输，并对比 AIBrix、llm-d、KServe、Dynamo、Ray Serve 与 vLLM Production Stack</summary>
    <category term="inference" />
  </entry>
  <entry>
    <title>AI Gateway、推理路由与流量治理</title>
    <id>https://aik8s.run/ai-k8s/inference/gateway-routing/</id>
    <link href="https://aik8s.run/ai-k8s/inference/gateway-routing/" />
    <updated>2026-08-06T12:12:15+00:00</updated>
    <summary>区分 API Gateway、Gateway API Inference Extension 和模型请求调度，设计认证、配额、缓存感知和发布策略</summary>
    <category term="inference" />
  </entry>
  <entry>
    <title>GPU 资源银行与潮汐推理平台实践蓝图</title>
    <id>https://aik8s.run/ai-k8s/practices/gpu-resource-bank-tidal-platform/</id>
    <link href="https://aik8s.run/ai-k8s/practices/gpu-resource-bank-tidal-platform/" />
    <updated>2026-08-05T10:14:41+00:00</updated>
    <summary>用 Kueue 或 Volcano 实现业务组 GPU 配额互借，结合 KServe、AIBrix、KEDA 与 vLLM 构建实时和定时弹性，并建立从硬件健康到单位 Token 成本的可观测闭环</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>KubeVirt 单节点桌面实战：本地盘、CDI 与浏览器 noVNC</title>
    <id>https://aik8s.run/ai-k8s/practices/kubevirt-local-desktop-lab/</id>
    <link href="https://aik8s.run/ai-k8s/practices/kubevirt-local-desktop-lab/" />
    <updated>2026-08-05T07:07:09+00:00</updated>
    <summary>在没有 Ceph 的 Kubernetes 集群中，把 KubeVirt VM 限制到单个节点，使用本地盘保存完整系统环境，并通过受限 noVNC 网关从浏览器访问桌面</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>用 KubeVirt 与 Ceph RBD 构建持久 GPU Notebook</title>
    <id>https://aik8s.run/ai-k8s/practices/kubevirt-rbd-notebook/</id>
    <link href="https://aik8s.run/ai-k8s/practices/kubevirt-rbd-notebook/" />
    <updated>2026-08-05T00:17:27+00:00</updated>
    <summary>为每个用户提供带独立 RBD 根盘的持久 Linux 工作站，覆盖宿主机准备、KubeVirt/CDI、GPU 直通、快照、故障恢复和生产验收</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>Spot GPU 与 Checkpoint 恢复实验</title>
    <id>https://aik8s.run/ai-k8s/practices/spot-checkpoint/</id>
    <link href="https://aik8s.run/ai-k8s/practices/spot-checkpoint/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>测量抢占通知、Checkpoint、重排队和训练恢复的真实成本收益</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>Prefill/Decode 分离的性能拐点</title>
    <id>https://aik8s.run/ai-k8s/practices/pd-break-even/</id>
    <link href="https://aik8s.run/ai-k8s/practices/pd-break-even/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>用双池容量、KV 传输和真实负载判断 P/D 分离是否值得</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>从 Ollama 到 Kubernetes 生产推理</title>
    <id>https://aik8s.run/ai-k8s/practices/ollama-to-production/</id>
    <link href="https://aik8s.run/ai-k8s/practices/ollama-to-production/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>把本地模型验证迁移为可压测、可灰度、可观测的 vLLM/KServe 服务</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>模型显存与并发容量计算器</title>
    <id>https://aik8s.run/ai-k8s/practices/model-memory-calculator/</id>
    <link href="https://aik8s.run/ai-k8s/practices/model-memory-calculator/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>估算模型权重、KV Cache、运行时开销、最大并发和单位 Token 成本</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>70B 模型向百节点分发</title>
    <id>https://aik8s.run/ai-k8s/practices/model-distribution-100-nodes/</id>
    <link href="https://aik8s.run/ai-k8s/practices/model-distribution-100-nodes/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>为 TB 级模型和百节点推理池设计 Registry、对象存储、P2P 与节点缓存实验</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>GPU 利用率为什么很低</title>
    <id>https://aik8s.run/ai-k8s/practices/low-gpu-utilization/</id>
    <link href="https://aik8s.run/ai-k8s/practices/low-gpu-utilization/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>从数据、CPU、通信、内核、批处理和平台指标定位 GPU 空转</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>Kueue 与 Volcano 对比实验</title>
    <id>https://aik8s.run/ai-k8s/practices/kueue-vs-volcano/</id>
    <link href="https://aik8s.run/ai-k8s/practices/kueue-vs-volcano/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>用相同训练任务验证准入队列、Gang、公平共享、抢占与拓扑能力</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>Kubernetes 还是 Slurm</title>
    <id>https://aik8s.run/ai-k8s/practices/kubernetes-vs-slurm/</id>
    <link href="https://aik8s.run/ai-k8s/practices/kubernetes-vs-slurm/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>从训练、推理、拓扑、队列、生态和运维边界选择 AI 调度平台</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>vLLM、SGLang 与 TensorRT-LLM 同机实测</title>
    <id>https://aik8s.run/ai-k8s/practices/inference-engine-benchmark/</id>
    <link href="https://aik8s.run/ai-k8s/practices/inference-engine-benchmark/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>固定模型、硬件和负载，公平比较主流 LLM 推理引擎</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>AI 集群事故复盘方法</title>
    <id>https://aik8s.run/ai-k8s/practices/incident-review/</id>
    <link href="https://aik8s.run/ai-k8s/practices/incident-review/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>用时间线、故障域、恢复证据和行动项复盘训练与推理事故</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>GPU 有空闲，Pod 为什么仍然 Pending</title>
    <id>https://aik8s.run/ai-k8s/practices/gpu-pending/</id>
    <link href="https://aik8s.run/ai-k8s/practices/gpu-pending/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>从队列准入、调度、拓扑、设备、存储和弹性逐层定位 GPU Pending</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>国产 GPU/NPU 的 Kubernetes 实践</title>
    <id>https://aik8s.run/ai-k8s/practices/domestic-accelerators/</id>
    <link href="https://aik8s.run/ai-k8s/practices/domestic-accelerators/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>用平台契约接入昇腾及其他国产加速器，管理驱动、资源名、镜像、调度和可观测差异</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>国内外 GPU 云资源选型</title>
    <id>https://aik8s.run/ai-k8s/practices/cloud-gpu-selection/</id>
    <link href="https://aik8s.run/ai-k8s/practices/cloud-gpu-selection/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>按库存、拓扑、网络、存储、Spot、出流和软件栈评估云上 GPU</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>离线环境部署 AI/LLM 平台</title>
    <id>https://aik8s.run/ai-k8s/practices/air-gapped-ai-platform/</id>
    <link href="https://aik8s.run/ai-k8s/practices/air-gapped-ai-platform/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>在无公网环境同步镜像、Chart、模型、驱动、软件包和安全元数据</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>Agent Sandbox 攻防实验</title>
    <id>https://aik8s.run/ai-k8s/practices/agent-sandbox-red-team/</id>
    <link href="https://aik8s.run/ai-k8s/practices/agent-sandbox-red-team/" />
    <updated>2026-08-04T08:14:28+00:00</updated>
    <summary>用文件、凭据、网络、资源耗尽和持久化测试验证 Agent 隔离边界</summary>
    <category term="practices" />
  </entry>
  <entry>
    <title>开源 Kubernetes 集群管理工具与方式</title>
    <id>https://aik8s.run/ai-k8s/cluster/open-source-management/</id>
    <link href="https://aik8s.run/ai-k8s/cluster/open-source-management/" />
    <updated>2026-08-04T07:44:36+00:00</updated>
    <summary>从 kubectl、Web UI 和 GitOps，到 Rancher、Cluster API、Gardener、Karmada 与 OCM 的分层选型</summary>
    <category term="cluster" />
  </entry>
  <entry>
    <title>国内外主流云厂商 Kubernetes</title>
    <id>https://aik8s.run/ai-k8s/cluster/cloud-managed-kubernetes/</id>
    <link href="https://aik8s.run/ai-k8s/cluster/cloud-managed-kubernetes/" />
    <updated>2026-08-04T07:44:36+00:00</updated>
    <summary>对比阿里云 ACK、腾讯云 TKE、华为云 CCE、AWS EKS、Google GKE 和 Azure AKS 的托管边界与 AI/GPU 能力</summary>
    <category term="cluster" />
  </entry>
  <entry>
    <title>AI/LLM 集群组件清单</title>
    <id>https://aik8s.run/cases/ai-cluster-component-checklist/</id>
    <link href="https://aik8s.run/cases/ai-cluster-component-checklist/" />
    <updated>2026-08-04T06:02:41+00:00</updated>
    <summary>按最小闭环、训练、大数据、Ray、在线推理和高级推理场景列出 Kubernetes 集群需要的组件、引入理由与验收条件</summary>
    <category term="cases" />
  </entry>
  <entry>
    <title>模型格式、制品供应链与分发</title>
    <id>https://aik8s.run/ai-k8s/data/model-artifacts/</id>
    <link href="https://aik8s.run/ai-k8s/data/model-artifacts/" />
    <updated>2026-08-04T06:02:41+00:00</updated>
    <summary>管理模型格式、OCI 制品、跨地域复制、P2P 分发、节点缓存、流式加载、签名和冷启动</summary>
    <category term="data" />
  </entry>
  <entry>
    <title>工程案例</title>
    <id>https://aik8s.run/cases/</id>
    <link href="https://aik8s.run/cases/" />
    <updated>2026-08-04T04:19:40+00:00</updated>
    <summary>记录真实 Kubernetes 与 AI 基础设施环境中的实施过程、故障处理、验证证据和可复用经验</summary>
    <category term="cases" />
  </entry>
  <entry>
    <title>AI/LLM Kubernetes 术语表</title>
    <id>https://aik8s.run/ai-k8s/reference/glossary/</id>
    <link href="https://aik8s.run/ai-k8s/reference/glossary/" />
    <updated>2026-08-04T04:19:40+00:00</updated>
    <summary>GPU、大数据、调度、训练、推理、网络、Agent 沙箱、模型制品和可靠性常用术语速查</summary>
    <category term="reference" />
  </entry>
  <entry>
    <title>Ray 在大模型训练与推理中的角色</title>
    <id>https://aik8s.run/ai-k8s/ray-llm-platform/</id>
    <link href="https://aik8s.run/ai-k8s/ray-llm-platform/" />
    <updated>2026-08-04T04:19:40+00:00</updated>
    <summary>Ray Core、Data、Train、Tune、Serve、Serve LLM 与 KubeRay 在大模型数据处理、训练、后训练和在线推理中的边界</summary>
    <category term="ai-k8s" />
  </entry>
  <entry>
    <title>LLM 推理平台</title>
    <id>https://aik8s.run/ai-k8s/llm-inference/</id>
    <link href="https://aik8s.run/ai-k8s/llm-inference/" />
    <updated>2026-08-04T04:19:40+00:00</updated>
    <summary>在线大模型服务的控制面、运行时、路由、伸缩和容量设计</summary>
    <category term="ai-k8s" />
  </entry>
  <entry>
    <title>LLM Serving 与 AI 微服务框架</title>
    <id>https://aik8s.run/ai-k8s/inference/serving-frameworks/</id>
    <link href="https://aik8s.run/ai-k8s/inference/serving-frameworks/" />
    <updated>2026-08-04T04:19:40+00:00</updated>
    <summary>对比 vLLM、KServe、AIBrix、Ray Serve、BentoML、NVIDIA NIM 与应用编排框架的层次、组合方式和选型边界</summary>
    <category term="inference" />
  </entry>
  <entry>
    <title>分布式训练平台</title>
    <id>https://aik8s.run/ai-k8s/distributed-training/</id>
    <link href="https://aik8s.run/ai-k8s/distributed-training/" />
    <updated>2026-08-04T04:19:40+00:00</updated>
    <summary>训练控制器、Gang Scheduling、集合通信、容错和作业生命周期</summary>
    <category term="ai-k8s" />
  </entry>
  <entry>
    <title>大数据 on Kubernetes</title>
    <id>https://aik8s.run/ai-k8s/data/big-data-on-kubernetes/</id>
    <link href="https://aik8s.run/ai-k8s/data/big-data-on-kubernetes/" />
    <updated>2026-08-04T04:19:40+00:00</updated>
    <summary>Spark、Flink、Kafka、Trino、Lakehouse、对象存储、Operator、队列调度，以及与大模型训练和 RAG 的结合</summary>
    <category term="data" />
  </entry>
  <entry>
    <title>AI 数据、存储与缓存</title>
    <id>https://aik8s.run/ai-k8s/data-storage/</id>
    <link href="https://aik8s.run/ai-k8s/data-storage/" />
    <updated>2026-08-04T04:00:13+00:00</updated>
    <summary>对象存储、共享文件、本地 NVMe、数据加载和多级缓存设计</summary>
    <category term="ai-k8s" />
  </entry>
</feed>