实战、排障与选型¶
这个系列不再按组件解释“它是什么”,而是从一个具体问题出发,给出证据链、实验变量、验收指标和停止条件。页面中的数字应由目标硬件和真实负载实测,示例值不能替代生产基线。
排障与事故¶
性能、成本与容量¶
平台和调度¶
- 大模型时代 GPU 开发平台踩坑记
- GPU 资源银行与潮汐推理平台实践蓝图
- Kueue 与 Volcano 对比实验
- Kubernetes 还是 Slurm
- KubeVirt 单节点桌面实战:本地盘、CDI 与浏览器 noVNC
- 用 KubeVirt 与 Ceph RBD 构建持久 GPU Notebook
- Spot GPU 与 Checkpoint 恢复实验
- 国产 GPU/NPU 的 Kubernetes 实践
端到端交付¶
- DeepSeek-V4-Flash-0731 的 H20 部署与压测
- 在既有 Kubernetes 集群落地 AIBrix
- AIBrix 真实 GPU 实测:从两机推理到八节点碎片 GPU
- 在 Kubernetes 部署 ComfyUI:离线镜像、CephFS 模型与跨集群 Ingress
- RBG 多角色推理编排与 sr1 实战
- SGLang Model Gateway CPU 实战:动态发现、路由与故障摘除
- 从 Ollama 到 Kubernetes 生产推理
- 70B 模型向百节点分发
- 离线环境部署 AI/LLM 平台
- Agent Sandbox 攻防实验
阅读和复现约定¶
每个实验至少记录:
- Kubernetes、驱动、CUDA/ROCm/CANN 和组件版本;
- GPU/NPU/TPU、CPU、内存、磁盘和网络拓扑;
- 模型、精度、输入输出长度和并发分布;
- 冷缓存/热缓存、失败重试和预热状态;
- 原始日志、事件、指标、Trace 和时间戳;
- 成功标准、失败标准和结果的不适用范围。
复现实验时先修改 Namespace、镜像、StorageClass、资源名和安全策略,不要直接把示例中的权限、镜像标签或云厂商参数复制到生产。