实战、排障与选型¶
这个系列不再按组件解释“它是什么”,而是从一个具体问题出发,给出证据链、实验变量、验收指标和停止条件。页面中的数字应由目标硬件和真实负载实测,示例值不能替代生产基线。
排障与事故¶
- GPU 有空闲,Pod 为什么仍然 Pending
- GPU 利用率为什么很低
- GPU 节点故障图鉴
- 看似 NCCL 故障,实际是 Host Memory OOM
- AI 集群事故复盘方法
- 数百个 Kubernetes 集群的稳定性建设
- 万节点 Kubernetes 集群优化实战:控制面、etcd、调度与网络
- Kube-apiserver 负载均衡实战:HTTP/2、TLS 终结与四层/七层选型
- Koordinator Webhook 多副本证书竞态实战:从每秒 60 次 409 到共享 CA 收敛
- APF 隔离实战:零席位 Reject 为什么仍会放行
性能、成本与容量¶
- MiMo-V2.6-Pro-RL 首测:八张 H20-3e 的 vLLM 部署与性能实测
- Qwen-Image-2.1:单卡 L20 的 SGLang 与 vLLM-Omni 实测
- Qwen3.8-2.4T-A95B-FP8 Day 0:32×H20-3e 的 SGLang 部署与压测
- MiniMax-M3:八卡 H20 上的 SGLang 与 vLLM 实测
- MiniMax H3 H20-3e 实测:完整音视频生成、双引擎与持久化验收
- DeepSeek-V4-Flash-Vision-Exp Day 0:4×H20 多模态部署与压测
- GLM-5.3 首日实测:8×H20 上的 SGLang 与 vLLM 基线压测
- Hy4-preview BF16 双机 H20 实测:SGLang 与 vLLM 怎么选
- Ling-3.0-flash BF16 单机 4×H20 实测:SGLang、vLLM 与 MTP 怎么选
- Qwen3.8-Flash-Next Day 0 实战:4×H20 跑通原生 262K
- SGLang v0.5.16 / v0.5.17 / v0.5.18 单卡 L20 实测:升级真的更快吗
- DeepSeek V4 Flash 的分布式 KV Cache:从 P/D 直传到全局缓存池
- 从半小时到五分钟:大模型冷启动全链路优化
- 大模型权重分发与加载加速:社区与商业方案选型
- vLLM、SGLang 与 TensorRT-LLM 同机实测
- 模型显存与并发容量计算器
- Prefill/Decode 分离的性能拐点
- 国内外 GPU 云资源选型
平台和调度¶
- OpenTelemetry × Grafana:观测 Kubernetes 控制面与集群状态
- 大模型时代 GPU 开发平台踩坑记
- 8 卡节点的四卡任务,如何避免拿到跨 NUMA 的碎片 GPU
- GPU 资源银行与潮汐推理平台实践蓝图
- Kueue 与 Volcano 对比实验
- Kubernetes 还是 Slurm
- 在 KubeVirt 上运行 Kubernetes:架构边界、生产设计与 AI 场景取舍
- KubeVirt 单节点桌面实战:本地盘、CDI 与浏览器 noVNC
- 用 KubeVirt 与 Ceph RBD 构建持久 GPU Notebook
- Spot GPU 与 Checkpoint 恢复实验
- 国产 GPU/NPU 的 Kubernetes 实践
端到端交付¶
- 大模型 SFT 入门:把 Loss、LoRA、Batch 和并行一次讲明白
- 大模型 SFT 训练实战:从单卡 LoRA 到 DeepSeek V4
- RDMA 到底能让分布式训练快多少:DeepSeek V4 双机 16 卡实测
- SwanLab 自托管:从 Kubernetes 部署到真实 SFT 指标
- 从 W&B Local 到 SwanLab:两年团队实验追踪实践与选型
- 用 SGLang-Omni 部署 MiniMax-Music3:从一句创意到完整歌曲
- Qwen3.8-27B Day 0:vLLM 与 SGLang 测试记录
- 从 Docker 到 Kubernetes:DeepSeek Harness、内置 Chromium 与 DSH Plugin 实战
- GLM-5.2 FP8 在 8×H20 141GB 上的 AIBrix + vLLM 实测
- DeepSeek-V4-Flash-0731 的 H20 部署与压测
- 在既有 Kubernetes 集群落地 AIBrix
- AIBrix 面向生产:DS V4 Flash 压测、看板与恢复实战
- AIBrix 生产实战:Qwen3.8-27B 在 L20 上的容量、退出与过载保护
- AIBrix 路由到底在优化什么:从缓存命中到尾延迟
- AIBrix 真实 GPU 实测:从两机推理到八节点碎片 GPU
- 在 Kubernetes 部署 ComfyUI:离线镜像、CephFS 模型与跨集群 Ingress
- RBG 多角色推理编排与 sr1 实战
- SGLang Model Gateway CPU 实战:动态发现、路由与故障摘除
- 从 Ollama 到 Kubernetes 生产推理
- 70B 模型向百节点分发
- 离线环境部署 AI/LLM 平台
- Agent Sandbox 攻防实验
阅读和复现约定¶
每个实验至少记录:
- Kubernetes、驱动、CUDA/ROCm/CANN 和组件版本;
- GPU/NPU/TPU、CPU、内存、磁盘和网络拓扑;
- 模型、精度、输入输出长度和并发分布;
- 冷缓存/热缓存、失败重试和预热状态;
- 原始日志、事件、指标、Trace 和时间戳;
- 成功标准、失败标准和结果的不适用范围。
复现实验时先修改 Namespace、镜像、StorageClass、资源名和安全策略,不要直接把示例中的权限、镜像标签或云厂商参数复制到生产。