DANDAN LEARN / AI Infra
从 GPU 到千卡训练系统
让模型跑得动、跑得稳、跑得便宜。这里是所有大模型背后的"隐形基建"——也是最能体现工程师价值的地方。
Learning goals
Put principles into practice.
- 理解 GPU 执行与内存模型
- 梳理分布式训练、通信与并行策略
- 分析推理优化和模型服务中的性能取舍
Who this is for
- 关注训练、推理与算力工程的开发者
Prerequisites
- 了解深度学习基本概念;进阶章节涉及 CUDA 与分布式系统
A closer look
A few chapters to start with
Jump to a chapter 7 chapters
序言
基础设施
训练系统进阶
推理系统
MLOps
大规模与前沿
更多文章
- 综合实战 — 用 DeepSpeed 训练 GPT-2Member article
- 数据并行:从 DP 到 DDPMember article
- DeepSpeed 入门:一站式分布式训练框架Member article
- 分布式训练总览Member article
- 混合精度训练:FP16 / BF16 / FP8 实战Member article
- 模型并行:张量并行 & 流水线并行Member article
- ZeRO:显存优化的终结者Member article
- AI 综合实战Member article
- cuBLAS API 与性能调优Member article
- cuBLAS 架构与 GEMMMember article
- cuDNN 卷积算法选择Member article
- NHWC vs NCHW:内存布局的性能影响Member article
- 性能调优完整流程Member article
- Workspace 管理与算子融合Member article
- 标准 Attention 的 IO 瓶颈分析Member article
- 从零实现简化版 FlashAttentionMember article
- FlashAttention v1 CUDA 实现详解Member article
- FlashAttention v2 优化点深度解析Member article
- FlashAttention v3 与 H100 新特性Member article
- 分块计算与 Online Softmax 推导Member article
- Medusa / Lookahead:并行解码进阶Member article
- 设计千卡 LLM 训练系统Member article
- 专家并行与 MoE 训练挑战Member article
- MoE 架构:专家路由与负载均衡Member article
- Pipeline 调度:1F1B 与 InterleavedMember article
- 序列并行:突破单卡序列长度限制Member article
- AWQ:激活感知权重量化Member article
- 量化方案选型与精度评估Member article
- GPTQ:基于 Hessian 的权重量化Member article
- 量化基础:数值表示与量化误差Member article
- SmoothQuant:激活量化的挑战与解决Member article
- 8 全面复习与面试模拟Member article
- 成本优化:Spot 实例与资源调度Member article
- 面试精讲:AI Infra 高频面试题与解题框架Member article
- 系统设计:LLM 推理服务架构Member article
- 带宽瓶颈分析:NVLink/InfiniBand/RDMAMember article
- Capstone · 本阶段:通信效率全面分析Member article
- 梯度压缩:稀疏化/量化/PowerSGDMember article
- Capstone · 本阶段:实现 Fused LayerNormMember article
- 算子融合:减少内存往返提升性能Member article
- Profile 驱动优化:Nsight 实战Member article
- Warp 级优化:Shuffle/Reduce/VoteMember article
- BentoML:现代 ML 服务框架Member article
- Capstone · 本阶段:部署 LLM 推理服务Member article
- TorchServe:PyTorch 官方服务化方案Member article
- Capstone · 本阶段:LLM 推理 PT → TRT 全链路Member article
- ONNX:跨框架优化中间格式Member article
- 完整优化链路:PT→ONNX→TensorRTMember article
- TensorRT:NVIDIA 推理引擎Member article
- torch.compile:Python 图优化Member article
- XLA:Google 线性代数加速器Member article
- Capstone · 本阶段:诊断并修复 IO 瓶颈Member article
- 高效数据流水线设计Member article
- DataLoader 性能优化Member article
- GPU Direct Storage:绕过 CPUMember article
- 存储系统选型:NFS/Lustre/对象存储Member article
- WebDataset:流式数据集格式Member article
- Capstone · 本阶段:排查一次训练卡住问题Member article
- 成本核算:GPU 小时/ROI 分析Member article
- 故障检测与定位:GPU/网络/存储Member article
- 集群性能分析:MFU/训练效率Member article
- 资源调度:Kubernetes/SlurmMember article
- Capstone · 本阶段:模拟面试完整流程Member article
- CUDA 面试题精讲Member article
- 分布式训练面试题精讲Member article
- 14 极速复习Member article
- 大厂真题精讲Member article
- 系统设计大题:LLM 推理/训练服务Member article
- 服务部署:vLLM + FastAPIMember article
- 压测:Locust 性能测试Member article
- 模型加载:高效加载大模型Member article
- 迭代优化:从压测结果找瓶颈Member article
- 量化实战:AWQ/GPTQ 实操Member article
- Megatron-LM 流水线并行深度解析Member article
- 张量并行:矩阵切分与通信优化Member article
- ZeRO 优化器:消除冗余内存的三个阶段Member article
- Ring Attention:超长上下文训练的解决方案Member article
- NCCL 通信原语深度解析与调优Member article
- 梯度检查点与选择性重计算Member article
- 混合精度训练:从 FP16 到 FP8Member article
- 大规模训练容错:检查点策略与弹性训练Member article
- vLLM 与 PagedAttention:重新定义推理吞吐Member article
- LLM 量化:AWQ、GPTQ 与 SmoothQuantMember article
- 推测解码:用小模型加速大模型Member article
- Prefill-Decode 分离:下一代推理系统架构Member article
- 推理 Kernel 优化:FlashInfer 与 CUDA 调优Member article
- 多模态 LLM 推理优化Member article
- LLM 推理 SLO 保障与请求调度Member article
- 推理长尾延迟优化:P99 的敌人Member article
- 实验追踪进阶:MLflow 与 W&B 深度实践Member article
- Feature Store 与训练数据管道Member article
- 模型评估基础设施:自动化评测与 LLM JudgeMember article
- A/B Testing 与在线实验:科学评估模型效果Member article
- 模型注册与部署流水线:MLOps CI/CDMember article
- 数据漂移与模型监控:保持模型健康Member article
- Kubernetes 上的 ML 工作负载管理Member article
- ML 训练的成本优化:Spot 实例与云资源管理Member article
- GPU 架构深度:Ampere 到 Hopper 的进化Member article
- CUDA 进阶:流并行与 CUDA GraphMember article
- 自定义 CUDA 算子:从 Triton 到 CUTLASSMember article
- AI 专用芯片:GPU 以外的加速世界Member article
- 网络互联深度:InfiniBand、RoCE 与集群拓扑Member article
- 存储系统优化:训练数据的 I/O 瓶颈Member article
- GPU Profiling 实战:找出真正的性能瓶颈Member article
- 编译器优化:torch.compile、XLA 与 TensorRTMember article
- NVIDIA Triton Inference Server 深度实战Member article
- KServe:Kubernetes 原生的模型服务标准Member article
- LLM 服务框架对比:vLLM、TGI、TensorRT-LLMMember article
- 流式推理与长对话管理Member article
- LLM API 网关:鉴权、限流与多租户Member article
- LLM 服务可观测性与 SLO 设计Member article
- 大模型安全防护:Guardrails 与对抗防御Member article
- 大模型高可用与灾备:跨区域部署与故障切换Member article
- 高级量化技术:从 GPTQ 到 FP8 训练Member article
- 推测解码进阶:Medusa、EAGLE 与草稿模型策略Member article
- KV Cache 深度优化:GQA、MQA 与缓存压缩Member article
- MoE 推理优化:稀疏模型的高效执行Member article
- LLM 推理内存管理:Block Manager 与 Disaggregated PDMember article
- 大模型评测基础设施:自动化 Benchmark 流水线Member article
- 持续预训练:在新数据上更新模型而不遗忘Member article
- 训练数据管理:去重、质量评估与合规Member article
- 大规模训练稳定性:Loss Spike 与梯度爆炸的工程防御Member article
- 分布式优化器进阶:ZeRO++、FSDP2 与新型优化器Member article
- 流水线并行进阶:1F1B、虚拟阶段与内存优化Member article
- 超大规模词表训练:Embedding 并行与多语言 TokenizerMember article
- RLHF 工程实现:PPO、GRPO 与奖励模型训练Member article
- 多模态大模型训练:视觉编码器与图文对齐Member article
- 推理时计算(Inference-Time Compute):CoT、Self-Consistency 与 o1 风格推理Member article
- AI 基础设施 ROI:成本分析与价值度量Member article
- AI 编译器栈:MLIR、XLA 与端到端优化Member article
- MoE 的未来:Expert Parallelism 与稀疏模型工程Member article
- 多智能体 AI 基础设施:Agent 工作流与 Memory 系统设计Member article
- AI 安全基础设施:内容安全、Red Teaming 与 PII 保护Member article
- 端侧推理:移动设备上运行 LLMMember article
- 数据飞轮:从线上数据到模型持续改进Member article
- 大模型的未来:Scaling 极限、能力边界与下一代架构Member article
- AI Infra 工程师成长路径:从入门到专家Member article
Reading and learning support
Forewords are public. Other chapters require access to the column or the whole library.
Overview reviewed on