Search the library

Type to search · ↑↓ select · ⏎ open · Esc close

Skip to content
Dandan

DANDAN LEARN / AI Infra

从 GPU 到千卡训练系统

让模型跑得动、跑得稳、跑得便宜。这里是所有大模型背后的"隐形基建"——也是最能体现工程师价值的地方。

7 chapters · 171 articles

Learning goals

Put principles into practice.

  • 理解 GPU 执行与内存模型
  • 梳理分布式训练、通信与并行策略
  • 分析推理优化和模型服务中的性能取舍

Who this is for

  • 关注训练、推理与算力工程的开发者

Prerequisites

  • 了解深度学习基本概念;进阶章节涉及 CUDA 与分布式系统

Contents

7 chapters · 171 articles

Jump to a chapter 7 chapters

序言

1 articles
  1. 自序 · AI InfraPublic foreword

基础设施

7 articles
  1. GPU vs CPU:从设计哲学说起Member article
  2. SM 架构:一张卡到底是怎么算的Member article
  3. CUDA 编程模型:Kernel / Grid / Block / ThreadMember article
  4. 写第一个 CUDA KernelMember article
  5. 内存层级与并行归约Member article
  6. Nsight 性能分析入门Member article
  7. 综合实战:手写 SGEMM 与 cuBLAS 对比Member article

训练系统进阶

8 articles
  1. 分布式训练总览:DP / MP / PP 的取舍Member article
  2. 数据并行:DP / DDP 原理Member article
  3. 模型并行:Megatron-LM 的列/行切分Member article
  4. ZeRO 优化:DeepSpeed 的三个阶段Member article
  5. DeepSpeed 入门Member article
  6. 混合精度训练:FP16 / BF16 / FP8Member article
  7. 3D 并行实战:Megatron 三种切分组合Member article
  8. 综合实战:GPT-2 + DeepSpeed 分布式训练Member article

推理系统

6 articles
  1. KV Cache 基础:自回归解码的核心优化Member article
  2. PagedAttention 与 vLLM 架构Member article
  3. Continuous Batching:让 GPU 不等人Member article
  4. Speculative Decoding:投机采样Member article
  5. 量化推理:GPTQ / AWQ / SmoothQuantMember article
  6. 综合实战:部署高吞吐推理服务Member article

MLOps

6 articles
  1. 训练监控:Loss Spike 与梯度诊断Member article
  2. 训练容错与自动恢复Member article
  3. Triton Inference Server 架构Member article
  4. TorchServe / BentoML 对比Member article
  5. Dynamic Batching:Serving 层的批处理Member article
  6. 综合实战:端到端 MLOps 流程Member article

大规模与前沿

6 articles
  1. NCCL 通信内幕Member article
  2. Ring AllReduce:让通信随卡数扩展Member article
  3. 集合通信原语:AllReduce / AllGather / BroadcastMember article
  4. 自定义 CUDA 算子:从 PyTorch 扩展到 TritonMember article
  5. Triton 编程:写高性能 GPU Kernel 的现代方式Member article
  6. 综合项目:大规模训练系统设计Member article

更多文章

137 articles
  1. 综合实战 — 用 DeepSpeed 训练 GPT-2Member article
  2. 数据并行:从 DP 到 DDPMember article
  3. DeepSpeed 入门:一站式分布式训练框架Member article
  4. 分布式训练总览Member article
  5. 混合精度训练:FP16 / BF16 / FP8 实战Member article
  6. 模型并行:张量并行 & 流水线并行Member article
  7. ZeRO:显存优化的终结者Member article
  8. AI 综合实战Member article
  9. cuBLAS API 与性能调优Member article
  10. cuBLAS 架构与 GEMMMember article
  11. cuDNN 卷积算法选择Member article
  12. NHWC vs NCHW:内存布局的性能影响Member article
  13. 性能调优完整流程Member article
  14. Workspace 管理与算子融合Member article
  15. 标准 Attention 的 IO 瓶颈分析Member article
  16. 从零实现简化版 FlashAttentionMember article
  17. FlashAttention v1 CUDA 实现详解Member article
  18. FlashAttention v2 优化点深度解析Member article
  19. FlashAttention v3 与 H100 新特性Member article
  20. 分块计算与 Online Softmax 推导Member article
  21. Medusa / Lookahead:并行解码进阶Member article
  22. 设计千卡 LLM 训练系统Member article
  23. 专家并行与 MoE 训练挑战Member article
  24. MoE 架构:专家路由与负载均衡Member article
  25. Pipeline 调度:1F1B 与 InterleavedMember article
  26. 序列并行:突破单卡序列长度限制Member article
  27. AWQ:激活感知权重量化Member article
  28. 量化方案选型与精度评估Member article
  29. GPTQ:基于 Hessian 的权重量化Member article
  30. 量化基础:数值表示与量化误差Member article
  31. SmoothQuant:激活量化的挑战与解决Member article
  32. 8 全面复习与面试模拟Member article
  33. 成本优化:Spot 实例与资源调度Member article
  34. 面试精讲:AI Infra 高频面试题与解题框架Member article
  35. 系统设计:LLM 推理服务架构Member article
  36. 带宽瓶颈分析:NVLink/InfiniBand/RDMAMember article
  37. Capstone · 本阶段:通信效率全面分析Member article
  38. 梯度压缩:稀疏化/量化/PowerSGDMember article
  39. Capstone · 本阶段:实现 Fused LayerNormMember article
  40. 算子融合:减少内存往返提升性能Member article
  41. Profile 驱动优化:Nsight 实战Member article
  42. Warp 级优化:Shuffle/Reduce/VoteMember article
  43. BentoML:现代 ML 服务框架Member article
  44. Capstone · 本阶段:部署 LLM 推理服务Member article
  45. TorchServe:PyTorch 官方服务化方案Member article
  46. Capstone · 本阶段:LLM 推理 PT → TRT 全链路Member article
  47. ONNX:跨框架优化中间格式Member article
  48. 完整优化链路:PT→ONNX→TensorRTMember article
  49. TensorRT:NVIDIA 推理引擎Member article
  50. torch.compile:Python 图优化Member article
  51. XLA:Google 线性代数加速器Member article
  52. Capstone · 本阶段:诊断并修复 IO 瓶颈Member article
  53. 高效数据流水线设计Member article
  54. DataLoader 性能优化Member article
  55. GPU Direct Storage:绕过 CPUMember article
  56. 存储系统选型:NFS/Lustre/对象存储Member article
  57. WebDataset:流式数据集格式Member article
  58. Capstone · 本阶段:排查一次训练卡住问题Member article
  59. 成本核算:GPU 小时/ROI 分析Member article
  60. 故障检测与定位:GPU/网络/存储Member article
  61. 集群性能分析:MFU/训练效率Member article
  62. 资源调度:Kubernetes/SlurmMember article
  63. Capstone · 本阶段:模拟面试完整流程Member article
  64. CUDA 面试题精讲Member article
  65. 分布式训练面试题精讲Member article
  66. 14 极速复习Member article
  67. 大厂真题精讲Member article
  68. 系统设计大题:LLM 推理/训练服务Member article
  69. 服务部署:vLLM + FastAPIMember article
  70. 压测:Locust 性能测试Member article
  71. 模型加载:高效加载大模型Member article
  72. 迭代优化:从压测结果找瓶颈Member article
  73. 量化实战:AWQ/GPTQ 实操Member article
  74. Megatron-LM 流水线并行深度解析Member article
  75. 张量并行:矩阵切分与通信优化Member article
  76. ZeRO 优化器:消除冗余内存的三个阶段Member article
  77. Ring Attention:超长上下文训练的解决方案Member article
  78. NCCL 通信原语深度解析与调优Member article
  79. 梯度检查点与选择性重计算Member article
  80. 混合精度训练:从 FP16 到 FP8Member article
  81. 大规模训练容错:检查点策略与弹性训练Member article
  82. vLLM 与 PagedAttention:重新定义推理吞吐Member article
  83. LLM 量化:AWQ、GPTQ 与 SmoothQuantMember article
  84. 推测解码:用小模型加速大模型Member article
  85. Prefill-Decode 分离:下一代推理系统架构Member article
  86. 推理 Kernel 优化:FlashInfer 与 CUDA 调优Member article
  87. 多模态 LLM 推理优化Member article
  88. LLM 推理 SLO 保障与请求调度Member article
  89. 推理长尾延迟优化:P99 的敌人Member article
  90. 实验追踪进阶:MLflow 与 W&B 深度实践Member article
  91. Feature Store 与训练数据管道Member article
  92. 模型评估基础设施:自动化评测与 LLM JudgeMember article
  93. A/B Testing 与在线实验:科学评估模型效果Member article
  94. 模型注册与部署流水线:MLOps CI/CDMember article
  95. 数据漂移与模型监控:保持模型健康Member article
  96. Kubernetes 上的 ML 工作负载管理Member article
  97. ML 训练的成本优化:Spot 实例与云资源管理Member article
  98. GPU 架构深度:Ampere 到 Hopper 的进化Member article
  99. CUDA 进阶:流并行与 CUDA GraphMember article
  100. 自定义 CUDA 算子:从 Triton 到 CUTLASSMember article
  101. AI 专用芯片:GPU 以外的加速世界Member article
  102. 网络互联深度:InfiniBand、RoCE 与集群拓扑Member article
  103. 存储系统优化:训练数据的 I/O 瓶颈Member article
  104. GPU Profiling 实战:找出真正的性能瓶颈Member article
  105. 编译器优化:torch.compile、XLA 与 TensorRTMember article
  106. NVIDIA Triton Inference Server 深度实战Member article
  107. KServe:Kubernetes 原生的模型服务标准Member article
  108. LLM 服务框架对比:vLLM、TGI、TensorRT-LLMMember article
  109. 流式推理与长对话管理Member article
  110. LLM API 网关:鉴权、限流与多租户Member article
  111. LLM 服务可观测性与 SLO 设计Member article
  112. 大模型安全防护:Guardrails 与对抗防御Member article
  113. 大模型高可用与灾备:跨区域部署与故障切换Member article
  114. 高级量化技术:从 GPTQ 到 FP8 训练Member article
  115. 推测解码进阶:Medusa、EAGLE 与草稿模型策略Member article
  116. KV Cache 深度优化:GQA、MQA 与缓存压缩Member article
  117. MoE 推理优化:稀疏模型的高效执行Member article
  118. LLM 推理内存管理:Block Manager 与 Disaggregated PDMember article
  119. 大模型评测基础设施:自动化 Benchmark 流水线Member article
  120. 持续预训练:在新数据上更新模型而不遗忘Member article
  121. 训练数据管理:去重、质量评估与合规Member article
  122. 大规模训练稳定性:Loss Spike 与梯度爆炸的工程防御Member article
  123. 分布式优化器进阶:ZeRO++、FSDP2 与新型优化器Member article
  124. 流水线并行进阶:1F1B、虚拟阶段与内存优化Member article
  125. 超大规模词表训练:Embedding 并行与多语言 TokenizerMember article
  126. RLHF 工程实现:PPO、GRPO 与奖励模型训练Member article
  127. 多模态大模型训练:视觉编码器与图文对齐Member article
  128. 推理时计算(Inference-Time Compute):CoT、Self-Consistency 与 o1 风格推理Member article
  129. AI 基础设施 ROI:成本分析与价值度量Member article
  130. AI 编译器栈:MLIR、XLA 与端到端优化Member article
  131. MoE 的未来:Expert Parallelism 与稀疏模型工程Member article
  132. 多智能体 AI 基础设施:Agent 工作流与 Memory 系统设计Member article
  133. AI 安全基础设施:内容安全、Red Teaming 与 PII 保护Member article
  134. 端侧推理:移动设备上运行 LLMMember article
  135. 数据飞轮:从线上数据到模型持续改进Member article
  136. 大模型的未来:Scaling 极限、能力边界与下一代架构Member article
  137. AI Infra 工程师成长路径:从入门到专家Member article

Reading and learning support

Forewords are public. Other chapters require access to the column or the whole library.

Overview reviewed on

Learning notes and complete roadmap