Search the library

Type to search · ↑↓ select · ⏎ open · Esc close

Skip to content
Dandan

DANDAN LEARN / Large Language Models

从 Transformer 到顶尖 LLM

理解 Transformer 如何工作,掌握预训练 / SFT / RLHF 的训练闭环,能读懂前沿论文并把模型部署到生产。

10 chapters · 234 articles

Learning goals

Put principles into practice.

  • 理解注意力、位置编码与 Transformer 架构
  • 梳理预训练、微调与对齐的不同职责
  • 理解推理部署与应用中的工程取舍

Who this is for

  • 希望深入大模型原理、训练和应用的开发者

Prerequisites

  • 熟悉 Python;了解基础机器学习概念

Contents

10 chapters · 234 articles

Jump to a chapter 10 chapters

序言

1 articles
  1. 自序 · 大模型Public foreword

演进时间线

1 articles
  1. 大模型架构演进时间线(2013–2025)Member article

架构与原理

6 articles
  1. Self-Attention:从头推导缩放点积注意力Member article
  2. 位置编码进阶:RoPE 与 ALiBiMember article
  3. GPT 预训练目标与自回归建模Member article
  4. Encoder / Decoder 架构对比(BERT vs GPT)Member article
  5. Scaling Law:规模定律与涌现能力Member article
  6. 综合实战:Mini-Transformer 从零实现Member article

训练与微调

6 articles
  1. 预训练数据处理:清洗、去重与质量控制Member article
  2. Gradient Checkpointing:以计算换显存Member article
  3. Flash Attention 原理与核心代码Member article
  4. 分布式训练:DeepSpeed 与 FSDPMember article
  5. 训练稳定性:Loss Spike 与梯度裁剪Member article
  6. 综合实战:分布式训练完整流程Member article

SFT & 对齐

6 articles
  1. LoRA:低秩自适应微调Member article
  2. PEFT 全景:LoRA / QLoRA / AdapterMember article
  3. RLHF 原理:奖励模型 + PPOMember article
  4. DPO:直接偏好优化Member article
  5. 指令微调(SFT)实战Member article
  6. 综合实战:LLaMA-Factory 微调全流程Member article

推理与部署

6 articles
  1. KV Cache:自回归解码的核心优化Member article
  2. 量化:INT8 / INT4 / GPTQ / AWQMember article
  3. vLLM 与 PagedAttentionMember article
  4. Continuous Batching:连续批处理推理范式Member article
  5. Speculative Decoding:投机采样Member article
  6. 综合实战:生产级推理服务部署Member article

Agent & 应用

6 articles
  1. Prompt Engineering 基础Member article
  2. 高级提示工程:CoT / Few-shot / Self-ConsistencyMember article
  3. RAG 核心实现:检索增强生成Member article
  4. 向量数据库与 EmbeddingMember article
  5. Function Calling 与 LLM AgentMember article
  6. 综合实战:完整 RAG + Agent 应用Member article

前沿研究

11 articles
  1. Test-Time Compute:o1 / R1 的推理时扩展Member article
  2. MoE 混合专家架构深度解读Member article
  3. LLaMA 4 架构解读:MoE 化与 iRoPE 长上下文Member article
  4. Agentic AI:让 LLM 成为行动者Member article
  5. 多模态大模型架构:视觉 + 语言Member article
  6. 自监督语音表征:wav2vec / HuBERT / WhisperMember article
  7. 音频 Token 化与端到端语音对话:EnCodec / VALL-E / GPT-4oMember article
  8. 世界模型基础:World Models / PlaNet / DreamerMember article
  9. 视频生成与世界模拟器:Sora / Genie / GameNGenMember article
  10. 长上下文推理:100K Token 时代的工程挑战Member article
  11. 综合实战:前沿论文精读与复现Member article

大模型实操速通(w30)

12 articles
  1. LLM API 环境配置与多轮对话(OpenAI / DeepSeek 兼容)Member article
  2. 自定义 Prompt 提升解题能力 + Gradio 交互界面Member article
  3. LoRA 原理:从线性层到注意力机制的低秩注入Member article
  4. PEFT 快速实践:在大模型上应用 LoRA 的完整流程Member article
  5. Beam Search 原理与从零实现Member article
  6. Top-K / Top-P / Temperature 采样策略详解Member article
  7. DPO 微调:根据人类偏好优化 LLMMember article
  8. RTN 模型量化 + GGUF/GGML 格式解析Member article
  9. 本地运行量化 LLM:Transformers vs llama-cpp-pythonMember article
  10. RAG 入门实践:文档拆分 → 向量库 → LangChain 问答链Member article
  11. Tokenizer 原理:BPE vs WordPieceMember article
  12. Transformer 论文精读:Attention Is All You NeedMember article

更多文章

179 articles
  1. 激活函数Member article
  2. 自编码模型Member article
  3. 自回归模型Member article
  4. 梯度与反向传播基础Member article
  5. 反向传播基础Member article
  6. 条件概率与贝叶斯公式基础Member article
  7. 微积分基础知识点详解Member article
  8. 链式法则基础Member article
  9. CNN基础Member article
  10. 协方差与相关系数基础Member article
  11. 数据构建与清洗Member article
  12. 导数与偏导数基础Member article
  13. 常见概率分布基础Member article
  14. 特征值 (Eigenvalue) 与 特征向量 (Eigenvector) 详解Member article
  15. 期望与方差基础Member article
  16. 前向传播Member article
  17. 全量参数微调Member article
  18. 梯度下降法Member article
  19. 梯度基础Member article
  20. 指令微调Member article
  21. 积分与基本定理基础Member article
  22. Agent 开发实战Member article
  23. Harness 架构设计Member article
  24. 2026 大模型求职全景指南Member article
  25. 推理加速与量化Member article
  26. 3-6个月学习路线Member article
  27. LLMOps 全链路Member article
  28. LoRA/QLoRA 微调实战Member article
  29. Python 工程栈实战Member article
  30. RAG 全链路工程化Member article
  31. 安全合规与幻觉治理Member article
  32. 岗位能力地图 — 对照自查,精准补全短板Member article
  33. KL散度基础Member article
  34. 线性变换 (Linear Transformation) 详解Member article
  35. 损失函数Member article
  36. 矩阵 (Matrix) 基础知识详解Member article
  37. 神经网络基础Member article
  38. 优化器基础Member article
  39. 感知机与基础概念Member article
  40. 预训练任务Member article
  41. 概率论基础知识点详解Member article
  42. 随机变量与概率分布基础Member article
  43. 正则化技术Member article
  44. RNN基础Member article
  45. SFT基础概念Member article
  46. 奇异值分解 (Singular Value Decomposition, SVD) 详解Member article
  47. 泰勒展开基础Member article
  48. 向量空间 (Vector Space) 详解Member article
  49. 向量 (Vector) 基础知识详解Member article
  50. Feed-Forward Network & 残差归一化深入Member article
  51. 动手实现最小 Transformer + 本周小结Member article
  52. 分词与嵌入:从文本到向量Member article
  53. 训练实战:把 Tiny Transformer 跑起来Member article
  54. Transformer 鸟瞰 —— 整体结构与信息流Member article
  55. 完整代码手写实现 AttentionMember article
  56. 注意力复杂度分析与优化Member article
  57. Attention 的直觉理解 —— 查询/键/值的隐喻Member article
  58. 注意力变体 —— Sparse / Linear / FlashMember article
  59. 多头注意力机制实现Member article
  60. Scaled Dot-Product Attention 完整推导Member article
  61. 综合实战 —— 从零搭建小型 TransformerMember article
  62. 链式法则与反向传播Member article
  63. 综合实战:手写 BP vs PyTorch 验证Member article
  64. 导数与梯度直觉理解Member article
  65. 信息论:熵、交叉熵、KL 散度Member article
  66. 极大似然估计Member article
  67. 概率论基础Member article
  68. PyTorch 自动微分实战Member article
  69. Tokenizer 原理与实战Member article
  70. 对齐综合实战:LLaMA-Factory 全流程Member article
  71. Capstone:端到端对齐一个 1.5B 模型Member article
  72. Capstone:构建企业级 RAG 系统Member article
  73. Embedding 模型Member article
  74. RAG 系统评估Member article
  75. Reranker:精排提升 RAG 质量Member article
  76. 检索策略:BM25、稠密检索与混合检索Member article
  77. LLM Agent 系统设计Member article
  78. LLM 安全:攻击与防御Member article
  79. 结构化输出:JSON Mode 与约束解码Member article
  80. Capstone - 多模态 RAG 问答系统实战Member article
  81. 图文对比学习与 CLIP 原理Member article
  82. GPT-4V 与多模态大模型工程Member article
  83. LLaVA 视觉语言模型实战Member article
  84. Sora 架构分析:视频生成原理Member article
  85. Vision Transformer (ViT) 深度剖析Member article
  86. Capstone - 128k 上下文长文档问答系统Member article
  87. FlashAttention 与长序列工程Member article
  88. 稀疏注意力:Longformer 与 BigBirdMember article
  89. 记忆增强:外部记忆与 MemGPTMember article
  90. 位置插值:PI / YaRN / LongRoPEMember article
  91. RoPE 原理与长度外推Member article
  92. 基准测评:MMLU / HumanEval / HELMMember article
  93. 生产级 LLM 评估管线设计Member article
  94. 幻觉检测与缓解Member article
  95. 人类偏好评估与 LLM-as-JudgeMember article
  96. 红队测试与安全评估Member article
  97. Capstone - 从零预训练 1B 参数语言模型Member article
  98. Checkpoint 策略与训练恢复Member article
  99. 课程学习与数据调度Member article
  100. 预训练数据配比与过滤Member article
  101. 训练监控与调试Member article
  102. Capstone - 数据分析 Agent 系统Member article
  103. Code Interpreter:代码执行 AgentMember article
  104. Multi-Agent:协作与调度Member article
  105. OS Agent:计算机控制Member article
  106. Tool Use 进阶:并行与条件调用Member article
  107. Web Agent:浏览器操作Member article
  108. LLM API 设计规范Member article
  109. 上下文管理与多租户Member article
  110. 成本控制与优化Member article
  111. LLMOps:监控与可观测性Member article
  112. 流式输出:SSE 与 WebSocketMember article
  113. 大模型架构演进Member article
  114. Capstone - LLM 模拟面试系统Member article
  115. 工程面试题精讲Member article
  116. 综合真题精讲 50 题Member article
  117. 训练技巧与优化器Member article
  118. Transformer 深度细节Member article
  119. SmartDocs Agent 集成Member article
  120. Capstone - SmartDocs AI 端到端实战Member article
  121. API 服务与部署Member article
  122. 知识库构建Member article
  123. SmartDocs AI 系统设计Member article
  124. Flash Attention:重新思考注意力机制的计算方式Member article
  125. 大模型训练的学习率调度策略Member article
  126. 大模型预训练数据混合策略Member article
  127. Muon 优化器:超越 AdamW 的新选择?Member article
  128. 大模型权重初始化:被低估的训练关键Member article
  129. Batch Size 与训练效率:如何选择最优批次大小Member article
  130. RLHF 深度解析:从 PPO 到现代实现Member article
  131. DPO 及其变体:简化对齐的新范式Member article
  132. 奖励模型训练:RLHF 的隐藏核心Member article
  133. Constitutional AI 与 RLAIF:让 AI 训练 AIMember article
  134. 过程奖励模型(PRM):奖励每一步推理Member article
  135. Rejection Sampling Fine-tuning(RFT):简单而有效的对齐技术Member article
  136. GRPO 与 DeepSeek-R1:让模型学会"慢慢思考"Member article
  137. 对齐效果评估:如何知道 RLHF/DPO 真的有效?Member article
  138. KV Cache 优化:推理加速的核心Member article
  139. 推测解码(Speculative Decoding):用小模型加速大模型Member article
  140. 大模型量化进阶:从 GPTQ 到 AWQMember article
  141. 知识蒸馏:让小模型学习大模型的"智慧"Member article
  142. 推理阶段的张量并行与流水线并行Member article
  143. 模型剪枝与稀疏性:另一条压缩道路Member article
  144. LLaMA 3 架构深度解析Member article
  145. Mistral 与 Mixtral:稀疏专家模型的工程典范Member article
  146. DeepSeek 系列架构解析:从 V2 到 V3Member article
  147. Qwen 与 Gemma:中西双线的开源标杆Member article
  148. 状态空间模型(SSM):Transformer 的挑战者Member article
  149. 主流架构横向对比:如何选择适合你的模型Member article
  150. 持续学习(Continual Learning):让模型不断进化而不遗忘Member article
  151. 前沿 Scaling Laws:超越 Chinchilla 的新发现Member article
  152. 模型合并(Model Merging):不训练也能提升能力Member article
  153. 合成数据(Synthetic Data):用 AI 训练 AI 的新范式Member article
  154. 上下文压缩:让长上下文处理更高效Member article
  155. LLM 安全前沿:对抗攻击与防御Member article
  156. 代码大模型:从补全到生成完整程序Member article
  157. Function Calling 与 MCP:LLM 的工具接口标准Member article
  158. 生产级微调:从实验到部署的全流程Member article
  159. RAG 进阶:从基础检索到生产级知识增强Member article
  160. LLM 评估体系:构建可信的测试框架Member article
  161. Embedding 模型:语义表示的基础设施Member article
  162. LLM 推理优化实战:从代码到生产部署Member article
  163. LLM 应用架构模式:从原型到生产Member article
  164. LLM 行业应用:垂直场景的落地实践Member article
  165. LLMOps:大模型的运维工程体系Member article
  166. 多模态应用开发:视觉、语音与文本的融合Member article
  167. 开源 LLM 生态全景:工具链与社区Member article
  168. LLM 经济学:成本、收益与商业模式Member article
  169. LLM 从业者指南:学习路径与职业发展Member article
  170. LLM 的未来:趋势、挑战与展望Member article
  171. 端到端 LLM 项目实战:构建生产级智能问答系统Member article
  172. 进阶微调技术:从 LoRA 到全参数精调Member article
  173. LLM 可解释性:打开黑盒的探索Member article
  174. 知识图谱与 LLM 的结合:结构化与非结构化的融合Member article
  175. LLM 硬件与基础设施:GPU、互联与存储Member article
  176. 2025 年 LLM 研究前沿:最新进展速览Member article
  177. 24 知识复习与融会贯通Member article
  178. 实战项目集与挑战题:检验你的 LLM 掌握程度Member article
  179. 参数初始化Member article

Reading and learning support

Forewords are public. Other chapters require access to the column or the whole library.

Overview reviewed on

Learning notes and complete roadmap