DANDAN LEARN / Large Language Models
从 Transformer 到顶尖 LLM
理解 Transformer 如何工作,掌握预训练 / SFT / RLHF 的训练闭环,能读懂前沿论文并把模型部署到生产。
Learning goals
Put principles into practice.
- 理解注意力、位置编码与 Transformer 架构
- 梳理预训练、微调与对齐的不同职责
- 理解推理部署与应用中的工程取舍
Who this is for
- 希望深入大模型原理、训练和应用的开发者
Prerequisites
- 熟悉 Python;了解基础机器学习概念
A closer look
A few chapters to start with
Jump to a chapter 10 chapters
序言
演进时间线
架构与原理
训练与微调
SFT & 对齐
推理与部署
Agent & 应用
前沿研究
- Test-Time Compute:o1 / R1 的推理时扩展Member article
- MoE 混合专家架构深度解读Member article
- LLaMA 4 架构解读:MoE 化与 iRoPE 长上下文Member article
- Agentic AI:让 LLM 成为行动者Member article
- 多模态大模型架构:视觉 + 语言Member article
- 自监督语音表征:wav2vec / HuBERT / WhisperMember article
- 音频 Token 化与端到端语音对话:EnCodec / VALL-E / GPT-4oMember article
- 世界模型基础:World Models / PlaNet / DreamerMember article
- 视频生成与世界模拟器:Sora / Genie / GameNGenMember article
- 长上下文推理:100K Token 时代的工程挑战Member article
- 综合实战:前沿论文精读与复现Member article
大模型实操速通(w30)
- LLM API 环境配置与多轮对话(OpenAI / DeepSeek 兼容)Member article
- 自定义 Prompt 提升解题能力 + Gradio 交互界面Member article
- LoRA 原理:从线性层到注意力机制的低秩注入Member article
- PEFT 快速实践:在大模型上应用 LoRA 的完整流程Member article
- Beam Search 原理与从零实现Member article
- Top-K / Top-P / Temperature 采样策略详解Member article
- DPO 微调:根据人类偏好优化 LLMMember article
- RTN 模型量化 + GGUF/GGML 格式解析Member article
- 本地运行量化 LLM:Transformers vs llama-cpp-pythonMember article
- RAG 入门实践:文档拆分 → 向量库 → LangChain 问答链Member article
- Tokenizer 原理:BPE vs WordPieceMember article
- Transformer 论文精读:Attention Is All You NeedMember article
更多文章
- 激活函数Member article
- 自编码模型Member article
- 自回归模型Member article
- 梯度与反向传播基础Member article
- 反向传播基础Member article
- 条件概率与贝叶斯公式基础Member article
- 微积分基础知识点详解Member article
- 链式法则基础Member article
- CNN基础Member article
- 协方差与相关系数基础Member article
- 数据构建与清洗Member article
- 导数与偏导数基础Member article
- 常见概率分布基础Member article
- 特征值 (Eigenvalue) 与 特征向量 (Eigenvector) 详解Member article
- 期望与方差基础Member article
- 前向传播Member article
- 全量参数微调Member article
- 梯度下降法Member article
- 梯度基础Member article
- 指令微调Member article
- 积分与基本定理基础Member article
- Agent 开发实战Member article
- Harness 架构设计Member article
- 2026 大模型求职全景指南Member article
- 推理加速与量化Member article
- 3-6个月学习路线Member article
- LLMOps 全链路Member article
- LoRA/QLoRA 微调实战Member article
- Python 工程栈实战Member article
- RAG 全链路工程化Member article
- 安全合规与幻觉治理Member article
- 岗位能力地图 — 对照自查,精准补全短板Member article
- KL散度基础Member article
- 线性变换 (Linear Transformation) 详解Member article
- 损失函数Member article
- 矩阵 (Matrix) 基础知识详解Member article
- 神经网络基础Member article
- 优化器基础Member article
- 感知机与基础概念Member article
- 预训练任务Member article
- 概率论基础知识点详解Member article
- 随机变量与概率分布基础Member article
- 正则化技术Member article
- RNN基础Member article
- SFT基础概念Member article
- 奇异值分解 (Singular Value Decomposition, SVD) 详解Member article
- 泰勒展开基础Member article
- 向量空间 (Vector Space) 详解Member article
- 向量 (Vector) 基础知识详解Member article
- Feed-Forward Network & 残差归一化深入Member article
- 动手实现最小 Transformer + 本周小结Member article
- 分词与嵌入:从文本到向量Member article
- 训练实战:把 Tiny Transformer 跑起来Member article
- Transformer 鸟瞰 —— 整体结构与信息流Member article
- 完整代码手写实现 AttentionMember article
- 注意力复杂度分析与优化Member article
- Attention 的直觉理解 —— 查询/键/值的隐喻Member article
- 注意力变体 —— Sparse / Linear / FlashMember article
- 多头注意力机制实现Member article
- Scaled Dot-Product Attention 完整推导Member article
- 综合实战 —— 从零搭建小型 TransformerMember article
- 链式法则与反向传播Member article
- 综合实战:手写 BP vs PyTorch 验证Member article
- 导数与梯度直觉理解Member article
- 信息论:熵、交叉熵、KL 散度Member article
- 极大似然估计Member article
- 概率论基础Member article
- PyTorch 自动微分实战Member article
- Tokenizer 原理与实战Member article
- 对齐综合实战:LLaMA-Factory 全流程Member article
- Capstone:端到端对齐一个 1.5B 模型Member article
- Capstone:构建企业级 RAG 系统Member article
- Embedding 模型Member article
- RAG 系统评估Member article
- Reranker:精排提升 RAG 质量Member article
- 检索策略:BM25、稠密检索与混合检索Member article
- LLM Agent 系统设计Member article
- LLM 安全:攻击与防御Member article
- 结构化输出:JSON Mode 与约束解码Member article
- Capstone - 多模态 RAG 问答系统实战Member article
- 图文对比学习与 CLIP 原理Member article
- GPT-4V 与多模态大模型工程Member article
- LLaVA 视觉语言模型实战Member article
- Sora 架构分析:视频生成原理Member article
- Vision Transformer (ViT) 深度剖析Member article
- Capstone - 128k 上下文长文档问答系统Member article
- FlashAttention 与长序列工程Member article
- 稀疏注意力:Longformer 与 BigBirdMember article
- 记忆增强:外部记忆与 MemGPTMember article
- 位置插值:PI / YaRN / LongRoPEMember article
- RoPE 原理与长度外推Member article
- 基准测评:MMLU / HumanEval / HELMMember article
- 生产级 LLM 评估管线设计Member article
- 幻觉检测与缓解Member article
- 人类偏好评估与 LLM-as-JudgeMember article
- 红队测试与安全评估Member article
- Capstone - 从零预训练 1B 参数语言模型Member article
- Checkpoint 策略与训练恢复Member article
- 课程学习与数据调度Member article
- 预训练数据配比与过滤Member article
- 训练监控与调试Member article
- Capstone - 数据分析 Agent 系统Member article
- Code Interpreter:代码执行 AgentMember article
- Multi-Agent:协作与调度Member article
- OS Agent:计算机控制Member article
- Tool Use 进阶:并行与条件调用Member article
- Web Agent:浏览器操作Member article
- LLM API 设计规范Member article
- 上下文管理与多租户Member article
- 成本控制与优化Member article
- LLMOps:监控与可观测性Member article
- 流式输出:SSE 与 WebSocketMember article
- 大模型架构演进Member article
- Capstone - LLM 模拟面试系统Member article
- 工程面试题精讲Member article
- 综合真题精讲 50 题Member article
- 训练技巧与优化器Member article
- Transformer 深度细节Member article
- SmartDocs Agent 集成Member article
- Capstone - SmartDocs AI 端到端实战Member article
- API 服务与部署Member article
- 知识库构建Member article
- SmartDocs AI 系统设计Member article
- Flash Attention:重新思考注意力机制的计算方式Member article
- 大模型训练的学习率调度策略Member article
- 大模型预训练数据混合策略Member article
- Muon 优化器:超越 AdamW 的新选择?Member article
- 大模型权重初始化:被低估的训练关键Member article
- Batch Size 与训练效率:如何选择最优批次大小Member article
- RLHF 深度解析:从 PPO 到现代实现Member article
- DPO 及其变体:简化对齐的新范式Member article
- 奖励模型训练:RLHF 的隐藏核心Member article
- Constitutional AI 与 RLAIF:让 AI 训练 AIMember article
- 过程奖励模型(PRM):奖励每一步推理Member article
- Rejection Sampling Fine-tuning(RFT):简单而有效的对齐技术Member article
- GRPO 与 DeepSeek-R1:让模型学会"慢慢思考"Member article
- 对齐效果评估:如何知道 RLHF/DPO 真的有效?Member article
- KV Cache 优化:推理加速的核心Member article
- 推测解码(Speculative Decoding):用小模型加速大模型Member article
- 大模型量化进阶:从 GPTQ 到 AWQMember article
- 知识蒸馏:让小模型学习大模型的"智慧"Member article
- 推理阶段的张量并行与流水线并行Member article
- 模型剪枝与稀疏性:另一条压缩道路Member article
- LLaMA 3 架构深度解析Member article
- Mistral 与 Mixtral:稀疏专家模型的工程典范Member article
- DeepSeek 系列架构解析:从 V2 到 V3Member article
- Qwen 与 Gemma:中西双线的开源标杆Member article
- 状态空间模型(SSM):Transformer 的挑战者Member article
- 主流架构横向对比:如何选择适合你的模型Member article
- 持续学习(Continual Learning):让模型不断进化而不遗忘Member article
- 前沿 Scaling Laws:超越 Chinchilla 的新发现Member article
- 模型合并(Model Merging):不训练也能提升能力Member article
- 合成数据(Synthetic Data):用 AI 训练 AI 的新范式Member article
- 上下文压缩:让长上下文处理更高效Member article
- LLM 安全前沿:对抗攻击与防御Member article
- 代码大模型:从补全到生成完整程序Member article
- Function Calling 与 MCP:LLM 的工具接口标准Member article
- 生产级微调:从实验到部署的全流程Member article
- RAG 进阶:从基础检索到生产级知识增强Member article
- LLM 评估体系:构建可信的测试框架Member article
- Embedding 模型:语义表示的基础设施Member article
- LLM 推理优化实战:从代码到生产部署Member article
- LLM 应用架构模式:从原型到生产Member article
- LLM 行业应用:垂直场景的落地实践Member article
- LLMOps:大模型的运维工程体系Member article
- 多模态应用开发:视觉、语音与文本的融合Member article
- 开源 LLM 生态全景:工具链与社区Member article
- LLM 经济学:成本、收益与商业模式Member article
- LLM 从业者指南:学习路径与职业发展Member article
- LLM 的未来:趋势、挑战与展望Member article
- 端到端 LLM 项目实战:构建生产级智能问答系统Member article
- 进阶微调技术:从 LoRA 到全参数精调Member article
- LLM 可解释性:打开黑盒的探索Member article
- 知识图谱与 LLM 的结合:结构化与非结构化的融合Member article
- LLM 硬件与基础设施:GPU、互联与存储Member article
- 2025 年 LLM 研究前沿:最新进展速览Member article
- 24 知识复习与融会贯通Member article
- 实战项目集与挑战题:检验你的 LLM 掌握程度Member article
- 参数初始化Member article
Reading and learning support
Forewords are public. Other chapters require access to the column or the whole library.
Overview reviewed on