AI DAILY / 2026-09-25
GitHub热门AI工程课程:从机器学习到智能体系统设计
amitshekhariitbhu/ai-engineering-course
全文中文翻译 · AI 生成,仅供学习交流
AI 工程课程
AI 工程课程 - 一门免费且完整的 AI 工程课程,帮助你一步步学习 AI 工程 , 从机器学习(Machine Learning)、神经网络(Neural Networks)和 Transformer,到 LLM、微调(Fine-Tuning)、RAG、AI Agent、LLM 推理(Inference)、评估(Evaluation)、AI 安全(Safety)以及 AI 系统设计(System Design)。每一节都配有详尽的博客文章,许多节还配有视频。
这门 AI 工程课程适合任何想要成为以下角色的人:
- AI 工程师
- 生成式 AI 工程师(Gen AI Engineer)
- LLM 工程师
- Agentic AI 工程师(译注:Agentic 强调 AI 自主行动与目标驱动的能力,中文常译作"智能体式 AI",圈内也常直接保留 Agentic 一词)
- AI Agent 工程师
- 前线部署工程师(Forward Deployed Engineer)(译注:该职位由 Palantir 推广,指驻扎在客户现场交付项目的工程师)
- AI 解决方案架构师
- AI 平台工程师
- 应用 AI 工程师
- 机器学习工程师
- MLOps 工程师
- LLMOps 工程师注:本 AI 工程课程会随着我撰写更多博客和制作更多新主题视频而持续扩充。请持续学习。
关于本 AI 工程课程
- 什么是 AI 工程?
- 本 AI 工程课程面向谁?
- 本 AI 工程课程将学些什么?
- 本 AI 工程课程的前置要求
- 如何使用本 AI 工程课程
- AI 工程课程总览
- AI 工程学习路径
- 模块 0:必知必会
- 模块 1:机器学习基础
- 模块 2:深度学习与神经网络
- 模块 3:生成式 AI 与 Transformer 架构
- 模块 4:LLM 如何生成文本
- 模块 5:现代 LLM 架构
- 模块 6:语言模型的类型
- 模块 7:训练、微调与对齐
- 模块 8:提示工程与上下文工程
- 模块 9:向量检索与检索增强生成(RAG)
- 模块 10:AI Agent 与 Agentic 系统
- 模块 11:Agentic 工程与 Agent 框架
- 模块 12:LLM 推理工程
- 模块 13:评估与可观测性
- 模块 14:AI 安全与防御
- 模块 15:多模态 AI 与生成式模型
- 模块 16:AI 基础设施、部署与系统设计
- 模块 17:AI 前沿思想
- 模块 18:准备 AI 工程面试
- AI 工程关键概念术语表
- AI 工程课程常见问题
- 许可协议
关于本 AI 工程课程
这门 AI 工程课程是一门免费、结构化、循序渐进的课程体系,旨在从零开始学习 AI 工程。它包含 18 个模块、146+ 节深入课程,每一节都是一篇详细的博客文章,以通俗易懂的语言、示例、图表以及必要的数学推导来解释一个概念。
简而言之,这正是我在初学 AI 工程时希望拥有的课程。我们从机器学习的基础开始,逐步深入到 Transformer 的内部工作原理、LLM 如何生成文本、如何对 LLM 进行微调与对齐、如何构建 RAG 系统和 AI Agent、如何在生产环境中又快又省地服务 LLM、如何评估并保障其安全,最终学会如何端到端地设计一个完整的 AI 系统。
本 AI 工程课程中的每一节都:
- 免费阅读。
- 无需注册。无付费墙。
- 为初学者撰写。
- 无行话。无假设。
- 详尽细致。
- 我们从"为什么需要它"讲到"它是如何一步步工作的",再到"它在现实世界中的应用"。
- 循序递进。
- 每一节都建立在前一节的基础之上。
什么是 AI 工程?
AI 工程是在 AI 模型(尤其是大语言模型 LLM)之上构建真实世界应用和系统的学科。
AI 工程师并不总是从零开始训练模型。相反,AI 工程师了解这些模型的内部工作原理,能挑选合适的模型,为其提供恰当的上下文,将其与工具和数据相连,使其运行又快又省,衡量它的表现是否良好,保障其安全,并最终交付给真实用户。
简而言之:AI 工程 = 理解模型 + 在模型之上构建 + 在生产环境中运行模型。
这正是我们在这门 AI 工程课程中将学习的内容。
本 AI 工程课程面向谁?
本 AI 工程课程适合:
- 希望转型到 AI 工程的软件工程师。
- 希望打造 AI 驱动产品的后端、移动端和前端开发者。
- 希望深入研究 LLM、RAG 和 AI Agent 的机器学习工程师和数据科学家。
- 希望开启 AI 职业生涯的学生和应届毕业生。
- 希望了解现代 AI 系统构建方式的工程经理和技术负责人。
- 任何准备 AI 工程师面试的人。
本 AI 工程课程将学些什么?
在本 AI 工程课程中,我们将学习:
- 机器学习基础:监督学习、无监督学习和强化学习,损失函数、正则化、精确率与召回率。
- 深度学习:梯度下降、反向传播、交叉熵、Dropout、归一化、RNN、PyTorch 和 TensorFlow。
- Transformer 架构:分词(tokenization)、BPE、嵌入(embedding)、自注意力(self attention)、Q、K、V 背后的数学、多头注意力(multi-head attention)、因果掩码(causal masking)、RoPE 以及前馈网络(feed-forward network)。
- LLM 如何生成文本:温度(temperature)、top-k 与 top-p 采样、token 流式输出,以及"迷失在中间"(lost in the middle)问题。
- 现代 LLM 架构:混合专家(Mixture of Experts,MoE)、分组查询注意力(Grouped Query Attention,GQA)、滑动窗口注意力(sliding window attention)、注意力汇聚(attention sinks)、Flash Attention 以及 DeepSeek-V4。
- 语言模型的类型:SLM、大型推理模型(Large Reasoning Models)、递归语言模型(Recursive Language Models)、扩散语言模型(Diffusion Language Models)以及系统一模型(System One Models)。
- 微调与对齐:微调、LoRA、前缀微调(prefix tuning)、知识蒸馏(knowledge distillation)、持续学习(continual learning)、RLHF、InstructGPT、PPO、DPO 与 GRPO。
- 提示工程与上下文工程:思维链(chain-of-thought)、提示链(prompt chaining)、提示缓存(prompt caching)以及上下文压缩(context compaction)。
- RAG 与向量检索:向量数据库(vector databases)、ANN 检索、语义检索(semantic search)、混合检索(hybrid search)、重排序(rerankers)、ColBERT、分块(chunking)、HyDE、缓存、Agentic RAG、GraphRAG 与无向量 RAG(Vectorless RAG)。
- AI Agent:函数调用(function calling)、Agent 循环(agent loop)、ReAct、Plan-and-Execute、反思(Reflection)、记忆(memory)、MCP、Agent 技能(Agent Skills)、多智能体系统(multi-agent systems)、子智能体(SubAgents)、编排(orchestration)以及计算机使用 Agent(computer-use agents)。
- Agentic 工程:执行环境工程(harness engineering)、循环工程(loop engineering)、图工程(graph engineering)、LangChain、LangGraph、Claude Code 与 Cursor。
- LLM 推理工程:预填充与解码(prefill vs decode)、KV 缓存(KV cache)、分页注意力(paged attention)、连续批处理(continuous batching)、推测解码(speculative decoding)、Medusa、EAGLE、量化(quantization)、GGUF、llama.cpp、vLLM、SGLang 与 TensorRT-LLM。
- 评估与可观测性:LLM 评估、LLM 作为裁判(LLM as a judge)、AI Agent 评估以及 Agent 可观测性。
- AI 安全与防御:护栏(guardrails)、提示注入(prompt injection)与水印(watermarking)。
- 多模态 AI 与生成式模型:视觉 Transformer(Vision Transformers)、图像嵌入(image embeddings)、扩散模型(diffusion models)、GAN 与 VAE。
- AI 基础设施与系统设计:GPU、TPU、LPU、云端 vs 端侧部署、LLM 路由(LLM routing)以及实时语音 AI Agent 的设计。
- AI 前沿思想:JEPA、世界模型(world models)与递归自我改进(recursive self-improvement)。
- AI 工程面试准备。
本 AI 工程课程的前置要求
- 基本的编程知识,最好是 Python。课程中的大多数代码示例都使用 Python。
- 高中水平的数学知识。
- 我们会在课程中一步步讲解所需的线性代数、微积分和概率知识。
- 好奇心。
仅此而已。
无需任何 AI 或机器学习的相关背景。
如何使用本 AI 工程课程
本 AI 工程课程的设计使得任何人都能按既定顺序跟随学习,即便完全没有 AI 背景。
在每个模块中,请按给定顺序阅读课程。每一节都用通俗易懂的语言和示例来解释一个概念。
即便时间紧迫,也不要跳过模块 1 和模块 2。AI 工程的其余一切都建立在它们的基础之上。
如果你已经了解某个主题,可以先阅读该课程的"我们将涵盖以下内容"列表。如果你能解释每一个要点,就继续下一节。
完成每个模块后,试着用自己的语言向朋友解释这些概念。如果你能讲清楚,就说明你已经掌握了。
让我们开始吧。
AI 工程课程总览
| 模块 | 主题 |
|---|---|
| 0 | 必知必会 |
| 1 | 机器学习基础 |
| 2 | 深度学习与神经网络 |
| 3 | 生成式 AI 与 Transformer 架构 |
| 4 | LLM 如何生成文本 |
| 5 | 现代 LLM 架构 |
| 6 | 语言模型的类型 |
| 7 | 训练、微调与对齐 |
| 8 | 提示工程与上下文工程 |
| 9 | 向量检索与检索增强生成(RAG) |
| 10 | AI Agent 与 Agentic 系统 |
| 11 | Agentic 工程与 Agent 框架 |
| 12 | LLM 推理工程 |
| 13 | 评估与可观测性 |
| 14 | AI 安全与防御 |
| 15 | 多模态 AI 与生成式模型 |
| 16 | AI 基础设施、部署与系统设计 |
| 17 | AI 前沿思想 |
| 18 | 准备 AI 工程面试 |
AI 工程学习路径
flowchart TD
A[机器学习基础] --> B[深度学习与神经网络]
B --> C[生成式 AI 与 Transformer]
C --> D[LLM 如何生成文本]
D --> E[现代 LLM 架构]
E --> F[语言模型的类型]
F --> G[训练、微调与对齐]
G --> H[提示与上下文工程]
H --> I[RAG 与向量检索]
I --> J[AI Agent 与 Agentic 系统]
J --> K[Agentic 工程与框架]
K --> L[LLM 推理工程]
L --> M[评估与可观测性]
M --> N[AI 安全与防御]
N --> O[多模态 AI 与生成式模型]
O --> P[AI 基础设施与系统设计]
P --> Q[AI 前沿思想]
Q --> R[AI 工程面试]Loading
模块 0:必知必会
在深入细节之前,我们必须先知道在每一次 AI 工程对话中都会出现的六个词:
- LLM
- RAG
- MCP
- Agent
- Fine-tuning
- Quantization通过一段视频了解全部六个:AI Engineering Explained: LLM, RAG, MCP, Agent, Fine-Tuning, Quantization现在,我们已经了解了整体图景。在接下来的模块中,我们将逐一深入学习每一个概念。
模块 1:机器学习基础
在本模块中,我们将学习什么是机器学习、机器可以学习的不同方式,以及在后续每个模块中都会反复使用的基本术语。
到本模块结束时,我们将了解模型如何从数据中学习,我们如何衡量它,以及如何防止它过拟合。
本模块的课程:
- 什么是机器学习?
- 监督学习 vs 无监督学习
- 线性回归 vs 逻辑回归
- 什么是机器学习中的特征工程?
- 精确率 vs 召回率
- 什么是 L1 和 L2 损失函数?
- 什么是机器学习中的正则化?L1 vs L2 详解
- 什么是强化学习?
- 什么是对比学习?它是如何一步步工作的?
1.1 什么是机器学习?
在这篇博客中,我们将学习什么是机器学习。
让我们开始吧:什么是机器学习?
1.2 监督学习 vs 无监督学习
在这篇博客中,我们将学习机器学习中的监督学习与无监督学习。
我们将涵盖以下内容:
- 监督学习
- 无监督学习
- 监督学习与无监督学习的区别让我们开始吧:监督学习 vs 无监督学习
1.3 线性回归 vs 逻辑回归
在这篇博客中,我们将学习机器学习中的线性回归与逻辑回归。
我们将涵盖以下内容:
- 线性回归
- 逻辑回归
- 线性回归与逻辑回归的区别让我们开始吧:线性回归 vs 逻辑回归
1.4 什么是机器学习中的特征工程?
在这篇博客中,我们将学习机器学习中的特征工程。
让我们开始吧:什么是机器学习中的特征工程?
观看视频:机器学习中的特征工程
观看视频:机器学习中的独热编码
1.5 精确率 vs 召回率
在这篇博客中,我们将学习精确率与召回率,这两个数字用来衡量一个系统在做出"是或否"决策时的表现。我们还将了解精确率和召回率之间的区别以及何时使用哪一个,任何此类决策的四种可能结果是什么,为什么这两个数字会相互拉扯,以及错误的成本如何决定我们更应关注哪一个。
我们将涵盖以下内容:
- 我们要解决的问题
- 四种可能的结果
- 什么是精确率?
- 什么是召回率?
- 精确率 vs 召回率
- 何时使用哪一个?
- 公式快速回顾
- 小结让我们开始吧:精确率 vs 召回率
1.6 什么是 L1 和 L2 损失函数?
在这篇博客中,我们将学习 L1 和 L2 损失函数。
我们将涵盖以下内容:
- L1 损失函数
- L2 损失函数
- 如何在 L1 和 L2 损失函数之间抉择?
让我们开始吧:什么是 L1 和 L2 损失函数?
1.7 什么是机器学习中的正则化?L1 vs L2 详解
在这篇博客中,我们将学习机器学习中的正则化。
我们将涵盖以下内容:
- 什么是过拟合?
- L1 正则化或 Lasso 正则化
- L2 正则化或 Ridge 正则化让我们开始吧:什么是机器学习中的正则化?L1 vs L2 详解
1.8 什么是强化学习?
在这篇博客中,我们将学习强化学习,机器学习的一个分支,其中智能体(agent)通过与环境交互并根据其行为获得奖励或惩罚来学习做出决策。
我们将涵盖以下内容:
- 全局视角
- 什么是强化学习?
- 一个简单的现实类比
- 强化学习的基本要素
- 强化学习循环
- 强化学习 vs 监督学习 vs 无监督学习
- 回合、回报与折扣因子
- 探索 vs 利用
- 常见的强化学习算法家族
- 强化学习的应用场景
- 为什么强化学习很难
- 快速小结让我们开始吧:什么是强化学习?
1.9 什么是对比学习?它是如何一步步工作的?
在这篇博客中,我们将学习对比学习。我们还将了解它是如何一步步工作的,以及它在现实世界中的应用。
我们将涵盖以下内容:
- 什么是对比学习?
- 为什么我们需要对比学习?
- 对比学习背后的核心思想
- 正样本对与负样本对
- 对比学习是如何一步步工作的?
- 对比学习中使用的损失函数
- 主流的对比学习方法
- 对比学习的现实用例让我们开始吧:什么是对比学习?它是如何一步步工作的?
模块 1 的视频和更多资源:
- 机器学习中的特征工程(视频)
- 机器学习中的独热编码(视频)
模块 2:深度学习与神经网络
在本模块中,我们将学习神经网络究竟是如何学习的。我们将一步步理解梯度下降和反向传播背后的数学,以及使训练稳定的技术。
到本模块结束时,我们将能够解释神经网络是如何训练的,从前向传播到权重更新,以及为什么归一化和 Dropout 如此重要。
本模块的课程:
- 人工神经网络中的偏置是什么?
- 梯度下降是如何工作的?
- 反向传播是如何工作的?数学一步步详解
- 什么是交叉熵损失?
- 神经网络中的 Dropout 是什么?它是如何工作的?
- 批归一化 vs 层归一化
- 什么是 RMSNorm?均方根层归一化详解
- 什么是循环神经网络(RNN)?
- PyTorch 是如何工作的?
- 机器学习库 TensorFlow 是如何工作的?
2.1 人工神经网络中的偏置是什么?
在这篇博客中,我们将学习人工神经网络中的偏置。
让我们开始吧:人工神经网络中的偏置是什么?
2.2 梯度下降是如何工作的?
在这篇博客中,我们将通过一步步的数值示例学习梯度下降背后的数学。
我们将涵盖以下内容:
- 全局视角
- 什么是损失函数
- 什么是梯度下降
- 梯度下降的直觉
- 梯度下降的数学
- 一步步的数值示例
- 多参数下的梯度下降
- 学习率的作用
- 梯度下降的类型
- Python 中的梯度下降
- 融会贯通让我们开始吧:梯度下降是如何工作的?
观看视频:Epoch、Batch、Batch Size、Iteration
2.3 反向传播是如何工作的?数学一步步详解
在这篇博客中,我们将学习神经网络中反向传播背后的数学。
我们将涵盖以下内容:
- 什么是反向传播?
- 微积分的链式法则
- 前向传播
- 损失计算
- 反向传播(Backpropagation)
- 一步步的数值示例
- 使用梯度下降更新权重
- Python 中的反向传播让我们开始吧:反向传播是如何工作的?数学一步步详解
2.4 什么是交叉熵损失?
在这篇博客中,我们将通过一步步的数值示例学习交叉熵损失背后的数学。
我们将涵盖以下内容:
- 全局视角
- 什么是交叉熵
- 交叉熵损失公式
- 为什么我们要取负对数
- 二元交叉熵损失
- 类别交叉熵损失
- 一步步的数值示例
- 语言模型的交叉熵损失
- 交叉熵损失的梯度
- 快速小结让我们开始吧:什么是交叉熵损失?
观看视频:机器学习中的 Softmax 激活函数
2.5 神经网络中的 Dropout 是什么?它是如何工作的?
在这篇博客中,我们将学习神经网络中的 Dropout。我们将了解它是什么、它解决的问题、它是如何通过简单示例一步步工作的,以及它的应用场景。
我们将涵盖以下内容:
- 什么是 Dropout?
- 过拟合问题
- 为什么我们需要 Dropout?
- Dropout 是如何工作的?
- 一步步的示例
- 训练阶段 vs 测试阶段的 Dropout
- 代码中的 Dropout
- Dropout 的变体
- Dropout 的优势
- Dropout 的应用场景让我们开始吧:神经网络中的 Dropout 是什么?它是如何工作的?
2.6 批归一化 vs 层归一化
在这篇博客中,我们将学习批归一化与层归一化。我们还将了解二者之间的区别以及何时使用哪一种。
我们将涵盖以下内容:
- 什么是归一化?
- 为什么我们需要归一化?
- 什么是批归一化?
- 什么是层归一化?
- 批归一化 vs 层归一化
- 何时使用哪一种?
让我们开始吧:批归一化 vs 层归一化
2.7 什么是 RMSNorm?均方根层归一化详解
在这篇博客中,我们将学习 RMSNorm,一种更快、更简单的层归一化替代方案,它支撑着大多数现代大语言模型,如 Llama、Mistral、Gemma、Qwen、PaLM 和 DeepSeek。
我们将涵盖以下内容:
- 为什么深度网络需要归一化
- 层归一化(LayerNorm)快速回顾
- 什么是 RMSNorm 及其工作原理
- 通过具体数值示例详解 RMSNorm 的数学
- LayerNorm vs RMSNorm,关键差异
- 为什么现代 LLM 更青睐 RMSNorm
- 代码示例
- RMSNorm 在 Transformer 中的位置
- 快速小结让我们开始吧:什么是 RMSNorm?均方根层归一化详解
2.8 什么是循环神经网络(RNN)?
在这篇博客中,我们将学习循环神经网络。
让我们开始吧:什么是循环神经网络(RNN)?
2.9 PyTorch 是如何工作的?
在这篇博客中,我们将学习 PyTorch 是如何工作的。我们还将了解什么是张量(tensor)、计算图(computation graph)和 autograd 如何协同训练模型,以及为什么 PyTorch 利用 GPU 成为现实世界中最受欢迎的工具之一。
我们将涵盖以下内容:
- 什么是 PyTorch?
- 什么是张量?
- PyTorch 解决的问题
- 什么是计算图?
- 什么是 Autograd?
- 一个完整的训练示例
- 什么是 GPU?为什么 PyTorch 使用它?
- 为什么 PyTorch 如此流行?
让我们开始吧:PyTorch 是如何工作的?
2.10 机器学习库 TensorFlow 是如何工作的?
在这篇博客中,我们将学习机器学习库 TensorFlow 是如何工作的。
让我们开始吧:机器学习库 TensorFlow 是如何工作的?
模块 2 的视频和更多资源:
- Epoch、Batch、Batch Size、Iteration(视频)
模块 3:生成式 AI 与 Transformer 架构
在本模块中,我们将