人工智能学习总览¶
适用人群:准备系统学习机器学习、深度学习、强化学习或大语言模型的读者 前置要求:掌握基本 Python,了解向量、函数和概率的直觉 最后更新:2026-07-20
1. 人工智能到底是什么¶
人工智能(Artificial Intelligence,AI)不是某一种算法,而是让计算系统完成感知、预测、推理、决策和生成任务的总称。机器学习是 AI 的主要实现路径;深度学习是机器学习中以多层神经网络为核心的方法;大语言模型是深度学习在大规模文本和多模态数据上的代表;强化学习则研究智能体如何通过行动、反馈和长期回报学习策略。
人工智能 AI
├── 规则系统、搜索、规划、知识表示
└── 机器学习 ML
├── 监督学习
├── 无监督与自监督学习
├── 深度学习 DL
│ └── 大语言模型 LLM
└── 强化学习 RL
这些集合并非完全互斥。现代大语言模型属于深度学习,预训练主要采用自监督学习,对齐阶段又可能使用强化学习。正确学习方式不是争论“哪一种更高级”,而是先明确任务、数据、目标和约束,再选择合适方法。
2. 从传统程序到学习系统¶
传统程序由人明确编写规则:输入数据和规则,得到输出。机器学习则提供输入和目标结果,让算法从样本中估计规则。两者并不冲突,真实系统通常是“确定性业务逻辑 + 学习模型”的组合。
一个学习系统可以抽象为模型 \(f_\theta\)。输入为 \(x\),参数为 \(\theta\),预测为:
训练的目标,是让预测 \(\hat{y}\) 尽可能符合真实目标 \(y\)。为此定义损失函数 \(\ell(\hat{y},y)\),在训练数据 \(D=\{(x_i,y_i)\}_{i=1}^{n}\) 上最小化经验风险:
仅仅记住训练样本并没有价值。真正目标是让模型对未见数据也有效,这叫泛化。因此数据需要划分为训练集、验证集和测试集:训练集更新参数,验证集选择模型和超参数,测试集只用于最终无偏评估。若测试信息泄漏进训练过程,得到的高分不能代表上线表现。
为了限制模型过度复杂,训练目标常加入正则项:
其中 \(\Omega\) 惩罚过大的参数或复杂结构,\(\lambda\) 控制拟合训练数据与保持简单之间的权衡。
3. 四种主要学习范式¶
3.1 监督学习¶
监督学习使用带标签样本。回归预测连续数值,例如价格、温度和耗时;分类预测离散类别,例如欺诈识别、垃圾邮件和缺陷类型。常见方法包括线性/逻辑回归、决策树、随机森林、梯度提升树、支持向量机和神经网络。
监督学习最昂贵的部分往往不是模型,而是建立准确、一致、无偏的标签。标签定义不清会把业务歧义直接写进模型。
3.2 无监督学习¶
无监督学习没有明确标签,目标是发现数据结构。聚类寻找相似群体,降维寻找低维表示,异常检测识别偏离常态的样本。无监督结果通常没有唯一标准答案,需要结合业务解释和下游效果验证。
3.3 自监督学习¶
自监督学习从数据本身构造监督信号。语言模型用前文预测下一个 Token,视觉模型可以遮挡图像区域再重建。它避免了人工逐条标注,使模型能从海量原始数据学习通用表示,再通过少量标注数据适配具体任务。
3.4 强化学习¶
强化学习中的智能体在环境中选择动作,接收奖励并进入新状态。目标不是预测固定标签,而是最大化长期累计回报。它适合动作会影响未来、反馈延迟且需要连续决策的任务,例如机器人控制、游戏和资源调度。
4. 数据是系统边界,不只是模型燃料¶
数据决定模型能学到什么,也决定它在哪些人群和场景上可靠。一个完整数据流程包括采集、授权、清洗、去重、标注、版本化、划分、特征处理和质量监控。
4.1 数据分布与采样¶
训练数据应近似覆盖上线输入分布。若医院模型只在某一设备或人群上训练,换到其他设备和人群时可能失效。对类别不均衡问题,只看准确率尤其危险:若阳性率只有 1%,永远预测阴性也有 99% 准确率。
4.2 数据泄漏¶
数据泄漏是指训练时使用了预测发生时不可能获得的信息。常见形式包括:先在全量数据上标准化再划分;同一用户的高度相似样本同时出现在训练集和测试集;把事后产生的字段作为特征;反复查看测试集后调参。
预处理应只在训练集上拟合,然后应用到验证集和测试集。scikit-learn 的 Pipeline 能把预处理与模型绑定,降低泄漏风险。
4.3 分布漂移¶
上线后输入分布 \(P(X)\)、标签关系 \(P(Y\mid X)\) 或类别比例 \(P(Y)\) 可能变化。模型监控不能只看服务器是否存活,还要观察输入缺失率、特征分布、预测分布、真实业务指标和延迟反馈标签。
5. 模型训练与优化¶
大多数可微模型使用梯度下降。若目标函数为 \(J(\theta)\),学习率为 \(\eta\),参数更新为:
学习率过大会越过最优区域甚至发散,过小则训练缓慢。随机梯度下降使用小批量样本估计真实梯度,降低每次更新成本;Momentum、Adam 等优化器利用历史梯度改善方向和步长。
需要区分三类值:参数由训练自动学习,例如神经网络权重;超参数由人或搜索过程设置,例如学习率、树深度和批量大小;模型状态还可能包括归一化统计量和优化器动量。部署和恢复训练时必须保存正确的全部状态。
过拟合表现为训练误差继续下降、验证误差开始上升。常见应对方法包括更多高质量数据、数据增强、正则化、简化模型、早停和交叉验证。欠拟合则意味着训练集本身都表现差,需要更有效特征、更合适模型或更充分训练。
6. 评估指标必须匹配真实目标¶
分类任务的混淆矩阵由 TP、FP、TN、FN 构成。常用指标为:
误报代价高时关注精确率,漏报代价高时关注召回率。F1 平衡两者,但它忽略 TN;类别严重不均衡时还应查看 PR-AUC、不同阈值下的成本和概率校准。
回归任务常用 MAE、MSE 和 RMSE:
RMSE 对大误差惩罚更重,MAE 对异常值更稳健。离线指标提升不等于业务价值提升;最终还需通过灰度发布、A/B 测试和业务指标确认。
7. 推理、部署与 MLOps¶
训练产生模型,推理使用模型处理新输入。上线系统除了预测精度,还要满足延迟、吞吐、内存、成本、可用性和隐私要求。批处理适合离线报表,在线服务要求低延迟,边缘推理强调体积和功耗。
模型版本不能只记录权重文件。可复现版本至少应关联:代码提交、依赖环境、训练配置、数据快照或数据版本、随机种子、评估报告和模型制品。否则一次训练成功后,很可能无法解释或复现。
模型发布建议遵循:离线评估 → 影子流量 → 小比例灰度 → 逐步扩容 → 持续监控。必须准备快速回滚到上一模型版本的能力。高风险任务应保留人工复核和拒答机制,不能把模型输出直接当成事实或最终裁决。
8. 生成式 AI 与大语言模型¶
判别模型学习 \(P(Y\mid X)\),用于从输入判断目标;生成模型学习数据分布或条件分布,可以生成新的文本、图像和音频。自回归语言模型把序列概率分解为:
每一步预测下一个 Token 的概率,连续采样形成文本。模型输出流畅,不代表内容真实,因为训练目标主要优化“下一个 Token 是否合理”,而不是“陈述是否经过外部事实验证”。降低幻觉需要检索增强、工具调用、引用证据、结构化验证和人工审核的组合。
大语言模型应用通常分为四层:基础模型提供通用能力;提示和上下文描述当前任务;RAG 或工具连接外部事实与行动;应用层负责权限、状态、日志、安全和用户体验。真正可靠的系统工程远多于一段 Prompt。
9. 安全、伦理与负责任使用¶
模型会继承训练数据中的偏差,也可能泄露隐私、生成虚假内容或被对抗输入诱导。安全不是训练结束后的附加选项,而应贯穿需求、数据、模型、部署和运营。
至少应回答:数据是否取得合法授权;敏感信息是否最小化收集并脱敏;不同人群上的错误率是否明显不同;用户是否知道自己面对的是模型;高风险输出是否有人工复核;系统能否追踪模型、提示、数据和工具调用;发生事故时能否关闭功能并回滚。
LLM 应用还要防范提示注入、越权工具调用、敏感信息进入上下文、检索库投毒和不可信输出被下游程序直接执行。模型输出必须按不可信输入处理:验证类型和范围、限制工具权限、隔离执行环境、记录审计日志。
10. 学习路线与章节关系¶
如果目标是数据分析和传统预测,先学 机器学习,重点掌握数据处理、基准模型和评估。如果目标是视觉、语音或复杂表示学习,在机器学习之后进入 深度学习。如果目标是生成式 AI 应用,理解 Transformer 后继续学习 大语言模型。如果任务包含长期决策、控制或偏好优化,再学习 强化学习。
掌握模型原理后,可通过前沿 AI 工具综合指南学习通用助手、深度研究、编程 Agent、多模态工具、本地模型和自动化的实际选择方法;需要自行设计可调用工具、使用记忆并持续执行任务的系统时,再进入Agent 综合指南,学习控制循环、MCP/A2A、评估、可观测性和安全治理。
推荐顺序:
- Python、NumPy、Pandas、基础线性代数与概率。
- 机器学习流程、数据泄漏、交叉验证与指标。
- 神经网络、反向传播、优化器和 Transformer。
- LLM 的预训练、对齐、RAG、推理与 Agent。
- 强化学习中的 MDP、价值函数、策略梯度和 PPO。
- 前沿 AI 工具的选择、上下文工程、结果验证与安全使用。
- Agent 的工具协议、编排、评估、监控与成本治理。
11. 核心概念速查¶
| 概念 | 准确定义 | 常见误区 |
|---|---|---|
| 特征 | 模型可使用的输入变量 | 特征不一定天然有意义,需要验证 |
| 标签 | 监督学习希望预测的目标 | 标签可能有噪声和偏差 |
| 参数 | 从训练数据学习的值 | 不等同于人工设置的超参数 |
| 损失 | 单样本或批次错误的可优化度量 | 不一定等同于业务指标 |
| 训练 | 根据数据更新参数 | 训练分数高不代表泛化好 |
| 推理 | 使用固定模型产生预测 | 仍需要输入校验和监控 |
| Epoch | 完整遍历训练集一次 | 更多 Epoch 不一定更好 |
| Batch | 一次参数更新使用的样本集合 | 批量大小会影响显存与优化 |
| Embedding | 对象在连续向量空间中的表示 | 距离只在训练语义下有意义 |
| Token | 分词器定义的文本基本单位 | 不等同于汉字或单词 |
| RAG | 检索外部资料后辅助生成 | 不能自动保证检索内容正确 |
| Agent | 能规划并调用工具的模型系统 | 不是天然可靠的自主智能 |
延伸阅读¶
- Google Machine Learning Crash Course:机器学习概念与练习
- Dive into Deep Learning:可运行代码与数学并行的开放教材
- Stanford AI Index:AI 产业、研究和社会影响年度报告
- NIST AI Risk Management Framework:AI 风险治理框架
本文档持续维护更新。如有错误或建议,欢迎提交 Issue 或 PR。