跳转至

人工智能学习总览

适用人群:准备系统学习机器学习、深度学习、强化学习或大语言模型的读者 前置要求:掌握基本 Python,了解向量、函数和概率的直觉 最后更新:2026-07-20


1. 人工智能到底是什么

人工智能(Artificial Intelligence,AI)不是某一种算法,而是让计算系统完成感知、预测、推理、决策和生成任务的总称。机器学习是 AI 的主要实现路径;深度学习是机器学习中以多层神经网络为核心的方法;大语言模型是深度学习在大规模文本和多模态数据上的代表;强化学习则研究智能体如何通过行动、反馈和长期回报学习策略。

人工智能 AI
├── 规则系统、搜索、规划、知识表示
└── 机器学习 ML
    ├── 监督学习
    ├── 无监督与自监督学习
    ├── 深度学习 DL
    │   └── 大语言模型 LLM
    └── 强化学习 RL

这些集合并非完全互斥。现代大语言模型属于深度学习,预训练主要采用自监督学习,对齐阶段又可能使用强化学习。正确学习方式不是争论“哪一种更高级”,而是先明确任务、数据、目标和约束,再选择合适方法。


2. 从传统程序到学习系统

传统程序由人明确编写规则:输入数据和规则,得到输出。机器学习则提供输入和目标结果,让算法从样本中估计规则。两者并不冲突,真实系统通常是“确定性业务逻辑 + 学习模型”的组合。

一个学习系统可以抽象为模型 \(f_\theta\)。输入为 \(x\),参数为 \(\theta\),预测为:

\[ \hat{y}=f_\theta(x) \]

训练的目标,是让预测 \(\hat{y}\) 尽可能符合真实目标 \(y\)。为此定义损失函数 \(\ell(\hat{y},y)\),在训练数据 \(D=\{(x_i,y_i)\}_{i=1}^{n}\) 上最小化经验风险:

\[ \hat{R}(\theta)=\frac{1}{n}\sum_{i=1}^{n}\ell(f_\theta(x_i),y_i) \]

仅仅记住训练样本并没有价值。真正目标是让模型对未见数据也有效,这叫泛化。因此数据需要划分为训练集、验证集和测试集:训练集更新参数,验证集选择模型和超参数,测试集只用于最终无偏评估。若测试信息泄漏进训练过程,得到的高分不能代表上线表现。

为了限制模型过度复杂,训练目标常加入正则项:

\[ J(\theta)=\hat{R}(\theta)+\lambda\Omega(\theta) \]

其中 \(\Omega\) 惩罚过大的参数或复杂结构,\(\lambda\) 控制拟合训练数据与保持简单之间的权衡。


3. 四种主要学习范式

3.1 监督学习

监督学习使用带标签样本。回归预测连续数值,例如价格、温度和耗时;分类预测离散类别,例如欺诈识别、垃圾邮件和缺陷类型。常见方法包括线性/逻辑回归、决策树、随机森林、梯度提升树、支持向量机和神经网络。

监督学习最昂贵的部分往往不是模型,而是建立准确、一致、无偏的标签。标签定义不清会把业务歧义直接写进模型。

3.2 无监督学习

无监督学习没有明确标签,目标是发现数据结构。聚类寻找相似群体,降维寻找低维表示,异常检测识别偏离常态的样本。无监督结果通常没有唯一标准答案,需要结合业务解释和下游效果验证。

3.3 自监督学习

自监督学习从数据本身构造监督信号。语言模型用前文预测下一个 Token,视觉模型可以遮挡图像区域再重建。它避免了人工逐条标注,使模型能从海量原始数据学习通用表示,再通过少量标注数据适配具体任务。

3.4 强化学习

强化学习中的智能体在环境中选择动作,接收奖励并进入新状态。目标不是预测固定标签,而是最大化长期累计回报。它适合动作会影响未来、反馈延迟且需要连续决策的任务,例如机器人控制、游戏和资源调度。


4. 数据是系统边界,不只是模型燃料

数据决定模型能学到什么,也决定它在哪些人群和场景上可靠。一个完整数据流程包括采集、授权、清洗、去重、标注、版本化、划分、特征处理和质量监控。

4.1 数据分布与采样

训练数据应近似覆盖上线输入分布。若医院模型只在某一设备或人群上训练,换到其他设备和人群时可能失效。对类别不均衡问题,只看准确率尤其危险:若阳性率只有 1%,永远预测阴性也有 99% 准确率。

4.2 数据泄漏

数据泄漏是指训练时使用了预测发生时不可能获得的信息。常见形式包括:先在全量数据上标准化再划分;同一用户的高度相似样本同时出现在训练集和测试集;把事后产生的字段作为特征;反复查看测试集后调参。

预处理应只在训练集上拟合,然后应用到验证集和测试集。scikit-learn 的 Pipeline 能把预处理与模型绑定,降低泄漏风险。

4.3 分布漂移

上线后输入分布 \(P(X)\)、标签关系 \(P(Y\mid X)\) 或类别比例 \(P(Y)\) 可能变化。模型监控不能只看服务器是否存活,还要观察输入缺失率、特征分布、预测分布、真实业务指标和延迟反馈标签。


5. 模型训练与优化

大多数可微模型使用梯度下降。若目标函数为 \(J(\theta)\),学习率为 \(\eta\),参数更新为:

\[ \theta_{t+1}=\theta_t-\eta\nabla_\theta J(\theta_t) \]

学习率过大会越过最优区域甚至发散,过小则训练缓慢。随机梯度下降使用小批量样本估计真实梯度,降低每次更新成本;Momentum、Adam 等优化器利用历史梯度改善方向和步长。

需要区分三类值:参数由训练自动学习,例如神经网络权重;超参数由人或搜索过程设置,例如学习率、树深度和批量大小;模型状态还可能包括归一化统计量和优化器动量。部署和恢复训练时必须保存正确的全部状态。

过拟合表现为训练误差继续下降、验证误差开始上升。常见应对方法包括更多高质量数据、数据增强、正则化、简化模型、早停和交叉验证。欠拟合则意味着训练集本身都表现差,需要更有效特征、更合适模型或更充分训练。


6. 评估指标必须匹配真实目标

分类任务的混淆矩阵由 TP、FP、TN、FN 构成。常用指标为:

\[ Precision=\frac{TP}{TP+FP} \]
\[ Recall=\frac{TP}{TP+FN} \]
\[ F_1=2\cdot\frac{Precision\cdot Recall}{Precision+Recall} \]

误报代价高时关注精确率,漏报代价高时关注召回率。F1 平衡两者,但它忽略 TN;类别严重不均衡时还应查看 PR-AUC、不同阈值下的成本和概率校准。

回归任务常用 MAE、MSE 和 RMSE:

\[ MAE=\frac{1}{n}\sum_{i=1}^{n}|y_i-\hat{y}_i| \]
\[ RMSE=\sqrt{\frac{1}{n}\sum_{i=1}^{n}(y_i-\hat{y}_i)^2} \]

RMSE 对大误差惩罚更重,MAE 对异常值更稳健。离线指标提升不等于业务价值提升;最终还需通过灰度发布、A/B 测试和业务指标确认。


7. 推理、部署与 MLOps

训练产生模型,推理使用模型处理新输入。上线系统除了预测精度,还要满足延迟、吞吐、内存、成本、可用性和隐私要求。批处理适合离线报表,在线服务要求低延迟,边缘推理强调体积和功耗。

模型版本不能只记录权重文件。可复现版本至少应关联:代码提交、依赖环境、训练配置、数据快照或数据版本、随机种子、评估报告和模型制品。否则一次训练成功后,很可能无法解释或复现。

模型发布建议遵循:离线评估 → 影子流量 → 小比例灰度 → 逐步扩容 → 持续监控。必须准备快速回滚到上一模型版本的能力。高风险任务应保留人工复核和拒答机制,不能把模型输出直接当成事实或最终裁决。


8. 生成式 AI 与大语言模型

判别模型学习 \(P(Y\mid X)\),用于从输入判断目标;生成模型学习数据分布或条件分布,可以生成新的文本、图像和音频。自回归语言模型把序列概率分解为:

\[ P(x_{1:T})=\prod_{t=1}^{T}P(x_t\mid x_{<t}) \]

每一步预测下一个 Token 的概率,连续采样形成文本。模型输出流畅,不代表内容真实,因为训练目标主要优化“下一个 Token 是否合理”,而不是“陈述是否经过外部事实验证”。降低幻觉需要检索增强、工具调用、引用证据、结构化验证和人工审核的组合。

大语言模型应用通常分为四层:基础模型提供通用能力;提示和上下文描述当前任务;RAG 或工具连接外部事实与行动;应用层负责权限、状态、日志、安全和用户体验。真正可靠的系统工程远多于一段 Prompt。


9. 安全、伦理与负责任使用

模型会继承训练数据中的偏差,也可能泄露隐私、生成虚假内容或被对抗输入诱导。安全不是训练结束后的附加选项,而应贯穿需求、数据、模型、部署和运营。

至少应回答:数据是否取得合法授权;敏感信息是否最小化收集并脱敏;不同人群上的错误率是否明显不同;用户是否知道自己面对的是模型;高风险输出是否有人工复核;系统能否追踪模型、提示、数据和工具调用;发生事故时能否关闭功能并回滚。

LLM 应用还要防范提示注入、越权工具调用、敏感信息进入上下文、检索库投毒和不可信输出被下游程序直接执行。模型输出必须按不可信输入处理:验证类型和范围、限制工具权限、隔离执行环境、记录审计日志。


10. 学习路线与章节关系

如果目标是数据分析和传统预测,先学 机器学习,重点掌握数据处理、基准模型和评估。如果目标是视觉、语音或复杂表示学习,在机器学习之后进入 深度学习。如果目标是生成式 AI 应用,理解 Transformer 后继续学习 大语言模型。如果任务包含长期决策、控制或偏好优化,再学习 强化学习

掌握模型原理后,可通过前沿 AI 工具综合指南学习通用助手、深度研究、编程 Agent、多模态工具、本地模型和自动化的实际选择方法;需要自行设计可调用工具、使用记忆并持续执行任务的系统时,再进入Agent 综合指南,学习控制循环、MCP/A2A、评估、可观测性和安全治理。

推荐顺序:

  1. Python、NumPy、Pandas、基础线性代数与概率。
  2. 机器学习流程、数据泄漏、交叉验证与指标。
  3. 神经网络、反向传播、优化器和 Transformer。
  4. LLM 的预训练、对齐、RAG、推理与 Agent。
  5. 强化学习中的 MDP、价值函数、策略梯度和 PPO。
  6. 前沿 AI 工具的选择、上下文工程、结果验证与安全使用。
  7. Agent 的工具协议、编排、评估、监控与成本治理。

11. 核心概念速查

概念 准确定义 常见误区
特征 模型可使用的输入变量 特征不一定天然有意义,需要验证
标签 监督学习希望预测的目标 标签可能有噪声和偏差
参数 从训练数据学习的值 不等同于人工设置的超参数
损失 单样本或批次错误的可优化度量 不一定等同于业务指标
训练 根据数据更新参数 训练分数高不代表泛化好
推理 使用固定模型产生预测 仍需要输入校验和监控
Epoch 完整遍历训练集一次 更多 Epoch 不一定更好
Batch 一次参数更新使用的样本集合 批量大小会影响显存与优化
Embedding 对象在连续向量空间中的表示 距离只在训练语义下有意义
Token 分词器定义的文本基本单位 不等同于汉字或单词
RAG 检索外部资料后辅助生成 不能自动保证检索内容正确
Agent 能规划并调用工具的模型系统 不是天然可靠的自主智能

延伸阅读


本文档持续维护更新。如有错误或建议,欢迎提交 Issue 或 PR。