外观
AI vs ML vs DL vs GenAI vs Agent
一句话定义:AI 是目标,机器学习是手段,深度学习是机器学习的一个分支,生成式 AI 是深度学习家族中"以生成新内容为目标"的子集,智能体则是建立在 LLM 之上的应用范式。这五个词不是并列关系,而是一个层层包含、又各自独立的多层结构。
你可能在一天之内同时刷到"AI 取代程序员""机器学习岗位萎缩""大模型 Agent 元年"三条新闻——它们说的是同一个世界的五件不同的事。把它们的边界切清楚,是理解当下 AI 热点的第一道门槛,也是本手册的全景总览的"边界篇"。
一、一张总览表:谁包含谁
先把结论摆出来,后面逐节展开:
| 概念 | 中文 | 一句话定位 | 包含/被包含 | 代表物 |
|---|---|---|---|---|
| AI | 人工智能 | 让机器表现出智能的总目标 | 最大集合,包含其余全部 | 下棋程序、专家系统、自动驾驶 |
| ML | 机器学习 | 从数据中自动学规律的路径 | ML ⊂ AI | 推荐系统、垃圾邮件过滤、XGBoost |
| DL | 深度学习 | 用多层神经网络学表征 | DL ⊂ ML | CNN、RNN、Transformer、LLM |
| GenAI | 生成式 AI | 以"生成新内容"为目标的模型 | GenAI ⊂ DL | ChatGPT、Midjourney、Sora |
| Agent | 智能体 | 用 LLM 做大脑的自主执行系统 | 应用范式,跨上述各层 | Manus、Deep Research、AutoGPT |
三个必须记住的包含关系
AI ⊃ ML ⊃ DL;GenAI 是 DL 的子集;Agent 不是新模型,而是建立在 LLM 之上的应用范式。 后面所有澄清都从这三句话出发。
二、五个概念逐一拆解
1. 人工智能(AI):1956 年诞生的大伞
| 维度 | 内容 |
|---|---|
| 起源 | 1956 年达特茅斯会议,John McCarthy 提出 "Artificial Intelligence" 一词,AI 作为学科诞生 |
| 核心问题 | 让机器完成需要人类智能才能完成的任务:推理、感知、语言、规划、学习 |
| 经典路线 | 符号主义(规则/逻辑)、连接主义(神经网络)、行为主义(感知-行动) |
| 非 ML 分支 | 搜索与博弈、规划、知识图谱、专家系统、约束求解 |
| 今日语境 | 媒体里的"AI"几乎特指 ML/DL 驱动的系统,但学术上伞更大 |
展开:AI 是这五个词里唯一以"目标"而非"方法"定义的概念。1956 年达特茅斯会议之后二十年,主流路线是符号主义(symbolic AI):把知识编码成显式规则,让机器按逻辑推理。医疗诊断系统 MYCIN、IBM 深蓝(Deep Blue)下棋击败卡斯帕罗夫,靠的是搜索与规则而非学习。知识图谱也是这条路线的重要产物——用节点和边把实体关系显式表示出来,直到今天仍是 LLM 事实性增强的关键补充(见知识图谱与知识注入)。
关键判断:AI 不都是机器学习。一个用 minimax 搜索的棋类程序是 AI 但不是 ML;一套手写规则的审批系统也是 AI 但不是 ML。ML 只是让机器获得智能的诸多路径中当前最成功的一条。想了解 AI 整个谱系,可读什么是 AI 热门概念与演进简史。
2. 机器学习(ML):数据驱动学习
| 维度 | 内容 |
|---|---|
| 定义 | 让计算机从数据中自动发现规律并用于预测/决策,规则由数据生成而非人写 |
| 三大范式 | 监督(有标签)、无监督(无标签)、强化(奖励信号) |
| 与 AI 的关系 | ML ⊂ AI,当前占比最大的子领域 |
| 与 DL 的关系 | DL ⊂ ML;经典方法(树模型、SVM、线性模型)仍大量服役 |
| 中坚阵地 | 表格数据、推荐排序、风控、广告、搜索排序 |
展开:机器学习的全部秘密在于"知识从哪来"——不是程序员写规则,而是模型从数据中拟合规则。三范式按"答案的形态"区分:监督学习有人给标准答案,无监督学习只有数据本身的结构,强化学习只有事后奖励信号。这一套框架在今天不仅没过时,反而是大模型之外最稳定的生产工具:电商推荐、信息流排序、风控反欺诈、广告点击率预估,至今仍是树模型与深度模型混编的主战场(见大模型时代的推荐系统)。
一个常被低估的事实:在表格数据上,XGBoost/LightGBM 这类经典方法常常依然强于深度学习。ML 不是"过时"的技术,DL 也不是"更好的 ML"——它们是针对不同数据形态的两类工具。深度学习是 ML 的子集,详见下节。
3. 深度学习(DL):多层神经网络家族
| 维度 | 内容 |
|---|---|
| 定义 | 用多层神经网络做表征学习:浅层学边缘笔画、深层学对象语义 |
| 复兴节点 | 2012 年 AlexNet 在 ImageNet 上把 top-5 错误率从 26.2% 断崖式降到 15.3% |
| 主要家族 | CNN(视觉)、RNN(序列)、Transformer(注意力,2017) |
| 与 ML 的关系 | DL ⊂ ML,是"另一类数据上的 ML" |
| 代价 | 吃数据、吃算力、可解释性差 |
展开:深度学习之所以是"革命",在于它把 ML 的"特征工程"变成了"表征学习"——人不再手工设计特征,网络自己从原始像素/字符逐层学到可用的表示。2012 年 AlexNet 引爆第一波,2017 年《Attention Is All You Need》提出的 Transformer 引爆第二波,并最终孕育了 LLM 时代。CNN/RNN/Transformer 的机制与取舍见Transformer 与注意力机制,这条技术线的完整脉络见演进简史。
别把"用了神经网络"和"深度学习"划等号
深度学习的关键是"多层"。单层感知机(1960 年代)算神经网络,但不是深度模型——这也是 1969 年 Minsky 证明其无法表达 XOR 后第一轮 AI 寒冬的直接原因。深度(depth)才是 DL 的本体。
4. 生成式 AI(GenAI):以"生成"为目标
| 维度 | 内容 |
|---|---|
| 定义 | 以"生成新内容"(文本/图像/音频/视频/代码)为目标的模型 |
| 核心差异 | 判别式学"是什么",生成式学"怎么造" |
| 文本主力 | 大语言模型(LLM),基于 Transformer 的预训练+对齐 |
| 视觉主力 | 扩散模型(Diffusion),从噪声逐步还原图像 |
| 与 DL 的关系 | GenAI ⊂ DL,是目标分类而非架构分类 |
展开:生成式 AI 不是一种新架构,而是一类新目标。传统深度学习模型大多是判别式的——输入一张图,输出"猫/狗";而生成式模型要做的是学出数据的分布,然后从中采样出新样本。当前两大主力:LLM 用 Transformer 自回归地生成文本(见大语言模型),扩散模型从噪声逐步去噪生成图像与视频(见扩散模型与生成式 AI)。
这个子集的商业化速度是史无前例的:ChatGPT 两个月破亿用户(见ChatGPT 与对话式 AI),Midjourney 改变插画行业(见Midjourney 与图像生成),Sora 打开视频生成大门(见Sora 与视频生成)。GenAI 是当前 DL 热度最高的子集,但 DL 的范畴远不止生成。
5. 智能体(Agent):LLM 之上的应用范式
| 维度 | 内容 |
|---|---|
| 定义 | 让 LLM 扮演"大脑",自主完成"感知-规划-行动"闭环的执行系统 |
| 关键组件 | 规划(planning)+ 工具调用(tools)+ 记忆(memory)+ 行动(action) |
| 与模型的关系 | 不是新模型家族,底层仍是 LLM;是 LLM 的应用范式 |
| 运行闭环 | 接收目标 → 拆解任务 → 调用工具 → 观察结果 → 迭代直至完成 |
| 代表 | Manus、Deep Research、各类 Coding Agent |
展开:Agent 是五个词里唯一不指"模型"而指"系统"的概念。它把 LLM 从"问答机器"升级为"执行机器":给一个目标(比如"查财报并写摘要"),Agent 自主拆解任务、搜索网页、调用代码工具、反复验证后交付结果。其闭环本质是 LLM + 规划 + 工具 + 记忆 + 行动 五件套的拼装,机制详解见AI 智能体(Agent),落地案例见Manus 与 Agent 应用,动手搭建见从零开发一个 Agent。
关键判断:Agent 不是第五种"模型",而是第四种"用法"。底层跑的还是 LLM,你给 Agent 换一个更强的模型,它就变强;它没有独立于 LLM 的"大脑"。把 Agent 误当成新模型,是市面上 90% 概念混淆的源头。
三、栈式结构:从应用到基础设施
把视角从"横向包含"转到"纵向分层",五个概念恰好落在技术栈的四层上:
┌──────────────────────────────────────────────────────────┐
│ ① 应用层 Agent · RAG · Prompt 应用 │
│ (把模型能力组装成产品:问答、搜索、自动化) │
├──────────────────────────────────────────────────────────┤
│ ② 模型层 LLM · 多模态 · 扩散模型 │
│ (GenAI 的"生成能力"发生在这层) │
├──────────────────────────────────────────────────────────┤
│ ③ 架构层 Transformer(注意力机制) │
│ (CNN/RNN 是旧主力,Transformer 是当代地基) │
├──────────────────────────────────────────────────────────┤
│ ④ 基础设施层 GPU · 向量数据库 · 推理引擎 │
│ (算力、检索、加速,决定上面三层能跑多快) │
└──────────────────────────────────────────────────────────┘- 应用层:Agent、RAG、提示词应用是最贴近用户的一层。RAG 解决 LLM 的幻觉与知识时效问题(见检索增强生成(RAG)与从零搭建 RAG 应用),提示词工程决定模型输出的下限(见提示词工程与提示词实战手册),Agent 把这套能力组装成自主执行的产品(见AI 智能体(Agent))。
- 模型层:大语言模型是文本能力的载体(见大语言模型),多模态让模型同时看懂图文音视频(见多模态模型),扩散模型负责图像与视频生成(见扩散模型与生成式 AI)。
- 架构层:当代几乎所有前沿模型的地基都是 Transformer(见Transformer 与注意力机制)。这一层决定了模型的上限,也是论文精读的主战场。
- 基础设施层:向量数据库支撑语义检索(见向量数据库与语义检索),推理引擎与量化决定部署成本(见推理优化与量化),这一层往往被入门者忽略,但决定产品能不能上线。整栈的完整拆解见总体架构解剖。
用这四层定位任何 AI 新闻
以后看到任何 AI 热点,先问一句:它是哪一层的突破?模型层的突破(新模型)会传导到应用层,但应用层的创新(Agent)未必需要新模型。分层思考能帮你过滤掉 80% 的无效焦虑。
四、四个常见混淆点
| 混淆点 | 真相 | 一句话判断 |
|---|---|---|
| AI = LLM? | 大模型只是 AI 当前的当红子集 | AI 是百年学科的伞,LLM 是伞下最新的那把尖刀 |
| 机器学习 = 深度学习? | DL 只是 ML 的深度子集 | 表格数据上树模型常常还赢,DL 不是"更强的 ML"而是"另一种 ML" |
| 生成式 = 智能? | 生成能力强 ≠ 推理、理解、可靠 | 能写出像样的文章,不等于会算账、不幻觉、能担责 |
| Agent 是新模型? | Agent 是 LLM 的用法,不是新的"大脑" | 底层还是同一个 LLM,换模型 Agent 就换脑子 |
逐一展开:
「AI = LLM?」:媒体语境下两者几乎可以互换,但学术与工程上差着一个量级。AI 包含符号主义、知识图谱、搜索规划、机器人学等几十个分支;LLM 只是 DL → Transformer → 预训练大模型这一条线上最新的一环。把 AI 等同于 LLM,就像把"交通"等同于"汽车"——能交流,但不精确。
「机器学习 = 深度学习?」:深度学习是机器学习的一个分支,但机器学习远不止深度学习。推荐系统、信贷风控、广告竞价这些大规模生产系统里,树模型与经典方法依然稳坐主力(见大模型时代的推荐系统)。正确的说法是:DL 在非结构化数据上碾压,经典 ML 在表格数据上依然能打。
「生成式 = 智能?」:这是四个混淆点里最危险的一个。生成能力(流畅地写出文章)与智能(正确地推理、诚实地承认不知道、稳定地承担责任)是两回事。LLM 会一本正经地编造事实(幻觉),这正是 RAG 与对齐技术存在的意义,也是LLM 评估与基准要做的事。会写不等于会想,更不等于靠谱。
「Agent 是新模型?」:Agent 的智能全部来自底层的 LLM,它没有独立的模型参数。区别只在"使用方式":把它当问答框,它是 Chatbot;给它规划、工具和记忆,它是 Agent。关于这一点更系统的辨析见AI 智能体(Agent)。
一个提醒
这四个混淆点不是文字游戏。面试时把"Agent 是应用范式"讲成"Agent 是新模型",把"LLM 等于 AI"说出口,都会被面试官一票否决——概念边界是这行的基本功。
五、求职视角:JD 里的这些词各指什么
同一份 JD,五个词指向五套技能栈。对照JD 知识点拆解与JD 清单:
| JD 关键词 | 实际技能栈 | 典型岗位 |
|---|---|---|
| AI / 人工智能 | 泛化词,常兼指算法岗全栈:数学 + 至少一条技术线 + 论文阅读 | AI 科学家、AI 研究员 |
| 机器学习 | 特征工程、表格建模、树模型/GBDT、模型评估、SQL/Spark | 机器学习工程师、算法工程师(风控/推荐/广告) |
| 深度学习 | PyTorch、CNN/Transformer、训练与调参、GPU 资源管理 | 算法工程师(CV/NLP)、深度学习研究员 |
| 生成式 AI / LLM | Prompt 工程、RAG、微调(LoRA)、评估、Agent 开发 | LLM 应用工程师、提示词工程师、大模型算法工程师 |
| Agent | 工程能力:工具调用、MCP、工作流编排、前端/后端集成 | Agent 应用开发、AI 产品工程师 |
一个反直觉的观察:岗位越靠近应用层,工程占比越高,模型深度越低。2024 年之后增长最快的不是"大模型研究员",而是"LLM 应用工程师"——JD 里写"Agent""RAG"的岗位,考的是工程与系统设计能力。想给自己做全面能力对标,见能力对标:简历该突出什么;想检验概念理解,见面试题库。
给你的最小行动建议
不要被五个词吓住。选一条主线吃透,其余概念用"包含关系 + 四层架构"这张图兜底:先把本文的表格记住,再按学习路径从大模型原理走起,就足以覆盖 90% 的面试概念题。词汇表式的快速查证可随时回术语表。
延伸阅读
- 什么是 AI 热门概念——五词全景的"总纲篇",与本文互为表里
- 演进简史——1956→2025,五条线如何依次登场与交替
- 总体架构解剖——从 GPU 到 Agent 的完整技术栈拆解
- 大语言模型——GenAI 文本主力的内部机制
- AI 智能体(Agent)——LLM+规划+工具+记忆+行动的闭环拆解
- 从零开发一个 Agent——把"应用范式"落成代码
- 检索增强生成(RAG)——解决幻觉与知识时效的工程范式
- 演进简史与论文地图——想深挖时从论文维度再看一遍
- 术语表——五个词之外更多易混术语对
参考资料
- Dartmouth Workshop 原始提案(1955,McCarthy 等) —— "Artificial Intelligence" 一词的诞生文件
- Russell & Norvig. Artificial Intelligence: A Modern Approach —— AI 学科最权威教材,AI 范畴的完整地图
- McCulloch & Pitts. A Logical Calculus of the Ideas Immanent in Nervous Activity(1943) —— 神经网络最早的数学模型
- Rosenblatt. The Perceptron(1958) —— 单层感知机与第一轮热潮
- Krizhevsky et al. ImageNet Classification with Deep Convolutional Neural Networks(NeurIPS 2012) —— AlexNet,深度学习复兴的引爆点
- Vaswani et al. Attention Is All You Need(NeurIPS 2017) —— Transformer,当代架构层的地基
- Ho et al. Denoising Diffusion Probabilistic Models(NeurIPS 2020) —— 扩散模型,图像/视频生成的原理源头
- Brown et al. Language Models are Few-Shot Learners(NeurIPS 2020) —— GPT-3,LLM 规模法则的代表
- Doshi-Velez & Kim. Towards A Rigorous Science of Interpretable Machine Learning(2017) —— 模型可解释性与"黑箱"讨论