Skip to content

AI vs ML vs DL vs GenAI vs Agent

本页速览 人工智能、机器学习、深度学习、生成式 AI、智能体——五个天天上热搜的词,包含关系与边界到底怎么划?本文给出总览表、栈式架构图、四个常见混淆点的澄清,以及求职视角的技能栈对照。

AI vs ML vs DL vs GenAI vs Agent ​

一句话定义:AI 是目标,机器学习是手段,深度学习是机器学习的一个分支,生成式 AI 是深度学习家族中"以生成新内容为目标"的子集,智能体则是建立在 LLM 之上的应用范式。这五个词不是并列关系,而是一个层层包含、又各自独立的多层结构。

你可能在一天之内同时刷到"AI 取代程序员""机器学习岗位萎缩""大模型 Agent 元年"三条新闻——它们说的是同一个世界的五件不同的事。把它们的边界切清楚,是理解当下 AI 热点的第一道门槛,也是本手册的全景总览的"边界篇"。

一、一张总览表:谁包含谁 ​

先把结论摆出来,后面逐节展开:

概念中文一句话定位包含/被包含代表物
AI人工智能让机器表现出智能的总目标最大集合,包含其余全部下棋程序、专家系统、自动驾驶
ML机器学习从数据中自动学规律的路径ML ⊂ AI推荐系统、垃圾邮件过滤、XGBoost
DL深度学习用多层神经网络学表征DL ⊂ MLCNN、RNN、Transformer、LLM
GenAI生成式 AI以"生成新内容"为目标的模型GenAI ⊂ DLChatGPT、Midjourney、Sora
Agent智能体用 LLM 做大脑的自主执行系统应用范式,跨上述各层Manus、Deep Research、AutoGPT

三个必须记住的包含关系

AI ⊃ ML ⊃ DL;GenAI 是 DL 的子集;Agent 不是新模型,而是建立在 LLM 之上的应用范式。 后面所有澄清都从这三句话出发。

二、五个概念逐一拆解 ​

1. 人工智能(AI):1956 年诞生的大伞 ​

维度内容
起源1956 年达特茅斯会议,John McCarthy 提出 "Artificial Intelligence" 一词,AI 作为学科诞生
核心问题让机器完成需要人类智能才能完成的任务:推理、感知、语言、规划、学习
经典路线符号主义(规则/逻辑)、连接主义(神经网络)、行为主义(感知-行动)
非 ML 分支搜索与博弈、规划、知识图谱、专家系统、约束求解
今日语境媒体里的"AI"几乎特指 ML/DL 驱动的系统,但学术上伞更大

展开:AI 是这五个词里唯一以"目标"而非"方法"定义的概念。1956 年达特茅斯会议之后二十年,主流路线是符号主义(symbolic AI):把知识编码成显式规则,让机器按逻辑推理。医疗诊断系统 MYCIN、IBM 深蓝(Deep Blue)下棋击败卡斯帕罗夫,靠的是搜索与规则而非学习。知识图谱也是这条路线的重要产物——用节点和边把实体关系显式表示出来,直到今天仍是 LLM 事实性增强的关键补充(见知识图谱与知识注入)。

关键判断:AI 不都是机器学习。一个用 minimax 搜索的棋类程序是 AI 但不是 ML;一套手写规则的审批系统也是 AI 但不是 ML。ML 只是让机器获得智能的诸多路径中当前最成功的一条。想了解 AI 整个谱系,可读什么是 AI 热门概念与演进简史。

2. 机器学习(ML):数据驱动学习 ​

维度内容
定义让计算机从数据中自动发现规律并用于预测/决策,规则由数据生成而非人写
三大范式监督(有标签)、无监督(无标签)、强化(奖励信号)
与 AI 的关系ML ⊂ AI,当前占比最大的子领域
与 DL 的关系DL ⊂ ML;经典方法(树模型、SVM、线性模型)仍大量服役
中坚阵地表格数据、推荐排序、风控、广告、搜索排序

展开:机器学习的全部秘密在于"知识从哪来"——不是程序员写规则,而是模型从数据中拟合规则。三范式按"答案的形态"区分:监督学习有人给标准答案,无监督学习只有数据本身的结构,强化学习只有事后奖励信号。这一套框架在今天不仅没过时,反而是大模型之外最稳定的生产工具:电商推荐、信息流排序、风控反欺诈、广告点击率预估,至今仍是树模型与深度模型混编的主战场(见大模型时代的推荐系统)。

一个常被低估的事实:在表格数据上,XGBoost/LightGBM 这类经典方法常常依然强于深度学习。ML 不是"过时"的技术,DL 也不是"更好的 ML"——它们是针对不同数据形态的两类工具。深度学习是 ML 的子集,详见下节。

3. 深度学习(DL):多层神经网络家族 ​

维度内容
定义用多层神经网络做表征学习:浅层学边缘笔画、深层学对象语义
复兴节点2012 年 AlexNet 在 ImageNet 上把 top-5 错误率从 26.2% 断崖式降到 15.3%
主要家族CNN(视觉)、RNN(序列)、Transformer(注意力,2017)
与 ML 的关系DL ⊂ ML,是"另一类数据上的 ML"
代价吃数据、吃算力、可解释性差

展开:深度学习之所以是"革命",在于它把 ML 的"特征工程"变成了"表征学习"——人不再手工设计特征,网络自己从原始像素/字符逐层学到可用的表示。2012 年 AlexNet 引爆第一波,2017 年《Attention Is All You Need》提出的 Transformer 引爆第二波,并最终孕育了 LLM 时代。CNN/RNN/Transformer 的机制与取舍见Transformer 与注意力机制,这条技术线的完整脉络见演进简史。

别把"用了神经网络"和"深度学习"划等号

深度学习的关键是"多层"。单层感知机(1960 年代)算神经网络,但不是深度模型——这也是 1969 年 Minsky 证明其无法表达 XOR 后第一轮 AI 寒冬的直接原因。深度(depth)才是 DL 的本体。

4. 生成式 AI(GenAI):以"生成"为目标 ​

维度内容
定义以"生成新内容"(文本/图像/音频/视频/代码)为目标的模型
核心差异判别式学"是什么",生成式学"怎么造"
文本主力大语言模型(LLM),基于 Transformer 的预训练+对齐
视觉主力扩散模型(Diffusion),从噪声逐步还原图像
与 DL 的关系GenAI ⊂ DL,是目标分类而非架构分类

展开:生成式 AI 不是一种新架构,而是一类新目标。传统深度学习模型大多是判别式的——输入一张图,输出"猫/狗";而生成式模型要做的是学出数据的分布,然后从中采样出新样本。当前两大主力:LLM 用 Transformer 自回归地生成文本(见大语言模型),扩散模型从噪声逐步去噪生成图像与视频(见扩散模型与生成式 AI)。

这个子集的商业化速度是史无前例的:ChatGPT 两个月破亿用户(见ChatGPT 与对话式 AI),Midjourney 改变插画行业(见Midjourney 与图像生成),Sora 打开视频生成大门(见Sora 与视频生成)。GenAI 是当前 DL 热度最高的子集,但 DL 的范畴远不止生成。

5. 智能体(Agent):LLM 之上的应用范式 ​

维度内容
定义让 LLM 扮演"大脑",自主完成"感知-规划-行动"闭环的执行系统
关键组件规划(planning)+ 工具调用(tools)+ 记忆(memory)+ 行动(action)
与模型的关系不是新模型家族,底层仍是 LLM;是 LLM 的应用范式
运行闭环接收目标 → 拆解任务 → 调用工具 → 观察结果 → 迭代直至完成
代表Manus、Deep Research、各类 Coding Agent

展开:Agent 是五个词里唯一不指"模型"而指"系统"的概念。它把 LLM 从"问答机器"升级为"执行机器":给一个目标(比如"查财报并写摘要"),Agent 自主拆解任务、搜索网页、调用代码工具、反复验证后交付结果。其闭环本质是 LLM + 规划 + 工具 + 记忆 + 行动 五件套的拼装,机制详解见AI 智能体(Agent),落地案例见Manus 与 Agent 应用,动手搭建见从零开发一个 Agent。

关键判断:Agent 不是第五种"模型",而是第四种"用法"。底层跑的还是 LLM,你给 Agent 换一个更强的模型,它就变强;它没有独立于 LLM 的"大脑"。把 Agent 误当成新模型,是市面上 90% 概念混淆的源头。

三、栈式结构:从应用到基础设施 ​

把视角从"横向包含"转到"纵向分层",五个概念恰好落在技术栈的四层上:

┌──────────────────────────────────────────────────────────┐
│  ① 应用层    Agent · RAG · Prompt 应用                    │
│              (把模型能力组装成产品:问答、搜索、自动化)    │
├──────────────────────────────────────────────────────────┤
│  ② 模型层    LLM · 多模态 · 扩散模型                     │
│              (GenAI 的"生成能力"发生在这层)              │
├──────────────────────────────────────────────────────────┤
│  ③ 架构层    Transformer(注意力机制)                    │
│              (CNN/RNN 是旧主力,Transformer 是当代地基)   │
├──────────────────────────────────────────────────────────┤
│  ④ 基础设施层 GPU · 向量数据库 · 推理引擎                 │
│              (算力、检索、加速,决定上面三层能跑多快)      │
└──────────────────────────────────────────────────────────┘

用这四层定位任何 AI 新闻

以后看到任何 AI 热点,先问一句:它是哪一层的突破?模型层的突破(新模型)会传导到应用层,但应用层的创新(Agent)未必需要新模型。分层思考能帮你过滤掉 80% 的无效焦虑。

四、四个常见混淆点 ​

混淆点真相一句话判断
AI = LLM?大模型只是 AI 当前的当红子集AI 是百年学科的伞,LLM 是伞下最新的那把尖刀
机器学习 = 深度学习?DL 只是 ML 的深度子集表格数据上树模型常常还赢,DL 不是"更强的 ML"而是"另一种 ML"
生成式 = 智能?生成能力强 ≠ 推理、理解、可靠能写出像样的文章,不等于会算账、不幻觉、能担责
Agent 是新模型?Agent 是 LLM 的用法,不是新的"大脑"底层还是同一个 LLM,换模型 Agent 就换脑子

逐一展开:

「AI = LLM?」:媒体语境下两者几乎可以互换,但学术与工程上差着一个量级。AI 包含符号主义、知识图谱、搜索规划、机器人学等几十个分支;LLM 只是 DL → Transformer → 预训练大模型这一条线上最新的一环。把 AI 等同于 LLM,就像把"交通"等同于"汽车"——能交流,但不精确。

「机器学习 = 深度学习?」:深度学习是机器学习的一个分支,但机器学习远不止深度学习。推荐系统、信贷风控、广告竞价这些大规模生产系统里,树模型与经典方法依然稳坐主力(见大模型时代的推荐系统)。正确的说法是:DL 在非结构化数据上碾压,经典 ML 在表格数据上依然能打。

「生成式 = 智能?」:这是四个混淆点里最危险的一个。生成能力(流畅地写出文章)与智能(正确地推理、诚实地承认不知道、稳定地承担责任)是两回事。LLM 会一本正经地编造事实(幻觉),这正是 RAG 与对齐技术存在的意义,也是LLM 评估与基准要做的事。会写不等于会想,更不等于靠谱。

「Agent 是新模型?」:Agent 的智能全部来自底层的 LLM,它没有独立的模型参数。区别只在"使用方式":把它当问答框,它是 Chatbot;给它规划、工具和记忆,它是 Agent。关于这一点更系统的辨析见AI 智能体(Agent)。

一个提醒

这四个混淆点不是文字游戏。面试时把"Agent 是应用范式"讲成"Agent 是新模型",把"LLM 等于 AI"说出口,都会被面试官一票否决——概念边界是这行的基本功。

五、求职视角:JD 里的这些词各指什么 ​

同一份 JD,五个词指向五套技能栈。对照JD 知识点拆解与JD 清单:

JD 关键词实际技能栈典型岗位
AI / 人工智能泛化词,常兼指算法岗全栈:数学 + 至少一条技术线 + 论文阅读AI 科学家、AI 研究员
机器学习特征工程、表格建模、树模型/GBDT、模型评估、SQL/Spark机器学习工程师、算法工程师(风控/推荐/广告)
深度学习PyTorch、CNN/Transformer、训练与调参、GPU 资源管理算法工程师(CV/NLP)、深度学习研究员
生成式 AI / LLMPrompt 工程、RAG、微调(LoRA)、评估、Agent 开发LLM 应用工程师、提示词工程师、大模型算法工程师
Agent工程能力:工具调用、MCP、工作流编排、前端/后端集成Agent 应用开发、AI 产品工程师

一个反直觉的观察:岗位越靠近应用层,工程占比越高,模型深度越低。2024 年之后增长最快的不是"大模型研究员",而是"LLM 应用工程师"——JD 里写"Agent""RAG"的岗位,考的是工程与系统设计能力。想给自己做全面能力对标,见能力对标:简历该突出什么;想检验概念理解,见面试题库。

给你的最小行动建议

不要被五个词吓住。选一条主线吃透,其余概念用"包含关系 + 四层架构"这张图兜底:先把本文的表格记住,再按学习路径从大模型原理走起,就足以覆盖 90% 的面试概念题。词汇表式的快速查证可随时回术语表。

延伸阅读 ​

参考资料 ​