外观
论文地图
一句话定位:这张地图以 2017 年的《Attention Is All You Need》为根节点,把 2014 到 2025 年间塑造当代 AI 的 20 多篇关键论文,按四条演进支线排成一张可随时检索的坐标系——读完这张地图,你能说出"每一篇论文站在哪些工作的肩膀上、又长出了哪些新枝、值得精读还是泛读"。
论文阅读最大的障碍不是"读不懂一篇",而是"不知道下一篇该读哪篇"。教程会按章节顺序教,但真实的论文世界是按引用关系组织的:GPT-3 引用 BERT 的预训练思想,却把目标从"理解"改成"生成";DDPM 与 GAN 争同一个"造出逼真图像"的问题,却走了完全不同的路;LoRA 是 GPT-3 发布两年后才出现的"给大模型减肥"方案。如果你只顺着时间线读,你会迷失在"谁替代了谁"的细节里;如果你只按主题读,你会错过"为什么范式会迁移"的宏观叙事。这张地图的目的,就是把主题和时间两个维度叠在一起,让每一篇论文都能回答三个问题:它属于哪条技术线?它处在范式演进的哪个阶段?它和哪几篇论文构成"必读链"?
地图与其他页面的分工
本站论文栏目共六页,分工不同:从这里开始 讲"为什么要读论文",阅读路径 讲"按目标怎么读",本文(论文地图) 讲"整个领域有哪些值得读的论文、它们之间什么关系",经典论文精读 逐篇深挖十篇枢纽论文,前沿进展 追踪 2020 年代的新趋势,阅读纪律与 FAQ 回答"读不懂、记不住、判断不了好坏"怎么办。一句话:地图定坐标,精读给深度,前沿指方向。
一、这张地图怎么读
在展开地图之前,先说清三条阅读约定:
- 编号约定:除 GAN(NeurIPS 2014)与 Sora 报告(OpenAI 官方博客、无 arXiv)外,本文给出的论文均有 arXiv 编号,可在
https://arxiv.org/abs/<编号>免费取全文。 - 年份约定:论文年份一律指首次公开发表(会议正式发表或 arXiv 预印本提交)的年份。例如 Latent Diffusion 的 arXiv 预印本 2021 年 12 月提交、CVPR 2022 发表,本文记为 2021(正式发表 2022);BERT 的 arXiv 提交为 2018 年 10 月、NAACL 2019 发表,本文记为 2018。标注规则比具体数字更重要。
- 深读约定:地图只给"一句话贡献"与"阅读优先级",回答"这篇为什么值得记、值不值得精读"。想读透一篇时,跳到经典论文精读;想追它之后的发展,用前沿进展;想知道该按什么顺序读,回阅读路径。
三大坐标一起使用:支线决定它归哪条技术线,年份决定它在范式演进中的位置,优先级决定你投入多少时间。下图是这张地图的总览:
主题维度(四条演进支线)
┌───────────────────────────────────────────┐
时间维度 ↓ │ ① 语言模型支:理解 → 规模 → 对齐 → 开源 → 推理 │
│ ② 生成模型支:对抗 → 扩散 → 可控 → 视频 │
│ ③ 工程应用支:检索 → 微调 → 智能体 → 知识图谱 │
│ ④ 对齐支:人类反馈 → AI 反馈 → 偏好优化 │
└───────────────────────────────────────────┘二、根节点:Attention Is All You Need(2017)
四条支线从哪里来?都从同一棵树的根上长出来——2017 年 Google 团队发表的《Attention Is All You Need》。它用纯注意力架构(Transformer)同时取代了循环与卷积,最初只是机器翻译的新模型,却在随后几年成为大语言模型(LLM)、多模态模型、扩散模型骨干的共同底座。它自己不开花结果,而是让所有后继工作有了同一块地基。
| 论文 | 作者/机构 | 年份 | 出处/arXiv | 一句话贡献 |
|---|---|---|---|---|
| Attention Is All You Need | Vaswani 等(Google Brain) | 2017 | arXiv:1706.03762 | 提出纯注意力架构 Transformer,去掉循环与卷积,成为 BERT、GPT、乃至扩散模型骨干的共同底座 |
从这一根出发,四条支线各自演化:
┌── 语言模型支:BERT → GPT-3 → InstructGPT → ChatGPT → Llama → o1/R1
Attention ├── 生成模型支:GAN → DDPM → LDM → ControlNet → Sora
Is All You Need ├── 工程应用支:RAG → LoRA → ReAct → QLoRA → GraphRAG
(2017) └── 对齐支:InstructGPT → Constitutional AI → DPO为什么把 2017 设为根
Transformer 之前当然有大量重要工作(Seq2Seq、注意力机制、CNN/RNN),但对今天的 AI 热门概念来说,Transformer 是"遗传学上的共同祖先"——本站的演进简史会讲更完整的故事,而Transformer 概念页会讲它的机制。这张地图选择 2017 年作为起点,是因为之后的每一条支线都能沿引用关系追回这里。
三、四条演进支线
1. 语言模型支:从"理解"到"规模"再到"推理"(2018–2025)
这条支线是 2020 年代 AI 热潮的主干。它回答了三个递进的问题:模型怎么学会理解语言(BERT)→ 规模能不能直接带来能力(GPT-3)→ 如何让模型更听话、更会推理(InstructGPT / ChatGPT / Llama / o1 / R1)。机制详解见大语言模型。
| 论文 | 年份 | 出处/arXiv | 一句话贡献 | 演进箭头 | 优先级 |
|---|---|---|---|---|---|
| BERT | 2018 | arXiv:1810.04805 | 双向 Transformer 编码器 + 掩码语言模型预训练,横扫 11 项 NLP 基准,确立"预训练 + 微调"范式 | 从 Transformer 长出(编码器路线) | 必读 |
| GPT-3 | 2020 | arXiv:2005.14165 | 1750 亿参数 + 上下文学习,实证"规模本身带来能力跃迁",开启规模法则 | ← BERT 的预训练思想,换成自回归生成目标 | 必读 |
| InstructGPT | 2022 | arXiv:2203.02155 | 用 RLHF 让 GPT-3 学会"遵循指令",对齐到人类意图 | ← GPT-3 加"对齐"工序 | 必读 |
| ChatGPT | 2022 | 无正式论文(OpenAI 技术说明) | 把 GPT-3.5 + RLHF 包装成对话产品,引爆生成式 AI 大众化 | ← InstructGPT 的产品化 | 拓展 |
| Llama | 2023 | arXiv:2302.13971 | 开源可再分发的基座模型(Llama 系列),让微调与本地部署进入千家万户 | ← GPT-3 的架构配方,走开源路线 | 选读 |
| o1 / DeepSeek-R1 | 2024–2025 | arXiv:2412.16735(o1 系统卡)/ arXiv:2501.12948(R1) | 推理时计算 + 强化学习驱动的"思维链",模型学会"先思考再回答" | ← InstructGPT 的 RL 思想迁移到推理能力 | 选读 |
双向 vs 单向的分岔
BERT 和 GPT 从同一个 Transformer 出发,走的却是两条相反的路线:BERT 是双向编码器,擅长理解(分类、抽取、检索);GPT 是自回归解码器,擅长生成。2020 年代的竞争最终是生成路线胜出——ChatGPT 证明了"把一切任务都当作生成"是更统一的范式。这个分岔与汇合,是理解 2018 到 2024 年 AI 史的关键线索,可对照演进简史阅读,案例层面的完整叙事见ChatGPT 案例。
2. 生成模型支:从"对抗"到"扩散"再到"视频"(2014–2024)
这条支线回答一个更"出圈"的问题:机器能不能像画家一样,从一句话造出一张图、一段视频? 答案的变迁是一部范式迁移史:GAN 用对抗博弈第一个做到"以假乱真",DDPM 用"加噪-去噪"以稳定性和高质量反超,LDM 把扩散搬进潜空间让图像生成成为大众产品,ControlNet 给了创作者精准控制权,Sora 把同一套思路扩展到一分钟级视频。机制详解见扩散模型与生成式 AI。
| 论文 | 年份 | 出处/arXiv | 一句话贡献 | 演进箭头 | 优先级 |
|---|---|---|---|---|---|
| GAN | 2014 | arXiv:1406.2661 | 生成器与判别器零和博弈,第一个让"从噪声造出逼真图像"成为现实的模型 | 生成式 AI 的先声(早于 Transformer) | 选读 |
| DDPM | 2020 | arXiv:2006.11239 | 逐步加噪再学去噪,训练稳定、无模式坍缩,奠定扩散生成的基础 | 取代 GAN 的生成主力地位 | 必读 |
| LDM(Latent Diffusion) | 2021 | arXiv:2112.10752 | 在潜空间做扩散 + 文本条件注入,训练高效可控,成为 Stable Diffusion 的地基 | ← DDPM 搬进潜空间 | 必读 |
| ControlNet | 2023 | arXiv:2302.05543 | 给扩散模型加"控制手柄"(姿态、边缘、深度),让生成结果可被精确指挥 | ← LDM 的可控性增强 | 选读 |
| Sora 报告 | 2024 | 官方博客(无 arXiv) | 扩散 Transformer + 视频数据,宣称视频生成模型是"世界模拟器" | ← LDM 思想扩展到视频;前置论文为 DiT(arXiv:2212.09748) | 拓展 |
一句话记住这条支线
GAN 用对抗求"像",DDPM 用去噪求"稳",LDM 用潜空间求"省",ControlNet 用条件求"控",Sora 用视频求"真"。 这条支线与图像生成案例、视频生成案例一一对应,想让"文本画图"落地的人还会用到提示词工程。
3. 工程应用支:把大模型"用起来"(2020–2024)
前面两条支线回答"模型怎么更强",这条支线回答"模型怎么被用起来"。RAG 解决"模型记不住最新知识",LoRA 解决"全量微调太贵",ReAct 解决"让模型动手做事",QLoRA 把微调压到一张消费级显卡,GraphRAG 用知识图谱补足 RAG 的全局理解短板。这条支线最贴近工程实践,配套实战见从零搭建 RAG 应用与从零开发一个 Agent。
| 论文 | 年份 | 出处/arXiv | 一句话贡献 | 演进箭头 | 优先级 |
|---|---|---|---|---|---|
| RAG | 2020 | arXiv:2005.11401 | 检索外部知识库再生成答案,缓解幻觉、让模型"知道最新事实" | 与 GPT-3 同年,另起一条工程线 | 必读 |
| LoRA | 2021 | arXiv:2106.09685 | 只训练低秩增量矩阵完成微调,参数高效,催生 PEFT 家族 | ← GPT-3 的微调痛点 | 必读 |
| ReAct | 2022 | arXiv:2210.03629 | 让 LLM 交替"推理"与"行动"(调工具),奠定 Agent 范式 | ← RAG 之外的第二条工具使用路线 | 必读 |
| QLoRA | 2023 | arXiv:2305.14314 | 4-bit 量化 + LoRA,单张显卡即可微调 65B 模型 | ← LoRA 的"再压缩" | 选读 |
| GraphRAG | 2024 | arXiv:2404.16130 | 把文档建成知识图谱再做 RAG,回答"全局性问题"不再靠拼碎片 | ← RAG + 知识图谱 | 拓展 |
工程支与本站实践页的对应
RAG 的落地细节见检索增强生成概念页、向量数据库与Perplexity 案例;LoRA/QLoRA 见微调与 PEFT与微调你自己的 LLM;ReAct 见AI 智能体概念页、Manus 案例与从零开发一个 Agent。这条支线是"读完论文马上能写代码"的一条线。
4. 对齐支:让模型"说人话、守规矩"(2022–2023)
前三条支线关心"能力",这条支线关心"价值观与服从性"。InstructGPT 确立 RLHF 三件套(SFT + 奖励模型 + PPO);Constitutional AI 尝试用"AI 审 AI"替代昂贵的人类反馈;DPO 用一个封闭式目标同时完成"模仿偏好 + 拒绝不喜欢",把 RLHF 简化为一次监督学习。这条支线的概念化解读见对齐:RLHF 与 DPO,更广泛的治理视角见AI 安全与治理。
| 论文 | 年份 | 出处/arXiv | 一句话贡献 | 演进箭头 | 优先级 |
|---|---|---|---|---|---|
| InstructGPT | 2022 | arXiv:2203.02155 | 人类反馈 + 强化学习(PPO 为引擎)把大模型对齐到用户意图,ChatGPT 的核心技术 | 对齐支的原点(与语言模型支共享) | 必读 |
| Constitutional AI | 2022 | arXiv:2212.08073 | 用"宪法 + AI 自我批评"替代部分人类反馈,降低对齐成本 | ← InstructGPT 的降本尝试 | 选读 |
| DPO | 2023 | arXiv:2305.18290 | 直接从偏好数据优化策略,去掉奖励模型与在线采样,训练极简 | ← InstructGPT 的简化 | 必读 |
一条容易误解的"引用线"
InstructGPT 同时出现在语言模型支和对齐支——它不是一篇论文挂两条线,而是一篇论文确实做了两件事:能力上它把 GPT-3 变成"会听话的助手",方法上它确立了 RLHF 范式。地图的价值正在于此:一篇论文可以跨越多个主题,读的时候要同时挂靠两条线。
四、论文-概念-案例三方映射表
地图的意义最后要落在"用"上。下表把本文的每一篇论文映射到本站的概念页(学原理)与案例页(看产品),并标出优先级。你在工作中遇到任何一篇论文的名字,都可以沿这张表找到本站对应的深度内容。
| 论文 | 概念页 | 案例页 | 优先级 |
|---|---|---|---|
| Attention Is All You Need | Transformer 与注意力机制 | ChatGPT 与对话式 AI | 必读 |
| BERT | 大语言模型 | Perplexity 与 AI 搜索 | 必读 |
| GPT-3 | 大语言模型 | ChatGPT 与对话式 AI | 必读 |
| InstructGPT | 对齐:RLHF 与 DPO | ChatGPT 与对话式 AI | 必读 |
| ChatGPT | 大语言模型 | ChatGPT 与对话式 AI | 拓展 |
| Llama | 微调与 PEFT | DeepSeek-R1 与推理模型 | 选读 |
| o1 / DeepSeek-R1 | 大语言模型 | DeepSeek-R1 与推理模型 | 选读 |
| GAN | 扩散模型与生成式 AI | Midjourney 与图像生成 | 选读 |
| DDPM | 扩散模型与生成式 AI | Midjourney 与图像生成 | 必读 |
| LDM | 扩散模型与生成式 AI | Midjourney 与图像生成 | 必读 |
| ControlNet | 扩散模型与生成式 AI | Midjourney 与图像生成 | 选读 |
| Sora 报告 | 多模态模型 | Sora 与视频生成 | 拓展 |
| RAG | 检索增强生成 | Perplexity 与 AI 搜索 | 必读 |
| LoRA | 微调与 PEFT | GitHub Copilot 与代码智能 | 必读 |
| ReAct | AI 智能体 | Manus 与 Agent 应用 | 必读 |
| QLoRA | 微调与 PEFT | GitHub Copilot 与代码智能 | 选读 |
| GraphRAG | 知识图谱与知识注入 | Perplexity 与 AI 搜索 | 拓展 |
| Constitutional AI | 对齐:RLHF 与 DPO | ChatGPT 与对话式 AI | 选读 |
| DPO | 对齐:RLHF 与 DPO | DeepSeek-R1 与推理模型 | 必读 |
怎么理解优先级
必读:读透后能读懂该支线大部分论文的摘要,是"枢纽论文";选读:理解了必读论文后再读,能补齐一条完整链条;拓展:多为技术报告或产品说明,跟着前沿进展扫读即可。若时间只够读 8 篇,按第四节"必读核心"的顺序来。
五、如何使用这张地图
1. 精读核心:十篇必读
读论文最怕"平均用力"。建议把有限时间集中在必读的十篇"枢纽论文"上——它们各自是某条技术线的必经路口。按推荐顺序:
| 顺序 | 论文 | 精读理由 |
|---|---|---|
| 1 | Attention Is All You Need | 当代一切大模型的架构源头,先读它等于拿到 2020 年代的地图钥匙 |
| 2 | BERT | 预训练/微调范式 + 双向注意力,理解"模型怎么学会语言" |
| 3 | GPT-3 | 规模法则与上下文学习的奠基实证,读它是为理解 ChatGPT 作思想准备 |
| 4 | InstructGPT | RLHF 三件套,理解"模型为什么听话",也进入对齐支 |
| 5 | DDPM | 扩散模型原点,当前图像/视频/音频生成的共同根基 |
| 6 | LDM | Stable Diffusion 的底座,理解"为什么图像生成能上消费级显卡" |
| 7 | RAG | 工程落地最广的技术之一,幻觉治理与知识外挂的第一课 |
| 8 | LoRA | 参数高效微调的代表,几乎所有开源模型生态都在用 |
| 9 | ReAct | Agent 范式奠基,"推理 + 行动"让模型从问答走向做事 |
| 10 | DPO | 对齐的第二范式,训练极简,R1 等模型的对齐家族成员 |
这十篇的逐篇深读,见经典论文精读;读法上的方法论(怎么记笔记、读不懂怎么办)见阅读纪律与 FAQ。
2. 泛读周边:一条支线一条链
不是每篇论文都值得精读。对"选读/拓展"级别的论文,用"三件套泛读法"处理:摘要(1 分钟)→ 核心图(2 分钟)→ 结论与局限(2 分钟),产出三行笔记:"解决什么问题 / 核心方法一句话 / 自述局限"。这样把四条支线各读成一条"链",你的地图就从"四个孤岛"变成"一张网络"。
3. 按任务检索:四步法
遇到一个具体问题(比如"我要给大模型接知识库")时,按四步用这张地图:
① 定位支线 → 判断问题属于语言模型 / 生成 / 工程 / 对齐哪一支,找到入口论文
② 追源头 → 读入口论文的 References,找到它站在哪些工作上(溯源)
③ 追下游 → 用 Google Scholar / Semantic Scholar 查"引用它的论文"(流向)
④ 记节点 → 把新论文挂到本文某条支线 + 某年,扩展你自己的地图做完一轮,你的个人地图就比本文更大了——这本来就是地图的正确用法:先继承,再扩张。
4. 与本站其他资源的配合
- 概念不清时查术语表;
- 想深入某概念的结构化知识,读概念边界与总体架构解剖;
- 想看到本文所述论文在真实产品中的样子,读ChatGPT 案例、Midjourney 案例与Perplexity 案例;
- 想动手实践,走实践指南列出的各条路线,或直接看常见陷阱与反模式;
- 想知道这些论文对应什么岗位要求,查JD 知识点拆解。
六、延伸阅读
- 经典论文精读 —— 本文地图中十篇必读论文的逐篇深读(信息表、动机、方法、结果、影响、坑)
- 前沿进展 —— 地图时间轴的右端:2024–2025 的新论文与新趋势
- 演进简史 —— 范式迁移时间轴的完整历史叙事
- 从这里开始 与 阅读路径 —— 读论文前的定位与路线选择
- 阅读纪律与 FAQ —— 读不懂、记不住、判断不了论文好坏时来这里
- 术语表 —— 读论文时随时查阅概念
参考资料
以下资料均为真实公开资源,供进一步自学。所有 arXiv 编号均可直接访问 https://arxiv.org/abs/<编号>:
- Vaswani et al. Attention Is All You Need. NeurIPS 2017 —— Transformer,本图根节点
- Devlin et al. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL 2019 —— BERT
- Brown et al. Language Models are Few-Shot Learners. NeurIPS 2020 —— GPT-3
- Ouyang et al. Training language models to follow instructions with human feedback. NeurIPS 2022 —— InstructGPT / RLHF
- Touvron et al. LLaMA: Open and Efficient Foundation Language Models. 2023 —— Llama 1
- OpenAI. OpenAI o1 System Card. 2024 —— o1 系统卡
- DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. 2025 —— DeepSeek-R1
- Goodfellow et al. Generative Adversarial Nets. NeurIPS 2014 —— GAN
- Ho, Jain, Abbeel. Denoising Diffusion Probabilistic Models. NeurIPS 2020 —— DDPM
- Rombach et al. High-Resolution Image Synthesis with Latent Diffusion Models. CVPR 2022 —— LDM / Stable Diffusion 底座
- Zhang et al. Adding Conditional Control to Text-to-Image Diffusion Models. ICLR 2024 —— ControlNet
- Peebles & Xie. Scalable Diffusion Models with Transformers. ICCV 2023 —— DiT,Sora 的架构前身
- OpenAI. Video generation models as world simulators. 2024 —— Sora 技术报告
- Lewis et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020 —— RAG
- Hu et al. LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022 —— LoRA
- Yao et al. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023 —— ReAct
- Dettmers et al. QLoRA: Efficient Finetuning of Quantized LLMs. NeurIPS 2023 —— QLoRA
- Edge et al. From Local to Global: A Graph RAG Approach to Query-Focused Summarization. 2024 —— GraphRAG
- Bai et al. Constitutional AI: Harmlessness from AI Feedback. 2022 —— Constitutional AI
- Rafailov et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023 —— DPO
- arXiv 预印本库 —— 本文绝大多数论文的第一发布地
- Papers with Code —— 论文 + 代码 + 基准聚合,核对 SOTA 与复现的权威入口