Skip to content

论文地图

本页速览 以 Attention Is All You Need 为根节点,把大语言模型、生成模型、工程应用、对齐四条演进支线排成一张可检索的论文地图,覆盖 2014–2025 的 20 余篇关键论文,附论文-概念-案例三方映射与阅读优先级。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

论文地图 ​

一句话定位:这张地图以 2017 年的《Attention Is All You Need》为根节点,把 2014 到 2025 年间塑造当代 AI 的 20 多篇关键论文,按四条演进支线排成一张可随时检索的坐标系——读完这张地图,你能说出"每一篇论文站在哪些工作的肩膀上、又长出了哪些新枝、值得精读还是泛读"。

论文阅读最大的障碍不是"读不懂一篇",而是"不知道下一篇该读哪篇"。教程会按章节顺序教,但真实的论文世界是按引用关系组织的:GPT-3 引用 BERT 的预训练思想,却把目标从"理解"改成"生成";DDPM 与 GAN 争同一个"造出逼真图像"的问题,却走了完全不同的路;LoRA 是 GPT-3 发布两年后才出现的"给大模型减肥"方案。如果你只顺着时间线读,你会迷失在"谁替代了谁"的细节里;如果你只按主题读,你会错过"为什么范式会迁移"的宏观叙事。这张地图的目的,就是把主题和时间两个维度叠在一起,让每一篇论文都能回答三个问题:它属于哪条技术线?它处在范式演进的哪个阶段?它和哪几篇论文构成"必读链"?

地图与其他页面的分工

本站论文栏目共六页,分工不同:从这里开始 讲"为什么要读论文",阅读路径 讲"按目标怎么读",本文(论文地图) 讲"整个领域有哪些值得读的论文、它们之间什么关系",经典论文精读 逐篇深挖十篇枢纽论文,前沿进展 追踪 2020 年代的新趋势,阅读纪律与 FAQ 回答"读不懂、记不住、判断不了好坏"怎么办。一句话:地图定坐标,精读给深度,前沿指方向。

一、这张地图怎么读 ​

在展开地图之前,先说清三条阅读约定:

  1. 编号约定:除 GAN(NeurIPS 2014)与 Sora 报告(OpenAI 官方博客、无 arXiv)外,本文给出的论文均有 arXiv 编号,可在 https://arxiv.org/abs/<编号> 免费取全文。
  2. 年份约定:论文年份一律指首次公开发表(会议正式发表或 arXiv 预印本提交)的年份。例如 Latent Diffusion 的 arXiv 预印本 2021 年 12 月提交、CVPR 2022 发表,本文记为 2021(正式发表 2022);BERT 的 arXiv 提交为 2018 年 10 月、NAACL 2019 发表,本文记为 2018。标注规则比具体数字更重要。
  3. 深读约定:地图只给"一句话贡献"与"阅读优先级",回答"这篇为什么值得记、值不值得精读"。想读透一篇时,跳到经典论文精读;想追它之后的发展,用前沿进展;想知道该按什么顺序读,回阅读路径。

三大坐标一起使用:支线决定它归哪条技术线,年份决定它在范式演进中的位置,优先级决定你投入多少时间。下图是这张地图的总览:

                    主题维度(四条演进支线)
                  ┌───────────────────────────────────────────┐
  时间维度 ↓       │  ① 语言模型支:理解 → 规模 → 对齐 → 开源 → 推理 │
                  │  ② 生成模型支:对抗 → 扩散 → 可控 → 视频     │
                  │  ③ 工程应用支:检索 → 微调 → 智能体 → 知识图谱 │
                  │  ④ 对齐支:人类反馈 → AI 反馈 → 偏好优化     │
                  └───────────────────────────────────────────┘

二、根节点:Attention Is All You Need(2017) ​

四条支线从哪里来?都从同一棵树的根上长出来——2017 年 Google 团队发表的《Attention Is All You Need》。它用纯注意力架构(Transformer)同时取代了循环与卷积,最初只是机器翻译的新模型,却在随后几年成为大语言模型(LLM)、多模态模型、扩散模型骨干的共同底座。它自己不开花结果,而是让所有后继工作有了同一块地基。

论文作者/机构年份出处/arXiv一句话贡献
Attention Is All You NeedVaswani 等(Google Brain)2017arXiv:1706.03762提出纯注意力架构 Transformer,去掉循环与卷积,成为 BERT、GPT、乃至扩散模型骨干的共同底座

从这一根出发,四条支线各自演化:

                ┌── 语言模型支:BERT → GPT-3 → InstructGPT → ChatGPT → Llama → o1/R1
Attention       ├── 生成模型支:GAN → DDPM → LDM → ControlNet → Sora
Is All You Need ├── 工程应用支:RAG → LoRA → ReAct → QLoRA → GraphRAG
 (2017)         └── 对齐支:InstructGPT → Constitutional AI → DPO

为什么把 2017 设为根

Transformer 之前当然有大量重要工作(Seq2Seq、注意力机制、CNN/RNN),但对今天的 AI 热门概念来说,Transformer 是"遗传学上的共同祖先"——本站的演进简史会讲更完整的故事,而Transformer 概念页会讲它的机制。这张地图选择 2017 年作为起点,是因为之后的每一条支线都能沿引用关系追回这里。

三、四条演进支线 ​

1. 语言模型支:从"理解"到"规模"再到"推理"(2018–2025) ​

这条支线是 2020 年代 AI 热潮的主干。它回答了三个递进的问题:模型怎么学会理解语言(BERT)→ 规模能不能直接带来能力(GPT-3)→ 如何让模型更听话、更会推理(InstructGPT / ChatGPT / Llama / o1 / R1)。机制详解见大语言模型。

论文年份出处/arXiv一句话贡献演进箭头优先级
BERT2018arXiv:1810.04805双向 Transformer 编码器 + 掩码语言模型预训练,横扫 11 项 NLP 基准,确立"预训练 + 微调"范式从 Transformer 长出(编码器路线)必读
GPT-32020arXiv:2005.141651750 亿参数 + 上下文学习,实证"规模本身带来能力跃迁",开启规模法则← BERT 的预训练思想,换成自回归生成目标必读
InstructGPT2022arXiv:2203.02155用 RLHF 让 GPT-3 学会"遵循指令",对齐到人类意图← GPT-3 加"对齐"工序必读
ChatGPT2022无正式论文(OpenAI 技术说明)把 GPT-3.5 + RLHF 包装成对话产品,引爆生成式 AI 大众化← InstructGPT 的产品化拓展
Llama2023arXiv:2302.13971开源可再分发的基座模型(Llama 系列),让微调与本地部署进入千家万户← GPT-3 的架构配方,走开源路线选读
o1 / DeepSeek-R12024–2025arXiv:2412.16735(o1 系统卡)/ arXiv:2501.12948(R1)推理时计算 + 强化学习驱动的"思维链",模型学会"先思考再回答"← InstructGPT 的 RL 思想迁移到推理能力选读

双向 vs 单向的分岔

BERT 和 GPT 从同一个 Transformer 出发,走的却是两条相反的路线:BERT 是双向编码器,擅长理解(分类、抽取、检索);GPT 是自回归解码器,擅长生成。2020 年代的竞争最终是生成路线胜出——ChatGPT 证明了"把一切任务都当作生成"是更统一的范式。这个分岔与汇合,是理解 2018 到 2024 年 AI 史的关键线索,可对照演进简史阅读,案例层面的完整叙事见ChatGPT 案例。

2. 生成模型支:从"对抗"到"扩散"再到"视频"(2014–2024) ​

这条支线回答一个更"出圈"的问题:机器能不能像画家一样,从一句话造出一张图、一段视频? 答案的变迁是一部范式迁移史:GAN 用对抗博弈第一个做到"以假乱真",DDPM 用"加噪-去噪"以稳定性和高质量反超,LDM 把扩散搬进潜空间让图像生成成为大众产品,ControlNet 给了创作者精准控制权,Sora 把同一套思路扩展到一分钟级视频。机制详解见扩散模型与生成式 AI。

论文年份出处/arXiv一句话贡献演进箭头优先级
GAN2014arXiv:1406.2661生成器与判别器零和博弈,第一个让"从噪声造出逼真图像"成为现实的模型生成式 AI 的先声(早于 Transformer)选读
DDPM2020arXiv:2006.11239逐步加噪再学去噪,训练稳定、无模式坍缩,奠定扩散生成的基础取代 GAN 的生成主力地位必读
LDM(Latent Diffusion)2021arXiv:2112.10752在潜空间做扩散 + 文本条件注入,训练高效可控,成为 Stable Diffusion 的地基← DDPM 搬进潜空间必读
ControlNet2023arXiv:2302.05543给扩散模型加"控制手柄"(姿态、边缘、深度),让生成结果可被精确指挥← LDM 的可控性增强选读
Sora 报告2024官方博客(无 arXiv)扩散 Transformer + 视频数据,宣称视频生成模型是"世界模拟器"← LDM 思想扩展到视频;前置论文为 DiT(arXiv:2212.09748)拓展

一句话记住这条支线

GAN 用对抗求"像",DDPM 用去噪求"稳",LDM 用潜空间求"省",ControlNet 用条件求"控",Sora 用视频求"真"。 这条支线与图像生成案例、视频生成案例一一对应,想让"文本画图"落地的人还会用到提示词工程。

3. 工程应用支:把大模型"用起来"(2020–2024) ​

前面两条支线回答"模型怎么更强",这条支线回答"模型怎么被用起来"。RAG 解决"模型记不住最新知识",LoRA 解决"全量微调太贵",ReAct 解决"让模型动手做事",QLoRA 把微调压到一张消费级显卡,GraphRAG 用知识图谱补足 RAG 的全局理解短板。这条支线最贴近工程实践,配套实战见从零搭建 RAG 应用与从零开发一个 Agent。

论文年份出处/arXiv一句话贡献演进箭头优先级
RAG2020arXiv:2005.11401检索外部知识库再生成答案,缓解幻觉、让模型"知道最新事实"与 GPT-3 同年,另起一条工程线必读
LoRA2021arXiv:2106.09685只训练低秩增量矩阵完成微调,参数高效,催生 PEFT 家族← GPT-3 的微调痛点必读
ReAct2022arXiv:2210.03629让 LLM 交替"推理"与"行动"(调工具),奠定 Agent 范式← RAG 之外的第二条工具使用路线必读
QLoRA2023arXiv:2305.143144-bit 量化 + LoRA,单张显卡即可微调 65B 模型← LoRA 的"再压缩"选读
GraphRAG2024arXiv:2404.16130把文档建成知识图谱再做 RAG,回答"全局性问题"不再靠拼碎片← RAG + 知识图谱拓展

工程支与本站实践页的对应

RAG 的落地细节见检索增强生成概念页、向量数据库与Perplexity 案例;LoRA/QLoRA 见微调与 PEFT与微调你自己的 LLM;ReAct 见AI 智能体概念页、Manus 案例与从零开发一个 Agent。这条支线是"读完论文马上能写代码"的一条线。

4. 对齐支:让模型"说人话、守规矩"(2022–2023) ​

前三条支线关心"能力",这条支线关心"价值观与服从性"。InstructGPT 确立 RLHF 三件套(SFT + 奖励模型 + PPO);Constitutional AI 尝试用"AI 审 AI"替代昂贵的人类反馈;DPO 用一个封闭式目标同时完成"模仿偏好 + 拒绝不喜欢",把 RLHF 简化为一次监督学习。这条支线的概念化解读见对齐:RLHF 与 DPO,更广泛的治理视角见AI 安全与治理。

论文年份出处/arXiv一句话贡献演进箭头优先级
InstructGPT2022arXiv:2203.02155人类反馈 + 强化学习(PPO 为引擎)把大模型对齐到用户意图,ChatGPT 的核心技术对齐支的原点(与语言模型支共享)必读
Constitutional AI2022arXiv:2212.08073用"宪法 + AI 自我批评"替代部分人类反馈,降低对齐成本← InstructGPT 的降本尝试选读
DPO2023arXiv:2305.18290直接从偏好数据优化策略,去掉奖励模型与在线采样,训练极简← InstructGPT 的简化必读

一条容易误解的"引用线"

InstructGPT 同时出现在语言模型支和对齐支——它不是一篇论文挂两条线,而是一篇论文确实做了两件事:能力上它把 GPT-3 变成"会听话的助手",方法上它确立了 RLHF 范式。地图的价值正在于此:一篇论文可以跨越多个主题,读的时候要同时挂靠两条线。

四、论文-概念-案例三方映射表 ​

地图的意义最后要落在"用"上。下表把本文的每一篇论文映射到本站的概念页(学原理)与案例页(看产品),并标出优先级。你在工作中遇到任何一篇论文的名字,都可以沿这张表找到本站对应的深度内容。

论文概念页案例页优先级
Attention Is All You NeedTransformer 与注意力机制ChatGPT 与对话式 AI必读
BERT大语言模型Perplexity 与 AI 搜索必读
GPT-3大语言模型ChatGPT 与对话式 AI必读
InstructGPT对齐:RLHF 与 DPOChatGPT 与对话式 AI必读
ChatGPT大语言模型ChatGPT 与对话式 AI拓展
Llama微调与 PEFTDeepSeek-R1 与推理模型选读
o1 / DeepSeek-R1大语言模型DeepSeek-R1 与推理模型选读
GAN扩散模型与生成式 AIMidjourney 与图像生成选读
DDPM扩散模型与生成式 AIMidjourney 与图像生成必读
LDM扩散模型与生成式 AIMidjourney 与图像生成必读
ControlNet扩散模型与生成式 AIMidjourney 与图像生成选读
Sora 报告多模态模型Sora 与视频生成拓展
RAG检索增强生成Perplexity 与 AI 搜索必读
LoRA微调与 PEFTGitHub Copilot 与代码智能必读
ReActAI 智能体Manus 与 Agent 应用必读
QLoRA微调与 PEFTGitHub Copilot 与代码智能选读
GraphRAG知识图谱与知识注入Perplexity 与 AI 搜索拓展
Constitutional AI对齐:RLHF 与 DPOChatGPT 与对话式 AI选读
DPO对齐:RLHF 与 DPODeepSeek-R1 与推理模型必读

怎么理解优先级

必读:读透后能读懂该支线大部分论文的摘要,是"枢纽论文";选读:理解了必读论文后再读,能补齐一条完整链条;拓展:多为技术报告或产品说明,跟着前沿进展扫读即可。若时间只够读 8 篇,按第四节"必读核心"的顺序来。

五、如何使用这张地图 ​

1. 精读核心:十篇必读 ​

读论文最怕"平均用力"。建议把有限时间集中在必读的十篇"枢纽论文"上——它们各自是某条技术线的必经路口。按推荐顺序:

顺序论文精读理由
1Attention Is All You Need当代一切大模型的架构源头,先读它等于拿到 2020 年代的地图钥匙
2BERT预训练/微调范式 + 双向注意力,理解"模型怎么学会语言"
3GPT-3规模法则与上下文学习的奠基实证,读它是为理解 ChatGPT 作思想准备
4InstructGPTRLHF 三件套,理解"模型为什么听话",也进入对齐支
5DDPM扩散模型原点,当前图像/视频/音频生成的共同根基
6LDMStable Diffusion 的底座,理解"为什么图像生成能上消费级显卡"
7RAG工程落地最广的技术之一,幻觉治理与知识外挂的第一课
8LoRA参数高效微调的代表,几乎所有开源模型生态都在用
9ReActAgent 范式奠基,"推理 + 行动"让模型从问答走向做事
10DPO对齐的第二范式,训练极简,R1 等模型的对齐家族成员

这十篇的逐篇深读,见经典论文精读;读法上的方法论(怎么记笔记、读不懂怎么办)见阅读纪律与 FAQ。

2. 泛读周边:一条支线一条链 ​

不是每篇论文都值得精读。对"选读/拓展"级别的论文,用"三件套泛读法"处理:摘要(1 分钟)→ 核心图(2 分钟)→ 结论与局限(2 分钟),产出三行笔记:"解决什么问题 / 核心方法一句话 / 自述局限"。这样把四条支线各读成一条"链",你的地图就从"四个孤岛"变成"一张网络"。

3. 按任务检索:四步法 ​

遇到一个具体问题(比如"我要给大模型接知识库")时,按四步用这张地图:

① 定位支线 → 判断问题属于语言模型 / 生成 / 工程 / 对齐哪一支,找到入口论文
② 追源头   → 读入口论文的 References,找到它站在哪些工作上(溯源)
③ 追下游   → 用 Google Scholar / Semantic Scholar 查"引用它的论文"(流向)
④ 记节点   → 把新论文挂到本文某条支线 + 某年,扩展你自己的地图

做完一轮,你的个人地图就比本文更大了——这本来就是地图的正确用法:先继承,再扩张。

4. 与本站其他资源的配合 ​

六、延伸阅读 ​

  • 经典论文精读 —— 本文地图中十篇必读论文的逐篇深读(信息表、动机、方法、结果、影响、坑)
  • 前沿进展 —— 地图时间轴的右端:2024–2025 的新论文与新趋势
  • 演进简史 —— 范式迁移时间轴的完整历史叙事
  • 从这里开始 与 阅读路径 —— 读论文前的定位与路线选择
  • 阅读纪律与 FAQ —— 读不懂、记不住、判断不了论文好坏时来这里
  • 术语表 —— 读论文时随时查阅概念

参考资料 ​

以下资料均为真实公开资源,供进一步自学。所有 arXiv 编号均可直接访问 https://arxiv.org/abs/<编号>: