外观
经典论文精读
一句话定位:这十篇论文串起来,就是一部"AI 热门概念"的进化史——从 2017 年的 Transformer 点燃的第一簇火苗,到 2023 年 DPO 简化对齐,每一篇都解决了一个当时卡住整个领域的具体痛点,然后改变了世界。读透这十篇,你就握住了大语言模型、生成式 AI、RAG、Agent、对齐这五大热门方向的"遗传学主干"。
一、为什么是这十篇
先把十篇按时间摆成一条线,你会发现一张完整的图谱:
2017 Attention Is All You Need 注意力取代循环与卷积,一切大模型的底座
2018 BERT 双向预训练 + 微调,理解派代表
2020 GPT-3 规模法则降临,生成派登顶
2020 RAG 给模型外挂知识库,缓解幻觉
2020 DDPM 扩散模型奠基,稳定生成新范式
2021 LoRA 参数高效微调,让大模型"改得起"
2021 LDM 潜空间扩散,Stable Diffusion 的地基
2022 ReAct 推理 + 行动,Agent 范式开启
2022 InstructGPT RLHF 对齐,ChatGPT 的核心技术
2023 DPO 直接偏好优化,对齐的极简解| 论文 | 第一作者 | 发表 | 一句话贡献 |
|---|---|---|---|
| Attention Is All You Need | Vaswani | NeurIPS 2017 | 纯注意力架构 Transformer,取代 RNN |
| BERT | Devlin | NAACL 2019 | 双向预训练 + 微调,横扫 NLP 基准 |
| Language Models are Few-Shot Learners | Brown | NeurIPS 2020 | 1750 亿参数,规模即能力 |
| Retrieval-Augmented Generation | Lewis | NeurIPS 2020 | 检索外部知识 + 生成,缓解幻觉 |
| Denoising Diffusion Probabilistic Models | Ho | NeurIPS 2020 | 加噪-去噪式稳定生成,改写图像生成 |
| LoRA | Hu | ICLR 2022 | 低秩增量矩阵微调,参数高效 |
| High-Resolution Image Synthesis with LDM | Rombach | CVPR 2022 | 潜空间扩散,Stable Diffusion 底座 |
| ReAct | Yao | ICLR 2023 | 推理 + 行动交替,Agent 范式 |
| Training LMs to Follow Instructions | Ouyang | NeurIPS 2022 | RLHF 三件套,让模型听话 |
| Direct Preference Optimization | Rafailov | NeurIPS 2023 | 去掉奖励模型,对齐简化为一步监督学习 |
为什么是这十篇,而不是别的?三个理由:
- 每一篇都代表一次范式切换或一条新工程线:从"循环/卷积"到"纯注意力"(Transformer),从"单向"到"双向"(BERT),从"微调每个任务"到"规模 + 提示"(GPT-3),从"闭卷生成"到"开卷检索"(RAG),从"对抗博弈"到"加噪去噪"(DDPM),从"全量微调"到"参数高效"(LoRA),从"像素空间"到"潜空间"(LDM),从"只会问答"到"推理 + 行动"(ReAct),从"奖励模型"到"直接偏好"(InstructGPT → DPO)。
- 篇幅都适合精读:除 GPT-3 外,正文大多在 10 页上下,方法与实验都聚焦在一个核心思想上,比今天的巨型技术报告好读得多。
- 引用量都是万级到十万级:它们是被全世界反复检验、反复引用的"锚点"。读懂了它们,再读任何后续工作都有参照系。它们各自的坐标位置见论文地图。
阅读本文前
建议先读从这里开始了解栏目定位,再看论文地图建立全局坐标,并配合演进简史把时间线串起来。每篇精读的结构都是固定六步:论文信息 → 解决了什么问题 → 怎么解决的(核心方法)→ 关键结果 → 为什么重要(影响)→ 论文里的坑,方便你边读边做笔记。
二、Attention Is All You Need:一切大模型的底座(Vaswani, 2017)
论文信息
| 项目 | 内容 |
|---|---|
| 标题 | Attention Is All You Need |
| 第一作者 | Ashish Vaswani(Google Brain) |
| 发表 | NeurIPS 2017 |
| arXiv | 1706.03762 |
| 对应概念页 | Transformer 与注意力机制 |
解决了什么问题
2017 年的机器翻译由 RNN(尤其 LSTM)统治,但循环结构有两个天生短板:一是顺序计算——处理第 t 个词必须先算完前 t−1 个词,无法并行,长序列训练极慢;二是长距离依赖——信息隔得越远越难传递,梯度要么消失要么爆炸。Bahdanau 等 2014 年引入注意力机制缓解了第二个问题,但循环仍然是骨架。作者提出一个激进问题:能不能完全扔掉循环和卷积,只靠注意力?
怎么解决的
Transformer 的全部魔法浓缩在一个公式里:
Attention(Q, K, V) = softmax( Q·Kᵀ / √d_k ) · V
Q(Query 查询): "我在找什么"
K(Key 键) : "我是什么"
V(Value 值) : "我提供什么"每个 token 生成自己的 Q、K、V;用 Q 与所有 token 的 K 做内积得到"注意力权重"(除以 √d_k 防止点积过大导致 softmax 梯度消失),再按权重加权 V——每个 token 一步就能同时看到整句的任意 token,长距离依赖不复存在。围绕它还有四个关键设计:
- 多头注意力:把注意力拆成 h 个"头"并行计算,各头关注不同子空间(句法、指代、位置),拼起来再投影。论文的实验表明多头显著优于单头。
- 位置编码:没有循环就没有顺序信息,必须用正弦/余弦函数把位置信息显式加进输入。
- 残差连接 + LayerNorm:每个子层外面都包一层"残差 + 归一化",保证深网络可训练。
- Masked 注意力:解码器预测下一个词时,屏蔽未来位置的 token,防止"偷看答案"。
关键结果
在 WMT 2014 英德翻译上 BLEU 达 28.4(此前 SOTA 26.8),英法达 41.8(此前 SOTA 39.2),同时训练成本只有当时最好循环模型的零头——8 块 P100 训练 3.5 天。效果与效率的双重碾压,让"纯注意力"迅速取代 RNN。
为什么重要
- 通用底座:Transformer 成为 BERT、GPT、扩散模型骨干的共同底座,是整个 2020 年代生成式 AI 的地基。机制细节与注意力变体见Transformer 概念页。
- "少假设 + 更多数据"的设计哲学:去掉循环/卷积的顺序归纳偏置,用更通用的机制换更强的可扩展性——这条思路被证明极端有效。
- 复杂度遗产:自注意力是 O(n²),长序列(整本书、整段视频)至今是研究前线,推理优化与量化里有大量工作在攻克它。
论文里的坑
- "All You Need"其实不够:论文作者自己对"注意力到底学到了什么"也没有完备解释;后续研究(如 2021 年对注意力图的可解释性分析)发现注意力权重并不总能代表"重要程度"。
- O(n²) 复杂度是论文自带的暗雷:今天的超长上下文全部靠稀疏注意力、线性注意力、KV Cache 等工程手段绕开,原论文并没有给出长序列方案。
- 位置编码的正弦/余弦方案后来基本被可学习位置嵌入取代——作者以为重要的设计,时间验证后让位于更简单的方案。
相关链接
- Transformer 与注意力机制 —— 本文的机制详版
- ChatGPT 与对话式 AI —— Transformer 最出圈的产品后代
- 总体架构解剖 —— Transformer 在现代大模型架构中的位置
三、BERT:双向预训练开启理解时代(Devlin, 2018)
论文信息
| 项目 | 内容 |
|---|---|
| 标题 | BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding |
| 第一作者 | Jacob Devlin(Google) |
| 发表 | NAACL 2019(arXiv 2018) |
| arXiv | 1810.04805 |
| 对应概念页 | 大语言模型 |
解决了什么问题
2018 年,"预训练 + 微调"已被证明有效:先在无标注大语料上预训练一个语言模型,再在任务数据上微调。但当时的预训练语言模型都有结构性缺陷:GPT 是从左到右单向的(只能看左侧上下文);ELMo 是"浅层"拼接两个方向的 LSTM 表示。而大量理解任务——完形填空、指代消解、句间关系判断——天然需要同时看到左右两侧。如何做出"深度双向"的语言模型?
怎么解决的
BERT(Bidirectional Encoder Representations from Transformers)用两个预训练任务解开这个结:
任务一:掩码语言模型 MLM(解决"深度双向")
输入: 我 [MASK] 机器学习。[MASK] 是一门用数据自动找规律的学科。
目标: 预测被 [MASK] 的两个词
→ 模型被迫同时使用左右两侧上下文,实现深度双向
任务二:下一句预测 NSP(解决"句间关系")
输入: [CLS] 机器学习很有趣 [SEP] 它从数据中学习规律 [SEP]
目标: 判断第二句是否是第一句的真实下一句
→ 为问答、推理、句对任务注入能力架构:多层双向 Transformer 编码器。BERT-base 12 层、1.1 亿参数;BERT-large 24 层、3.4 亿参数。预训练语料为 BookCorpus + 英文维基(约 33 亿词)。微调时只需在顶部加一个任务相关输出层,用极少训练步数就能适配任意下游任务。
关键结果
BERT-large 在 11 项 NLP 基准上全面刷新 SOTA:GLUE 综合分 80.5(此前最好 72.8);SQuAD v1.1 问答 F1 93.2,首次超过人类水平 91.2,引发"AI 阅读理解超过人类"的公众关注。
为什么重要
- 预训练 + 微调范式:海量无标注数据学通用表示、少量标注数据做任务适配——这个范式定义了整个 2010 年代末到 2020 年代,所有大模型都是它的后裔。完整脉络见大语言模型概念页。
- 双向 vs 单向的分叉:BERT 证明双向理解更强,GPT 证明单向生成更顺;今天的 decoder-only 大模型用"因果掩码 + 注意力"重新统一了两者。
- 预训练目标本身就是创新对象:把"完形填空"(MLM)变成预训练任务,后续 T5、RoBERTa 都在改这个目标。
- 通向规模法则:BERT 用 3.4 亿参数 + 33 亿词,效果随两者同步放大——直接指向两年后 GPT-3 的"参数、数据、算力三者按幂律增长"。
论文里的坑
- NSP 任务被后续工作证明基本无用:RoBERTa(2019)去掉 NSP 后性能不降反升。作者以为重要的"句间关系预训练",时间验证后是可有可无的。
- MLM 的"两个短板":训练与推理不一致(预训练见 [MASK]、推理不见 [MASK]),且每个 token 只被预测 15%,训练效率低——这正是后续被 BART、T5 的"去噪自编码"路线取代的原因之一。
- "双向"以牺牲生成能力为代价:BERT 只会"理解"不会"续写",在生成型任务上完全不是 GPT 的对手。
相关链接
- 大语言模型 —— BERT 与 GPT 路线的完整对照
- Perplexity 与 AI 搜索 —— BERT 系向量检索的实际应用
- LLM 评估与基准 —— BERT 当年刷的 GLUE 正是今天评估体系的祖先
四、GPT-3:规模法则降临(Brown, 2020)
论文信息
| 项目 | 内容 |
|---|---|
| 标题 | Language Models are Few-Shot Learners |
| 第一作者 | Tom Brown(OpenAI) |
| 发表 | NeurIPS 2020 |
| arXiv | 2005.14165 |
| 对应概念页 | 大语言模型 |
解决了什么问题
BERT 证明了"预训练 + 微调"有效,但微调有个现实瓶颈:每个新任务都要重新收集标注数据、重新训练,成本高且难扩展。GPT-3 提出更激进的问法:能不能完全不微调——只给模型几个示例(甚至零个示例),它就直接干活? 论文标题本身就是宣言:语言模型是"少样本学习者"(Few-Shot Learners)。
怎么解决的
- 规模:1750 亿参数,比前代 GPT-2 大两个数量级;训练数据约 45TB 清理后的网络文本(Common Crawl、WebText 等)。这是当时世界上最大的神经网络。
- 上下文学习(In-Context Learning):把任务示例直接写进输入提示(prompt),模型"即看即学",不更新任何参数。
- 三种评测设置:零样本(Zero-shot)、单样本(One-shot)、少样本(Few-shot)。实验结果几乎总是随示例数单调提升——上下文里的示例就是"在线微调"。
- 规模法则的实证:训练损失、下游任务能力随参数、数据、算力按幂律稳定提升。
预训练(一次性,代价巨大):
45TB 文本 ──▶ 1750 亿参数模型(学习"世界的统计规律")
推理(即看即学,零成本适配):
prompt = "翻译成英文:猫 → cat;狗 → dog;鸟 →" ──▶ "bird"
↑ 不给梯度更新,只给几个例子,模型就能完成新任务关键结果
在翻译、问答、闭卷知识填空、算术、新闻生成等 20+ 任务上,GPT-3 的 few-shot 表现与当时专门微调的 SOTA 相当甚至更好。同时论文也如实报告了大模型的阴暗面:训练数据里的偏见被放大、生成内容可能捏造事实(幻觉)、规模到一定程度收益递减。
为什么重要
- 规模法则是 2020 年代最硬的信仰:它直接催生了 ChatGPT(2022)、GPT-4(2023)和全球大模型军备竞赛。理解它,才理解为什么各家公司都在疯狂堆 GPU 和买数据。
- 范式再次切换:从"预训练 + 微调"到"预训练 + 提示/对齐"——人与模型的交互从"写代码微调"变成"对话"。产品化见ChatGPT 案例。
- 能力藏在数据里:少样本学习的表现说明,许多"能力"可能早已潜伏在预训练数据中,只是需要合适的方式被唤起。
- 提示词成为新接口:既然示例写进 prompt 就行,提示词工程就成了普通人操作大模型的主要方式。
论文里的坑
- "Few-Shot"的边界很模糊:论文自己也承认,示例数的提升存在天花板,且闭卷问答里"知识"是死记硬背出来的,不是真正检索。
- 幻觉与偏见被如实记录但没解决:论文第 7 节公开了性别/种族偏见放大的测量结果,却没有给出对策——"提出问题但没有答案"是这篇论文的诚实之处。
- 175B 的复现门槛:绝大多数研究者无法复现,导致后续两年学界主要在"云上炼丹"与"追赶复现"之间摇摆,直到开源模型出现才打破。
相关链接
- 大语言模型 —— 规模法则与上下文学习的机制解读
- ChatGPT 与对话式 AI —— GPT-3 之后的产品形态
- 提示词工程 —— 上下文学习在实操中的样子
五、RAG:给模型外挂一个知识库(Lewis, 2020)
论文信息
| 项目 | 内容 |
|---|---|
| 标题 | Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks |
| 第一作者 | Patrick Lewis(Facebook AI) |
| 发表 | NeurIPS 2020 |
| arXiv | 2005.11401 |
| 对应概念页 | 检索增强生成 |
解决了什么问题
大模型有两个先天缺陷:一是知识截止——训练数据有时间边界,最新的新闻、私有的企业文档一概不知;二是幻觉——模型无法确认自己"不知道什么",会把编造的内容一本正经地说出来。与其逼模型把所有知识塞进参数,不如让模型在回答前去查资料——这就是"检索增强生成"(Retrieval-Augmented Generation, RAG)的核心思想。
怎么解决的
RAG 把生成过程拆成"查-读-写"三步,用一个检索器和生成器拼成端到端可训练的系统:
用户问题 q
│
▼
检索器(DPR:BERT 双编码器)
│ 在知识库(如维基百科段落)里按向量相似度
│ 召回 top-k 相关文档 z₁...z_k
▼
生成器(BART)── 以 [q + z₁...z_k] 为输入 ──▶ 生成答案
两种解码策略:
RAG-Sequence:每个候选文档生成一整段答案,再对答案求和取最大
RAG-Token: 每个 token 生成时都综合所有文档的分布关键点:检索器和生成器是联合训练的——生成器学会"怎么用检索来的资料",检索器学会"什么样的资料对生成最有帮助";知识可以随时更换(换索引即可),不必重训模型。
关键结果
在 **Natural Questions、WebQuestions、FEVER(事实验证)**等知识密集型任务上,RAG 刷新当时 SOTA。尤其重要的是它的"开卷"特性:知识库里更新了什么,模型就能答什么,不需要重训。
为什么重要
- 幻觉治理的第一课:让答案"有出处"(引用检索到的文档),成为今天企业级应用的标配。实操见从零搭建 RAG 应用。
- 知识外挂范式:文档、数据库、代码库都能"外挂"给模型,向量索引怎么做见向量数据库与语义检索。
- 催生了整条工具链:GraphRAG(加知识图谱)、RAGAS(评估 RAG)等后续工作全部挂在这篇论文的引用树上。
- 产品形态的样板:Perplexity 的"搜索 + 引用"交互直接继承自 RAG 思想,见Perplexity 与 AI 搜索。
论文里的坑
- 检索质量决定上限:论文用的是维基百科级的干净语料;真实场景里企业文档混杂、检索召回差,RAG 效果会大幅跳水——"垃圾进,垃圾出"是 RAG 的头号工程坑。
- 端到端训练并不总是必要:作者发现检索器冻结时性能下降不大;实践中大家常直接复用现成 embedding 模型,省去联合训练。
- 一次检索一步生成的朴素结构处理多跳问题("A 和 B 的关系是什么,B 又在哪")很吃力,需要 ReAct 式的多轮检索来补。
相关链接
- 检索增强生成 —— 机制、组件选型与变体的完整解读
- 向量数据库与语义检索 —— RAG 的检索底座
- 从零搭建 RAG 应用 —— 手把手实现一个 RAG
- Perplexity 与 AI 搜索 —— RAG 的产品化样板
六、LoRA:让大模型"改得起"(Hu, 2021)
论文信息
| 项目 | 内容 |
|---|---|
| 标题 | LoRA: Low-Rank Adaptation of Large Language Models |
| 第一作者 | Edward Hu(Microsoft) |
| 发表 | ICLR 2022(arXiv 2021) |
| arXiv | 2106.09685 |
| 对应概念页 | 微调与 PEFT |
解决了什么问题
GPT-3 把模型推到了 1750 亿参数,全量微调的成本也随之爆炸:175B 模型的每个权重都要存梯度、都要更新,一次微调要几十张甚至上百张高端 GPU,个人和小团队根本玩不起。有没有办法只改极少一部分参数,却能达到接近全量微调的效果?
怎么解决的
LoRA 的洞察来自一个经验事实:大模型微调时的权重变化量 ΔW 往往是低秩的——不需要 D×D 个自由参数,只需要用两个小矩阵的乘积就能近似。于是它把微调改写成:
预训练权重 W₀(D×D,冻结,不更新)
微调增量 ΔW = B·A (B: D×r,A: r×D,r 远小于 D)
前向计算: h = W₀·x + (B·A)·x
训练时: 只更新 B 和 A(可合并:推理时 W' = W₀ + B·A,零额外延迟)以 GPT-3 175B 为例,r 取 4 时训练参数量从 1750 亿降到 3500 万,约缩小 10000 倍,GPU 显存需求降低约 3 倍。
关键结果
在 RoBERTa、DeBERTa、GPT-2 上,LoRA 微调与全量微调的效果几乎持平甚至更好;在 GPT-3 175B 上,LoRA 逼近全量微调基线,且训练参数量少到可以在单卡上完成。作者还发现:秩 r 在 1–64 之间对效果影响很小,说明 ΔW 确实低秩。
为什么重要
- 微调民主化:LoRA 让个人开发者在消费级显卡上微调大模型成为可能,直接催生了 Hugging Face PEFT 生态与海量"微调模型"(社区里无数 Llama 系微调模型都挂着 LoRA)。实操见微调你自己的 LLM。
- 参数高效微调(PEFT)家族的起点:Prefix-Tuning、P-Tuning、Adapter、QLoRA(量化 + LoRA)都是它的后继或组合。
- 多任务切换变便宜:每个任务存一个几十 MB 的 LoRA 权重,而不是几百 GB 的全量权重——"一个底座 + 一堆适配器"成为工程主流。
论文里的坑
- 低秩假设不总是成立:后续研究发现,某些任务(尤其新领域、新语言)的 ΔW 并不低秩,LoRA 效果会明显差于全量微调。
- r 不是越小越好:论文说 r 对效果不敏感,但在训练数据非常少或任务变化很大时,r 太小会欠拟合——选 r 要结合数据量。
- 与量化叠加的坑:LoRA 权重通常用更高精度(如 bf16)保存,部署时若把它硬压成 4-bit 会掉点,需要 QLoRA 式的一体化方案。对比见QLoRA的前沿梳理。
相关链接
- 微调与 PEFT —— LoRA 的原理、参数与选型建议
- 微调你自己的 LLM —— 动手做一次 LoRA 微调
- GitHub Copilot 与代码智能 —— LoRA 微调代码模型的典型场景
- 常见陷阱与反模式 —— 微调中最常踩的坑
七、DDPM:扩散模型奠基(Ho, 2020)
论文信息
| 项目 | 内容 |
|---|---|
| 标题 | Denoising Diffusion Probabilistic Models |
| 第一作者 | Jonathan Ho(UC Berkeley) |
| 发表 | NeurIPS 2020 |
| arXiv | 2006.11239 |
| 对应概念页 | 扩散模型与生成式 AI |
解决了什么问题
2020 年的图像生成处于两难:GAN 质量最高但训练不稳、模式坍缩;VAE 稳定但样本模糊。有没有一种方法训练稳定、模式覆盖全、生成质量还高?Ho、Jain、Abbeel 把 2015 年 Sohl-Dickstein 等提出的扩散思想(受非平衡热力学启发)用工程配方重新落地,给出了答案。
怎么解决的
扩散模型是一个"先污染、后治理"的两阶段过程:
前向过程(加噪,无需学习):
x₀(真实图)──加一点点噪声──▶ x₁ ──▶ x₂ ──▶ ⋯ ──▶ x_T(纯噪声)
每一步: x_t = √(1−β_t)·x_{t−1} + √β_t·ε ,ε ~ N(0, I)
反向过程(去噪,神经网络学习):
训练目标: 给定带噪图 x_t 和时间步 t,预测所加的噪声 ε
生成: 从纯噪声 x_T 出发,逐步去噪,T 步还原出 x₀三个关键工程配方让它从"理论上可行"变成"真的能生成":
- 简化的训练目标:把复杂的变分下界(ELBO)简化成只优化"预测噪声"的均方误差——监督信号极其简单干净。
- U-Net 骨干 + 时间步嵌入:用带跳跃连接的 U-Net 做去噪网络,把时间步 t 作为条件嵌入(网络需要知道"当前该去掉多少噪声")。
- 与 VAE 的统一视角:扩散模型本质是一个特殊的层次化 VAE——每一层都把输入"打散成噪声"再学会恢复。
关键结果
在无条件 CIFAR-10 上,DDPM 的 Inception Score 达 9.46、FID 达 3.17,与当时最好的 GAN 相当甚至更优;而它的训练过程全程稳定、无模式坍缩,生成多样性远超 GAN 家族。
为什么重要
- 稳定与质量兼得:把生成建模成"预测噪声"的简单回归,用稳定的监督学习取代了不稳定的对抗博弈——这是它能反超 GAN 并大规模工程化的前提。
- 后续连锁反应:DDIM(更快采样)、Classifier-Free Guidance(可控生成)、Latent Diffusion(Stable Diffusion 底座)层层叠加,把扩散推上 2022 年后图像/视频/音频生成的主峰。
- 方法论价值:把热力学/物理里的老思想引入机器学习是发现新模型的捷径。生成式 AI 的现状见扩散模型概念页与Midjourney 案例。
论文里的坑
- 采样慢:生成一张图要跑 1000 步去噪,是 GAN 的百倍量级;论文没有给出加速方案,DDIM、LCM、蒸馏都是后来的补丁。
- T=1000 是经验值:论文对步数做了敏感性实验,但"为什么是 1000"没有严格理论依据。
- 无条件生成的局限:论文主要在无条件 CIFAR-10 上验证;真正可控生成(文本条件)要等后续工作补上。
相关链接
- 扩散模型与生成式 AI —— 扩散原理、采样与变体的完整解读
- Midjourney 与图像生成 —— 扩散模型的产品化
- Sora 与视频生成 —— 扩散思想扩展到视频
八、LDM / Stable Diffusion:潜空间扩散(Rombach, 2021)
论文信息
| 项目 | 内容 |
|---|---|
| 标题 | High-Resolution Image Synthesis with Latent Diffusion Models |
| 第一作者 | Robin Rombach(LMU Munich / Runway) |
| 发表 | CVPR 2022(arXiv 2021) |
| arXiv | 2112.10752 |
| 对应概念页 | 扩散模型与生成式 AI |
解决了什么问题
DDPM 证明了扩散可行,但有个致命工程问题:在像素空间跑 1000 步扩散,训练和推理都贵得离谱。生成一张 512×512 的图,每一步都要处理 26 万维的张量。能不能先压缩、再生成——在信息密度高得多、维度低得多的潜空间里做扩散?
怎么解决的
LDM(Latent Diffusion Models)把生成拆成"压缩"和"扩散"两段:
第一段:自编码器压缩
图像 ──▶ 编码器 E ──▶ 潜变量 z(8 倍下采样,尺寸缩小到 1/64)──▶ 解码器 D
第二段:在潜空间做条件扩散
噪声 z_T ──▶ U-Net 逐步去噪 ──▶ z₀
每一层用「交叉注意力」注入文本条件 c(来自 CLIP 文本编码器)
→ 文本:"一只戴帽子的柴犬" ──▶ 生成对应的潜变量 ──▶ 解码成图像三个关键设计:
- 潜空间压缩(VQ-reg / KL-reg 自编码器):训练一个专用 VAE 把图像压进低维潜空间,扩散只在潜空间里做,计算量直接降低一个数量级。
- 交叉注意力文本条件:让扩散 U-Net 的每一层都能"读到"文本语义,实现文本到图像的可控生成。
- 尺度可调的条件注入:同一架构支持文本、图像(图生图)、布局、超分等多种条件。
关键结果
LDM 在高分辨率(256×256 及以上)图像合成上达到或超越当时 SOTA,同时推理成本比像素空间扩散低一个数量级——512×512 图像可在消费级 GPU 上生成。基于 LAION-5B 训练的 Stable Diffusion 随后成为开源图像生成的统治级工具。
为什么重要
- Stable Diffusion 的地基:Stability AI 直接采用 LDM 配方开源了 Stable Diffusion,"文本画图"从此进入大众电脑。见Midjourney 与图像生成。
- "压缩 + 生成"的分工思想:VAE 负责"保真的压缩",扩散负责"有创意的生成",两者各司其职——这套架构后来被 Sora 的视频生成继承。
- 可控生成的开关:ControlNet、LoRA 微调、图生图、超分全部构建在 LDM 的潜空间之上。
论文里的坑
- 压缩器的瓶颈:自编码器的重建质量是上限——VAE 压缩 8 倍会丢失高频细节(小字、纹理),所以才有后续的更高倍率压缩与扩散解码器研究。
- 长文本能力弱:CLIP 文本编码器对长句、组合概念理解有限,"红色的小猫在蓝色的桌子上"这类复合指令经常画错。
- 版权与滥用争议:LAION-5B 从网络抓取,训练数据包含受版权保护的作品——这篇论文开启了技术红利,也开启了后续一连串法律与伦理争议,可延伸读AI 安全与治理。
相关链接
- 扩散模型与生成式 AI —— LDM 在生成模型家族中的位置
- 多模态模型 —— 文本条件注入背后的跨模态原理
- Midjourney 与图像生成 —— LDM 的消费级产品形态
九、ReAct:让模型推理 + 行动(Yao, 2022)
论文信息
| 项目 | 内容 |
|---|---|
| 标题 | ReAct: Synergizing Reasoning and Acting in Language Models |
| 第一作者 | Shunyu Yao(Princeton) |
| 发表 | ICLR 2023(arXiv 2022) |
| arXiv | 2210.03629 |
| 对应概念页 | AI 智能体 |
解决了什么问题
纯语言模型是"纸上谈兵"的:它只能从记忆里作答,无法查网页、算不了实时数据、不能操作外部系统。而纯工具调用(只调 API 不思考)又容易在复杂任务上跑偏。推理(Reasoning)和行动(Acting)能不能交替进行、互相补充——先想一步,再做一步,看到结果再想下一步?
怎么解决的
ReAct 把 LLM 的交互循环定义为"想→做→看"三拍:
Thought(推理): 问题需要最新股价。我可以查实时数据。
Action(行动): search("AAPL 最新股价")
Observation(观察): 搜索结果:$234.50(2025-06-10)
Thought: 已获得答案,可以总结。
Action: finish("苹果公司当前股价为 234.50 美元")三拍交替,模型就能在真实环境里逐步解决多步任务。论文同时给出两种关键 prompting 手法:少样本示例(示范"想-做-看"循环)与 inner-monologue 式引导。
关键结果
- 在 HotpotQA(多跳问答) 与 FEVER(事实验证) 上,ReAct 同时超过"纯推理"(Chain-of-Thought)和"纯行动"(Act-only)基线——因为推理让行动有方向,行动让推理有依据。
- 在 ALFWorld(虚拟家庭任务) 与 WebShop(模拟购物) 两个需要与环境交互的基准上,ReAct 大幅超越纯行动基线。
为什么重要
- Agent 范式的奠基论文:今天几乎所有 LLM Agent 框架(LangChain、AutoGPT、Manus 等)的"思考-行动-观察"循环都源自 ReAct。概念化解读见AI 智能体,产品级案例见Manus 与 Agent 应用。
- 让"工具使用"成为一等公民:搜索、计算器、代码解释器、数据库查询都可以是模型手里的一件工具——提示词工程与推理优化都受这条思路影响。
- 把 RAG 从"一次检索"升级为"多轮检索":Agent 化的 RAG 可以边查边想,解决多跳问题。手把手实现见从零开发一个 Agent。
论文里的坑
- 观测开销与循环失控:每步行动都消耗 token 与时间;模型可能在错误方向上反复打转,需要最大步数上限与终止条件。
- 对提示敏感:少样本示例的质量直接影响成功率;换一个领域常常要重新设计示例。
- "幻觉"没有消失,只是转移:模型的"Thought"仍然可能编造观测——需要在系统层校验工具返回的真实性。
相关链接
- AI 智能体 —— ReAct 循环、规划、记忆、工具的完整拆解
- 从零开发一个 Agent —— 用 ReAct 思想搭一个可用 Agent
- Manus 与 Agent 应用 —— ReAct 思想的产品化
- 常见陷阱与反模式 —— Agent 循环失控等工程坑
十、InstructGPT:RLHF 三件套(Ouyang, 2022)
论文信息
| 项目 | 内容 |
|---|---|
| 标题 | Training Language Models to Follow Instructions with Human Feedback |
| 第一作者 | Long Ouyang(OpenAI) |
| 发表 | NeurIPS 2022 |
| arXiv | 2203.02155 |
| 对应概念页 | 对齐:RLHF 与 DPO |
解决了什么问题
GPT-3 会生成,但它不听话:答非所问、编造事实、输出有害内容、对同一问题给出前后矛盾的答案。模型是"预测下一个词"训练出来的,目标函数是"像互联网文本",不是"让用户满意"。怎么让模型学会遵循指令、诚实、无害?
怎么解决的
InstructGPT 用人类反馈的强化学习(RLHF) 分三步走:
第一步 SFT(监督微调):
人类写演示答案 → 微调 GPT-3,让它先学会"大致该这么答"
第二步 奖励模型 RM:
让模型对同一问题生成多个答案 → 人类按偏好排序
→ 训练一个打分器 RM 模拟人类偏好
第三步 PPO(强化学习优化):
以 SFT 模型为初始策略,用 RM 的分数做奖励,PPO 更新策略
→ 让"被人类喜欢的回答"概率越来越高一个反直觉但关键的结果:训练中人类偏好数据来自约 40 名标注员,数据规模只有几万条——与预训练动辄 TB 级的数据相比微不足道,却能把模型从"能言善辩"变成"懂规矩"。
关键结果
- 1.3B 的 InstructGPT 在人类偏好测试中胜过大 100 倍的 175B 原始 GPT-3——"对齐"比"规模"更能改善用户感受。
- 在"遵循指令"、"编造率"、"有害输出"三个维度全面改善;论文同时发现对齐会让模型"更受人类喜欢",但会略微降低一些传统基准分数(对齐税)。
为什么重要
- ChatGPT 的核心技术:GPT-3.5 + RLHF 成就了 2022 年 11 月引爆全球的 ChatGPT。产品叙事见ChatGPT 案例。
- 对齐成为独立研究方向:RLHF 三件套(SFT + RM + PPO)之后成为对齐的标准配方,直到 DPO 等更简方法出现。
- 让"人类价值"进入训练目标:模型不仅"有能力",还要"被信任"——这对AI 安全与治理意义深远。
论文里的坑
- RLHF 很贵且脆弱:奖励模型会过拟合、标注员之间意见不一致、PPO 训练不稳定——作者自己承认这些是"未竟之事"。
- "对齐税":偏好优化让模型更听话,但可能削弱开放性生成与创造力,评测分数也可能下降。
- 奖励黑客:模型可能学会"刷分"而不是"做好事"——说人类爱听的话,而不一定是真话。这个问题直到今天仍是前沿难题。
相关链接
- 对齐:RLHF 与 DPO —— RLHF 原理、奖励模型与 PPO 详解
- ChatGPT 与对话式 AI —— RLHF 的产品化
- DeepSeek-R1 与推理模型 —— RL 思想在推理能力上的延伸
- AI 安全与治理 —— 对齐之上的治理视角
十一、DPO:把对齐简化为一步监督学习(Rafailov, 2023)
论文信息
| 项目 | 内容 |
|---|---|
| 标题 | Direct Preference Optimization: Your Language Model is Secretly a Reward Model |
| 第一作者 | Rafael Rafailov(Stanford) |
| 发表 | NeurIPS 2023 |
| arXiv | 2305.18290 |
| 对应概念页 | 对齐:RLHF 与 DPO |
解决了什么问题
RLHF 有效但工程上极其麻烦:要训练奖励模型、要在线采样、要调 PPO 的超参、训练不稳定。作者问了一个尖锐的问题:既然最优策略与奖励模型之间存在闭式解关系,能不能跳过奖励模型,直接从偏好数据一步到位?
怎么解决的
DPO 的关键洞察来自一个数学事实:对于带 KL 约束的最优策略,奖励函数可以写成策略比的对数形式:
最优策略满足: r(x,y) = β·log( π_r(y|x) / π_ref(y|x) ) + β·log Z(x)
把 r 代回 Bradley-Terry 偏好模型,奖励模型消失了:
L_DPO = − E[ log σ( β·log(π_θ(y_w|x)/π_ref(y_w|x))
− β·log(π_θ(y_l|x)/π_ref(y_l|x)) ) ]
其中 y_w 是更受偏好的回答,y_l 是较差回答翻译成人话:只要模型对"好回答"的概率比参考模型上升得多、对"差回答"下降得多,就是一次正确的偏好优化。整个训练就是一次标准的分类式监督学习——不需要奖励模型、不需要在线采样、不需要 PPO。
关键结果
在**情感控制(IMDb)、摘要(TL;DR)、对话(Reddit)**等任务上,DPO 与 RLHF 效果相当;在摘要质量的人工评估中甚至优于 PPO 基线。训练只需单个 GPU、几行 PyTorch 即可复现——这是 RLHF 完全做不到的。
为什么重要
- 对齐民主化:DPO 把"对齐"从 OpenAI 级工程变成普通团队可复现的实验,开源社区迅速跟进。
- RLHF 家族的新基准:GRPO(DeepSeek-R1 使用)、KTO、ORPO 等后续方法都是"无奖励模型"路线的一员。R1 的对齐与强化学习链条见DeepSeek-R1 案例。
- 思想价值:"语言模型本身就是隐式奖励模型"——理解这一点,才能理解对齐方法为什么能越来越简。
论文里的坑
- 需要高质量偏好数据:DPO 没有 RM 的"在线反馈",全部依赖离线偏好对的质量;数据差,结果就差。
- 参考模型必须冻结且训练时保留:DPO 需要参考分布做对比,实践中参考模型要单独保存,推理/部署时多一份内存开销。
- 离线数据的分布漂移:偏好数据来自某个旧模型,用它训练新模型时,新模型生成的回答可能不在数据分布内,效果打折——需要迭代式收集。
相关链接
- 对齐:RLHF 与 DPO —— DPO 推导、实现与 RLHF 对照
- DeepSeek-R1 与推理模型 —— GRPO 与 DPO 家族在推理模型中的应用
- AI 安全与治理 —— 对齐方法之上的治理框架
- 术语表 —— 碰到 RLHF、PPO、DPO 术语随时查
十二、读这十篇的共同规律
十篇论文横跨 2017–2023、覆盖理解、生成、工程、对齐四大方向,但放在一起,规律惊人地一致:
规律一:好论文都来自解决具体的痛点,而不是追逐新概念。 Transformer 解决"RNN 不能并行 + 长距离遗忘";BERT 解决"语言模型单向";GPT-3 解决"每个任务都要标注数据微调";RAG 解决"模型不知道最新知识";LoRA 解决"全量微调太贵";DDPM 解决"GAN 训练不稳定";LDM 解决"扩散太贵";ReAct 解决"模型只会说不做事";InstructGPT 解决"模型不听话";DPO 解决"对齐太复杂"。痛点定义问题,问题定义创新。
规律二:核心机制简单到一句话能讲清。 注意力:softmax(QKᵀ/√d)·V;MLM:遮词填空;上下文学习:把示例写进 prompt;RAG:先查再答;LoRA:ΔW = BA;扩散:加噪再学去噪;潜空间:先压缩再生成;ReAct:想-做-看循环;RLHF:人类偏好当奖励;DPO:偏好对当监督。真正改变领域的机制,往往一句话就能讲清。复杂是实现的复杂,不是概念的复杂。
规律三:都用实验证明"是机制在起作用",而不是只给结果。 Transformer 用 BLEU + 训练成本双指标;BERT 用 11 项基准 + 消融;GPT-3 用三种评测设置对比;DDPM 用 FID/IS + 稳定性报告;ReAct 用"推理 vs 行动 vs 两者结合"的对照。好论文不仅给结果,还给"证明结果是机制导致的"的实验设计。
规律四:突破几乎都来自"跨界借思想"。 注意力借信息检索的"查询-键值",扩散借热力学的熵增,LoRA 借矩阵低秩近似,DPO 借统计学的 Bradley-Terry 偏好模型,ReAct 借认知科学的"思考与行动交替"。站在别的学科肩膀上,是降低创新成本的最短路径。
规律五:每篇都打开一扇门,而不是关上一扇门。 Transformer 让"更大"成为可能,RAG 让"外挂知识"成为可能,LoRA 让"人人可微调"成为可能,DPO 让"人人可对齐"成为可能——它们没有终结一个领域,而是让领域爆发。判断一篇论文价值的简单标准:它是否让后续工作更容易、更便宜、更有可能?
用一句话总结
读论文与其说是学知识,不如说是学如何发现和解决问题。这十篇的共同方法论是:找到一个具体的、可测量的痛点 → 给出一个机制简单、可解释的解法 → 用实验证明机制与效果之间的因果链。 你如果能复现这条方法论,就具备了独立研究或独立落地的骨架。剩下的,就是把论文地图上的每一个坐标都走一遍。
延伸阅读
- 从这里开始 —— 论文栏目总入口与概念地基,先确定你的阅读目标
- 阅读路径 —— 三条路线的具体文章清单与阅读顺序
- 论文地图 —— 把本文十篇放进 2014–2025 论文演进的宏观坐标系
- 前沿进展 —— 读完经典之后,往 2024–2025 的前沿走
- 演进简史 —— 从 Transformer 到 Agent 的完整历史叙事
- 概念深化:Transformer 与注意力机制、大语言模型、扩散模型与生成式 AI、检索增强生成、AI 智能体、对齐:RLHF 与 DPO、微调与 PEFT
- 案例对应:ChatGPT 与对话式 AI、Midjourney 与图像生成、Perplexity 与 AI 搜索、Manus 与 Agent 应用、DeepSeek-R1 与推理模型
- 实战落地:从零搭建 RAG 应用、从零开发一个 Agent、微调你自己的 LLM
- 术语表 —— 读论文时随时查阅
参考资料
以下均为真实公开资源,可直接访问原文:
- Vaswani et al. Attention Is All You Need. NeurIPS 2017 —— Transformer 原论文
- Devlin et al. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL 2019 —— BERT
- Brown et al. Language Models are Few-Shot Learners. NeurIPS 2020 —— GPT-3
- Lewis et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020 —— RAG
- Ho, Jain, Abbeel. Denoising Diffusion Probabilistic Models. NeurIPS 2020 —— DDPM
- Hu et al. LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022 —— LoRA
- Rombach et al. High-Resolution Image Synthesis with Latent Diffusion Models. CVPR 2022 —— LDM / Stable Diffusion
- Yao et al. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023 —— ReAct
- Ouyang et al. Training language models to follow instructions with human feedback. NeurIPS 2022 —— InstructGPT / RLHF
- Rafailov et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023 —— DPO
- Keshav. How to Read a Paper (2007) —— 三遍读论文法的原始出处
- arXiv 预印本库 —— 本文全部论文的第一发布地
- Papers with Code —— 论文 + 代码 + 基准聚合,核对复现与 SOTA