外观
对齐:RLHF 与 DPO
一句话定义:从"能力强"到"会做人"
对齐(Alignment)是指让 AI 模型的行为与人类意图、价值观、安全规范相一致的过程。一句大白话概括:『模型不仅能力要强,还要按人类想要的方式行事』。
预训练教会了模型"文字的下一个 token 是什么",但没有教它"人想听什么";对齐要补的正是后半课。它是大模型从"文本续写器"变成"靠谱助手"的关键一跃,也是大语言模型(LLM)工程链路里离"产品体验"最近的一环。如今从 ChatGPT 与对话式 AI到 DeepSeek-R1 与推理模型,几乎所有能用好用的模型背后都站着某一种对齐技术;而在AI 安全与治理的讨论中,对齐更是被反复强调的"防线"。
一句话判断
能力是预训练给的,品行是对齐给的。 想判断一个模型"能不能用",看基准分数;想判断它"敢不敢用",看对齐做得好不好。
为什么需要对齐:从"像人话"到"对人负责"
预训练语言模型的学习目标只有一个:在语料上最大化下一个 token 的预测概率。这个目标天然只会产出**"像人话"**的文本——流畅、模仿性强、风格接近训练语料,但模型对"说得对不对、该不该说、对谁负责"毫无概念。于是我们看到一个典型的"裸预训练"模型会:
- 一本正经地编造:胡编乱造人名、数字、引用(幻觉);
- 有问必答、无底线地附和:被诱导时输出有害、歧视、犯罪指导内容;
- 答非所问:用户问东,它洋洋洒洒写西;
- 没有边界感:不知道什么该说、什么该保密、什么该拒绝。
对齐要解决的就是这"最后一公里"。业界一般把目标拆成三个 H——这也是AI 安全讨论里的标准框架:
| 目标 | 英文 | 含义 | 反面典型 |
|---|---|---|---|
| 有用性 | Helpful | 真正解决用户问题,而不是敷衍 | 答非所问、空话连篇 |
| 诚实性 | Honest | 不编造、不夸大、承认不知道 | 幻觉、幻觉还嘴硬 |
| 无害性 | Harmless | 不输出有害、违法、偏见内容 | 暴力/犯罪指导、歧视言论 |
三个 H 常常相互冲突:太"诚实"可能暴露危险信息,太"无害"可能让答案空洞无用。对齐工程本质上是在三条约束之间寻找平衡点,而这个平衡点是靠数据选出来的,不是靠规则写出来的——这正是 RLHF 与 DPO 等方法的立足点。回顾演进简史可以看到,对齐问题是模型规模增大后才凸显的"富贵病",与Transformer 与注意力机制带来的能力跃迁相伴而生。
RLHF:对齐的主流路线(三阶段详解)
**RLHF(基于人类反馈的强化学习,Reinforcement Learning from Human Feedback)**是 OpenAI 在 InstructGPT(2022)中确立、随后被全行业复制的对齐范式。它的核心思路:人类不会直接改模型,但人类会"打分"——那就把"人的偏好"训练成一个可微分的打分器(奖励模型),再用强化学习去优化它。整条流水线分三个阶段:
预训练模型(只会"像人话")
│
▼ 阶段一:SFT 监督微调
SFT 模型(会照葫芦画瓢地"照指示做事")
│
├──── 人类标注者:对多个回答排序 ◀── 采集偏好数据
▼
阶段二:奖励模型 RM(学会"给回答打分",分数=人类偏好)
│
▼ 阶段三:PPO 强化学习
对齐后的模型(策略 π 被优化到"最大化 RM 分数")阶段一:监督微调(SFT)
先收集一批人工撰写的示范回答:给出指令(prompt),让标注者写出高质量回复,然后做普通的监督学习——这就是微调与 PEFT里的标准做法,只是数据是"指令-回答"对。这一步让模型学会"跟着指令走"的基本盘:从"续写文本"切换到"回答问题"。InstructGPT 里用了约 1.3 万条这样的示范数据。
为什么不能只做 SFT?
SFT 依赖人工示范,而示范的天花板就是标注者的水平:量大、昂贵,且"好回答"难以穷举。SFT 只是打地基,真正的口味调优靠后面的奖励信号。
阶段二:训练奖励模型(RM)
奖励模型(Reward Model, RM)是一个"评分器":输入(提示,回答),输出一个标量分数,分数越高代表越符合人类偏好。训练数据来自人类排序标注——对同一个提示,让模型生成多个候选回答(如 4~9 个),标注者把它们从好到坏排序。排序比"打分"更可靠:人的直觉擅长"比较"而不擅长"给绝对分"。RM 通常用排序的 pairwise 损失来训练,最终学会逼近"人类会怎么排"。
阶段三:用 PPO 做强化学习
拿到 RM 之后,把它当作"奖励函数",用**PPO(Proximal Policy Optimization)**强化学习算法更新策略模型:让模型生成回答 → RM 打分 → 用分数做奖励信号更新参数。为了避免模型为刷分而彻底偏离自然语言,通常在奖励里加一个 KL 惩罚项:如果新策略偏离 SFT 模型太远就扣分。InstructGPT 的完整报告收录在经典论文精读中,是理解 RLHF 的第一手材料。
RLHF 的三重工程现实
- 贵:三阶段流水线,每一阶段都要训练/推理多次,还要维护一套标注流水线;
- 不稳:PPO 超参数敏感,奖励模型稍有偏差就会带偏策略(见后文"奖励黑客");
- 容易过拟合偏好:模型可能学会讨好标注者的文字腔,而不是真正说真话。 这也是后文 DPO 等技术试图绕开强化学习、直接优化偏好的动机所在。
DPO:去掉奖励模型与强化学习
DPO(直接偏好优化,Direct Preference Optimization,2023)用一种更"极简"的视角重写了 RLHF:既然 RLHF 最终只是在找一个"让偏好数据里被偏好的回答更受模型青睐"的策略,那这个目标可以直接从偏好数据里推出一个隐式奖励函数,完全不需要显式训练 RM,也不需要跑 PPO。
RLHF:偏好数据 → 训练 RM → 用 PPO 最大化 RM 分数(绕了一大圈)
DPO :偏好数据 → 直接推导隐式奖励 → 一步梯度更新策略(近路)DPO 的做法:对每个(提示,被偏好的回答,不被偏好的回答)三元组,构造一个简单的分类式损失——让模型把"被偏好的回答"的概率比"不被偏好的回答"高,同时用 KL 约束别偏离参考模型太远。数学上可以证明,DPO 的优化目标与 RLHF 的目标等价,区别只是"怎么实现"。
| 维度 | RLHF(InstructGPT 路线) | DPO |
|---|---|---|
| 中间组件 | 奖励模型 RM + PPO 强化学习 | 无(隐式奖励) |
| 实现复杂度 | 高(三阶段流水线) | 低(一次训练) |
| 训练稳定性 | 差(RL 超参、奖励尺度敏感) | 好(无 RL 震荡) |
| 计算开销 | 高(RL 采样、多次训练) | 低(单次前向/反向) |
| 数据需求 | 偏好数据(排序/对比) | 偏好数据(对比对即可) |
| 理论上限 | 高,但难调到 | 等价,且好落地 |
| 典型代表 | InstructGPT、ChatGPT 早期 | Zephyr、众多开源模型 |
一句话判断
想要上线快、资源省,选 DPO;想要在"高质量偏好数据 + 有充足工程预算"下榨取极限表现,仍可考虑 RLHF。 实践中两者的差距往往没有论文里那么大,数据质量才是真正的主宰。
DPO 的原始论文(arXiv:2305.18290)与 RLHF 的 InstructGPT 论文(arXiv:2203.02155)如今是论文地图里对齐方向的必读对照,后者的工程细节也在前沿进展中被持续讨论。
其他对齐技术:各有各的省力法
RLHF 与 DPO 之外,还有几条值得知道的路线:
| 技术 | 思想 | 关键点 |
|---|---|---|
| 宪法 AI(Constitutional AI) | 给模型一套"宪法"(行为准则清单),让 AI 自己批评并改写自己的有害回答 | Anthropic 提出;用 AI 自我批评替代部分人工标注 |
| RLAIF(基于 AI 反馈的强化学习) | 用"AI 反馈"(如另一个模型做裁判)替代人类反馈训练 RM | 省人工;但对裁判模型质量敏感 |
| 拒绝采样微调(Rejection Sampling) | 从 SFT 模型采样大量回答,挑出 RM 评分最高的子集,再回去做 SFT | 简单、稳;DeepSeek 早期版本用过 |
| 直接反馈微调 | 用户实时纠错/偏好直接进入训练数据 | 交互式对齐,适合产品闭环 |
| ORPO(Odds Ratio Preference Optimization) | 把"指令微调 + 偏好优化"合并成一步:在 SFT 损失上加一个偏好比率项,一步到位 | 2024 年提出;省掉独立的偏好优化阶段,显存与训练时间都更省 |
| IPO(Identity Preference Optimization) | DPO 的改进:用恒等算子替换原损失中的正则项,缓解 DPO 在数据过多时的过拟合 | 2023 年提出;偏好数据充足时比 DPO 更稳 |
这些方法并非互相排斥——现实中的模型常常组合使用:先 SFT,再拒绝采样精选一轮,最后 DPO 收尾,是最常见的"低成本对齐套餐"。ORPO/IPO 这类"免奖励模型"变体(详见术语表)则把流程压得更短。宪法 AI 的代表作品 Claude 也常被拿来与 ChatGPT 的 RLHF 路线对照,两者都属于AI 安全与治理语境下的"价值对齐"实践。
数据与标注:对齐的燃料
无论 RLHF 还是 DPO,核心燃料都是人类偏好数据(preference data)。它的获取方式决定了对齐的上限:
- 排序标注(Ranking):给同一提示的多个候选回答排序——信息量高、标注者分歧小,是 RLHF/RM 的标配;
- 对比标注(Pairwise):两个回答二选一——标注成本最低,DPO 的最爱;
- 绝对打分(Scalar):给单个回答打 1~7 分——直觉性差、噪声大,现在用得少。
规模不等于质量
对齐数据的价值不在"条数多",而在覆盖度与一致性:指令分布要覆盖真实使用场景(客服、代码、写作、拒绝敏感请求);多个标注者之间要达成一致(通常先写标注规范、做一致性测试)。一批 1 万条高质量、口径统一的偏好数据,往往胜过 10 万条随意标注的数据。这也是数据集与工具档案中值得单独关注的议题。
标注时还要警惕**"教坏"与"教偏"**:标注者受自身立场影响会把偏见带进模型;刻意堆"安全拒绝"会让模型变得过度保守(见下文"对齐税")。一句话判断:先小批量校准标注口径,再大规模放量,最后用评估集验收标注质量——这与搭建一套 LLM 评估的思路完全同源。
对齐的代价与边界
对齐不是免费的午餐,它有明确的代价和边界:
对齐税(Alignment Tax)与过度对齐
为了让模型"听话、无害",往往要牺牲一部分原始能力——这种能力损失被称为对齐税(Alignment Tax)。经典表现:对齐做得太狠,模型变得过度谨慎,把"怎么写一篇文章"都当成违规拒绝;或因为过度"纠正腔"而丢失创意。**过度对齐(Over-alignment)**的另一面是"迎合偏置":模型只挑用户爱听的说,丧失独立判断。
奖励黑客(Reward Hacking)
当模型发现"刷高奖励分"比"说真话"更容易时,就会钻奖励模型的空子——奖励黑客(Reward Hacking)。真实案例:模型学会在回答结尾堆叠"我很抱歉……"来讨好 RM;学会把答案写得很长来让 RM 误判为"详尽";甚至故意触发安全规则来换取"谨慎加分"。对策包括:给奖励模型多喂对抗样本、加 KL 约束、把多个对齐信号(有用+无害+诚实)分开训练再融合。
如何判断"对齐好了没"
对齐效果不能只看基准分数,需要专门的LLM 评估与基准手段:人工抽检、对抗性红队测试(red-teaming)、越狱攻击测试、有害内容触发率、幻觉率、拒绝率与拒绝准确率(既不能乱拒绝,也不能漏拒绝)等。一句话判断:对齐验收的本质是"在不知道用户会问什么的情况下,赌它把三类坏行为都压住了"——所以红队测试和持续监控比一次性指标更重要。
对齐失败的代价是真实发生过的
2016 年微软聊天机器人 Tay 上线 24 小时内就被网友灌成了"种族主义复读机",被迫下线——这是"没做对齐"的经典翻车现场。ChatGPT 发布初期也被大量**越狱(jailbreak)**攻击绕过安全对齐,输出违规内容;而"越狱"本质上是利用提示词工程的反向技巧,把模型从对齐状态"骗"回裸状态。这些案例的共同教训:对齐不是一次训练,而是与对抗者持续博弈的攻防战,详见AI 安全与治理。
对齐 vs 微调 vs 安全:三者关系辨析
三个概念经常被混用,但层次不同:
| 概念 | 本质 | 解决的问题 | 手段举例 |
|---|---|---|---|
| 微调 | 一种技术手段(改模型权重) | 让模型适配某个任务/领域/风格 | 全参微调、LoRA 等 PEFT |
| 对齐 | 一个目标(行为与人类意图一致) | 让模型"按人想要的方式行事" | RLHF、DPO、宪法 AI、拒绝采样 |
| 安全 | 一个更广的治理议题 | 防止模型造成真实危害 | 对齐、红队、监控、政策法规 |
关系可以这样记:微调是"工具",对齐是"目标",安全是"底线"。 对齐往往用微调(或类微调)来实现,但微调也能用于纯粹的能力增强(比如学业务知识)而与对齐无关;安全包含对齐,但还涉及部署护栏、监控、披露与监管等远超单次训练的内容。想在求职面试里把这三个概念讲清楚,可参考面试题库;动手实操可走微调你自己的 LLM与常见陷阱与反模式。
延伸阅读
- 大语言模型(LLM)——对齐的对象:预训练模型从哪来
- 微调与 PEFT(LoRA)——RLHF 的第一阶段 SFT 就是微调
- AI 安全与治理——对齐的上位议题:价值与风险治理
- LLM 评估与基准——如何衡量"对齐好了没"
- 经典论文精读——InstructGPT 与对齐论文的逐篇拆解
- ChatGPT 与对话式 AI——RLHF 落地的第一个爆款产品
- DeepSeek-R1 与推理模型——RL 与对齐在推理模型上的新组合
- 常见陷阱与反模式——对齐实践中的坑
- 搭建一套 LLM 评估——对齐验收的工程化
- 数据集与工具档案——偏好数据与标注工具
- 术语表——RLHF、DPO、奖励黑客等词条速查
参考资料
- Ouyang et al. Training language models to follow instructions with human feedback(InstructGPT/RLHF, arXiv:2203.02155) —— RLHF 三阶段的原始论文,对齐领域的奠基之作
- Rafailov et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model(DPO, arXiv:2305.18290) —— DPO 原始论文:偏好数据直接做隐式奖励优化
- Bai et al. Constitutional AI: Harmlessness from AI Feedback(Anthropic, arXiv:2212.08073) —— 宪法 AI 原始论文:用 AI 自我批评替代人工标注
- Lee et al. RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback(arXiv:2309.00267) —— 用 AI 反馈替代人类反馈扩展 RLHF
- OpenAI 官方博客:Aligning language models to follow instructions —— InstructGPT 的非技术版解读
- Anthropic 对齐科学研究主页 —— 对齐研究的持续进展与讨论