在 5.1 到 5.3 节中,我们梳理了从 SFT 到 RLHF,再到 DPO 的主干对齐范式。它们构成了当前工业界最成熟的三级火箭,但远非全部。随着对齐成本(尤其是高质量人类标注)日益成为瓶颈,研究界和工业界正在探索两条新路径:一是用“离线筛选”替代“在线博弈”,二是让模型自己当自己的老师。 前者以拒绝采样(Rejection Sampling / Best-of-N)为代表,后者催生了自我对齐(Self-Alignment)家族。本节把它们的技术逻辑、工程实现与潜在陷阱一次说清。
一、拒绝采样:用奖励模型做“海选”
拒绝采样(Rejection Sampling,RS),在大模型语境下通常被称为 Best-of-N,核心思想极其朴素:同一个问题,让模型多答几遍,挑最好的那个留下。
1.1 操作流程
假设你已经有一个训练好的奖励模型(RM,见 5.2 节)和一个待对齐的策略模型:
- 批量采样(Sample):对同一个 Prompt,从策略模型(或稍早版本的模型)中采样出 N 个不同的回答。通过调高 Temperature(如 0.7–1.0)或引入 nucleus sampling,确保这 N 个回答具有一定的多样性,而非同一个答案的微小变体。
- 离线打分(Score):用 RM 对这 N 个回答逐一打分,选出得分最高的那个作为“金牌回答”。
- 蒸馏训练(Distill):将这些金牌回答加入 SFT 数据集,对策略模型进行新一轮监督微调;或者,把金牌回答作为正例、低分回答作为负例,直接送入 DPO(5.3 节)进行训练。
1.2 为什么有效?与 PPO 的本质区别
PPO(5.2 节)是在线学习:每生成一个回答,RM 立刻打分,策略模型据此调整参数,然后继续生成下一个。这个过程像“边考试边改学习方法”,收敛快但极不稳定,容易出现奖励劫持(Reward Hacking)和训练崩溃。
拒绝采样则是“先交卷,再挑最好的试卷抄一遍”。它是离线的:生成阶段和训练阶段解耦,不需要复杂的 Advantage 估计、Clipping 和 Critic 网络,工程实现难度远低于 PPO。Meta 的 Llama 2 在后训练(Post-training)阶段就大量使用了拒绝采样,先生成多条回答,筛选后只做简单的 SFT,显著提升了指令遵循和安全性。
1.3 实用边界与工程陷阱
- N 越大,成本越高:生成 N 个回答意味着推理成本翻 N 倍。在实际生产中,N 通常取 4–16,再大就吃不消了。
- 天花板受限于模型自身的探索能力:如果策略模型本身水平太差,采 100 个也找不到好答案。因此 RS 通常用于“模型已经有一定基础,需要优中选优”的阶段。
- 同质化风险:如果模型对某类问题已经陷入固定模式,Temperature 再高,N 个回答也可能大同小异,导致筛选失去意义。此时需要引入多样化 Prompt 工程或对抗性解码策略。
- RM 的偏见会被放大:RS 极度依赖 RM 的判别质量。如果 RM 偏好“更长更啰嗦”的回答,RS 会系统性地把模型推向过度冗长。
二、自我对齐:让模型自己当老师和裁判
如果说 DPO 简化了 RLHF 的流程,那么自我对齐(Self-Alignment)则试图从根本上减少对人类标注者的依赖。它的哲学是:一个足够强的基座模型,已经内化了大量人类知识和价值观,可以被引导来自我批评、自我修正、自我标注。
2.1 Self-Instruct:数据自举的起点
这是自我对齐的“老祖宗”。其核心流程是:
- 用一小批人工撰写的种子指令(Seed Instructions)作为示例;
- 让模型模仿这些示例,自己生成新的指令和对应的输入/输出;
- 用启发式规则(如 Rouge-L 去重、格式校验、困惑度过滤)清洗自动生成的数据;
- 将过滤后的数据加入 SFT 训练集。
实用价值:在开源社区,Self-Instruct 是低成本构建指令数据集(如 Alpaca、Vicuna 的早期数据)的标配。它证明了一个 7B 的模型就能生成足以训练同类模型的指令数据。
局限:数据质量存在“回声室”效应——模型生成的数据不过是自身能力的同义反复,很难突破能力天花板,且可能放大训练数据中的偏见。
2.2 Constitutional AI 与 RLAIF:用“宪法”替代人类标注
Anthropic 提出的 Constitutional AI(CAI) 是自我对齐的里程碑。它不再让人类标注偏好,而是给模型一套书面原则(Constitution,即“宪法”),例如:
“请选择更无害的回答;请拒绝协助非法活动;请优先选择更诚实的陈述……”
具体分为两步:
- 自我批评与修正(Critique & Revision):模型先对一个 Prompt 生成初始回答,然后被要求根据宪法原则对自己的回答进行批评,并给出修正后的版本。由此自动生成“原始版 vs 修正版”的偏好对。
- RLAIF(Reinforcement Learning from AI Feedback):用这些 AI 生成的偏好对训练一个奖励模型,再执行标准的 PPO;或者直接用这些偏好对做 DPO。
Google DeepMind 的后续研究进一步验证:RLAIF(AI 反馈)可以达到与 RLHF(人类反馈)相当的对齐效果,尤其在有害性降低上表现突出。这对缺乏专业标注团队的企业极具吸引力。
2.3 Self-Rewarding:裁判与选手合二为一
Meta 在 2024 年提出的 Self-Rewarding Language Models 把自我对齐推向极致:
- 模型既生成回答,又扮演 LLM-as-a-Judge 的角色,按照给定的评分标准(如 1–5 分)给自己的回答打分;
- 基于这些自生成的分数构建偏好对(高分 vs 低分),直接进行 DPO 迭代训练;
- 每一轮训练后,模型能力提升,生成的回答和评判标准也随之提升,形成“自我进化”循环。
风险警示:这本质上是一个自我强化回路。如果模型在早期轮次就学会了某种系统性的自我欺骗(比如给自己打高分但实质回答质量一般),这种偏见会被后续轮次不断放大,最终“自我对齐”变成“自我巩固错误”。目前这仍是研究前沿,尚未成为工业界大规模部署的成熟方案。
三、其他新兴对齐技术:从“成对偏好”到“更弱的信号”
除了拒绝采样和自我对齐,还有一些方法试图进一步降低数据门槛或提升训练稳定性:
| 技术 | 核心思想 | 与 DPO/RLHF 的区别 |
|------|----------|-------------------|
| KTO(Kahneman-Tversky Optimization) | 不需要成对的“好/坏”对比数据,只需要知道某个回答“是理想的”或“是不理想的”(二分类信号) | 数据收集成本更低,适合只有单条数据标签的场景 |
| SLiC(Sequence Likelihood Calibration) | 对候选序列进行排序,用校准损失(Calibrated Loss)直接优化 | 不训练显式的奖励模型,训练更稳定 |
| IPO(Identity Preference Optimization) | 在 DPO 基础上加入更强的正则化,防止过拟合到偏好数据 | 解决 DPO 在数据量过小时容易过拟合的问题 |
实用建议:如果你手头只有少量偏好对,DPO 可能已经足够;如果连成对数据都难以收集,KTO 是值得尝试的方向。SLiC 和 IPO 更适合作为 DPO 的“调优插件”,在精调阶段解决特定的稳定性问题。
四、工业界的组合拳:如何搭配使用?
在真实的大模型生产线中,上述技术很少单打独斗,而是以流水线形式组合:
方案 A:低成本自举路线(适合垂直领域模型)
Self-Instruct 生成数据 → 轻量 SFT(5.1 节)→ 用 RLAIF/Constitutional AI 生成偏好对 → DPO(5.3 节)对齐
方案 B:极致性能路线(适合旗舰基座模型)
大规模 SFT → 训练 RM → 拒绝采样(Best-of-N)筛选高质量数据 → 再次 SFT 或 DPO → 最后可选 PPO(5.2 节)精调
方案 C:安全优先路线(适合面向 C 端的产品)
人工撰写安全宪法 → Constitutional AI 生成安全偏好对 → RLAIF/DPO 训练 → 线上部署时配合拒绝采样(对敏感问题多采样几次,选最安全的回答)
五、小结
拒绝采样和自我对齐代表了后 RLHF 时代的两条核心思路:
- 拒绝采样(Best-of-N):用“离线海选”替代“在线博弈”,以推理成本的增加换取训练稳定性和工程可控性。它是 DPO/SFT 的优质前置或后置增强。
- 自我对齐(Self-Alignment):从 Self-Instruct 到 RLAIF 再到 Self-Rewarding,核心驱动力是降低对人类标注的依赖。它让对齐变得可扩展,但也引入了“自我回声”和“偏见放大”的新风险。
关键 takeaway:
- 没有免费的午餐:拒绝采样省下了 PPO 的调参麻烦,却烧掉了更多推理算力;自我对齐省下了标注预算,却需要极强的基座模型质量和监控机制来防止自我欺骗。
- 数据质量永远是对齐的天花板:无论是人类标注、RM 打分还是 AI 自我批评,最终都取决于偏好信号本身的可靠性。技术可以简化流程,但无法自动产生“正确”的价值观。
- 组合拳 > 单点突破:在 5.1 到 5.4 节介绍的整个工具箱中,工业界的赢家往往是那些懂得“在正确阶段用正确工具”的团队,而非盲目追求最新算法的团队。
至此,第 5 章的对齐技术原理已经全部梳理完毕。从 SFT 到 RLHF,从 DPO 到拒绝采样与自我对齐,我们看到的不仅是算法的演进,更是一条“如何让机器行为与人类意图收敛”的工程化路径。在下一章(第 6 章)中,我们将进入大模型的关键技术特性,剖析上下文学习、思维链、工具调用、幻觉、MoE 等能力的底层机制。