人人都会AI编程

2.2 预训练、微调、对齐的核心范式

更新时间:2026-07-09

在 2.1 节中,我们把大模型的参数比作调音台的旋钮,并提到一个关键事实:这些旋钮并非一次性铸造完成的。一个 Llama 3 或 GPT-4 级别的模型,其参数要经历三个截然不同的“生命阶段”——预训练(Pre-training)、微调(Fine-tuning)和对齐(Alignment)。这三个阶段构成了现代 LLM 的标准生产线,也直接解释了为什么同一个基座模型,既能变成温文尔雅的客服,也能变成冷酷高效的代码助手,还能在未经约束时输出危险内容。

理解这条流水线,是你判断“该直接用开源模型?还是自己微调?还是需要对齐?”的决策基础。


一、阶段一:预训练(Pre-training)—— 通识教育的“灌书”阶段

定义:在海量无标注文本上,通过自监督的 Next Token Prediction 任务,从零开始训练基座模型(Base Model / Foundation Model)。

过程细节

  • 数据:通常采集万亿(Trillion)级别的 Token,来源包括 Common Crawl 网页、书籍、代码仓库、学术论文、百科等。这是 1.4 节数据层的主战场。
  • 机制:与 1.1 节描述完全一致——模型逐词预测,通过反向传播调整数百亿参数,将人类语言统计规律和知识压缩进权重。
  • 算力:需要数千张高端 GPU/TPU 持续运行数周甚至数月,成本数百万到上千万美元。这是算力层的主战场。
  • 产出:一个裸基座模型(如 Llama-3-70B-base、Qwen2-72B-base)。

基座模型的性格画像
它像一个博览群书但患有社交障碍的天才:拥有丰富的语言能力和世界知识,能续写小说、补全代码,但不会对话。如果你问它“请问如何制作蛋糕?”,它更可能接着你的话头继续“接龙”(比如开始列举蛋糕的历史),而不是礼貌地分步骤回答你。它也可能输出有害、偏见或令人不适的内容,因为它只学会了“像训练数据那样说话”,而没有学会“什么该说、什么不该说”。

实用认知:除非你是拥有千卡集群和顶级数据清洗团队的大厂(如 OpenAI、Anthropic、Meta、阿里、DeepSeek),否则不要尝试自研预训练。这是整个链条中门槛最高、容错率最低的环节。


二、阶段二:微调(Fine-tuning / SFT)—— 学会“听话”和“说人话”

定义:使用高质量、人工标注的指令-回复对(Instruction-Response Pairs),以有监督学习(Supervised Fine-Tuning, SFT)的方式继续训练基座模型。

过程细节

  • 数据格式:通常是一个 JSON 列表,每个样本包含 { "instruction": "翻译这句话", "input": "Hello world", "output": "你好,世界" }。数据量一般在数十万到数百万条,远小于预训练,但质量要求极高
  • 训练目标:不再是“漫无目的地接龙”,而是让模型学会对话格式(用户问/助手答)、指令遵循(按照要求输出 JSON、表格、分步骤推理)以及角色扮演
  • 技术要点
  • 学习率通常比预训练低 1–2 个数量级,防止破坏已学到的通用知识(灾难性遗忘)。
  • 数据配比很关键:对话数据、代码数据、推理数据、安全数据需要精心调配,否则模型会在某类任务上偏科。
  • 产出指令模型 / 对话模型雏形(如 Llama-3-70B-Instruct 的半成品)。

为什么 SFT 是企业级应用的主战场?
预训练需要天量算力,而 SFT 可以在消费级或单卡/多卡环境下完成(尤其是配合 LoRA、QLoRA 等参数高效微调技术)。如果你有高质量的垂直领域对话数据(如医疗问诊记录、金融客服日志、法律合同分析样本),通过对开源基座模型做 SFT,就能得到一个领域专家模型,效果往往优于通用大模型的零样本(Zero-shot)表现。

实用认知

  • SFT 解决的是能力和格式问题,而非安全问题。经过 SFT 的模型虽然更“听话”,但仍可能一本正经地胡说八道(幻觉),或被诱导输出有害内容。
  • 数据质量 > 数据数量。10 万条精心清洗、边界清晰的标注数据,胜过 100 万条粗糙爬取的数据。

三、阶段三:对齐(Alignment)—— 装上“价值观刹车片”

定义:通过人类或 AI 的偏好反馈,进一步调整模型行为,使其输出不仅有用(Helpful),而且诚实(Honest)、无害(Harmless)。

为什么必须对齐?
SFT 只告诉模型“什么样的回答是正确的格式”,但没告诉它“在冲突情境下如何选择”。例如,当用户要求生成钓鱼邮件时,模型需要学会拒绝;当用户提出偏见性假设时,模型需要学会中立纠正。对齐的本质是在巨大的输出空间中,把概率质量从“有害/低质区域”推向“高价值区域”

核心技术路线

1. RLHF:人类反馈强化学习(Reinforcement Learning from Human Feedback)

这是 ChatGPT 成名的关键工艺,分为三步:

  • Step 1:训练奖励模型(Reward Model, RM)。让标注者对同一个问题的多个模型回答进行排序(A > B > C),训练一个独立的神经网络来学习人类的偏好标准。
  • Step 2:强化学习微调。用 PPO(Proximal Policy Optimization)等算法,让主模型生成回答,奖励模型打分,主模型根据分数调整策略——高分回答的生成路径被强化,低分路径被抑制。
  • Step 3:迭代。不断收集新的失败案例,重复上述过程。

2. DPO:直接偏好优化(Direct Preference Optimization)

RLHF 需要维护三个模型(主模型、参考模型、奖励模型),训练不稳定且工程复杂。2023 年后兴起的 DPO 直接用偏好数据(Win/Loss 对)优化主模型,跳过了显式奖励模型和强化学习循环,在保持效果的同时大幅降低了实现难度。目前开源社区(如 Llama 3、Qwen2 的后训练)已广泛采用 DPO 或其变体(如 IPO、KTO)。

3. RLAIF:AI 反馈强化学习

用另一个更强的模型(如 GPT-4)代替人类做偏好标注,降低成本。这是数据层与算法层结合的新趋势。

对齐的代价与争议

  • 对齐税(Alignment Tax):过度对齐可能导致模型能力下降,比如变得过度谨慎、拒绝回答本可回答的问题,或在需要创造性突破时显得死板。
  • 模式崩溃(Mode Collapse):模型可能学会讨好用户(Sycophancy),说用户想听的话而非事实。
  • 价值观的不可通约性:不同文化、不同企业对“什么是有害的”定义不同,不存在放之四海而皆准的对齐标准。

实用认知:如果你基于开源 Instruct 模型(如 Llama-3-70B-Instruct)做二次开发,通常不需要从头做 RLHF。但在垂直场景中(如儿童教育、医疗咨询),你可能需要补充领域特定的安全对齐数据,防止模型在专业话题上“过度自信”或输出禁忌内容。


四、三阶段关系:一个完整的“人才养成”比喻

把模型参数想象成一个人的大脑发育:

| 阶段 | 教育类比 | 数据特征 | 算力成本 | 解决的核心问题 |
|------|----------|----------|----------|----------------|
| 预训练 | 从小学到大学的通识教育 | 万亿级无标注文本,互联网+书籍+代码 | 极高(千卡×月) | 语言是什么?世界有哪些知识? |
| 微调(SFT) | 职业岗前培训 | 数十万到百万级高质量指令对 | 中等(单卡/多卡×天) | 怎么跟用户对话?怎么遵循指令? |
| 对齐 | 职业道德与合规教育 | 数万到数十万偏好排序对 | 中高(RLHF 较高,DPO 较低) | 什么该说?什么不该说?拒绝有害请求 |

关键洞察:预训练决定了模型的智商上限,微调决定了模型的技能方向,对齐决定了模型的人格底线。三者层层递进,但每一层都可能被后来者覆盖或修正——这也是开源社区能快速推出各种“魔改版”模型的原因:大家共享第一层(基座),在第二、三层各显神通。


五、工程决策:不同角色该介入哪一层?

  • 基座模型厂商(如 Meta、阿里、Mistral):负责全部三层,交付 Instruct 模型。
  • 行业应用开发者(如金融、医疗、法律):
  • 首选基于开源 Instruct 模型做垂直 SFT
  • 若对安全有极高要求(如未成年人产品),补充领域对齐
  • 极少需要回炉预训练。
  • 个人开发者/小团队:直接使用 API 或开源 Instruct 模型,通过提示工程(Prompt Engineering)RAG 解决 80% 的问题,必要时做轻量级 LoRA 微调。

六、小结

预训练、微调、对齐是现代大模型从“一团随机权重”到“可用产品”必经的三重锻造。它们共享同一套参数,但消耗不同的数据、算力和算法:

  • 预训练是资本密集型基础设施,产出通才基座;
  • 微调是数据密集型工程,产出听话的领域助手;
  • 对齐是偏好密集型雕塑,产出安全可控的产品。

在 2.3 节中,我们将把目光从“模型的训练阶段”转向“模型的输入输出界面”——上下文窗口、Token 和词表。这些概念是你写 Prompt、算 API 账单、评估模型能读多长文档时,每天都打交道的“计量单位”。