人人都会AI编程

7.1 预训练数据的来源与分类:网页、书籍、代码、对话、多模态数据

更新时间:2026-07-09

在第 1 章中,我们曾把大模型定义为“将人类语言知识压缩进数百亿级参数中的概率模型”;在 2.2 节中,又区分了预训练、微调与对齐三大范式。这里需要直面一个更根本的问题:这些知识最初是以什么形态喂给模型的?

预训练阶段(Pre-training)的本质是自监督学习,它不依赖人工标注的答案,而是让模型在海量原始文本中自行捕捉语言规律与世界知识。因此,预训练数据不仅决定了模型的“知识储备”,更深刻影响着它的语言风格、价值观倾向、推理习惯乃至偏见盲区。业界有句共识:“Garbage in, garbage out”——数据质量的天花板,就是模型能力的天花板。

现代大模型的预训练语料通常以 万亿(Trillion)级别 Token 为计量单位,来源可以归纳为五大类。每一类都有其不可替代的价值,也伴随着独特的清洗难题。


一、网页数据:规模最大、噪声最高的“主食”

网页数据是绝大多数 LLM 预训练语料的绝对大头,通常占比在 60%–90% 之间。

主要来源

  • Common Crawl:全球最大规模的公开网页抓取数据集,每月更新,原始数据 PB 级;
  • C4(Colossal Clean Crawled Corpus):Google 基于 Common Crawl 清洗后的开源子集;
  • 内部抓取库:各头部厂商(OpenAI、Anthropic、Meta、阿里等)自行维护的专有网页库,质量远高于 raw Common Crawl。

价值

  • 覆盖领域极广:新闻、百科、论坛、博客、电商、政府公告、学术论文索引页等;
  • 语言覆盖面大,是模型掌握多语言能力的基础;
  • 包含大量时效性信息(截至训练 cutoff 时间)。

清洗痛点

  • 质量极差:广告横幅、导航栏、重复模板页、SEO 垃圾内容、机器生成的填充文本占比极高;
  • 去重压力大:同一篇新闻被无数站点转载,若不进行文档级/段落级去重,模型会严重过拟合到这些高频低质文本;
  • 有毒与偏见:网页中包含仇恨言论、成人内容、刻板印象,需要通过毒性分类器、关键词过滤、人工规则进行多层清洗。

实用认知:Llama 2 的技术报告显示,经过清洗后实际用于训练的网页 Token 可能只有原始抓取的 10%–20%。数据工程团队的核心竞争力,往往体现在这套清洗管线的精细度上。


二、书籍数据:长程连贯性与深度叙事能力

书籍类数据在预训练语料中通常占比 5%–15%,体量不大,但对模型能力的塑造极为关键。

主要来源

  • Gutenberg Project:公版书,版权清晰;
  • BooksCorpus / BookCorpusOpen:小说类文本集合;
  • 出版商合作数据:部分商用模型会采购正版电子书库进行训练(需严格处理版权合规,详见 7.5 节)。

价值

  • 长程依赖:一本书有数万到数十万字的连贯叙事,能强制模型学习跨越极长上下文的指代消解、情节记忆和角色一致性;
  • 复杂句式与修辞:文学性语言、对话体、细腻的逻辑推进,提升模型生成文本的流畅度和多样性;
  • 知识深度:历史、哲学、科普类书籍包含结构化知识体系,而非网页的碎片化信息。

清洗痛点

  • OCR 错误:扫描版书籍引入大量乱码、断行、页眉页脚噪声;
  • 版权雷区:现代出版物版权保护严格,开源模型(如 Llama、Qwen)在披露训练数据时通常会模糊处理书籍来源与占比;
  • 内容偏向:小说以虚构叙事为主,过度依赖可能导致模型在事实性任务上混淆现实与虚构。

三、代码数据:推理能力的“隐形放大器”

代码数据是近年来大模型预训练中最重要的“增强项”之一。GPT-3 到 GPT-4、Llama 到 Qwen 的演进都证明:代码数据的比例与模型的逻辑推理、数学能力、工具调用能力呈强正相关。

主要来源

  • GitHub 公开仓库:Python、JavaScript、C++、Java 等主流语言;
  • Stack Overflow / Stack Exchange:问答形式的技术讨论;
  • 技术文档与 API 手册:官方文档、教程、开源项目 README;
  • 合成代码数据:部分团队通过编译器、执行器自动生成带验证的代码片段。

价值

  • 结构化思维:代码具有严格的语法树、作用域、条件分支和循环结构,天然训练模型的层次化推理能力;
  • 长距离依赖:一个函数可能依赖数百行外定义的类或变量,迫使模型学习精确的跨段关联;
  • 指令遵循的雏形:代码注释→实现、需求描述→函数签名,这种“指令-执行”模式与后期 SFT 的对话数据形成能力接力。

清洗痛点

  • 许可证合规:GPL 等“传染性”开源许可证可能限制衍生模型的商用,需要在数据收集阶段做许可证过滤;
  • 质量参差不齐:大量 GitHub 仓库是半成品、教学练习或自动生成的配置模板;
  • 自然语言混杂:代码文件中混杂的注释语言多样,需要与训练目标的语种配比进行平衡。

实用认知:Meta 在 Llama 3 的技术报告中特别提到,将代码数据占比提升到 15% 以上,是其在数学和推理基准上取得突破的关键因素之一。


四、对话与问答数据:预训练中的“语气调味剂”

严格来说,高质量的对话数据更多用于 SFT(监督微调)和 RLHF 阶段(见 2.2 节与第 10 章),但近年来一个明显的趋势是:在预训练阶段混入少量高质量对话/问答语料,能显著改善基座模型的指令敏感性和对话流畅度。

主要来源

  • Reddit / Twitter / 知乎 / 贴吧:真实的人类互动,口语化、话题广泛;
  • Stack Exchange 系列:高质量的知识问答,回答通常经过社区投票筛选;
  • 维基百科对话页 / 论坛精华帖:结构化讨论;
  • 合成对话数据:早期基座模型生成后经人工筛选的对话对(需注意数据污染问题)。

价值

  • 口语化表达:让模型学会缩写、语气词、反问、礼貌用语,避免生成过于书面化、 encyclopedia-style 的僵硬文本;
  • 多轮交互模式:对话天然是多轮结构,预训练阶段接触此类数据,能让模型在微调前就对“角色扮演”“追问澄清”有初步概念;
  • 知识密度高:问答形式的信息通常是“问题导向”的,比一般网页叙述更聚焦。

清洗痛点

  • 毒性集中:匿名社区是仇恨言论、歧视、争论的重灾区,过滤难度比网页更高;
  • 隐私泄露:用户可能在对话中透露真实姓名、地址、电话,需要做 PII(个人可识别信息)检测与脱敏;
  • 数据污染:如果预训练语料混入了下游评测基准(如 MMLU、GSM8K)的原始数据,会导致评测失真,这是 11.1 节将提到的评估伦理问题。

五、多模态数据:从“纯文本”到“跨模态”的桥梁

虽然传统 LLM 以文本为绝对核心,但 GPT-4V、Gemini、Qwen-VL 等模型的成功,使得多模态数据在预训练阶段的重要性急剧上升。如果你训练的是原生多模态大模型(而非后期拼接视觉编码器),这类数据不可或缺。

主要来源

  • 图文对:LAION-5B、COYO-700M 等大规模互联网图文数据集;网页中带有 alt-text 的图片;社交媒体帖子;
  • 视频-文本对:YouTube 字幕、短视频平台带描述的视频片段;
  • PDF/图表/幻灯片:学术论文中的插图配标题、财报中的表格配分析文字;
  • OCR 数据:带文本标注的街景、菜单、海报等。

价值

  • 跨模态对齐:让模型建立“视觉概念”与“语言概念”的共享向量空间;
  • 丰富世界知识:大量信息(如物体的颜色、空间关系、人脸表情)无法仅靠文本描述,必须依赖视觉信号;
  • 下游应用支撑:为第 25 章提到的多模态 Agent、具身智能提供感知基础。

清洗痛点

  • 图文不匹配:互联网上有大量“挂羊头卖狗肉”的图片(如钓鱼帖、meme 图),文本描述与图像内容完全无关;
  • 分辨率与格式混乱:需要统一预处理为视觉 Token(如 ViT Patch),低质压缩图会引入噪声;
  • 版权与肖像权:图片、视频中的品牌 logo、人脸、艺术作品涉及复杂的法律边界,比文本版权更难处理。

六、数据配比:没有“万能食谱”

五大来源并非简单堆叠。不同的模型定位,会采用截然不同的 Domain Mixing(领域配比)

| 模型定位 | 典型配比特征 |
|---------|-------------|
| 通用基座模型 | 网页为主(70%+),书籍+代码为辅,对话占少量 |
| 代码专用模型(如 CodeLlama、StarCoder) | 代码占比可提升至 50%–80%,大幅降低网页比例 |
| 多模态模型 | 文本与多模态 Token 按特定比例交错训练(如 1:1 或 3:1) |
| 中文增强模型 | 在通用配比基础上,大幅提升中文网页、百科、书籍的占比 |

配比策略直接决定了模型的“气质”。例如,过度依赖百科类网页会让模型说话像维基百科;代码比例不足则会在数学和逻辑任务上表现疲软。这是 7.3 节“数据配比与领域均衡”将深入展开的主题。


七、小结

预训练数据是大模型的“食材”,来源决定了营养结构,清洗工艺决定了食品安全。关键 takeaway:

  • 网页是主食,提供广度,但必须经过重度清洗和去重;
  • 书籍是补品,提供长程连贯性和深度叙事能力;
  • 代码是催化剂,对推理、数学和工具调用能力有超线性增益;
  • 对话是调味剂,改善语气与交互感,但需严防毒性和隐私;
  • 多模态是新增维度,让模型突破文本边界,感知真实世界。

在 7.2 节中,我们将进入“后厨”,详细拆解这些原始食材如何经过采集、去重、清洗、过滤、去毒、质量分级,最终变成可以喂给模型的高纯度 Token 流。