数据来源与数据集
对应课程 Lecture 13:Data (sources, datasets)(Percy)
模型是从数据里“长”出来的。数据质量的天花板就是模型质量的天花板——架构优化带来的提升往往不如把数据洗干净。这一讲介绍预训练数据的来源与代表性数据集。
数据从哪里来?
Common Crawl:互联网的快照
Common Crawl(CC) 是最大的公开网页抓取库:定期爬取全网,提供原始的 WARC 文件(网页 HTML + HTTP 元数据),总量以 PB 计。
- 优点:规模巨大、免费、持续更新、语言覆盖广;
- 问题:原始质量极低——大量垃圾页、广告、色情/毒性内容、机器生成的 SEO 文章、乱码、重复。原始 CC 不能直接训练,必须经过重型清洗(下一讲的主题)。
其他重要来源
| 来源 | 内容 | 角色 |
|---|---|---|
| Wikipedia、书籍 | 百科、长篇连贯文本 | 高质量“精华”成分 |
| 代码(GitHub 等) | 编程语言语料 | 提升代码与推理能力 |
| 论文(arXiv 等) | 学术文本 | 知识密度高 |
| 新闻、论坛(Reddit 等) | 时效性与对话性 | 多样性 |
| 教育资源 | 教材、习题 | 对齐教学与推理任务 |
经验共识:不是找一个“最好的”数据集,而是构建一个高质量来源的混合配方(mixture),后文详述配比。
代表性公开数据集
经典三代(发展史)
- C4(Colossal Clean Crawled Corpus,2019):T5 论文发布,对 CC 做了一套简单启发式清洗(去坏词、去短行、语言识别等),约 156B token。它的清洗规则成了后续所有工作的起点。
- The Pile(2021):825GB,由 22 个“精心策展”的子集组成(Wikipedia、Books3、GitHub、arXiv……),确立了“混合多种来源”的范式;也引发了版权争议(Books3 后来被下架)。
- Modern 大规模清洗系:Dolma(AI2,3T token,完整开源了数据管线)、FineWeb(HuggingFace,15T token,从 CC 系统性清洗)、RedPajama-V2 等。
从“发布数据”到“发布管线”
近年的明显趋势:数据集的价值越来越在于清洗管线的可复现性,而非静态文件。Dolma、FineWeb 都开源了完整代码,让社区可以复现、修改、扩展。亲手实现一条可复现的数据管线,是学习数据工程的最佳方式。
数据的法律与伦理维度
- 版权:训练网络文本的版权状态在多国仍在诉讼;The Pile 事件后,开源数据集倾向规避明显的受版权内容;
- 个人隐私:网页含邮箱、电话、身份证号等 PII(个人身份信息),需要在管线里检测并脱敏;
- 毒性与社会偏见:数据决定模型的偏见,清洗策略(屏蔽词表、域名黑名单)是必要但不完美的手段;
- 机器人协议(robots.txt):爬取时的礼貌与合规,近年成为行业焦点(多个网站开始禁止 AI 爬虫)。
数据与缩放定律的联动
缩放定律假设数据“无限多样”。当高质量数据接近用尽时,选项有:用低质量数据(需配比)、合成数据(见后文)、多模态数据、或更激进的重复利用策略(multi-epoch)。数据工程和规模化是同一个问题的两面。
数据配比的直觉
混合多个来源时,几个经验规律:
- 高质量数据过采样(upsampling):Wikipedia、代码这类精华在自然分布里占比极小,但模型从中学习效率高,实践中常重复利用(multi-epoch);
- 代码与数学对推理的外溢收益:即使模型不做编程用途,加入代码数据通常提升逻辑推理;
- 领域配比可以做实验:用小模型 + 小数据扫不同配比,观察各下游任务表现,再放大到全量——这本身就是一次缩放定律实验;
- 训练末期退火(annealing)用高质量数据:架构与超参数里讲过学习率衰减带来的第二下降,配合“最后阶段切换到高质量数据”是常见操作(Llama 3、OLMo 都这么做)。
小结
- Common Crawl 提供规模,但要经过重度清洗;高质量来源(Wikipedia、代码、书籍)靠混合与过采样。
- 数据集演进:C4(启发式清洗)→ The Pile(多源混合)→ Dolma/FineWeb(开源管线、数万亿 token)。
- 数据工程的法律/伦理约束是真实的设计参数,不是事后合规。
- 配比、过采样、退火都是可以通过小规模实验验证的科学决策。