Skip to content

数据来源与数据集

对应课程 Lecture 13:Data (sources, datasets)(Percy)

模型是从数据里“长”出来的。​数据质量的天花板就是模型质量的天花板——架构优化带来的提升往往不如把数据洗干净。这一讲介绍预训练数据的来源与代表性数据集。

数据从哪里来?

Common Crawl:互联网的快照

Common Crawl(CC) 是最大的公开网页抓取库:定期爬取全网,提供原始的 WARC 文件(网页 HTML + HTTP 元数据),总量以 PB 计。

  • 优点​:规模巨大、免费、持续更新、语言覆盖广;
  • 问题​:原始质量极低——大量垃圾页、广告、色情/毒性内容、机器生成的 SEO 文章、乱码、重复。​原始 CC 不能直接训练,必须经过重型清洗​(下一讲的主题)。

其他重要来源

来源内容角色
Wikipedia、书籍百科、长篇连贯文本高质量“精华”成分
代码(GitHub 等)编程语言语料提升代码与推理能力
论文(arXiv 等)学术文本知识密度高
新闻、论坛(Reddit 等)时效性与对话性多样性
教育资源教材、习题对齐教学与推理任务

经验共识:​不是找一个“最好的”数据集,而是构建一个高质量来源的混合配方(mixture)​,后文详述配比。

代表性公开数据集

经典三代(发展史)

  • C4(Colossal Clean Crawled Corpus,2019)​:T5 论文发布,对 CC 做了一套简单启发式清洗(去坏词、去短行、语言识别等),约 156B token。它的清洗规则成了后续所有工作的起点。
  • The Pile(2021)​:825GB,由 22 个“精心策展”的子集组成(Wikipedia、Books3、GitHub、arXiv……),确立了“混合多种来源”的范式;也引发了版权争议(Books3 后来被下架)。
  • Modern 大规模清洗系​:Dolma(AI2,3T token,完整开源了数据管线)、FineWeb(HuggingFace,15T token,从 CC 系统性清洗)、RedPajama-V2 等。

从“发布数据”到“发布管线”

近年的明显趋势:​数据集的价值越来越在于清洗管线的可复现性​,而非静态文件。Dolma、FineWeb 都开源了完整代码,让社区可以复现、修改、扩展。亲手实现一条可复现的数据管线,是学习数据工程的最佳方式。

数据的法律与伦理维度

  • 版权​:训练网络文本的版权状态在多国仍在诉讼;The Pile 事件后,开源数据集倾向规避明显的受版权内容;
  • 个人隐私​:网页含邮箱、电话、身份证号等 PII(个人身份信息),需要在管线里检测并脱敏;
  • 毒性与社会偏见​:数据决定模型的偏见,清洗策略(屏蔽词表、域名黑名单)是必要但不完美的手段;
  • 机器人协议(robots.txt)​:爬取时的礼貌与合规,近年成为行业焦点(多个网站开始禁止 AI 爬虫)。

数据与缩放定律的联动

缩放定律假设数据“无限多样”。当高质量数据接近用尽时,选项有:用低质量数据(需配比)、合成数据(见后文)、多模态数据、或更激进的重复利用策略(multi-epoch)。数据工程和规模化是同一个问题的两面。

数据配比的直觉

混合多个来源时,几个经验规律:

  1. 高质量数据过采样(upsampling)​:Wikipedia、代码这类精华在自然分布里占比极小,但模型从中学习效率高,实践中常重复利用(multi-epoch);
  2. 代码与数学对推理的外溢收益​:即使模型不做编程用途,加入代码数据通常提升逻辑推理;
  3. 领域配比可以做实验​:用小模型 + 小数据扫不同配比,观察各下游任务表现,再放大到全量——这本身就是一次缩放定律实验;
  4. 训练末期退火(annealing)用高质量数据​:架构与超参数里讲过学习率衰减带来的第二下降,配合“最后阶段切换到高质量数据”是常见操作(Llama 3、OLMo 都这么做)。

小结

  • Common Crawl 提供规模,但要经过重度清洗;高质量来源(Wikipedia、代码、书籍)靠混合与过采样。
  • 数据集演进:C4(启发式清洗)→ The Pile(多源混合)→ Dolma/FineWeb(开源管线、数万亿 token)。
  • 数据工程的法律/伦理约束是真实的设计参数,不是事后合规。
  • 配比、过采样、退火都是可以通过小规模实验验证的科学决策。
最近更新