Skip to content

CS336:从零开始的语言模型

Stanford CS336 · Language Modeling from Scratch · Stanford / Spring 2026 讲师:Tatsunori Hashimoto(Tatsu Hashimoto)、Percy Liang

这门课讲什么?

语言模型(Language Model,简称 LM)是现代自然语言处理的基石。从 ChatGPT 到 Claude,从代码助手到智能体(Agent),背后都是同一个东西:​用海量文本训练出来的自回归语言模型​。

这门课的理念类似操作系统课上“从零写一个操作系统”:​带你亲手把一个语言模型从无到有造出来​。它不满足于“会调用 API、会微调一个模型”,而是要求你弄懂每一个零件:

  • 数据​:预训练数据从哪里来?原始网页怎么变成干净的训练语料?
  • 分词​:文本怎么变成模型能处理的 token(词元)?
  • 架构​:Transformer(变换器)为什么长这样?每个组件起什么作用?
  • 训练​:优化器怎么写?学习率怎么调度?怎么在多块 GPU 上把训练跑起来?
  • 规模化​:模型越大越好吗?给定算力预算,模型该多大、数据该多少?
  • 评估​:训练出来的模型到底好不好?怎么科学地衡量?
  • 后训练​:预训练完的“续写机器”怎么变成会听指令、会推理的助手?

学完这门课,你应该能回答一个别人常常答不上来的问题:​“你知道你的模型每一部分为什么是这样吗?”

先修要求

要求说明
Python 熟练作业脚手架极少,代码量比一般课程大一个数量级,软件工程能力很重要
深度学习 + 系统优化经验需要熟悉 PyTorch,了解内存层级等基本系统概念
微积分、线性代数能看懂矩阵、向量记号和运算即可
概率与统计基础概率、高斯分布、均值、标准差等
机器学习基础学过一门 ML 或深度学习课程

提示

这是一门 5 学分的课程,​实现量非常大​,需要预留足够时间。

课程结构

本笔记按照课程 19 次讲座的主题组织为以下几组笔记:

基础入门

模型架构

系统与训练效率

规模化

  • 缩放定律 —— Kaplan 与 Chinchilla
  • 推理 —— KV 缓存、连续批处理、投机解码

评估

数据

后训练与对齐

2026 春季学期日程

#日期主题讲师
13 月 30 日课程总览、分词Percy
24 月 1 日PyTorch(einops)、资源估算(FLOPs、显存、运算强度)Percy
34 月 6 日架构、超参数Tatsu
44 月 8 日注意力替代方案与混合专家Tatsu
54 月 13 日GPU、TPUTatsu
64 月 15 日内核、TritonPercy
74 月 20 日并行Percy
84 月 22 日并行Tatsu
94 月 27 日缩放定律Tatsu
104 月 29 日推理Percy
115 月 4 日缩放定律Tatsu
125 月 6 日评估Percy
135 月 11 日数据(来源、数据集)Percy
145 月 13 日数据(过滤、去重、混合、合成数据)Percy
155 月 18 日训练中后期(SFT/RLHF)Tatsu
165 月 20 日后训练——RLVRTatsu
175 月 27 日对齐——多模态Percy
186 月 1 日客座讲座:Daniel Selsam
196 月 3 日客座讲座:Dan Fu

参考资料

最近更新