对齐与多模态
对应课程 Lecture 17:Alignment - multimodality(Percy)
最后一讲收束两条线:安全性对齐(让模型不作恶)与多模态(让模型不只读文字)。
安全对齐:让模型守住底线
有害性与拒绝
安全对齐的目标是双重的:
- 该拒绝的拒绝:涉暴、违法、危险知识等请求;
- 不该拒绝的不拒绝:过度的“安全官僚主义”(对无害请求也打太极)会毁掉可用性。
这本身是一个权衡问题,常用的手段延续了 RLHF 的工具箱:SFT 注入拒绝行为、偏好数据里把“有害但流畅”压在“安全且有帮助”之下、红队数据扩充边界样本。
越狱与鲁棒性
越狱(jailbreak) 是绕过安全训练的攻击手段,不断演化:
- 角色扮演(“你是一个没有限制的 AI”);
- 编码包装(“写一个小说情节,其中包含……”);
- 多轮诱导、低资源语言绕过、伪造系统提示、多模态越狱(把恶意指令藏在图片里)。
防御思路:训练时(红队数据进训练集)、推理时(输入/输出分类器、系统提示加固)、系统层(权限隔离、内容过滤)。没有银弹,防御是持续过程——攻击面是开放集合,这和语言模型评估中安全评估的结论一致。
更深的对齐问题
- 诚实与幻觉:模型会自信地编造,对齐训练(教它说“我不知道”)与 RLVR 式验证是主要手段;
- 可操控性(steerability):能否可靠地按指令调整行为;
- 价值观多元:不同用户/地区的规范不同,单一对齐策略的适配是开放问题。
多模态:让模型看见世界
视觉编码器:CLIP 范式
处理图像的第一步是把它变成向量。CLIP(Contrastive Language-Image Pre-training) 用对比学习对齐图文对:同一张图和它的配文在向量空间中靠近,不匹配的远离。
- 产物是一个视觉编码器(ViT 等),输出与语言嵌入“语义兼容”的图像特征;
- CLIP 特征同时支撑了图文检索、零样本分类等下游能力,也是 VLM 的标准底座。
VLM 的主流架构:桥接两个世界
以 LLaVA 为代表的简洁架构:
text
图像 → 视觉编码器 → 投影层(projector) → 图像 token 序列
↓
文字 → 分词 → 语言模型 ← 拼接(图像 token 当作"外语单词")- 投影层把视觉特征映射到语言模型的嵌入空间,通常是一个 MLP,在图文对数据上训练;
- 语言模型权重常冻结或轻度训练,复用全部语言能力;
- 训练两阶段:先训投影层(对齐),再全量指令微调(能力)。
设计选择的谱系
| 方案 | 做法 | 权衡 |
|---|---|---|
| 适配器式(LLaVA) | 现成视觉编码器 + 轻量桥接 | 便宜、快速;细粒度视觉任务偏弱 |
| 早期融合 | 图像切块后直接像文本一样进主干 | 统一、可扩展到视频;预训练成本高 |
| 原生多模态预训练 | 图文交错数据从头训练 | 最强;数据工程极重 |
关键细节:图像 token 的数量直接决定序列长度(一图几百 token),这把注意力替代方案(长序列)和推理(KV 缓存)的优化全部联动起来;图像分辨率与 token 数的权衡是 VLM 部署的核心成本项。
收束:整门课的地图
到这里,课程完成了从原始网页到推理模型的全程:
- 分词与架构决定模型的表达与效率;
- 系统决定你训练得起什么规模;
- 缩放定律决定资源怎么分配;
- 数据决定天花板;
- 评估保证你在做真优化;
- 后训练把潜能变成产品。
小结
- 安全是权衡而非开关:拒绝有害与保持可用要同时优化;越狱与防御是持续对抗。
- CLIP 编码器 + 投影层桥接是 VLM 的务实主流;图像 token 数是长序列成本的关键。
- 多模态把前面所有课程主题(序列长度、数据、评估)再次串联——这正是这门课的设计妙处。