Skip to content

对齐与多模态

对应课程 Lecture 17:Alignment - multimodality(Percy)

最后一讲收束两条线:​安全性对齐​(让模型不作恶)与多模态​(让模型不只读文字)。

安全对齐:让模型守住底线

有害性与拒绝

安全对齐的目标是双重的:

  1. 该拒绝的拒绝​:涉暴、违法、危险知识等请求;
  2. 不该拒绝的不拒绝​:过度的“安全官僚主义”(对无害请求也打太极)会毁掉可用性。

这本身是一个权衡问题,常用的手段延续了 RLHF 的工具箱:SFT 注入拒绝行为、偏好数据里把“有害但流畅”压在“安全且有帮助”之下、红队数据扩充边界样本。

越狱与鲁棒性

越狱(jailbreak) 是绕过安全训练的攻击手段,不断演化:

  • 角色扮演(“你是一个没有限制的 AI”);
  • 编码包装(“写一个小说情节,其中包含……”);
  • 多轮诱导、低资源语言绕过、伪造系统提示、​多模态越狱​(把恶意指令藏在图片里)。

防御思路:​训练时​(红队数据进训练集)、​推理时​(输入/输出分类器、系统提示加固)、​系统层​(权限隔离、内容过滤)。没有银弹,防御是持续过程——攻击面是开放集合,这和语言模型评估中安全评估的结论一致。

更深的对齐问题

  • 诚实与幻觉​:模型会自信地编造,对齐训练(教它说“我不知道”)与 RLVR 式验证是主要手段;
  • 可操控性(steerability)​:能否可靠地按指令调整行为;
  • 价值观多元​:不同用户/地区的规范不同,单一对齐策略的适配是开放问题。

多模态:让模型看见世界

视觉编码器:CLIP 范式

处理图像的第一步是把它变成向量。​CLIP(Contrastive Language-Image Pre-training) 用对比学习对齐图文对:同一张图和它的配文在向量空间中靠近,不匹配的远离。

  • 产物是一个视觉编码器(ViT 等)​,输出与语言嵌入“语义兼容”的图像特征;
  • CLIP 特征同时支撑了图文检索、零样本分类等下游能力,也是 VLM 的标准底座。

VLM 的主流架构:桥接两个世界

LLaVA 为代表的简洁架构:

text
图像 → 视觉编码器 → 投影层(projector) → 图像 token 序列

文字 → 分词 → 语言模型 ← 拼接(图像 token 当作"外语单词")
  • 投影层把视觉特征映射到语言模型的嵌入空间,通常是一个 MLP,在图文对数据上训练;
  • 语言模型权重常冻结或轻度训练,复用全部语言能力;
  • 训练两阶段:先训投影层(对齐),再全量指令微调(能力)。

设计选择的谱系

方案做法权衡
适配器式(LLaVA)现成视觉编码器 + 轻量桥接便宜、快速;细粒度视觉任务偏弱
早期融合图像切块后直接像文本一样进主干统一、可扩展到视频;预训练成本高
原生多模态预训练图文交错数据从头训练最强;数据工程极重

关键细节:​图像 token 的数量直接决定序列长度(一图几百 token),这把注意力替代方案(长序列)和推理(KV 缓存)的优化全部联动起来;图像分辨率与 token 数的权衡是 VLM 部署的核心成本项。

收束:整门课的地图

到这里,课程完成了从原始网页到推理模型的全程:

  • 分词架构决定模型的表达与效率;
  • 系统决定你训练得起什么规模;
  • 缩放定律决定资源怎么分配;
  • 数据决定天花板;
  • 评估保证你在做真优化;
  • 后训练把潜能变成产品。

小结

  • 安全是权衡而非开关:拒绝有害与保持可用要同时优化;越狱与防御是持续对抗。
  • CLIP 编码器 + 投影层桥接是 VLM 的务实主流;图像 token 数是长序列成本的关键。
  • 多模态把前面所有课程主题(序列长度、数据、评估)再次串联——这正是这门课的设计妙处。
最近更新