From Flamingo to LLaVA
8/23/26About 1 min
From Flamingo to LLaVA
现代视觉语言模型通常保留强大的预训练 LLM,在视觉编码器与语言模型之间插入连接模块。Flamingo 与 LLaVA 代表两种重要路径:前者强调交错图文与 few-shot,后者强调轻量连接和视觉指令微调。
Flamingo
Flamingo 用 Perceiver Resampler 把可变数量视觉特征压缩为固定数量 token,并在冻结 LLM 的若干层插入 gated cross-attention。图像与文本可以交错出现,模型由此支持多图上下文和 in-context learning。
LLaVA
LLaVA 用线性层或 MLP projector 将 CLIP 视觉特征映射到 LLM embedding 空间,再经过两阶段训练:
- 冻结视觉编码器和 LLM,训练 projector 做特征对齐;
- 用视觉 instruction data 微调 projector 与部分/全部 LLM。
结构简单使其容易复现和扩展,但模型可能依赖语言先验产生幻觉。
设计比较
| 设计问题 | Flamingo 路线 | LLaVA 路线 |
|---|---|---|
| 视觉压缩 | Perceiver Resampler | projector + visual tokens |
| 跨模态交互 | 多层 gated cross-attention | 视觉 token 进入 LLM 序列 |
| 主要优势 | 多图交错、few-shot | 简洁、易训练、instruction following |
| 主要成本 | 架构与训练复杂 | 长视觉 token 占上下文 |
