Fine-tuning
8/3/26About 1 min
Fine-tuning
多模态微调的核心选择是:哪些模块保持冻结、哪些参数允许适配、监督信号作用在哪个接口。训练参数越少不一定越差,关键在于基础表示与目标任务的距离。
适配方式
| 方法 | 更新范围 | 适合场景 |
|---|---|---|
| Linear probing | 只训练线性头 | 检查冻结表示是否直接可用 |
| Full fine-tuning | 更新全部参数 | 数据充足、域差距大 |
| Adapter / LoRA | 插入或更新少量参数 | 资源受限、多任务部署 |
| Projector tuning | 只训练模态连接层 | 冻结 vision encoder 与 LLM |
| Prompt tuning | 学习连续 prompt token | 任务变化小、需轻量切换 |
分阶段训练
视觉语言模型常先训练 projector 完成粗对齐,再用 instruction data 联合微调 projector、LoRA 或部分 LLM。直接全量训练可能破坏已有语言或视觉能力;长期冻结则可能限制细粒度跨模态交互。
数据与损失
数据应覆盖描述、问答、OCR、grounding、多图与拒答等目标能力。只用高层 caption 容易让模型依赖语言先验,忽略图像细节。可组合语言建模、对比、匹配和定位损失,但需要检查梯度冲突和任务采样比例。
验证
- 与 text-only 或 image-blind 基线比较,确认模型真正使用视觉;
- 做图像替换、遮挡与反事实测试;
- 分别测试识别、OCR、空间、计数和知识推理;
- 监控训练后语言能力与安全边界是否回退;
- 记录 base model、projector、adapter 和 prompt template 的版本组合。
