GLIP
8/3/26About 1 min
GLIP
GLIP(Grounded Language-Image Pre-training)把目标检测重新表述为短语 grounding:模型接收图像和文本提示,输出与文本短语对应的边界框。类别不再局限于固定分类头,而由自然语言定义。
核心转换
传统检测器预测预定义类别;GLIP 将类别名拼成文本 prompt,把每个目标框与 prompt 中对应的 token/span 对齐。这样可以联合利用检测数据中的框标注和图文数据中的弱监督语义。
image ──> visual encoder ─┐
├─ cross-modal fusion ─> boxes + phrase alignment
text ──> text encoder ───┘能力与价值
- 用自然语言组合类别和属性;
- 在新类别上进行 zero-shot / open-vocabulary detection;
- 把 detection、grounding 与图文预训练放进统一接口;
- 为视觉 Agent 提供“语言指向图中区域”的基础能力。
局限
输出仍受 prompt、训练词汇和区域标注偏差影响。相似类别、细粒度属性、计数和密集小目标仍困难;开放词汇不等于开放世界可靠性。评估需同时覆盖 seen/unseen 类别、定位精度、短语歧义和不同提示模板。
