DINO
8/3/26About 1 min
DINO
DINO 是无需人工标签的视觉自监督方法。它采用 teacher–student 自蒸馏:student 预测 teacher 对另一视图的输出,teacher 参数由 student 的指数移动平均更新。
训练机制
对同一图像生成 global crop 和 local crop。teacher 通常只看 global view,student 看所有 view,并让不同视图的类别分布保持一致:
teacher 输出经过 centering 与 sharpening,避免所有样本坍缩到相同表示。DINO 不依赖显式负样本,其有效性来自多视图一致性、动量 teacher 和输出分布控制。
学到了什么
ViT 的 attention map 会自然呈现对象区域,特征在 k-NN 和线性探测中具有较强可分性。后续 DINOv2 进一步强调大规模数据整理和通用视觉特征。
与其他范式比较
- 对比学习:通常显式拉近正对、推远负对;
- MAE:通过重建被遮挡 patch 学表示;
- CLIP:利用图文对齐获取开放词汇语义;
- DINO:依赖不同图像视图间的自蒸馏一致性。
评估时应区分线性探测、k-NN、全量微调与 dense prediction;它们分别反映表示的可分性、局部结构和可适配性。
参考:Emerging Properties in Self-Supervised Vision Transformers。
