DINOv3:Meta 新一代自监督视觉基座,彻底解决稠密特征退化

📅 2026/8/5 19:23:43
DINOv3:Meta 新一代自监督视觉基座,彻底解决稠密特征退化
深度学习论文: DINOv3:Meta 新一代自监督视觉基座,彻底解决稠密特征退化DINOv3:Meta 新一代自监督视觉基座,彻底解决稠密特征退化PDF: https://arxiv.org/pdf/2508.10104PyTorch代码: https://github.com/shanglianlm0525/CvPytorchPyTorch代码: https://github.com/shanglianlm0525/PyTorch-Networks1. 前言:自监督视觉的里程碑——从DINOv2到DINOv32024年Meta发布的DINOv2凭借无标注纯图像自监督学习,打破CLIP类弱监督模型依赖图文配对数据的限制,仅靠单张图片就能产出优质全局+局部特征,在分割、3D匹配、遥感、病理等无标注冷门领域爆火。但DINO系列(尤以DINOv2)在长时训练中面临稠密特征退化:迭代至1M轮时,[CLS]全局分类特征持续增强,但Patch级空间语义相似性急剧破坏——特征图糊化,同类物边界模糊,背景噪声激增。退化根源在于全局对比损失(DINO Loss)与局部掩码重构损失(iBOT Loss)的优化冲突,后期全局目标压制局