【Video】VideoMAE:Tube Masking与极高掩码率下的视频自监督预训练

📅 2026/7/20 10:42:21
【Video】VideoMAE:Tube Masking与极高掩码率下的视频自监督预训练
note针对视频时间冗余和信息泄漏问题VideoMAE首创时序贯通的Tube Masking把掩码率拉到90%-95%逼模型学全局时空语义而非靠邻近帧“走捷径”。采用时空立方体嵌入非对称编解码架构仅把10%未掩码token喂给编码器大幅降低计算成本的同时完成像素级重建预训练。这套设计让vanilla ViT无需任何额外图像/标签数据仅靠几千条视频就能训出SOTA性能验证了“数据质量比数量更重要”的SSVP核心规律。文章目录note一、研究动机二、论文核心三、实验结果和分析总结一、研究动机《VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training》2022年视频Transformer训练依赖大数据的痛点训练高效的视频Vision Transformer (ViT) 通常需要超大规模的有标签数据集或ImageNet预训练模型从头训练视频Transformer在小/中规模数据集上效果很差且容易受图像模型的偏置影响。视频数据的特性挑战相比图像视频存在时间冗余相邻帧语义变化慢和时间相关性。若直接使用类似MAE的随机掩码模型容易通过相邻帧的未掩码区域“作弊”信息泄漏来重建像素而非学习高层时空语义结构。自监督视频预训练(SSVP)的需求探索如何仅利用视频数据本身无额外图像数据、无标签高效地预训练 vanilla ViT 骨干网络。二、论文核心VideoMAE 基于 Image-MAE 架构针对视频特性做了两项关键定制设计极高比例的 Tube Masking管道掩码极高比例采用90%~95%的掩码率远高于图像的75%。因视频时间冗余度高低掩码率任务太简单易导致信息泄漏极高掩码迫使模型理解整体时空结构而非依赖局部补全。Tube Masking时序通道掩码掩码在时序维度上“贯通”即对同一空间位置的cube在所有时间帧上都掩码或都不掩码。这防止模型在相邻帧找对应未掩码块来“走捷径”缓解静止或微运动区域的信息泄漏。时序下采样与立方体嵌入 (Cube Embedding)时序下采样先对视频帧做带步长的采样如K400 stride4, SSV2 stride2减少冗余。Cube Embedding将输入划分为2 × 16 × 16 2 \times 16 \times 162×16×16的时空立方体token通过联合时空注意力joint space-time attention建模时空依赖。非对称编解码器仅将未掩码的少量token约10%送入Encoder轻量Decoder负责重建所有掩码像素使用MSE损失预训练后丢弃Decoder用于下游微调。三、实验结果和分析论文在 K400、SSV2、UCF101、HMDB51、AVA 等数据集上验证数据高效性即使在极小规模数据集HMDB51仅约3.5k视频上不使用任何额外数据VideoMAE也能成功预训练显著优于从头训练和MoCo v3等对比学习方法。在小数据集上UCF101达91.3%HMDB51达62.6%ViT-B无外部数据。主数据集SOTA表现无外部数据Kinetics-400ViT-L 达85.2%ViT-H (320分辨率) 达87.4%。Something-Something V2强依赖时序推理ViT-L (32帧) 达75.4%大幅超越此前需外部数据的方法。关键消融实验结论掩码策略Tube Masking 90%~95% 掩码率最优随机掩码或帧掩码因信息泄漏效果较差。解码器深度视频重建比图像更需要一定深度的解码器默认4层浅解码器显存低但性能下降。损失函数MSE损失优于L1和Smooth L1。预训练数据域数据质量 数据数量域偏移domain shift影响大直接在目标数据集预训练通常优于在大规模异域数据如K400→SSV2上预训练。下游迁移AVA动作检测VideoMAE预训练模型在AVA上迁移良好ViT-H (K400无标签预训练) 达39.5 mAP显示学到的时空表征具备通用性。总结VideoMAE 证明通过极高掩码率的Tube Masking和时空立方体重建可以让视频MAE成为极其数据高效的自我监督学习者使 vanilla ViT 能在无额外数据、甚至几千个视频的极小规模数据上训练出高性能视频识别模型。