VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training
- 类型:arxiv
- 标识:2203.12602
- 链接:https://arxiv.org/abs/2203.12602
- 主题:multimodal
- 主分类:multimodal
- 形态:method
- 被引:2186
- 被引来源:Semantic Scholar
- S2被引:2186
- OpenAlex被引:437
- 影响力被引:316
- TLDR:This paper shows that video masked autoencoders (VideoMAE) are data-efficient learners for self-supervised video pre-training (SSVP), and proposes customized video tube masking with an extremely high ratio, inspired by the recent ImageMAE.
- OpenAlex ID:W4221167396
- OpenAlex DOI:10.48550/arxiv.2203.12602
- DOI:10.48550/arxiv.2203.12602
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://arxiv.org/pdf/2203.12602
- OpenAlex更新:2026-07-30
- 副分类:engineering
- 待LLM分类:否
- 标题中文:VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training
- TLDR中文:本文表明视频掩码自编码器(VideoMAE)是自监督视频预训练(SSVP)的数据高效学习器,并受近期 ImageMAE 启发,提出采用极高掩码比例的定制化视频管状掩码策略。
- 来源文件:
- [OpenAlex discover]
- [S2 enrich]