Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model

  • 类型:arxiv
  • 标识:2401.09417
  • 链接:https://arxiv.org/abs/2401.09417
  • 主题:multimodal
  • 主分类:multimodal
  • 形态:method
  • 被引:2083
  • 被引来源:Semantic Scholar
  • S2被引:2083
  • OpenAlex被引:404
  • 影响力被引:206
  • TLDR:This paper proposes a new generic vision backbone with bidirectional Mamba blocks (Vim), which marks the image sequences with position embeddings and compresses the visual representation with bidirectional state space models and has great potential to be the next-generation backbone for vision foundation models.
  • OpenAlex ID:W4391013663
  • OpenAlex DOI:10.48550/arxiv.2401.09417
  • DOI:10.48550/arxiv.2401.09417
  • DOI来源:OpenAlex
  • 开放获取:green
  • 开放获取链接:https://arxiv.org/pdf/2401.09417
  • OpenAlex更新:2026-07-30
  • 待LLM分类:否
  • 标题中文:Vision Mamba:基于双向状态空间模型的高效视觉表示学习
  • TLDR中文:本文提出基于双向 Mamba 块(Vim)的通用视觉 backbone,通过位置嵌入标记图像序列,并利用双向 state space model 压缩视觉表征,具有成为下一代视觉基础模型 backbone 的巨大潜力。
  • 来源文件
  • [OpenAlex discover]
  • [S2 enrich]