On Locality and Length Generalization in Visual Reasoning

  • 类型:arxiv
  • 标识:2607.09061
  • 链接:https://arxiv.org/abs/2607.09061
  • 主分类:multimodal
  • 形态:method
  • 被引:0
  • 被引来源:Semantic Scholar + OpenAlex
  • S2被引:0
  • OpenAlex被引:0
  • 影响力被引:0
  • TLDR:The experiments reveal that, similar to language models, vision models can learn to exploit global shortcuts and thereby fail to generalize over task length or complexity, but it is shown that recurrent vision policies based on strictly local perception can mitigate these failures, thereby allowing models to generalize on these tasks.
  • OpenAlex ID:W7168123798
  • OpenAlex DOI:10.48550/arxiv.2607.09061
  • DOI:10.48550/arxiv.2607.09061
  • DOI来源:OpenAlex
  • 开放获取:green
  • 开放获取链接:https://doi.org/10.48550/arxiv.2607.09061
  • OpenAlex更新:2026-07-19
  • 待LLM分类:否
  • 标题中文:关于视觉推理中的局部性与长度泛化
  • TLDR中文:实验表明,与语言模型类似,视觉模型也会学习利用全局捷径,从而无法在任务长度或复杂度上泛化,但本文证明基于严格局部感知的循环视觉策略可以缓解这些失败,从而使模型在这些任务上具备泛化能力。
  • 来源文件
  • /inbox/tom/_candidates/2026-07-19-agent-rag-longcontext-candidates.json
  • [OpenAlex backfill]
  • [S2 enrich]
  • /inbox/tom/_candidates/2026-07-20-agent-rag-longcontext-candidates.json
  • /inbox/tom/_candidates/2026-07-20-agent-memory-tool-use-candidates.json