Invisible Shortcuts: Why Vision Encoders Know Your Camera

  • 类型:arxiv
  • 标识:2608.05424
  • 链接:https://arxiv.org/abs/2608.05424
  • 主分类:multimodal
  • 形态:method
  • 被引:0
  • 被引来源:Semantic Scholar
  • S2被引:0
  • 影响力被引:0
  • TLDR:Invisible metadata traces embedded at the pixel level are identified, suggesting that large-scale semantic supervision, whether through categorical labels or billion-scale captions, naturally induces metadata-semantics correlations during pretraining, leading models to convert low-level signals into predictive features.
  • 待LLM分类:否
  • 标题中文:Invisible Shortcuts:视觉 Encoder 为何知道你的相机
  • TLDR中文:识别出像素级嵌入的不可见元数据痕迹,表明大规模语义监督(无论是类别标签还是亿级规模的 caption)在预训练中会自然引发元数据-语义相关性,导致模型将低层信号转化为预测特征。
  • 来源文件
  • /inbox/tom/_candidates/2026-08-07-agent-rag-longcontext-candidates.json
  • [S2 enrich]