Invisible Shortcuts: Why Vision Encoders Know Your Camera
- 类型:arxiv
- 标识:2608.05424
- 链接:https://arxiv.org/abs/2608.05424
- 主分类:multimodal
- 形态:method
- 被引:0
- 被引来源:Semantic Scholar + OpenAlex
- S2被引:0
- OpenAlex被引:0
- 影响力被引:0
- TLDR:Invisible metadata traces embedded at the pixel level are identified, suggesting that large-scale semantic supervision, whether through categorical labels or billion-scale captions, naturally induces metadata-semantics correlations during pretraining, leading models to convert low-level signals into predictive features.
- OpenAlex ID:W7201845378
- OpenAlex DOI:10.48550/arxiv.2608.05424
- DOI:10.48550/arxiv.2608.05424
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2608.05424
- OpenAlex更新:2026-09-07
- 待LLM分类:否
- 标题中文:Invisible Shortcuts:视觉 Encoder 为何知道你的相机
- TLDR中文:识别出像素级嵌入的不可见元数据痕迹,表明大规模语义监督(无论是类别标签还是亿级规模的 caption)在预训练中会自然引发元数据-语义相关性,导致模型将低层信号转化为预测特征。
- 来源文件:
- /inbox/tom/_candidates/2026-08-07-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]