CoCa: Contrastive Captioners are Image-Text Foundation Models
- 类型:arxiv
- 标识:2205.01917
- 链接:https://arxiv.org/abs/2205.01917
- 主题:multimodal
- 主分类:multimodal
- 形态:method
- 被引:1813
- 被引来源:Semantic Scholar
- S2被引:1813
- OpenAlex被引:516
- 影响力被引:147
- TLDR:Contrastive Captioner (CoCa), a minimalist design to pretrain an image-text encoder-decoder foundation model jointly with contrastive loss and captioning loss, thereby subsuming model capabilities from contrastive approaches like CLIP and generative methods like SimVLM.
- OpenAlex ID:W4229042118
- OpenAlex DOI:10.48550/arxiv.2205.01917
- DOI:10.48550/arxiv.2205.01917
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://arxiv.org/pdf/2205.01917
- OpenAlex更新:2026-08-07
- 待LLM分类:否
- 成熟度:research
- 场景:image-text、contrastive learning、foundation model
- 标题中文:CoCa: Contrastive Captioners are Image-Text Foundation Models
- TLDR中文:Contrastive Captioner (CoCa) 采用极简设计,对图文编码器-解码器基础模型联合使用对比损失与字幕损失进行预训练,从而兼具 CLIP 等对比方法与 SimVLM 等生成方法的能力。
- 来源文件:
- [OpenAlex discover]
- [S2 enrich]