MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models
- 类型:arxiv
- 标识:2304.10592
- 链接:https://arxiv.org/abs/2304.10592
- 主题:multimodal
- 主分类:multimodal
- 形态:method
- 被引:3316
- 被引来源:Semantic Scholar
- S2被引:3316
- OpenAlex被引:481
- 影响力被引:316
- TLDR:MiniGPT-4 is presented, which aligns a frozen visual encoder with a frozen advanced LLM, Vicuna, using one projection layer to uncovers that properly aligning the visual features with an advanced large language model can possess numerous advanced multi-modal abilities demonstrated by G PT-4.
- OpenAlex ID:W4366850747
- OpenAlex DOI:10.48550/arxiv.2304.10592
- DOI:10.48550/arxiv.2304.10592
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://arxiv.org/pdf/2304.10592
- OpenAlex更新:2026-07-30
- 待LLM分类:否
- 标题中文:MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models
- TLDR中文:本文提出 MiniGPT-4,通过一个投影层将冻结的视觉编码器与冻结的先进 LLM Vicuna 对齐,发现将视觉特征与先进大语言模型恰当对齐可获得类似 GPT-4 所展现的多种先进多模态能力。
- 来源文件:
- [OpenAlex discover]
- [S2 enrich]