MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

  • 类型:arxiv
  • 标识:2304.10592
  • 链接:https://arxiv.org/abs/2304.10592
  • 主题:multimodal
  • 主分类:multimodal
  • 形态:method
  • 被引:3316
  • 被引来源:Semantic Scholar
  • S2被引:3316
  • OpenAlex被引:481
  • 影响力被引:316
  • TLDR:MiniGPT-4 is presented, which aligns a frozen visual encoder with a frozen advanced LLM, Vicuna, using one projection layer to uncovers that properly aligning the visual features with an advanced large language model can possess numerous advanced multi-modal abilities demonstrated by G PT-4.
  • OpenAlex ID:W4366850747
  • OpenAlex DOI:10.48550/arxiv.2304.10592
  • DOI:10.48550/arxiv.2304.10592
  • DOI来源:OpenAlex
  • 开放获取:green
  • 开放获取链接:https://arxiv.org/pdf/2304.10592
  • OpenAlex更新:2026-07-30
  • 待LLM分类:否
  • 标题中文:MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models
  • TLDR中文:本文提出 MiniGPT-4,通过一个投影层将冻结的视觉编码器与冻结的先进 LLM Vicuna 对齐,发现将视觉特征与先进大语言模型恰当对齐可获得类似 GPT-4 所展现的多种先进多模态能力。
  • 来源文件
  • [OpenAlex discover]
  • [S2 enrich]