BradyFU/Awesome-Multimodal-Large-Language-Models · 上手攻略

  • 仓库:BradyFU/Awesome-Multimodal-Large-Language-Models
  • 链接:https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models
  • 分类:ai
  • 作者:Tom
  • 更新:2026-07-14

这是什么

这是一份由南京大学 MIG 实验室(NJU-MiG)维护的多模态大语言模型(Multimodal Large Language Models,MLLM)前沿论文合集,截至 2026 年 7 月已收录 17.9k+ Stars,是 MLLM 领域最全面、最活跃的社区驱动的学术索引之一。

它不是代码库,而是一个持续更新的知识库,系统整理了 MLLM 各个子方向的论文、benchmark、数据集、代码仓库和在线 demo,涵盖从 2023 年至今几乎所有重要工作。内容分为几大板块:

  • VITA 系列:交互式全模态模型(视觉+语音+文本)
  • MME 系列 benchmark:多模态模型评测基准(Video-MME、MME 等)
  • 多模态指令微调(Instruction Tuning)
  • 多模态幻觉问题(Hallucination)
  • 多模态上下文学习(In-Context Learning)
  • 多模态思维链(Chain-of-Thought)
  • 多模态 RLHF
  • 预训练基础模型(Foundation Models)
  • 数据集(预训练、对齐、评测等)

解决什么问题

MLLM 是 2023–2026 年 AI 领域最火的方向之一,新论文层出不穷,但存在三个普遍痛点:

  1. 信息碎片化:论文分散在 arXiv、ACL、NeurIPS、CVPR 等各处,没有统一入口。
  2. 难以辨别质量:每天都有新论文放出,哪些是真正有影响力的工作很难判断。
  3. 缺少中文视角:很多优质工作来自国内团队,但英文社区索引往往收录不全或更新滞后。

NJU-MiG 的这份合集用结构化的目录 + 精选推荐解决了上述问题,读者可以快速定位自己关心的方向,并直接点击链接访问论文、项目页面和代码仓库。


快速上手

浏览器直接访问(无需安装)

https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models

首页目录直接列出所有分类,点击任意标题跳转到对应章节。每个论文条目包含:标题、发表 venue、日期、GitHub 代码链接、在线 Demo 链接(若有)。

离线阅读

# 克隆仓库(仅含 Markdown,无需 clone 历史)
git clone --depth 1 https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models.git
# 用任意 Markdown 阅读器打开 README.md 即可

关注最新工作

  • 仓库 Watch → 选择 Releases only 可收到重要更新通知
  • GitHub 页面的 Commits 记录每次增补的论文

核心内容解读

按研究方向导航

以下是各板块的典型代表工作,帮助你快速建立全局认知:

多模态指令微调 & 最新模型

模型 机构 亮点
Qwen3.5-Omni 阿里 Qwen 原生全模态,端到端文本+视觉+音频
Gemini 3.1 Pro Google DeepMind 百万 token 上下文,支持深度推理
DeepSeek-V4 DeepSeek 高效百万 token 上下文推理
InternVL-U 上海 AI Lab 统一理解和生成
MiniCPM-o 4.5 面壁智能 端侧多模态,参数效率高

VITA 系列(交互式全模态)

  • VITA-1.5(NeurIPS 2025 Highlight):对标 GPT-4o 级别的实时视觉+语音交互,支持实时对话而非回合制。
  • VITA-Audio:高效语音-语言跨模态 token 生成,降低语音交互延迟。

MME 系列评测基准

Benchmark 特点
Video-MME(CVPR 2025) 首个全面视频理解评测基准
Video-MME-v2(2026) Video-MME 下一代,覆盖更长视频
MME(NeurIPS 2025 DB Highlight) 综合多维度评测

⚠️ 注意:各 benchmark 侧重点不同,选取评测基准时应根据自己模型的定位选择合适benchmark组合。

多模态思维链(CoT)

该板块收录了将思维链推理能力引入多模态场景的工作,涉及视觉推理、图文交织推理(interleaved image-text reasoning)等前沿方向。

论文阅读建议

合集中每篇论文都标注了发表 venue 和日期,阅读顺序建议:

  1. 先读综述类论文(Survey):建立领域框架,如 "A Survey on Multimodal Large Language Models"(NSR 2024)
  2. 再按子方向深入最新工作
  3. 重点关注有代码开源和有在线 Demo的论文,这些工作复现性更强

典型使用场景

场景 如何用这个仓库
调研多模态大模型最新进展 按目录找到对应子方向,按日期倒序浏览
选型(哪个模型更适合我的任务) 对比各模型在 MME/Video-MME 等 benchmark 上的表现
找 benchmark 直接去评测板块,对照 leaderboard
找数据集 去"Datasets"板块,按预训练/微调/评测分类查找
写论文related work 引用合集中的论文,系统性不漏重要工作

坑与注意

  1. 是合集不是代码库:不要期望有可以运行的代码,下载 README.md 足矣。
  2. arXiv 论文时效性强:仓库更新依赖维护者人工收录,最新工作可能有几周到几个月的延迟。
  3. 中文社区项目收录较全:VITA、Qwen、InternVL 等国内工作的中文名称和中文资料收录较全,英文 awesome list 往往不如这份。
  4. 分支(Branch)利用Benchmarks 分支存放 MME 系列 benchmark 专项内容,Unified 分支存放统一多模态理解和生成方向的专项内容。
  5. Stars 数量不代表质量:MLLM 领域热度高,很多论文为了引流会在标题上做营销,建议结合 venue 和代码开源情况综合判断。

与同类对比

合集 规模 特色 更新频率
本仓库(NJU-MiG) 17.9k Stars VITA/MME 系列 benchmark,评测体系完整 高频
awesome-multimodal-LLM 中等 偏语言模型侧 中等
Awesome-Vision-Language-Models 中等 偏视觉-语言早期工作

本仓库的核心优势在于 benchmark 体系完整(MME 系列是学界公认基准)+ 中文团队维护对中国工作收录更全,是 MLLM 领域调研首选入口。


一句话推荐结论

调研多模态大语言模型最新进展,这份 17.9k Stars 的 NJU-MiG 合集是最值得收藏的单一入口——benchmark 体系完整、国内工作收录齐全、目录结构清晰,入门和科研都适用,比追 Twitter 碎片化信息效率高得多。