BradyFU/Awesome-Multimodal-Large-Language-Models · 上手攻略
- 仓库:BradyFU/Awesome-Multimodal-Large-Language-Models
- 链接:https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models
- 分类:ai
- 作者:Tom
- 更新:2026-07-14
这是什么
这是一份由南京大学 MIG 实验室(NJU-MiG)维护的多模态大语言模型(Multimodal Large Language Models,MLLM)前沿论文合集,截至 2026 年 7 月已收录 17.9k+ Stars,是 MLLM 领域最全面、最活跃的社区驱动的学术索引之一。
它不是代码库,而是一个持续更新的知识库,系统整理了 MLLM 各个子方向的论文、benchmark、数据集、代码仓库和在线 demo,涵盖从 2023 年至今几乎所有重要工作。内容分为几大板块:
- VITA 系列:交互式全模态模型(视觉+语音+文本)
- MME 系列 benchmark:多模态模型评测基准(Video-MME、MME 等)
- 多模态指令微调(Instruction Tuning)
- 多模态幻觉问题(Hallucination)
- 多模态上下文学习(In-Context Learning)
- 多模态思维链(Chain-of-Thought)
- 多模态 RLHF
- 预训练基础模型(Foundation Models)
- 数据集(预训练、对齐、评测等)
解决什么问题
MLLM 是 2023–2026 年 AI 领域最火的方向之一,新论文层出不穷,但存在三个普遍痛点:
- 信息碎片化:论文分散在 arXiv、ACL、NeurIPS、CVPR 等各处,没有统一入口。
- 难以辨别质量:每天都有新论文放出,哪些是真正有影响力的工作很难判断。
- 缺少中文视角:很多优质工作来自国内团队,但英文社区索引往往收录不全或更新滞后。
NJU-MiG 的这份合集用结构化的目录 + 精选推荐解决了上述问题,读者可以快速定位自己关心的方向,并直接点击链接访问论文、项目页面和代码仓库。
快速上手
浏览器直接访问(无需安装)
https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models
首页目录直接列出所有分类,点击任意标题跳转到对应章节。每个论文条目包含:标题、发表 venue、日期、GitHub 代码链接、在线 Demo 链接(若有)。
离线阅读
# 克隆仓库(仅含 Markdown,无需 clone 历史)
git clone --depth 1 https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models.git
# 用任意 Markdown 阅读器打开 README.md 即可
关注最新工作
- 仓库 Watch → 选择
Releases only可收到重要更新通知 - GitHub 页面的 Commits 记录每次增补的论文
核心内容解读
按研究方向导航
以下是各板块的典型代表工作,帮助你快速建立全局认知:
多模态指令微调 & 最新模型
| 模型 | 机构 | 亮点 |
|---|---|---|
| Qwen3.5-Omni | 阿里 Qwen | 原生全模态,端到端文本+视觉+音频 |
| Gemini 3.1 Pro | Google DeepMind | 百万 token 上下文,支持深度推理 |
| DeepSeek-V4 | DeepSeek | 高效百万 token 上下文推理 |
| InternVL-U | 上海 AI Lab | 统一理解和生成 |
| MiniCPM-o 4.5 | 面壁智能 | 端侧多模态,参数效率高 |
VITA 系列(交互式全模态)
- VITA-1.5(NeurIPS 2025 Highlight):对标 GPT-4o 级别的实时视觉+语音交互,支持实时对话而非回合制。
- VITA-Audio:高效语音-语言跨模态 token 生成,降低语音交互延迟。
MME 系列评测基准
| Benchmark | 特点 |
|---|---|
| Video-MME(CVPR 2025) | 首个全面视频理解评测基准 |
| Video-MME-v2(2026) | Video-MME 下一代,覆盖更长视频 |
| MME(NeurIPS 2025 DB Highlight) | 综合多维度评测 |
⚠️ 注意:各 benchmark 侧重点不同,选取评测基准时应根据自己模型的定位选择合适benchmark组合。
多模态思维链(CoT)
该板块收录了将思维链推理能力引入多模态场景的工作,涉及视觉推理、图文交织推理(interleaved image-text reasoning)等前沿方向。
论文阅读建议
合集中每篇论文都标注了发表 venue 和日期,阅读顺序建议:
- 先读综述类论文(Survey):建立领域框架,如 "A Survey on Multimodal Large Language Models"(NSR 2024)
- 再按子方向深入最新工作
- 重点关注有代码开源和有在线 Demo的论文,这些工作复现性更强
典型使用场景
| 场景 | 如何用这个仓库 |
|---|---|
| 调研多模态大模型最新进展 | 按目录找到对应子方向,按日期倒序浏览 |
| 选型(哪个模型更适合我的任务) | 对比各模型在 MME/Video-MME 等 benchmark 上的表现 |
| 找 benchmark | 直接去评测板块,对照 leaderboard |
| 找数据集 | 去"Datasets"板块,按预训练/微调/评测分类查找 |
| 写论文related work | 引用合集中的论文,系统性不漏重要工作 |
坑与注意
- 是合集不是代码库:不要期望有可以运行的代码,下载
README.md足矣。 - arXiv 论文时效性强:仓库更新依赖维护者人工收录,最新工作可能有几周到几个月的延迟。
- 中文社区项目收录较全:VITA、Qwen、InternVL 等国内工作的中文名称和中文资料收录较全,英文 awesome list 往往不如这份。
- 分支(Branch)利用:
Benchmarks分支存放 MME 系列 benchmark 专项内容,Unified分支存放统一多模态理解和生成方向的专项内容。 - Stars 数量不代表质量:MLLM 领域热度高,很多论文为了引流会在标题上做营销,建议结合 venue 和代码开源情况综合判断。
与同类对比
| 合集 | 规模 | 特色 | 更新频率 |
|---|---|---|---|
| 本仓库(NJU-MiG) | 17.9k Stars | VITA/MME 系列 benchmark,评测体系完整 | 高频 |
| awesome-multimodal-LLM | 中等 | 偏语言模型侧 | 中等 |
| Awesome-Vision-Language-Models | 中等 | 偏视觉-语言早期工作 | 低 |
本仓库的核心优势在于 benchmark 体系完整(MME 系列是学界公认基准)+ 中文团队维护对中国工作收录更全,是 MLLM 领域调研首选入口。
一句话推荐结论
调研多模态大语言模型最新进展,这份 17.9k Stars 的 NJU-MiG 合集是最值得收藏的单一入口——benchmark 体系完整、国内工作收录齐全、目录结构清晰,入门和科研都适用,比追 Twitter 碎片化信息效率高得多。