hymie122/RAG-Survey · 上手攻略
- 仓库:hymie122/RAG-Survey
- 链接:https://github.com/hymie122/RAG-Survey
- 分类:RAG · 综述 · Awesome List
- 作者:Jay
- 更新:2026-08-21
是什么
RAG-Survey 是一个按体系分类的 RAG 论文Awesome 列表,对应论文 Retrieval-Augmented Generation for AI-Generated Content: A Survey(arXiv:2402.19473,2024 年 2 月,北大/北大深圳研究生院团队)。仓库按该论文提出的三层分类法,对 RAG 领域论文进行结构化整理,涵盖 RAG Foundations(基础方法)、RAG Enhancements(增强技术)、以及应用层相关工作。
这不是一个代码项目,而是一个持续更新的论文知识库,供 RAG 研究者和工程师快速了解领域全貌、定位相关工作。
解决什么问题
RAG(检索增强生成)领域论文爆炸式增长(2023-2026 年每周都有数十篇新论文),研究者面临两大痛点:
- 找不到方向:不知道某类问题已经有哪些方法、各自优缺点
- 分类困难:同一篇论文可能同时涉及 Retriever 优化、Generator 微调、Pipeline 自适应等多个维度,难以归类
RAG-Survey 通过论文自带的系统化分类体系,把 RAG 工作分成清晰的子类,解决论文定位和综述写作时的"论文去重/归类"问题。
快速上手
查看分类体系
仓库 README 直接展示了完整的分类树,从上到下分为三大层:
RAG Foundations(基础)
├── Query-based RAG # 以查询为驱动的检索(REALM、Self-RAG、REPLUG…)
├── Latent Representation-based RAG # 隐表示级融合(RAG、In-context RALM…)
├── Logit-based RAG # Logit 级融合(kNN-LM…)
└── Speculative RAG # 推测解码加速(REST、GPTCache…)
RAG Enhancements(增强)
├── Input Enhancement # 输入侧增强
│ ├── Query Transformations(查询变换:Query2doc、RQ-RAG…)
│ └── Data Augmentation(数据增强:LESS、Make-An-Audio…)
├── Retriever Enhancement # 检索器增强
│ ├── Recursive Retrieve(递归检索:RAT、ReAct、CoT…)
│ ├── Chunk Optimization(分块优化:RAPTOR、LlamaIndex…)
│ ├── Finetune Retriever(检索器微调:BGE M3、C-Pack…)
│ ├── Hybrid Retrieve(混合检索:Corrective RAG、Blended RAG…)
│ ├── Re-ranking(重排序:BERT Re-ranker…)
│ └── Retrieval Transformation(检索转换:FiD-light…)
├── Generator Enhancement # 生成器增强
│ ├── Prompt Engineering(提示工程)
│ ├── Decoding Tuning(解码调优)
│ └── Finetune Generator(生成器微调)
└── Result Enhancement # 结果增强
RAG Pipeline Enhancement(Pipeline 增强)
└── Adaptive Retrieval(自适应检索)
└── Rule-Based / Model-Based
定位目标论文
在对应的子类下,每篇论文都附有论文标题 + 链接(arXiv / ACL / NeurIPS / ICLR / DOI),可以直接点击跳转原文。
使用场景举例
- 想了解 Query 变换(HyDE、Query2doc)方向有哪些工作 → README → RAG Enhancements → Input Enhancement → Query Transformations
- 想找 RAG + 代码相关论文 → Query-based RAG 子类下有 DocPrompting、InferFix、ReACC 等
- 想找 RAG + 多模态(文生图/视频/3D)相关工作 → Latent Representation-based RAG 子类有 Re-Imager、KNN-Diffusion、Animate-A-Story 等
核心用法
论文阅读路径推荐
- 先读原论文:从 arXiv:2402.19473 开始,了解分类体系设计思路
- 按图索骥:README 中每张分类图(
RAG_Overview.jpg、RAG_Foundations.png、RAG_Enhancements.png)展示了分类树可视化版本 - 子类深挖:在感兴趣子类下,从引用量最高的论文(如 REALM、Self-RAG、ReAct)开始读,再追踪子类内其他工作
论文引用格式
论文引用格式如下:
@article{zhao2024retrieval,
title={Retrieval-Augmented Generation for AI-Generated Content: A Survey},
author={Zhao, Penghao and Zhang, Hailin and Yu, Qinhan and Wang, Zhengren
and Geng, Yunteng and Fu, Fangcheng and Yang, Ling
and Zhang, Wentao and Cui, Bin},
journal={arXiv preprint arXiv:2402.19473},
year={2024}
}
追踪最新 RAG 工作
仓库 README 声明会随论文更新而持续更新。建议定期浏览 GitHub 仓库的 commit 历史,或 watch 仓库获取更新通知。
典型适用场景
- 论文综述写作:快速定位某 RAG 子方向的全部相关工作,避免漏读关键文献
- 研究选题:了解某子类是否已拥挤(代码 RAG 已有大量工作)、某子类是否还有空白(3D RAG 应用相对较少)
- 系统设计参考:做 RAG 系统时,想了解有哪些 Retriever / Generator 增强手段可供选择
- 面试准备:按分类体系系统复习 RAG 各方向代表性工作
坑与注意
- 这是 Awesome 列表,不是代码库:RAG-Survey 本身不提供可运行的 RAG 系统代码,想搭系统请参考 LlamaIndex、LangChain 等框架
- 分类存在主观性:同一篇论文可能跨多个子类(如 Self-RAG 同时属于 Query-based RAG 和 Adaptive Retrieval),README 按论文原文的主要贡献归类,可能与你预期的分类不同
- arXiv 论文质量参差:列表收录了大量 arXiv 预印本,部分未经同行评审,引用时请注意区分已中顶会的论文
- GitHub 页面加载图片可能失败:分类图(
RAG_Overview.jpg等)为 GitHub 托管图片,国内网络可能无法直接加载,可通过 Raw URL 或代理访问 - 非实时更新:虽然 README 承诺持续更新,但具体更新频率未标注,重要新工作仍需结合 Papers With Code / arXiv Daily 等渠道追踪
与同类对比
| 仓库 | 类型 | 分类方式 | 适用场景 |
|---|---|---|---|
| hymie122/RAG-Survey | 论文列表 | 三层分类树(论文官方分类) | 综述/选题 |
| ragas/awesome-rag | 论文+工具 | 偏工程应用 | 落地参考 |
| p Missing 等 | 通用 awesome | 无明确分类体系 | 快速了解 |
| 本仓库 | 按论文原部分类 | 理论体系完整 | 学术研究 |
核心差异:RAG-Survey 的分类体系直接来自论文 [Zhao et al., 2024],有完整的层次结构和学术依据(Query-based / Latent / Logit / Speculative 四类基础方法 + 各增强维度),比大多数按"应用场景"粗分 Awesome 列表分类更细、体系更完整,适合严肃学术用途。
一句话推荐结论
做 RAG 方向的研究或综述时,先用 RAG-Survey 定位方向全貌——它的三层分类树是当前最完整的 RAG 论文知识地图,按图索骥比逐篇搜 arXiv 效率高得多;落地做系统则配合 LlamaIndex 等框架使用。
⚠️ 注意:这是论文列表不是代码库;arXiv 预印本未全部经同行评审;图片国内访问可能需代理;分类按论文原版归属,理解论文原文分类逻辑是正确使用的前提。