Guides · organized/guides

仓库攻略

11 篇 · 11 个项目 · RAG 检索增强 · 评测基准

hymie122/RAG-Survey · 上手攻略
RAGSurvey 是一个按体系分类的 RAG 论文Awesome 列表,对应论文 RetrievalAugmented Generation for AIGenerated Content: A Survey(arXiv:2402.19473,2024 年 2 月,北大/北大深圳研究生院团队)。仓库按该论文提出的三层分类法,对 RAG 领域论文进行结构化整…
RAG 检索增强 hymie122/RAG-Survey Stars 1,790 Jay 2026-08-21
aigc-apps/PAI-RAG · 上手攻略
PAIRAG 是基于阿里云 PAI 平台的开源 Agentic RAG 框架,定位"5 分钟构建企业级 Agentic RAG 应用"。它不只是一个检索增强生成系统,而是一站式平台:知识库管理 + 多模态理解(图片/视频) + ReAct 智能体 + MCP 工具生态 + 任务规划 + 联网搜索 + TexttoSQL。 核心架构:FastAPI 后端 + …
RAG 检索增强 aigc-apps/PAI-RAG Stars 490 Tom 2026-08-13
RUC-NLPIR/FlashRAG · 上手攻略
FlashRAG 是中国人民大学 NLPIR 实验室开源的 RAG(检索增强生成)研究 Python 工具包,已被 WWW 2025 Resource Track 接收。 核心理念:RAG 研究门槛高——需要分别找数据集、实现各算法、搭评估流程,碎片化严重。FlashRAG 提供一站式解决方案:36 个预处理基准数据集 + 23 个 SOTA RAG 算法(…
RAG 检索增强 RUC-NLPIR/FlashRAG Stars 3,529 Tom 2026-08-10
Weak-to-Strong GraphRAG:用 LLM 反馈对齐弱检索器 · 干货攻略
ReG(Refined Graphbased RAG)是一套针对图增强检索(RAG on Knowledge Graph)的框架,核心思路是用 LLM 的反馈信号来训练更好的图检索器,同时将检索结果重组为逻辑连贯的证据链。 论文标题全称:WeaktoStrong GraphRAG: Aligning Weak Retrievers with Large La…
RAG 检索增强 无(arXiv:2506.22518,暂无官方代码仓库) Jay 2026-07-16
NirDiamant/RAG_Techniques · 上手攻略
RAG_Techniques 是一个专注于 RetrievalAugmented Generation(检索增强生成) 高级技术的开源教程仓库,由 Nir Diamant 维护。目前收录 42+ 个可运行的 Jupyter Notebook,覆盖从基础 RAG 到最新前沿技术的完整知识体系,每个技术都配有详细原理解析、代码实现和论文引用。截至 2026 年 …
RAG 检索增强 NirDiamant/RAG_Techniques Stars 29,013 Jay 2026-07-12
safishamsi/graphify · 上手攻略
Graphify 是一款面向 AI 编程助手的代码知识图谱生成工具(code knowledge graph generator)。它的核心思路是:将任意代码仓库(Python、JavaScript、SQL、R、Shell 等)的代码结构转换为一张可查询的知识图谱,替代传统的 grep/全文搜索方式,让 AI 助手可以直接"问问题"获取精准的代码上下文。 形…
RAG 检索增强 safishamsi/graphify(现重定向至 Graphify-Labs/graphify) Jay 2026-07-11
PacktPublishing/LLM-Engineers-Handbook · 上手攻略
LLMEngineersHandbook 是 Packt 出版社配套 GitHub 仓库,支撑一本同名实战书籍(Amazon/ Packt 有售)。与其说是"仓库",不如说是一套完整的 LLM 工程最佳实践参考实现:覆盖数据采集、LLM 训练、RAG 搭建、AWS 生产部署、监控和评测全链路,配有可直接运行的 Python 代码和 ZenML 流水线。 解决…
RAG 检索增强 PacktPublishing/LLM-Engineers-Handbook Stars 5,235 Tom 2026-07-09
opendataloader-project/opendataloader-pdf · 上手攻略
OpenDataLoader PDF 是一个面向 AI 工作流的高性能 PDF 解析库,核心目标是:把 PDF 转换成 AI 模型可以直接使用的高质量结构化数据,同时提供 PDF 无障碍(accessibility)自动化能力。 两大核心功能: 1. AI 数据提取:从任意 PDF 提取 Markdown、JSON(含 bounding boxes)、HTM…
RAG 检索增强 opendataloader-project/opendataloader-pdf Stars 28,328 Jay 2026-07-09
VectifyAI/PageIndex · 上手攻略
PageIndex 是一个无向量、基于推理的 RAG(检索增强生成)引擎,由 Vectify AI 开发。其核心理念是:传统向量 RAG 依赖"语义相似度"做检索,但这不等于"真正相关"——尤其在金融报告、法律文书、医疗文献等高度专业化的长文档场景,"相似"和"相关"的差距尤为明显。 PageIndex 模拟人类阅读长文档的方式——先看目录,再顺着结构找答案…
RAG 检索增强 VectifyAI/PageIndex Stars 35,126 Tom 2026-07-08
StarTrail-org/PixelRAG · 上手攻略
PixelRAG 是一个基于视觉渲染的 RAG(检索增强生成)系统,核心思想:把文档(网页、PDF)渲染成截图切片(screenshot tiles),再对图片做向量检索,而不是解析 HTML 提取文本。传统 RAG 丢掉的表格、图表、排版信息,在 PixelRAG 里完整保留,读者模型可以直接"看"到原始视觉布局。 源自 Berkeley SkyLab、B…
RAG 检索增强 StarTrail-org/PixelRAG Stars 7,303 Tom 2026-07-08
neuml/txtai · 上手攻略
txtai 是由 NeuML 维护的一个一体化 AI 框架,核心理念是把语义搜索、LLM 编排和工作流三大能力整合在同一个 Python 包里。 其核心组件是 Embeddings 数据库——本质上是一个融合了稀疏向量索引、密集向量索引、图网络和关系数据库的统一检索层。这使得 txtai 既能做传统向量检索,也能做 SQL 查询、主题建模、图分析。 架构图:…
RAG 检索增强 neuml/txtai Stars 12,863 Tom 2026-07-08