Guides · organized/guides

仓库攻略

16 篇 · 16 个项目 · RAG 检索增强 · tom

EmbraceAGI/AIGC_Interview · 上手攻略
AIGC_Interview 是一个中文 AIGC(人工智能生成内容)领域求职百科全书,涵盖算法工程师、提示词工程师、产品经理等岗位的面经、必备基础知识、学习路径和资源索引。仓库以 Markdown 形式维护,持续更新,分类清晰,聚合了知乎、牛客、CSDN 等平台大量真实面试经验分享,是 AIGC 求职者的一站式参考资料。 ⚠️ 性质说明:这是一个资料整理型…
RAG 检索增强 EmbraceAGI/AIGC_Interview Stars 812 Tom 2026-08-23
unclecode/crawl4ai · 上手攻略
Crawl4AI 是 GitHub Star 数最多的开源网页爬虫(75,960 ★,数据截至 20260817),专为将网页转化为 LLM 可直接消费的 Markdown 而设计。相比传统爬虫输出 HTML 碎片,Crawl4AI 输出结构清晰、噪音少、带引用标注的 Markdown,特别适合 RAG pipeline、Agent 数据摄取和大规模数据采集…
RAG 检索增强 unclecode/crawl4ai Stars 75,960 Tom 2026-08-17
vitali87/code-graph-rag · 上手攻略
CodeGraphRAG 是一个面向多语言代码库的 AI 问答与编辑系统。它用 Treesitter 解析源码,构建代码结构知识图谱存入 Memgraph,再用自然语言驱动 Cypher 查询,实现代码问答、编辑和优化。整个流程对用户屏蔽了图数据库细节——只需一条 CLI 命令,就能把一个陌生仓库变成可对话的智能体。 核心思路:把代码当知识图谱来索引,而不是…
RAG 检索增强 vitali87/code-graph-rag Stars 4,779 Tom 2026-08-15
aigc-apps/PAI-RAG · 上手攻略
PAIRAG 是基于阿里云 PAI 平台的开源 Agentic RAG 框架,定位"5 分钟构建企业级 Agentic RAG 应用"。它不只是一个检索增强生成系统,而是一站式平台:知识库管理 + 多模态理解(图片/视频) + ReAct 智能体 + MCP 工具生态 + 任务规划 + 联网搜索 + TexttoSQL。 核心架构:FastAPI 后端 + …
RAG 检索增强 aigc-apps/PAI-RAG Stars 490 Tom 2026-08-13
RUC-NLPIR/FlashRAG · 上手攻略
FlashRAG 是中国人民大学 NLPIR 实验室开源的 RAG(检索增强生成)研究 Python 工具包,已被 WWW 2025 Resource Track 接收。 核心理念:RAG 研究门槛高——需要分别找数据集、实现各算法、搭评估流程,碎片化严重。FlashRAG 提供一站式解决方案:36 个预处理基准数据集 + 23 个 SOTA RAG 算法(…
RAG 检索增强 RUC-NLPIR/FlashRAG Stars 3,529 Tom 2026-08-10
inkeep/open-knowledge · 上手攻略
OpenKnowledge(内部包名 @inkeep/openknowledge)是一个 AI 原生的 Markdown 编辑器,同时也是一个 LLM Wiki 工具。它的定位是"Notion meets VS Code"——既有 Notion 般的 WYSIWYG(所见即所得)编辑体验,又保留 VS Code 式的本地文件夹操作和 Markdown 文件本…
RAG 检索增强 inkeep/open-knowledge Stars 3,239 Tom 2026-07-17
TideDra/zotero-arxiv-daily · 上手攻略
zoteroarxivdaily 是一个零成本、零安装的 arXiv 论文每日推荐工具,通过 fork 该 GitHub 仓库并配置 GitHub Actions,即可每天自动根据你 Zotero 书架中的论文主题,推荐当日新提交的 arXiv(及 bioRxiv、medRxiv)论文,生成带有 AI TL;DR 的邮件发送到你的邮箱。 整个流程跑在 Git…
RAG 检索增强 TideDra/zotero-arxiv-daily Stars 5,804 Tom 2026-07-14
wdcpclover/ai4paper · 上手攻略
AI4Paper 是一款面向科研人员的 Zotero 插件(XPI),也是配套的网页应用(app.ai4paper.pro)。它把 AI 能力深度嵌入 Zotero 阅读器,覆盖找文献 → 读文献 → 写综述的完整科研流程。 核心理念:「让天下没有难读的 Paper,让天下没有难做的科研」。所有 AI 功能都基于真实文献(RAG),答案可溯源到原始论文,不凭…
RAG 检索增强 wdcpclover/ai4paper Stars 3,020 Tom 2026-07-11
pathwaycom/llm-app · 上手攻略
Pathway llmapp 是一套开箱即用的 RAG(检索增强生成)与 AI 流水线云模板集合。它基于 Pathway Live Data Framework,核心解决"数据源实时变化 → RAG 系统如何及时感知并更新索引"这个问题。与传统 VectorDB(如 Pinecone、Milvus)需要独立 ETL 管道不同,Pathway 在内存中直接处理…
RAG 检索增强 pathwaycom/llm-app Stars 59,079 Tom 2026-07-10
PacktPublishing/LLM-Engineers-Handbook · 上手攻略
LLMEngineersHandbook 是 Packt 出版社配套 GitHub 仓库,支撑一本同名实战书籍(Amazon/ Packt 有售)。与其说是"仓库",不如说是一套完整的 LLM 工程最佳实践参考实现:覆盖数据采集、LLM 训练、RAG 搭建、AWS 生产部署、监控和评测全链路,配有可直接运行的 Python 代码和 ZenML 流水线。 解决…
RAG 检索增强 PacktPublishing/LLM-Engineers-Handbook Stars 5,235 Tom 2026-07-09
microsoft/graphrag · 上手攻略
GraphRAG 是微软研究院开源的模块化图结构 RAG 系统,旨在解决传统向量 RAG 无法处理的"全数据集级别的推理问题"。 传统 RAG 靠向量相似度检索,擅长"找相似片段",但对"这本小说里最核心的主题是什么"这类需要全局理解的问题力不从心——因为答案分散在大量段落中,向量召回永远只能覆盖局部。 GraphRAG 的核心思路:先用 LLM 将文档内容…
RAG 检索增强 microsoft/graphrag Stars 35,401 Tom 2026-07-09
VectifyAI/PageIndex · 上手攻略
PageIndex 是一个无向量、基于推理的 RAG(检索增强生成)引擎,由 Vectify AI 开发。其核心理念是:传统向量 RAG 依赖"语义相似度"做检索,但这不等于"真正相关"——尤其在金融报告、法律文书、医疗文献等高度专业化的长文档场景,"相似"和"相关"的差距尤为明显。 PageIndex 模拟人类阅读长文档的方式——先看目录,再顺着结构找答案…
RAG 检索增强 VectifyAI/PageIndex Stars 35,126 Tom 2026-07-08
StarTrail-org/PixelRAG · 上手攻略
PixelRAG 是一个基于视觉渲染的 RAG(检索增强生成)系统,核心思想:把文档(网页、PDF)渲染成截图切片(screenshot tiles),再对图片做向量检索,而不是解析 HTML 提取文本。传统 RAG 丢掉的表格、图表、排版信息,在 PixelRAG 里完整保留,读者模型可以直接"看"到原始视觉布局。 源自 Berkeley SkyLab、B…
RAG 检索增强 StarTrail-org/PixelRAG Stars 7,303 Tom 2026-07-08
neuml/txtai · 上手攻略
txtai 是由 NeuML 维护的一个一体化 AI 框架,核心理念是把语义搜索、LLM 编排和工作流三大能力整合在同一个 Python 包里。 其核心组件是 Embeddings 数据库——本质上是一个融合了稀疏向量索引、密集向量索引、图网络和关系数据库的统一检索层。这使得 txtai 既能做传统向量检索,也能做 SQL 查询、主题建模、图分析。 架构图:…
RAG 检索增强 neuml/txtai Stars 12,863 Tom 2026-07-08
infiniflow/ragflow · 上手攻略
RAGFlow 是 InfiniFlow 出品的开源 RAG(检索增强生成)引擎,主打"深度文档理解 + 融合上下文引擎",将 RAG 与 Agent 能力结合,让大模型拥有可解释、可控的私有知识库。 核心理念:高质量输入才有高质量输出——RAGFlow 花大量精力在文档解析和切片质量上,而不是简单地把文档切成固定块塞进向量数据库。它支持可视化切片、智能重排…
RAG 检索增强 infiniflow/ragflow Stars 88,637 Tom 2026-07-07
ScrapeGraphAI/Scrapegraph-ai · 上手攻略
ScrapeGraphAI 是一个基于 LLM 的 Python 爬虫库,用自然语言描述你想提取什么,它就能自动搞定——无需写 CSS 选择器、XPath,也无需分析网页结构。它背后的设计逻辑是把网页 scraping 当作一个有向图(Graph)来执行:LLM 作为图节点之间的"路由器",决定如何遍历页面、提取什么数据。 简单说:你告诉它要什么,它用 LL…
RAG 检索增强 ScrapeGraphAI/Scrapegraph-ai Stars 29,344 Tom 2026-07-07