研究库 实战攻略
Guides · organized/guides

仓库攻略

42 篇 · 42 个项目 · RAG 检索增强

pathwaycom/llm-app · 上手攻略
Pathway llmapp 是一套开箱即用的 RAG(检索增强生成)与 AI 流水线云模板集合。它基于 Pathway Live Data Framework,核心解决"数据源实时变化 → RAG 系统如何及时感知并更新索引"这个问题。与传统 VectorDB(如 Pinecone、Milvus)需要独立 ETL 管道不同,Pathway 在内存中直接处理…
RAG 检索增强 pathwaycom/llm-app Stars 59,079 Tom 2026-07-10
miurla/morphic · 上手攻略
Morphic 是一个带有生成式 UI 的 AI 驱动搜索引擎。用户输入查询,它调用 AI 搜索多源内容,实时流式返回带引用来源的答案,答案中的内容块(图片、网格、标题)以结构化组件实时渲染,而非普通 Markdown 文本。 核心特点:Grounded answers with cited sources + Generative UI(生成式界面)。 1…
RAG 检索增强 miurla/morphic Stars 9,035 Jay 2026-07-10
PacktPublishing/LLM-Engineers-Handbook · 上手攻略
LLMEngineersHandbook 是 Packt 出版社配套 GitHub 仓库,支撑一本同名实战书籍(Amazon/ Packt 有售)。与其说是"仓库",不如说是一套完整的 LLM 工程最佳实践参考实现:覆盖数据采集、LLM 训练、RAG 搭建、AWS 生产部署、监控和评测全链路,配有可直接运行的 Python 代码和 ZenML 流水线。 解决…
RAG 检索增强 PacktPublishing/LLM-Engineers-Handbook Stars 5,235 Tom 2026-07-09
opendataloader-project/opendataloader-pdf · 上手攻略
OpenDataLoader PDF 是一个面向 AI 工作流的高性能 PDF 解析库,核心目标是:把 PDF 转换成 AI 模型可以直接使用的高质量结构化数据,同时提供 PDF 无障碍(accessibility)自动化能力。 两大核心功能: 1. AI 数据提取:从任意 PDF 提取 Markdown、JSON(含 bounding boxes)、HTM…
RAG 检索增强 opendataloader-project/opendataloader-pdf Stars 28,877 Jay 2026-07-09
microsoft/graphrag · 上手攻略
GraphRAG 是微软研究院开源的模块化图结构 RAG 系统,旨在解决传统向量 RAG 无法处理的"全数据集级别的推理问题"。 传统 RAG 靠向量相似度检索,擅长"找相似片段",但对"这本小说里最核心的主题是什么"这类需要全局理解的问题力不从心——因为答案分散在大量段落中,向量召回永远只能覆盖局部。 GraphRAG 的核心思路:先用 LLM 将文档内容…
RAG 检索增强 microsoft/graphrag Stars 35,401 Tom 2026-07-09
firecrawl/firecrawl · 上手攻略
Firecrawl 是一个面向 AI 的网页数据 API:给定 URL,爬取并转换为 LLM 可直接使用的干净 Markdown、JSON 或截图。它能处理 JavaScript 渲染的动态页面、反爬虫机制、代理轮换等"脏活",开发者只需调用 API 或装好 SDK 即可。开源,也可以直接用其托管服务(firecrawl.dev)。Stars 147k,周增…
RAG 检索增强 firecrawl/firecrawl Stars 165,271 Jay 2026-07-08
VectifyAI/PageIndex · 上手攻略
PageIndex 是一个无向量、基于推理的 RAG(检索增强生成)引擎,由 Vectify AI 开发。其核心理念是:传统向量 RAG 依赖"语义相似度"做检索,但这不等于"真正相关"——尤其在金融报告、法律文书、医疗文献等高度专业化的长文档场景,"相似"和"相关"的差距尤为明显。 PageIndex 模拟人类阅读长文档的方式——先看目录,再顺着结构找答案…
RAG 检索增强 VectifyAI/PageIndex Stars 35,126 Tom 2026-07-08
StarTrail-org/PixelRAG · 上手攻略
PixelRAG 是一个基于视觉渲染的 RAG(检索增强生成)系统,核心思想:把文档(网页、PDF)渲染成截图切片(screenshot tiles),再对图片做向量检索,而不是解析 HTML 提取文本。传统 RAG 丢掉的表格、图表、排版信息,在 PixelRAG 里完整保留,读者模型可以直接"看"到原始视觉布局。 源自 Berkeley SkyLab、B…
RAG 检索增强 StarTrail-org/PixelRAG Stars 7,303 Tom 2026-07-08
neuml/txtai · 上手攻略
txtai 是由 NeuML 维护的一个一体化 AI 框架,核心理念是把语义搜索、LLM 编排和工作流三大能力整合在同一个 Python 包里。 其核心组件是 Embeddings 数据库——本质上是一个融合了稀疏向量索引、密集向量索引、图网络和关系数据库的统一检索层。这使得 txtai 既能做传统向量检索,也能做 SQL 查询、主题建模、图分析。 架构图:…
RAG 检索增强 neuml/txtai Stars 12,994 Tom 2026-07-08
infiniflow/ragflow · 上手攻略
RAGFlow 是 InfiniFlow 出品的开源 RAG(检索增强生成)引擎,主打"深度文档理解 + 融合上下文引擎",将 RAG 与 Agent 能力结合,让大模型拥有可解释、可控的私有知识库。 核心理念:高质量输入才有高质量输出——RAGFlow 花大量精力在文档解析和切片质量上,而不是简单地把文档切成固定块塞进向量数据库。它支持可视化切片、智能重排…
RAG 检索增强 infiniflow/ragflow Stars 91,455 Tom 2026-07-07
ScrapeGraphAI/Scrapegraph-ai · 上手攻略
ScrapeGraphAI 是一个基于 LLM 的 Python 爬虫库,用自然语言描述你想提取什么,它就能自动搞定——无需写 CSS 选择器、XPath,也无需分析网页结构。它背后的设计逻辑是把网页 scraping 当作一个有向图(Graph)来执行:LLM 作为图节点之间的"路由器",决定如何遍历页面、提取什么数据。 简单说:你告诉它要什么,它用 LL…
RAG 检索增强 ScrapeGraphAI/Scrapegraph-ai Stars 29,344 Tom 2026-07-07
HKUDS/LightRAG · 上手攻略
LightRAG 是香港大学数据科学实验室(HKUDS)发布的轻量级知识图谱增强检索框架,发表在 EMNLP 2025。它采用双层(向量 + 知识图谱)架构,兼顾检索的全面性与语义深度,是 Microsoft GraphRAG 的高效替代方案。 核心思想:在索引阶段利用 LLM 从文档中提取实体和关系,构建知识图谱(KG),同时保留向量嵌入;查询时通过 lo…
RAG 检索增强 HKUDS/LightRAG Stars 39,859 Jay 2026-07-06