AIGC_Interview 是一个中文 AIGC(人工智能生成内容)领域求职百科全书,涵盖算法工程师、提示词工程师、产品经理等岗位的面经、必备基础知识、学习路径和资源索引。仓库以 Markdown 形式维护,持续更新,分类清晰,聚合了知乎、牛客、CSDN 等平台大量真实面试经验分享,是 AIGC 求职者的一站式参考资料。 ⚠️ 性质说明:这是一个资料整理型…
仓库攻略
16 篇 · 16 个项目 · RAG 检索增强 · Agent 智能体
Crawl4AI 是 GitHub Star 数最多的开源网页爬虫(75,960 ★,数据截至 20260817),专为将网页转化为 LLM 可直接消费的 Markdown 而设计。相比传统爬虫输出 HTML 碎片,Crawl4AI 输出结构清晰、噪音少、带引用标注的 Markdown,特别适合 RAG pipeline、Agent 数据摄取和大规模数据采集…
CodeGraphRAG 是一个面向多语言代码库的 AI 问答与编辑系统。它用 Treesitter 解析源码,构建代码结构知识图谱存入 Memgraph,再用自然语言驱动 Cypher 查询,实现代码问答、编辑和优化。整个流程对用户屏蔽了图数据库细节——只需一条 CLI 命令,就能把一个陌生仓库变成可对话的智能体。 核心思路:把代码当知识图谱来索引,而不是…
PAIRAG 是基于阿里云 PAI 平台的开源 Agentic RAG 框架,定位"5 分钟构建企业级 Agentic RAG 应用"。它不只是一个检索增强生成系统,而是一站式平台:知识库管理 + 多模态理解(图片/视频) + ReAct 智能体 + MCP 工具生态 + 任务规划 + 联网搜索 + TexttoSQL。 核心架构:FastAPI 后端 + …
OpenKnowledge(内部包名 @inkeep/openknowledge)是一个 AI 原生的 Markdown 编辑器,同时也是一个 LLM Wiki 工具。它的定位是"Notion meets VS Code"——既有 Notion 般的 WYSIWYG(所见即所得)编辑体验,又保留 VS Code 式的本地文件夹操作和 Markdown 文件本…
Context7 是由 Upstash 团队(推 Redis / Vector / QStash 的那家)开源并维护的「MCP 文档服务」。它把 GitHub 上常见开源库的 README、官方文档、版本说明抓取、解析、切片成一个可被 LLM 检索的索引,然后通过 Model Context Protocol(MCP)暴露给 Cursor、Claude Co…
FastGPT 是一个基于大语言模型的知识库问答与应用编排平台,提供完整的开箱即用能力:数据处理、RAG 检索、可视化 AI 工作流编排,让用户无需深度配置即可快速开发和部署复杂的问答系统。 它的核心定位是:企业级 RAG 应用平台,强调知识库管理与可视化流程编排的结合。相比单纯的知识库工具,FastGPT 多了工作流编排和 Agent 编排能力;相比纯 A…
RAG_Techniques 是一个专注于 RetrievalAugmented Generation(检索增强生成) 高级技术的开源教程仓库,由 Nir Diamant 维护。目前收录 42+ 个可运行的 Jupyter Notebook,覆盖从基础 RAG 到最新前沿技术的完整知识体系,每个技术都配有详细原理解析、代码实现和论文引用。截至 2026 年 …
Vane 是一个注重隐私的 AI 问答引擎,运行在你自己的硬件上。它结合了互联网搜索结果和本地 LLM(通过 Ollama)、云端模型(OpenAI、Claude、Gemini、Groq),给出带引用来源的精准答案,所有搜索记录完全本地保存。 类比来说,Vane 是一个可私有部署的 Perplexity,强调: 不把搜索数据交给第三方 支持本地模型(Olla…
Morphic 是一个带有生成式 UI 的 AI 驱动搜索引擎。用户输入查询,它调用 AI 搜索多源内容,实时流式返回带引用来源的答案,答案中的内容块(图片、网格、标题)以结构化组件实时渲染,而非普通 Markdown 文本。 核心特点:Grounded answers with cited sources + Generative UI(生成式界面)。 1…
Firecrawl 是一个面向 AI 的网页数据 API:给定 URL,爬取并转换为 LLM 可直接使用的干净 Markdown、JSON 或截图。它能处理 JavaScript 渲染的动态页面、反爬虫机制、代理轮换等"脏活",开发者只需调用 API 或装好 SDK 即可。开源,也可以直接用其托管服务(firecrawl.dev)。Stars 147k,周增…
PageIndex 是一个无向量、基于推理的 RAG(检索增强生成)引擎,由 Vectify AI 开发。其核心理念是:传统向量 RAG 依赖"语义相似度"做检索,但这不等于"真正相关"——尤其在金融报告、法律文书、医疗文献等高度专业化的长文档场景,"相似"和"相关"的差距尤为明显。 PageIndex 模拟人类阅读长文档的方式——先看目录,再顺着结构找答案…
PixelRAG 是一个基于视觉渲染的 RAG(检索增强生成)系统,核心思想:把文档(网页、PDF)渲染成截图切片(screenshot tiles),再对图片做向量检索,而不是解析 HTML 提取文本。传统 RAG 丢掉的表格、图表、排版信息,在 PixelRAG 里完整保留,读者模型可以直接"看"到原始视觉布局。 源自 Berkeley SkyLab、B…
txtai 是由 NeuML 维护的一个一体化 AI 框架,核心理念是把语义搜索、LLM 编排和工作流三大能力整合在同一个 Python 包里。 其核心组件是 Embeddings 数据库——本质上是一个融合了稀疏向量索引、密集向量索引、图网络和关系数据库的统一检索层。这使得 txtai 既能做传统向量检索,也能做 SQL 查询、主题建模、图分析。 架构图:…
RAGFlow 是 InfiniFlow 出品的开源 RAG(检索增强生成)引擎,主打"深度文档理解 + 融合上下文引擎",将 RAG 与 Agent 能力结合,让大模型拥有可解释、可控的私有知识库。 核心理念:高质量输入才有高质量输出——RAGFlow 花大量精力在文档解析和切片质量上,而不是简单地把文档切成固定块塞进向量数据库。它支持可视化切片、智能重排…
ScrapeGraphAI 是一个基于 LLM 的 Python 爬虫库,用自然语言描述你想提取什么,它就能自动搞定——无需写 CSS 选择器、XPath,也无需分析网页结构。它背后的设计逻辑是把网页 scraping 当作一个有向图(Graph)来执行:LLM 作为图节点之间的"路由器",决定如何遍历页面、提取什么数据。 简单说:你告诉它要什么,它用 LL…