Aivory 是一个自部署的 AI 对话与研究平台,将多模型聊天、代码执行、知识库检索、Deep Research 和团队协作整合在一个 Web 界面中。核心卖点是"多工具串联执行"——用户发一条指令,编排器可以在一次对话内自动完成搜索→抓取网页→运行 Python 分析数据→生成文件,最多 48 次工具调用跨越 12 轮模型循环,无需人工介入。⚠️ 公开 …
仓库攻略
42 篇 · 42 个项目 · RAG 检索增强
SAG(SQLRetrieval Augmented Generation)是 ZleapAI 提出的一种全新检索架构,不是对传统 dense RAG 和 GraphRAG 的缝合,而是用事件实体索引 + 查询时动态超边(hyperedge)的原生设计,在语义检索和关系推理上合二为一。 SAG 同时也是一个完整的知识库应用(桌面 + Docker 部署),支…
一句话定位:一个真正"在你浏览器里"跑 AI 的自托管搜索平台——单容器部署,AI 推理默认走 WebGPU + Wllama,零 API key、零外部依赖,是 Kagi/Perplexity 的开源、本地化替代品。 MiniSearch 是一个自托管 + 浏览器内推理的 AI 搜索平台,2026 年维护活跃。它的核心设计目标是:查询、检索、AI 总结都不…
LeanCTX(Lean Context 的缩写)是一个本地优先的 AI 编程代理上下文管理层,定位为"AI Value Gate"。它坐在你的 AI 编码工具和模型之间,决定代理读什么、压缩什么、记住什么、证明什么——并把 Token 消耗变成可测量的账本。 核心由三部分组成: 官方 slogan:Token savings are the receipt…
fastembedrs 是 Qdrant/fastembed(Python 版)的 Rust 实现,本地生成向量嵌入(vector embeddings)和重排序(reranking)的纯 Rust 库。无需网络请求、无 Python 依赖、无 Tokio 异步运行时,所有模型在本地通过 ONNX Runtime(via @pykeio/ort)执行。 ⚠️…
STAIR(STructure Aware Information Retriever)是 IBM Research 在 2026 年 9 月发表的一篇论文(arXiv:2609.03874)提出的检索系统,核心思路是: 用文档的目录(Table of Contents,ToC)替代传统的固定长度 chunk,作为 RAG 的检索单元。 现有 RAG 系统将…
ChromaFs 是 Mintlify 在 2026 年 3 月发布的一种虚拟文件系统(Virtual Filesystem)实现,它把 Chroma 向量数据库包装成 Agent 可用 ls、cat、grep、find、cd 等 UNIX 命令操作的"文件系统",从而替代传统的 naive RAG 方案。 核心洞察来自 Mintlify 工程师 Dens …
localrag 是一个纯本地运行的 RAG 应用,对接 Ollama 聊天模型和 Ollama/Hugging Face embedding 模型,实现文件摄入 → 向量索引 → 流式 RAG 问答的完整流程。所有数据(聊天、embedding、索引内容)完全不离开本机网络,适合对数据隐私有要求、不希望文档上传到第三方的团队或个人。 基于 Streamli…
dejavu 是一个本地、单二进制(Go 语言)、零 LLM/零 embedding 的「会话历史反向检索层」。它不记录未来,只索引过去——扫描 Claude Code、Codex、Cursor 等 21 款 AI 编程 agent 已经写到磁盘的会话历史(JSONL / SQLite 等),去重脱敏后建立倒排索引,让你(在任意 agent 里)能反查到「三…
Fess 是一款开源的、自托管的企业级搜索服务器,基于 OpenSearch 构建。通过浏览器管理界面配置,无需深入了解 OpenSearch 本身。内置爬虫支持网站、文件系统、数据库等多种数据源,支持全文检索、分面搜索、搜索建议、权限过滤等企业级功能。 本质上是「开源版 Google Search Appliance / Elasticsearch Sit…
AIGC_Interview 是一个中文 AIGC(人工智能生成内容)领域求职百科全书,涵盖算法工程师、提示词工程师、产品经理等岗位的面经、必备基础知识、学习路径和资源索引。仓库以 Markdown 形式维护,持续更新,分类清晰,聚合了知乎、牛客、CSDN 等平台大量真实面试经验分享,是 AIGC 求职者的一站式参考资料。 ⚠️ 性质说明:这是一个资料整理型…
bwiernik/zoteroshortdoi 是一个轻量级 Zotero 插件(XPI),只做一件事:自动从 CrossRef API 抓取期刊文章的 DOI,并通过 shortdoi.org 服务获取 shortDOI,同时对已存在的 DOI 做合法性校验并标记无效项。 它的功能面非常克制——没有 PDF 解析、没有翻译、没有 AI 摘要——但它解决的是…
RAGSurvey 是一个按体系分类的 RAG 论文Awesome 列表,对应论文 RetrievalAugmented Generation for AIGenerated Content: A Survey(arXiv:2402.19473,2024 年 2 月,北大/北大深圳研究生院团队)。仓库按该论文提出的三层分类法,对 RAG 领域论文进行结构化整…
Crawl4AI 是 GitHub Star 数最多的开源网页爬虫(75,960 ★,数据截至 20260817),专为将网页转化为 LLM 可直接消费的 Markdown 而设计。相比传统爬虫输出 HTML 碎片,Crawl4AI 输出结构清晰、噪音少、带引用标注的 Markdown,特别适合 RAG pipeline、Agent 数据摄取和大规模数据采集…
CodeGraphRAG 是一个面向多语言代码库的 AI 问答与编辑系统。它用 Treesitter 解析源码,构建代码结构知识图谱存入 Memgraph,再用自然语言驱动 Cypher 查询,实现代码问答、编辑和优化。整个流程对用户屏蔽了图数据库细节——只需一条 CLI 命令,就能把一个陌生仓库变成可对话的智能体。 核心思路:把代码当知识图谱来索引,而不是…
Open Paper 是一个研究文献管理工作台,定位为"读论文的 IDE"。核心功能是把 PDF 上传、AI 生成摘要、highlight 标注、AI 问答、跨文献综合、Zotero 同步全部收敛到一个 Web 应用里,AI 回答强制附带可点击溯源的精确引用(citationgrounded),并配套专门的 ResearchQA 基准 来量化回答质量。 读论…
PAIRAG 是基于阿里云 PAI 平台的开源 Agentic RAG 框架,定位"5 分钟构建企业级 Agentic RAG 应用"。它不只是一个检索增强生成系统,而是一站式平台:知识库管理 + 多模态理解(图片/视频) + ReAct 智能体 + MCP 工具生态 + 任务规划 + 联网搜索 + TexttoSQL。 核心架构:FastAPI 后端 + …
FlashRAG 是中国人民大学 NLPIR 实验室开源的 RAG(检索增强生成)研究 Python 工具包,已被 WWW 2025 Resource Track 接收。 核心理念:RAG 研究门槛高——需要分别找数据集、实现各算法、搭评估流程,碎片化严重。FlashRAG 提供一站式解决方案:36 个预处理基准数据集 + 23 个 SOTA RAG 算法(…
OpenKnowledge(内部包名 @inkeep/openknowledge)是一个 AI 原生的 Markdown 编辑器,同时也是一个 LLM Wiki 工具。它的定位是"Notion meets VS Code"——既有 Notion 般的 WYSIWYG(所见即所得)编辑体验,又保留 VS Code 式的本地文件夹操作和 Markdown 文件本…
llmtwincourse 是 Decoding AI Magazine(Paul Iusztin & Alex Vesa 团队)开源的免费工程课,目标是从零搭建一个能"模仿你写作风格"的生产级 LLM Twin —— 一套完整的端到端 LLM + RAG 系统,覆盖数据采集、CDC 同步、实时特征工程、SFT 微调、RAG 推理、Prompt 监控全部 6…
ReG(Refined Graphbased RAG)是一套针对图增强检索(RAG on Knowledge Graph)的框架,核心思路是用 LLM 的反馈信号来训练更好的图检索器,同时将检索结果重组为逻辑连贯的证据链。 论文标题全称:WeaktoStrong GraphRAG: Aligning Weak Retrievers with Large La…
zoteroarxivdaily 是一个零成本、零安装的 arXiv 论文每日推荐工具,通过 fork 该 GitHub 仓库并配置 GitHub Actions,即可每天自动根据你 Zotero 书架中的论文主题,推荐当日新提交的 arXiv(及 bioRxiv、medRxiv)论文,生成带有 AI TL;DR 的邮件发送到你的邮箱。 整个流程跑在 Git…
zoterogpt 是一个 Zotero 文献管理器的 AI 助手插件,让研究者在阅读 PDF 文献时直接用 GPT(gpt3.5turbo / gpt4)提问、摘要、搜索相关文献,所有交互都以内嵌弹窗形式在 Zotero 内完成,无需切换到 ChatGPT 或其他工具。 核心作者是 MuiseDestiny,基于 zoteroplugintemplate …
Context7 是由 Upstash 团队(推 Redis / Vector / QStash 的那家)开源并维护的「MCP 文档服务」。它把 GitHub 上常见开源库的 README、官方文档、版本说明抓取、解析、切片成一个可被 LLM 检索的索引,然后通过 Model Context Protocol(MCP)暴露给 Cursor、Claude Co…
Kotaemon 是一个开源的 RAG 文档问答 UI 工具,专注于为文档提供「聊天式问答」体验。它的目标是同时服务两类用户: 核心特点:干净的界面 + 混合检索 + 强引用展示 + 多模态文档支持。 有大量技术文档/论文/合同,想基于这些文档向 AI 提问 需要 AI 的回答有明确的文档来源引用,不能胡编 需要处理包含图表、表格、LaTeX 公式的复杂 P…
FastGPT 是一个基于大语言模型的知识库问答与应用编排平台,提供完整的开箱即用能力:数据处理、RAG 检索、可视化 AI 工作流编排,让用户无需深度配置即可快速开发和部署复杂的问答系统。 它的核心定位是:企业级 RAG 应用平台,强调知识库管理与可视化流程编排的结合。相比单纯的知识库工具,FastGPT 多了工作流编排和 Agent 编排能力;相比纯 A…
RAG_Techniques 是一个专注于 RetrievalAugmented Generation(检索增强生成) 高级技术的开源教程仓库,由 Nir Diamant 维护。目前收录 42+ 个可运行的 Jupyter Notebook,覆盖从基础 RAG 到最新前沿技术的完整知识体系,每个技术都配有详细原理解析、代码实现和论文引用。截至 2026 年 …
Vane 是一个注重隐私的 AI 问答引擎,运行在你自己的硬件上。它结合了互联网搜索结果和本地 LLM(通过 Ollama)、云端模型(OpenAI、Claude、Gemini、Groq),给出带引用来源的精准答案,所有搜索记录完全本地保存。 类比来说,Vane 是一个可私有部署的 Perplexity,强调: 不把搜索数据交给第三方 支持本地模型(Olla…
Graphify 是一款面向 AI 编程助手的代码知识图谱生成工具(code knowledge graph generator)。它的核心思路是:将任意代码仓库(Python、JavaScript、SQL、R、Shell 等)的代码结构转换为一张可查询的知识图谱,替代传统的 grep/全文搜索方式,让 AI 助手可以直接"问问题"获取精准的代码上下文。 形…
AI4Paper 是一款面向科研人员的 Zotero 插件(XPI),也是配套的网页应用(app.ai4paper.pro)。它把 AI 能力深度嵌入 Zotero 阅读器,覆盖找文献 → 读文献 → 写综述的完整科研流程。 核心理念:「让天下没有难读的 Paper,让天下没有难做的科研」。所有 AI 功能都基于真实文献(RAG),答案可溯源到原始论文,不凭…