Deep Lake 是 AI 数据运行时(AI Data Runtime),由 Activeloop 提供。其核心定位是:专为 AI 应用设计的多模态数据库,同时支持向量检索、数据版本控制和多模态原始数据存储。 与只存 embedding 的向量数据库不同,Deep Lake 可以存任意类型的原始数据——图片、视频、音频、PDF、文本、embedding 向…
仓库攻略
338 篇 · 334 个项目 · RAG 检索增强
txtai 是由 NeuML 维护的一个一体化 AI 框架,核心理念是把语义搜索、LLM 编排和工作流三大能力整合在同一个 Python 包里。 其核心组件是 Embeddings 数据库——本质上是一个融合了稀疏向量索引、密集向量索引、图网络和关系数据库的统一检索层。这使得 txtai 既能做传统向量检索,也能做 SQL 查询、主题建模、图分析。 架构图:…
OpenWiki 是 LangChain 团队开源的 CLI 工具,专门用于为代码库自动编写和维护文档。核心理念是:让 AI 编程 Agent(Claude Code、Codex、Cursor 等)在工作时能查阅结构化文档,而不是靠记忆或大海捞针式的全库搜索。 安装后只需一条命令,OpenWiki 就会扫描代码库,生成 openwiki/ 目录下的 Mark…
DeepTutor 是一个Agent 原生的个性化辅导系统,由香港大学数字智能系统实验室(HKUDS)开发,定位是让 AI tutor 真正介入学习过程、而非仅仅回答问题。它在 2025 年初的 arXiv 论文(arXiv:2604.26962)中被提出,当前最新版本为 v1.5.0(2026.7.4),处于活跃开发状态。 核心设计哲学:学习不是问答,而是…
内容待复核
ComposioHQ/awesome-claude-skills · 上手攻略
DeepTutor 是一个Agent 原生的个性化辅导系统,由香港大学数字智能系统实验室(HKUDS)开发,定位是让 AI tutor 真正介入学习过程、而非仅仅回答问题。它在 2025 年初的 arXiv 论文(arXiv:2604.26962)中被提出,当前最新版本为 v1.5.0(2026.7.4),处于活跃开发状态。 核心设计哲学:学习不是问答,而是…
CAMEL(camelai/camel)是首个专注多 Agent 系统研究的开源框架,自称"Finding the Scaling Law of Agents"。它不是单 Agent 工具,而是一个用于构建、运行和分析大规模多 Agent 系统的平台级框架,官方定位是研究框架,支持模拟最多 100 万个 Agent 同时运行。CAMEL 背后是一个 100+…
AnythingLLM 是一个本地优先的 AllinOne AI 应用平台,用 MIT 许可证开源(JavaScript),Stars 62,686,周增 +322,已达生产就绪级别。它让用户无需重复"租用 AI 智能"——在自己的服务器或电脑上,连接任意 LLM(本地或云端),管理知识库、操作 AI Agent、构建自动化工作流。 核心定位:私有化部署的 …
RAGFlow 是 InfiniFlow 出品的开源 RAG(检索增强生成)引擎,主打"深度文档理解 + 融合上下文引擎",将 RAG 与 Agent 能力结合,让大模型拥有可解释、可控的私有知识库。 核心理念:高质量输入才有高质量输出——RAGFlow 花大量精力在文档解析和切片质量上,而不是简单地把文档切成固定块塞进向量数据库。它支持可视化切片、智能重排…
ScrapeGraphAI 是一个基于 LLM 的 Python 爬虫库,用自然语言描述你想提取什么,它就能自动搞定——无需写 CSS 选择器、XPath,也无需分析网页结构。它背后的设计逻辑是把网页 scraping 当作一个有向图(Graph)来执行:LLM 作为图节点之间的"路由器",决定如何遍历页面、提取什么数据。 简单说:你告诉它要什么,它用 LL…
Mem0(发音 "memzero")是为大语言模型应用设计的通用记忆层,让 AI 记住用户偏好、对话历史和个人习惯,从而实现真正的个性化交互。与直接把历史对话塞进上下文不同,Mem0 会用 LLM 提取、理解和组织记忆,实现自我改进的长期记忆。 核心理念:Addonly(只新增,不覆盖)——记忆不断累积,Mem0 在检索时自动融合时间感知、实体链接和混合信号…
PaddleOCR 是百度飞桨(PaddlePaddle)团队开源的多功能 OCR 与文档解析工具包,GitHub Stars 超 8.4 万,被 Dify、RAGFlow、Cherry Studio 等主流项目深度集成。它不只是一套光学字符识别引擎,更是一个覆盖"图片→结构化数据"完整流程的文档 AI 基础设施。 当前稳定版本为 PaddleOCR 3.6…
500 AI Agents Projects 是一个精选的跨行业 AI Agent 用例合集,收录 500+ 生产级 AI Agent 项目案例,覆盖医疗、金融、教育、零售、网络安全、物流等 20+ 行业,展示 AI Agent 如何重塑各行各业。 每个案例均提供GitHub 开源项目链接,可直接克隆运行。仓库同时整理了主流 Agent 框架(LangGra…
awesomellmapps 是一个可运行的 AI Agent 与 RAG 应用模板集合,目前收录 100+ 完整可跑的应用示例,涵盖 AI Agent、多 Agent 协作、Alwayson 代理、语音 Agent、MCP 协议、RAG、生成式 UI 等现代 AI 栈的主流方向。 它的定位介于「awesome 榜单」和「完整课程」之间:每一个模板都是独立可…
LangChain 是目前最主流的 Agent 工程框架,为构建 LLM 应用提供标准化的组件抽象——模型接口、工具(Tools)、向量存储(Vector Store)、检索器(Retriever)等。2024–2025 年 LangChain 团队将产品线拆分为多个专注子库:主库 LangChain(底层组件)、LangGraph(复杂流程编排)、Deep…
DeerFlow(Deep Exploration and Efficient Research Flow)是字节跳动开源的 Super Agent Harness,于 2026 年 2 月 28 日凭借 2.0 重写版本登上 GitHub Trending 第 1 名。它将 SubAgent、Memory(记忆)、Sandbox(沙盒)和可扩展 Skill…
微软官方推出的 AI Agent 入门课程,以 Jupyter Notebook + 视频的形式,覆盖从 AI Agent 基础概念到生产部署的完整学习路径。官方定位是"12 节课入门 AI Agent 构建",实际内容已扩展至 18 节以上,涵盖设计模式、工具调用、Agentic RAG、多 Agent 协作、元认知、上下文工程、Agentic Memor…
LangGraph 是 LangChain 团队出品的状态化 Agent 编排框架(orchestration framework),用于构建、运行和管理"长时间运行、有状态"的多步骤 AI Agent 工作流。底层受 Google Pregel 和 Apache Beam 启发,接口设计参考了 NetworkX;用纯 Python 开发,License 为…
claudemem 是给 AI 编码 Agent 用的跨会话持久记忆系统,解决 AI Agent 的"失忆症"问题:每次开新会话,Agent 对之前做了什么一无所知——之前的 bug 修法、踩过的坑、项目结构,一概重新学起。 它的原理是:在会话过程中自动捕获 Agent 的所有操作、工具调用和观察结果,用 AI 压缩后存入本地数据库(SQLite + Chr…
Ruflo(原名 Claude Flow)是一个 Agent 元编排框架(metaharness)。它的核心理念一句话:Agent = Model + Harness——模型负责写作,框架负责给它配上工具、记忆、循环、沙箱和控制机制。Ruflo 就是这个框架层。 它运行在 Claude Code 和 Codex 之上,通过 npx ruflo init 一次…
LightRAG 是香港大学数据科学实验室(HKUDS)发布的轻量级知识图谱增强检索框架,发表在 EMNLP 2025。它采用双层(向量 + 知识图谱)架构,兼顾检索的全面性与语义深度,是 Microsoft GraphRAG 的高效替代方案。 核心思想:在索引阶段利用 LLM 从文档中提取实体和关系,构建知识图谱(KG),同时保留向量嵌入;查询时通过 lo…
UnlimitedOCR 是百度开源的多模态文档解析模型,定位是「一键长文档解析」——单张图片、PDF 多页、整本手册均可一次性处理,输出结构化文本。发布于 2026 年 6 月,arXiv 论文编号 2606.23050。 官方将其定位为对 DeepSeekOCR 的进一步推进,核心能力: 传统 OCR + NLP 管道有三个常见痛点: 1. 多步骤串联:…
learnclaudecode 是一个从 0 到 1 构建类 Claude Code 的 Agent Harness(智能体操控层)的完整学习项目。Stars 69,893,MIT 许可,Python 语言。 它的核心哲学一句话概括:「Bash is all you need」—— 一个 Bash 工具、一个 Agent Loop、一个模型,就是一个完整 A…
liyupi/aiguide(程序员鱼皮的 AI 知识库)是目前中文领域最系统的 Vibe Coding 零基础入门教程,完全免费开源,GitHub Stars 16.6k,仓库累计 130+ 篇文章。它不是传统意义的"工具",而是一个持续更新的知识平台,覆盖从 AI 编程入门到产品变现的完整路径。 教程作者"程序员鱼皮"是 B 站 up 主(空间粉丝众多)…
Open WebUI 是一个可扩展、功能丰富、用户友好的自托管 AI 交互界面。它的核心目标是让你完全离线运行自己的 AI 界面,同时支持连接任意 OpenAI API 兼容的模型(包括本地 Ollama、私有化部署的 vLLM、LM Studio 等)。 用一张图来理解它的位置: 用户浏览器 ←→ Open WebUI ←→ Ollama / OpenAI…
freellmapiresources 是一个持续更新的免费 LLM API 资源清单,收录了提供免费额度或试用积分的 LLM API 服务商,帮助开发者在不花一分钱的情况下接入大语言模型能力。 仓库本质上是一份结构化的资源目录,按免费程度分为两大类: 真正免费(无需付费即可使用) 有试用积分(注册送额度,用完需充值) 维护者通过脚本自动拉取各平台的模型列表…
obsidianskills 是由 kepano(Obsidian 核心插件开发者)维护的 Agent Skills 集合,让 AI 编程助手(Claude Code、Codex、OpenCode 等)能够理解并操作 Obsidian 的专有格式。遵循 Agent Skills 规范,以 .claude/skills/ 目录结构 + SKILL.md 元数据…
helloagents(全称《从零开始构建智能体》)是 Datawhale 社区开源的系统性 AI Agent 学习教程,_stars 33K+,周增 +658_。项目覆盖从"智能体"概念溯源到完整多智能体系统构建的全链路,配套开源书籍、代码仓库、视频课程(陆续放出),完全免费。 教程的核心主张:两派 Agent——流程驱动的低代码平台(Coze/Dify/…
MaxKB = Max Knowledge Brain,是一款开箱即用的企业级智能体平台,核心定位是让企业无需深厚 AI 技术背景,也能快速搭建私有化知识库问答、智能客服、复杂流程自动化 Agent。 它整合了 RAG(检索增强生成)管道、工作流引擎、MCP(Model Context Protocol)工具调用三大能力,同时支持国内外数十种大模型(Deep…
Headroom 是一个上下文压缩层(context compression layer),运行在 AI 编码助手和 LLM 提供商之间,把 tool 输出、日志、文件内容、RAG 检索结果、对话历史等压缩后再发给 LLM,Token 减少 60–95%,答案质量基本不变。 它的核心定位是:在你不动代码的前提下,给任何 AI 编码助手省 Token。支持三种…
这个仓库有两层含义,需要先区分清楚: 第一层(仓库名): 仓库全名是 Google Cloud Knowledge Catalog(谷歌云知识目录),这是 GCP 的企业级数据目录服务(原名 Dataplex),提供动态知识图谱和元数据管理,为 AI Agent 提供语义上下文。 第二层(核心内容): 这个 GitHub 仓库的真正核心是 Open Know…