LaunchStack 是一个TypeScript AI 原生应用引擎,内置文档摄取、OCR、RAG、知识图谱、LLM 抽象、后台任务等模块,配有一个 Next.js 参考应用演示完整接线方式。 核心定位是:让开发者把 AI 能力嵌入自己的应用时,不必从零组装 LangChain + PostgreSQL + 向量数据库 + 任务队列,而是直接用 Launc…
仓库攻略
12 篇 · 12 个项目 · 数据与向量库 · LLM 基础设施
Vespa 是 Yahoo(现 Verizon Media)开源的企业级 AI 搜索与推荐平台,定位并非单纯的向量数据库,而是将向量检索、全文搜索、结构化数据查询、分布式模型推理全部整合在单一分布式引擎内。用户无需组合 Elasticsearch + Milvus + 推理服务等多家基础设施,一套 Vespa 就能完成从数据索引到结果排序的全部工作。全球生产…
Vanna 是一个基于检索增强生成(RAG)的 TexttoSQL 开源框架,帮助开发者用自然语言查询 SQL 数据库。v2.0 是完全重写版本(与 v0.x 不兼容),核心定位从「RAG + LLM 生成 SQL」升级为「面向企业的用户感知型数据分析 Agent 平台」——每个组件都知道当前操作用户是谁,并自动做行级别权限过滤。 核心能力: Stars:约…
WhoDB 是一个浏览器端数据库工作空间,支持探索数据库表结构、编辑数据、运行查询、理解 schema 关系图。它用 Docker 一行命令启动、自托管免费(Apache 2.0)、也提供桌面 App 和终端 CLI。对 AI 编程场景,它还内置了 Ollama / OpenAI / Anthropic / LM Studio 的自然语言查询能力——用英文提…
TypeDB 是一个用 Rust 写成的下一代数据库,主打"为系统而生,而非为记录而生"。它用一个概念数据模型(conceptual data model)把关系型、文档型、图数据库的优势合并在一起,避免传统 RDBMS 里的对象关系阻抗不匹配(objectrelational mismatch)——也就是 Java/Python 程序员写业务时经常吐槽的"…
VectorChord(扩展名 vchord)是 PostgreSQL 上一款面向向量检索的扩展,由原 pgvecto.rs 团队(TensorChord)迭代而来。它把向量索引、Rerank 和量化压缩统一塞进 PG 里,目标是把"亿级向量表"和"普通业务表"放在同一套关系型基础设施上跑,不再引入额外的专用向量库。 它有几条主线卖点: 兼容 pgvecto…
Zvec 是阿里巴巴通义实验室开源的进程内(inprocess)向量数据库,定位为"向量数据库领域的 SQLite"——直接以内嵌库的方式运行在你的应用程序中,无需部署独立的数据库服务进程。它基于阿里生产级 Proxima 向量检索引擎,支持稠密向量 + 稀疏向量 + 全文检索(FTS)混合检索,并内置 WAL 持久化、多进程并发读取等企业级特性。 当前版本…
Canner/WrenAI 是 开源 GenBI(Generative BI)引擎,核心能力是让 AI Agent 通过自然语言生成可信的 SQL 查询、可治理的业务仪表盘。它不是简单的 texttoSQL 工具——它通过一层开放 Context Layer(MDL 语义模型),把业务定义、数据血缘、查询记忆等「业务知识」注入 Agent 的推理过程,从根本…
Graphify 是一个让 AI 编程助手(Claude Code、Cursor、Codex 等)把任意代码仓库转化为可查询知识图谱的工具。本质是一个 Claude Code / AI Coding Agent 的 /graphify 技能(Skill):输入 /graphify .,它便将项目代码、文档、图片、视频全部映射为一张节点边图谱,之后你可以用自然…
Milvus 是一款高性能、云原生的向量数据库,专为大规模向量 ANN(近似最近邻)搜索场景设计。它能够存储十亿级向量,支持实时插入与查询,广泛用于 AI 应用中的语义搜索、图像检索、RAG(检索增强生成)等场景。 核心特点: 官方提供完全托管云服务 Zilliz Cloud。 1. 向量数据量大时搜索慢 — 传统数据库无法高效做向量相似度搜索,Milvus…
Chroma(GitHub: chromacore/chroma)是一个面向 AI 应用的开源向量数据库,用 Rust 编写,提供 Apache 2.0 许可证。它既是自托管可部署的开源版本,也有付费托管服务 Chroma Cloud。 Chroma 的核心理念是:让 AI 应用的向量存储和检索变得极简。官方口号是 "the opensource data …
这个仓库有两层含义,需要先区分清楚: 第一层(仓库名): 仓库全名是 Google Cloud Knowledge Catalog(谷歌云知识目录),这是 GCP 的企业级数据目录服务(原名 Dataplex),提供动态知识图谱和元数据管理,为 AI Agent 提供语义上下文。 第二层(核心内容): 这个 GitHub 仓库的真正核心是 Open Know…