Eidos 是一个私有的、自托管的跨机器文件搜索系统,让你用"记忆"而非"路径"来搜索文件。它能同时索引工作站、笔记本、服务器、虚拟机(VM)、网络存储和压缩档案,从一个统一入口返回跨所有设备的搜索结果——无需记住"文件在哪台机器上"。 与普通桌面搜索(只能搜本机)、云盘搜索(只能搜云端内容)、向量搜索(丢失文件身份与位置)不同,Eidos 的核心思路是:先…
仓库攻略
24 篇 · 24 个项目 · 数据与向量库
DBX 是一个超轻量(~20 MB)的跨平台数据库客户端,支持 90+ 数据库,包括 MySQL、PostgreSQL、SQLite、Redis、MongoDB、DuckDB、ClickHouse、SQL Server、Elasticsearch、TiDB、OceanBase、GaussDB、Doris、StarRocks 等。零运行时依赖(无 Java、无…
LaunchStack 是一个TypeScript AI 原生应用引擎,内置文档摄取、OCR、RAG、知识图谱、LLM 抽象、后台任务等模块,配有一个 Next.js 参考应用演示完整接线方式。 核心定位是:让开发者把 AI 能力嵌入自己的应用时,不必从零组装 LangChain + PostgreSQL + 向量数据库 + 任务队列,而是直接用 Launc…
claudedb 为 Claude Code 提供持久化记忆层,解决每次新会话都要重新解释代码库背景的痛点。它在本地记录你与 Claude 的对话历史、代码理解结论和项目决策,新会话时自动注入上下文,Claude 无需再靠"考古式 grep"自行推断。 核心思路:capture(记录)+ recall(回填)+ code graph(代码图),三轨并行运作。…
Vespa 是 Yahoo(现 Verizon Media)开源的企业级 AI 搜索与推荐平台,定位并非单纯的向量数据库,而是将向量检索、全文搜索、结构化数据查询、分布式模型推理全部整合在单一分布式引擎内。用户无需组合 Elasticsearch + Milvus + 推理服务等多家基础设施,一套 Vespa 就能完成从数据索引到结果排序的全部工作。全球生产…
Vanna 是一个基于检索增强生成(RAG)的 TexttoSQL 开源框架,帮助开发者用自然语言查询 SQL 数据库。v2.0 是完全重写版本(与 v0.x 不兼容),核心定位从「RAG + LLM 生成 SQL」升级为「面向企业的用户感知型数据分析 Agent 平台」——每个组件都知道当前操作用户是谁,并自动做行级别权限过滤。 核心能力: Stars:约…
Pyzotero 是 Zotero API 的 Python 客户端,由 Zotero 社区维护,支持对个人库和团体库进行完整的增删改查操作。它提供 Python 库、CLI 工具和 MCP 服务器三种使用形态,适合需要将 Zotero 文献管理自动化接入 AI 工作流的用户。 uv add pyzotero pip install pyzotero con…
WhoDB 是一个浏览器端数据库工作空间,支持探索数据库表结构、编辑数据、运行查询、理解 schema 关系图。它用 Docker 一行命令启动、自托管免费(Apache 2.0)、也提供桌面 App 和终端 CLI。对 AI 编程场景,它还内置了 Ollama / OpenAI / Anthropic / LM Studio 的自然语言查询能力——用英文提…
xuchonglang/investingforbeginners 是小隐寺投资百科的官方公开索引仓库,面向中文投资者,系统梳理了美股、期权与加密货币的完整知识框架。仓库不提供"买什么"的建议,而是帮助读者理解"自己正在买什么、风险来自哪里、投入资金前应该核对哪些信息"。 核心定位:用成熟且资料丰富的美股市场建立股票/ETF/财报/资产配置的基础框架,同时把…
TypeDB 是一个用 Rust 写成的下一代数据库,主打"为系统而生,而非为记录而生"。它用一个概念数据模型(conceptual data model)把关系型、文档型、图数据库的优势合并在一起,避免传统 RDBMS 里的对象关系阻抗不匹配(objectrelational mismatch)——也就是 Java/Python 程序员写业务时经常吐槽的"…
VectorChord(扩展名 vchord)是 PostgreSQL 上一款面向向量检索的扩展,由原 pgvecto.rs 团队(TensorChord)迭代而来。它把向量索引、Rerank 和量化压缩统一塞进 PG 里,目标是把"亿级向量表"和"普通业务表"放在同一套关系型基础设施上跑,不再引入额外的专用向量库。 它有几条主线卖点: 兼容 pgvecto…
Zvec 是阿里巴巴通义实验室开源的进程内(inprocess)向量数据库,定位为"向量数据库领域的 SQLite"——直接以内嵌库的方式运行在你的应用程序中,无需部署独立的数据库服务进程。它基于阿里生产级 Proxima 向量检索引擎,支持稠密向量 + 稀疏向量 + 全文检索(FTS)混合检索,并内置 WAL 持久化、多进程并发读取等企业级特性。 当前版本…
ostaxonomy(Marble Skill Taxonomy)是一个开放的小学阶段全科学习知识图谱,由教育科技公司 Marble 于 2025 年中开源发布。它把一个孩子小学期间(大约 5~12 岁)要学的内容拆成了 1,590 个极细粒度的「微主题」(microtopics),再通过 3,221 条有向无环图(DAG)边把它们串联起来——每条边标注了「…
Canner/WrenAI 是 开源 GenBI(Generative BI)引擎,核心能力是让 AI Agent 通过自然语言生成可信的 SQL 查询、可治理的业务仪表盘。它不是简单的 texttoSQL 工具——它通过一层开放 Context Layer(MDL 语义模型),把业务定义、数据血缘、查询记忆等「业务知识」注入 Agent 的推理过程,从根本…
Dolt 是一个带版本控制的 SQL 数据库——把 Git 的协作模型带入了数据世界。你可以 fork、clone、branch、merge、push、pull 数据库表,就像对代码仓库操作一样。数据以 MySQL 兼容的 SQL 表形式存储,版本控制功能通过 SQL 内的系统表和存储过程暴露出来。 官方 slogan:"Git for Data"。 本质上…
Graphify 是一个让 AI 编程助手(Claude Code、Cursor、Codex 等)把任意代码仓库转化为可查询知识图谱的工具。本质是一个 Claude Code / AI Coding Agent 的 /graphify 技能(Skill):输入 /graphify .,它便将项目代码、文档、图片、视频全部映射为一张节点边图谱,之后你可以用自然…
astockdata 是一个面向 AI 编程助手(Claude Code / OpenClaw / Codex)设计的 A 股全栈数据 Skill 文件,本质是一份结构化 Markdown 文档,内嵌全部可运行 Python 代码,可直接被 AI 读取并在对话中执行。 它解决的核心问题是:A股数据源极度分散——行情在通达信协议、研报在东财 PDF、资金流在另…
SiYuan(思源笔记)是一款隐私优先、可完全自托管的个人知识管理(PKM)软件,使用 TypeScript + Go 双语言开发,Stars 约 4.5 万,周增约 +14。它以「块(Block)」为最小数据单元,支持块级引用和双向链接(类似 Roam Research / Obsidian),采用 Markdown 所见即所得(WYSIWYG)编辑体验,…
JavaGuide 是 GitHub 上规模最大的 Java 后端面试知识库,涵盖 Java 基础、并发、JVM、数据库(MySQL/Redis/MongoDB)、计算机网络、操作系统、数据结构与算法、系统设计、常用框架(Spring/SpringBoot)等核心主题。除面试内容外,还包含 AI 应用开发指南(AIGuide 子仓库),覆盖 LLM、Agen…
Milvus 是一款高性能、云原生的向量数据库,专为大规模向量 ANN(近似最近邻)搜索场景设计。它能够存储十亿级向量,支持实时插入与查询,广泛用于 AI 应用中的语义搜索、图像检索、RAG(检索增强生成)等场景。 核心特点: 官方提供完全托管云服务 Zilliz Cloud。 1. 向量数据量大时搜索慢 — 传统数据库无法高效做向量相似度搜索,Milvus…
awesomepublicdatasets 是 GitHub 上规模最大、分类最齐全的高质量公开数据集精选列表。它以主题(Topic)为导向,将来自政府、科研机构、高校、企业的公开数据按领域逐一整理,涵盖农业、生物学、化学、气候、经济、教育、能源、地理信息、政府数据、医疗健康、图像处理、机器学习、自然语言、神经科学、物理、公共领域、社交网络、体育、交通等 3…
Chroma(GitHub: chromacore/chroma)是一个面向 AI 应用的开源向量数据库,用 Rust 编写,提供 Apache 2.0 许可证。它既是自托管可部署的开源版本,也有付费托管服务 Chroma Cloud。 Chroma 的核心理念是:让 AI 应用的向量存储和检索变得极简。官方口号是 "the opensource data …
osiris 是一个开源全球情报平台(OSINT Dashboard),自称「Palantir 替代方案」。它将实时航班追踪、监控摄像头网络(CCTV)、地震监测、冲突区地图和 24/7 新闻流聚合在一个 GPU 加速的界面中,由 Next.js 16 + MapLibre GL 驱动,全部数据通过 WebGL 渲染,目标是 60fps 性能下同时展示数千个…
这个仓库有两层含义,需要先区分清楚: 第一层(仓库名): 仓库全名是 Google Cloud Knowledge Catalog(谷歌云知识目录),这是 GCP 的企业级数据目录服务(原名 Dataplex),提供动态知识图谱和元数据管理,为 AI Agent 提供语义上下文。 第二层(核心内容): 这个 GitHub 仓库的真正核心是 Open Know…