Guides · organized/guides

仓库攻略

24 篇 · 24 个项目 · 数据与向量库

josiah-nelson/eidos · 上手攻略
Eidos 是一个私有的、自托管的跨机器文件搜索系统,让你用"记忆"而非"路径"来搜索文件。它能同时索引工作站、笔记本、服务器、虚拟机(VM)、网络存储和压缩档案,从一个统一入口返回跨所有设备的搜索结果——无需记住"文件在哪台机器上"。 与普通桌面搜索(只能搜本机)、云盘搜索(只能搜云端内容)、向量搜索(丢失文件身份与位置)不同,Eidos 的核心思路是:先…
数据与向量库 josiah-nelson/eidos Stars 166 Jay 2026-08-25
t8y2/dbx · 上手攻略
DBX 是一个超轻量(~20 MB)的跨平台数据库客户端,支持 90+ 数据库,包括 MySQL、PostgreSQL、SQLite、Redis、MongoDB、DuckDB、ClickHouse、SQL Server、Elasticsearch、TiDB、OceanBase、GaussDB、Doris、StarRocks 等。零运行时依赖(无 Java、无…
数据与向量库 t8y2/dbx Stars 16,349 Jay 2026-08-25
Deodat-Lawson/LaunchStack · 上手攻略
LaunchStack 是一个TypeScript AI 原生应用引擎,内置文档摄取、OCR、RAG、知识图谱、LLM 抽象、后台任务等模块,配有一个 Next.js 参考应用演示完整接线方式。 核心定位是:让开发者把 AI 能力嵌入自己的应用时,不必从零组装 LangChain + PostgreSQL + 向量数据库 + 任务队列,而是直接用 Launc…
数据与向量库 Deodat-Lawson/LaunchStack Stars 885 Tom 2026-08-23
Avijit07x/claude-db · 上手攻略
claudedb 为 Claude Code 提供持久化记忆层,解决每次新会话都要重新解释代码库背景的痛点。它在本地记录你与 Claude 的对话历史、代码理解结论和项目决策,新会话时自动注入上下文,Claude 无需再靠"考古式 grep"自行推断。 核心思路:capture(记录)+ recall(回填)+ code graph(代码图),三轨并行运作。…
数据与向量库 Avijit07x/claude-db Stars 177 Tom 2026-08-22
vespa-engine/vespa · 上手攻略
Vespa 是 Yahoo(现 Verizon Media)开源的企业级 AI 搜索与推荐平台,定位并非单纯的向量数据库,而是将向量检索、全文搜索、结构化数据查询、分布式模型推理全部整合在单一分布式引擎内。用户无需组合 Elasticsearch + Milvus + 推理服务等多家基础设施,一套 Vespa 就能完成从数据索引到结果排序的全部工作。全球生产…
数据与向量库 vespa-engine/vespa Stars 7,046 Tom 2026-08-19
vanna-ai/vanna · 上手攻略
Vanna 是一个基于检索增强生成(RAG)的 TexttoSQL 开源框架,帮助开发者用自然语言查询 SQL 数据库。v2.0 是完全重写版本(与 v0.x 不兼容),核心定位从「RAG + LLM 生成 SQL」升级为「面向企业的用户感知型数据分析 Agent 平台」——每个组件都知道当前操作用户是谁,并自动做行级别权限过滤。 核心能力: Stars:约…
数据与向量库 vanna-ai/vanna Stars 23,820 Tom 2026-08-18
urschrei/pyzotero · 上手攻略
Pyzotero 是 Zotero API 的 Python 客户端,由 Zotero 社区维护,支持对个人库和团体库进行完整的增删改查操作。它提供 Python 库、CLI 工具和 MCP 服务器三种使用形态,适合需要将 Zotero 文献管理自动化接入 AI 工作流的用户。 uv add pyzotero pip install pyzotero con…
数据与向量库 urschrei/pyzotero Stars 1,388 Tom 2026-08-16
clidey/whodb · 上手攻略
WhoDB 是一个浏览器端数据库工作空间,支持探索数据库表结构、编辑数据、运行查询、理解 schema 关系图。它用 Docker 一行命令启动、自托管免费(Apache 2.0)、也提供桌面 App 和终端 CLI。对 AI 编程场景,它还内置了 Ollama / OpenAI / Anthropic / LM Studio 的自然语言查询能力——用英文提…
数据与向量库 clidey/whodb Stars 5,000 Tom 2026-08-10
xuchonglang/investing-for-beginners · 上手攻略
xuchonglang/investingforbeginners 是小隐寺投资百科的官方公开索引仓库,面向中文投资者,系统梳理了美股、期权与加密货币的完整知识框架。仓库不提供"买什么"的建议,而是帮助读者理解"自己正在买什么、风险来自哪里、投入资金前应该核对哪些信息"。 核心定位:用成熟且资料丰富的美股市场建立股票/ETF/财报/资产配置的基础框架,同时把…
数据与向量库 xuchonglang/investing-for-beginners Stars 3,228 Tom 2026-08-05
typedb/typedb · 上手攻略
TypeDB 是一个用 Rust 写成的下一代数据库,主打"为系统而生,而非为记录而生"。它用一个概念数据模型(conceptual data model)把关系型、文档型、图数据库的优势合并在一起,避免传统 RDBMS 里的对象关系阻抗不匹配(objectrelational mismatch)——也就是 Java/Python 程序员写业务时经常吐槽的"…
数据与向量库 typedb/typedb Stars 4,408 spark 2026-07-30
supervc-stack/VectorChord · 上手攻略
VectorChord(扩展名 vchord)是 PostgreSQL 上一款面向向量检索的扩展,由原 pgvecto.rs 团队(TensorChord)迭代而来。它把向量索引、Rerank 和量化压缩统一塞进 PG 里,目标是把"亿级向量表"和"普通业务表"放在同一套关系型基础设施上跑,不再引入额外的专用向量库。 它有几条主线卖点: 兼容 pgvecto…
数据与向量库 supervc-stack/VectorChord Stars 1,767 spark 2026-07-28
alibaba/zvec · 上手攻略
Zvec 是阿里巴巴通义实验室开源的进程内(inprocess)向量数据库,定位为"向量数据库领域的 SQLite"——直接以内嵌库的方式运行在你的应用程序中,无需部署独立的数据库服务进程。它基于阿里生产级 Proxima 向量检索引擎,支持稠密向量 + 稀疏向量 + 全文检索(FTS)混合检索,并内置 WAL 持久化、多进程并发读取等企业级特性。 当前版本…
数据与向量库 alibaba/zvec Stars 15,199 Tom 2026-07-19
withmarbleapp/os-taxonomy · 上手攻略
ostaxonomy(Marble Skill Taxonomy)是一个开放的小学阶段全科学习知识图谱,由教育科技公司 Marble 于 2025 年中开源发布。它把一个孩子小学期间(大约 5~12 岁)要学的内容拆成了 1,590 个极细粒度的「微主题」(microtopics),再通过 3,221 条有向无环图(DAG)边把它们串联起来——每条边标注了「…
数据与向量库 withmarbleapp/os-taxonomy Stars 3,947 Tom 2026-07-14
Canner/WrenAI · 上手攻略
Canner/WrenAI 是 开源 GenBI(Generative BI)引擎,核心能力是让 AI Agent 通过自然语言生成可信的 SQL 查询、可治理的业务仪表盘。它不是简单的 texttoSQL 工具——它通过一层开放 Context Layer(MDL 语义模型),把业务定义、数据血缘、查询记忆等「业务知识」注入 Agent 的推理过程,从根本…
数据与向量库 Canner/WrenAI Stars 17,219 Tom 2026-07-13
dolthub/dolt · 上手攻略
Dolt 是一个带版本控制的 SQL 数据库——把 Git 的协作模型带入了数据世界。你可以 fork、clone、branch、merge、push、pull 数据库表,就像对代码仓库操作一样。数据以 MySQL 兼容的 SQL 表形式存储,版本控制功能通过 SQL 内的系统表和存储过程暴露出来。 官方 slogan:"Git for Data"。 本质上…
数据与向量库 dolthub/dolt Stars 23,894 Tom 2026-07-13
Graphify-Labs/graphify · 上手攻略
Graphify 是一个让 AI 编程助手(Claude Code、Cursor、Codex 等)把任意代码仓库转化为可查询知识图谱的工具。本质是一个 Claude Code / AI Coding Agent 的 /graphify 技能(Skill):输入 /graphify .,它便将项目代码、文档、图片、视频全部映射为一张节点边图谱,之后你可以用自然…
数据与向量库 Graphify-Labs/graphify Stars 105,053 Jay 2026-07-12
simonlin1212/a-stock-data · 上手攻略
astockdata 是一个面向 AI 编程助手(Claude Code / OpenClaw / Codex)设计的 A 股全栈数据 Skill 文件,本质是一份结构化 Markdown 文档,内嵌全部可运行 Python 代码,可直接被 AI 读取并在对话中执行。 它解决的核心问题是:A股数据源极度分散——行情在通达信协议、研报在东财 PDF、资金流在另…
数据与向量库 simonlin1212/a-stock-data Stars 6,761 Tom 2026-07-11
siyuan-note/siyuan · 上手攻略
SiYuan(思源笔记)是一款隐私优先、可完全自托管的个人知识管理(PKM)软件,使用 TypeScript + Go 双语言开发,Stars 约 4.5 万,周增约 +14。它以「块(Block)」为最小数据单元,支持块级引用和双向链接(类似 Roam Research / Obsidian),采用 Markdown 所见即所得(WYSIWYG)编辑体验,…
数据与向量库 siyuan-note/siyuan Stars 45,719 Tom 2026-07-10
Snailclimb/JavaGuide · 上手攻略
JavaGuide 是 GitHub 上规模最大的 Java 后端面试知识库,涵盖 Java 基础、并发、JVM、数据库(MySQL/Redis/MongoDB)、计算机网络、操作系统、数据结构与算法、系统设计、常用框架(Spring/SpringBoot)等核心主题。除面试内容外,还包含 AI 应用开发指南(AIGuide 子仓库),覆盖 LLM、Agen…
数据与向量库 Snailclimb/JavaGuide Stars 157,677 Tom 2026-07-10
milvus-io/milvus · 上手攻略
Milvus 是一款高性能、云原生的向量数据库,专为大规模向量 ANN(近似最近邻)搜索场景设计。它能够存储十亿级向量,支持实时插入与查询,广泛用于 AI 应用中的语义搜索、图像检索、RAG(检索增强生成)等场景。 核心特点: 官方提供完全托管云服务 Zilliz Cloud。 1. 向量数据量大时搜索慢 — 传统数据库无法高效做向量相似度搜索,Milvus…
数据与向量库 milvus-io/milvus Stars 45,770 Jay 2026-07-10
awesomedata/awesome-public-datasets · 上手攻略
awesomepublicdatasets 是 GitHub 上规模最大、分类最齐全的高质量公开数据集精选列表。它以主题(Topic)为导向,将来自政府、科研机构、高校、企业的公开数据按领域逐一整理,涵盖农业、生物学、化学、气候、经济、教育、能源、地理信息、政府数据、医疗健康、图像处理、机器学习、自然语言、神经科学、物理、公共领域、社交网络、体育、交通等 3…
数据与向量库 awesomedata/awesome-public-datasets Stars 78,033 Jay 2026-07-09
chroma-core/chroma · 上手攻略
Chroma(GitHub: chromacore/chroma)是一个面向 AI 应用的开源向量数据库,用 Rust 编写,提供 Apache 2.0 许可证。它既是自托管可部署的开源版本,也有付费托管服务 Chroma Cloud。 Chroma 的核心理念是:让 AI 应用的向量存储和检索变得极简。官方口号是 "the opensource data …
数据与向量库 chroma-core/chroma Stars 29,012 Jay 2026-07-09
simplifaisoul/osiris · 上手攻略
osiris 是一个开源全球情报平台(OSINT Dashboard),自称「Palantir 替代方案」。它将实时航班追踪、监控摄像头网络(CCTV)、地震监测、冲突区地图和 24/7 新闻流聚合在一个 GPU 加速的界面中,由 Next.js 16 + MapLibre GL 驱动,全部数据通过 WebGL 渲染,目标是 60fps 性能下同时展示数千个…
数据与向量库 simplifaisoul/osiris Stars 6,693 Jay 2026-07-07
GoogleCloudPlatform/knowledge-catalog · 上手攻略
这个仓库有两层含义,需要先区分清楚: 第一层(仓库名): 仓库全名是 Google Cloud Knowledge Catalog(谷歌云知识目录),这是 GCP 的企业级数据目录服务(原名 Dataplex),提供动态知识图谱和元数据管理,为 AI Agent 提供语义上下文。 第二层(核心内容): 这个 GitHub 仓库的真正核心是 Open Know…
数据与向量库 GoogleCloudPlatform/knowledge-catalog Stars 5,915 Tom 2026-07-04