研究库 实战攻略
Guides · organized/guides

仓库攻略

33 篇 · 33 个项目 · 数据与向量库

CAPCOM-TD-OSS/REDox · 上手攻略
RE:Dox 是卡普空技术研发部开源的高性能 .NET 结构化数据引擎,核心是一个 64 位 Token DOM,将 JSON/CBOR/MessagePack 等多种格式统一解析为紧凑的 Token 中间表示,再驱动序列化、反序列化、原地编辑和格式转换——比 System.Text.Json 最高快 2.8 倍并行反序列化,内存分配仅后者的约 1/3。 R…
数据与向量库 CAPCOM-TD-OSS/REDox Stars 1,121 Tom 2026-10-05
Rohithgilla12/data-peek · 上手攻略
Data Peek 是一款轻量、键盘优先的 SQL 客户端桌面应用,支持 PostgreSQL、MySQL、Microsoft SQL Server,正在开发 SQLite 支持(约 1,677 Stars,单人维护)。核心理念:打开就用,用完就走,不拖泥带水。两秒启动、不跑 splash、不装插件、内存占用低——面向需要随时瞄一眼数据但不打算对付复杂 DB…
数据与向量库 Rohithgilla12/data-peek Stars 1,677 Jay 2026-10-05
qdrant/fastembed · 上手攻略
FastEmbed 是一个轻量、快速的 Python 向量嵌入生成库,由 Qdrant 团队开发和维护。它使用 ONNX Runtime 替代 PyTorch 作为推理后端,主打「无需 GPU、不下载 GB 级 PyTorch 依赖」就能跑 StateoftheArt 嵌入模型。 核心能力覆盖:稠密文本嵌入、稀疏嵌入(SPLADE++)、晚交互嵌入(ColB…
数据与向量库 qdrant/fastembed Stars 3,229 Tom 2026-10-02
asciimoo/hister · 上手攻略
Hister 是一个本地运行的私人搜索引擎,用于索引和检索你访问过的网页、书签和本地文件。全程数据保存在你自己控制的机器上,不需要任何云端账号或第三方服务。 通过浏览器插件自动收集页面内容,配合 Hister 内置的查询语言或 MCP 接口,可以从 Web UI、终端或 AI 助手侧查询你的个人知识库。 日常上网我们会访问大量页面,但浏览器自带的搜索功能只能…
数据与向量库 asciimoo/hister Stars 5,788 Jay 2026-09-29
danieldeer/seriousdb · 上手攻略
seriousdb 是一个极简的持久化键值存储(Persistent KeyValue Store),通过 HTTP API 暴露读写接口,数据以 JSON 格式保存在本地 .sdb 文件中。项目使用 Python + FastAPI 实现,代码量极小,架构刻意保持简单——没有独立数据库进程、没有客户端 SDK、没有复杂依赖,适合作为嵌入式配置存储、轻量状态…
数据与向量库 danieldeer/seriousdb Stars 210 Tom 2026-09-16
fruitflydev/flycoinrh · 上手攻略
flycoinrh 是一个真实果蝇大脑模拟项目,用真实果蝇的神经连接组(connectome)驱动 Robinhood Chain 上的代币发行。165,122 个神经元、10,228,000 个实测突触连接,全部来自真实雄性黑腹果蝇(Drosophila melanogaster)的电子显微镜扫描数据——不是神经网络的"仿生创意",是实测的生物学接线图。 …
数据与向量库 fruitflydev/flycoinrh Stars 174 Tom 2026-09-13
fabiocampolim-design/scitech-librarian · 上手攻略
scitechlibrarian 是一个可复现学术文献检索工具:用一条结构化查询同时打穿 8 个学术数据库(OpenAlex、NASA ADS、arXiv、INSPIREHEP、Scopus、Semantic Scholar、Crossref、Web of Science),自动将查询语法转译为各数据库的原生检索式,每次运行结果全部存档,并最终生成 PRIS…
数据与向量库 fabiocampolim-design/scitech-librarian Stars 5 Jay 2026-09-02
jushahulian/java-go-python · 上手攻略
一个持续更新的中文 IT 学习视频课程导航仓。仓库本身不产出代码,而是按编程语言与应用方向分类整理了慕课网、极客时间、腾讯课堂等主流平台的高质量付费课程链接,涵盖 Java、Python、Go、前端、大数据、C#/.NET 等方向。仓库以 Markdown 文件形式维护课程清单,每个文件对应一个方向,支持通过 Baidu Netdisk(百度网盘)提取码直接…
数据与向量库 jushahulian/java-go-python Stars 536 Tom 2026-08-28
jannisborn/paperscraper · 上手攻略
jannisborn/paperscraper 是一个 Python 文献计量工具包,用于抓取学术论文元数据(PubMed、arXiv、bioRxiv、medRxiv、chemRxiv)、下载全文(PDF/XML)、查询引用数、Google Scholar 指标、期刊影响因子,并支持自引率分析。 核心解决的问题:把散落在多个预印本服务器和文献数据库的论文元数…
数据与向量库 jannisborn/paperscraper Stars 543 Tom 2026-08-27
josiah-nelson/eidos · 上手攻略
Eidos 是一个私有的、自托管的跨机器文件搜索系统,让你用"记忆"而非"路径"来搜索文件。它能同时索引工作站、笔记本、服务器、虚拟机(VM)、网络存储和压缩档案,从一个统一入口返回跨所有设备的搜索结果——无需记住"文件在哪台机器上"。 与普通桌面搜索(只能搜本机)、云盘搜索(只能搜云端内容)、向量搜索(丢失文件身份与位置)不同,Eidos 的核心思路是:先…
数据与向量库 josiah-nelson/eidos Stars 124 Jay 2026-08-25
t8y2/dbx · 上手攻略
DBX 是一个超轻量(~20 MB)的跨平台数据库客户端,支持 90+ 数据库,包括 MySQL、PostgreSQL、SQLite、Redis、MongoDB、DuckDB、ClickHouse、SQL Server、Elasticsearch、TiDB、OceanBase、GaussDB、Doris、StarRocks 等。零运行时依赖(无 Java、无…
数据与向量库 t8y2/dbx Stars 16,349 Jay 2026-08-25
Deodat-Lawson/LaunchStack · 上手攻略
LaunchStack 是一个TypeScript AI 原生应用引擎,内置文档摄取、OCR、RAG、知识图谱、LLM 抽象、后台任务等模块,配有一个 Next.js 参考应用演示完整接线方式。 核心定位是:让开发者把 AI 能力嵌入自己的应用时,不必从零组装 LangChain + PostgreSQL + 向量数据库 + 任务队列,而是直接用 Launc…
数据与向量库 Deodat-Lawson/LaunchStack Stars 885 Tom 2026-08-23
Avijit07x/claude-db · 上手攻略
claudedb 为 Claude Code 提供持久化记忆层,解决每次新会话都要重新解释代码库背景的痛点。它在本地记录你与 Claude 的对话历史、代码理解结论和项目决策,新会话时自动注入上下文,Claude 无需再靠"考古式 grep"自行推断。 核心思路:capture(记录)+ recall(回填)+ code graph(代码图),三轨并行运作。…
数据与向量库 Avijit07x/claude-db Stars 177 Tom 2026-08-22
vespa-engine/vespa · 上手攻略
Vespa 是 Yahoo(现 Verizon Media)开源的企业级 AI 搜索与推荐平台,定位并非单纯的向量数据库,而是将向量检索、全文搜索、结构化数据查询、分布式模型推理全部整合在单一分布式引擎内。用户无需组合 Elasticsearch + Milvus + 推理服务等多家基础设施,一套 Vespa 就能完成从数据索引到结果排序的全部工作。全球生产…
数据与向量库 vespa-engine/vespa Stars 7,118 Tom 2026-08-19
vanna-ai/vanna · 上手攻略
Vanna 是一个基于检索增强生成(RAG)的 TexttoSQL 开源框架,帮助开发者用自然语言查询 SQL 数据库。v2.0 是完全重写版本(与 v0.x 不兼容),核心定位从「RAG + LLM 生成 SQL」升级为「面向企业的用户感知型数据分析 Agent 平台」——每个组件都知道当前操作用户是谁,并自动做行级别权限过滤。 核心能力: Stars:约…
数据与向量库 vanna-ai/vanna Stars 23,820 Tom 2026-08-18
urschrei/pyzotero · 上手攻略
Pyzotero 是 Zotero API 的 Python 客户端,由 Zotero 社区维护,支持对个人库和团体库进行完整的增删改查操作。它提供 Python 库、CLI 工具和 MCP 服务器三种使用形态,适合需要将 Zotero 文献管理自动化接入 AI 工作流的用户。 uv add pyzotero pip install pyzotero con…
数据与向量库 urschrei/pyzotero Stars 1,388 Tom 2026-08-16
clidey/whodb · 上手攻略
WhoDB 是一个浏览器端数据库工作空间,支持探索数据库表结构、编辑数据、运行查询、理解 schema 关系图。它用 Docker 一行命令启动、自托管免费(Apache 2.0)、也提供桌面 App 和终端 CLI。对 AI 编程场景,它还内置了 Ollama / OpenAI / Anthropic / LM Studio 的自然语言查询能力——用英文提…
数据与向量库 clidey/whodb Stars 5,000 Tom 2026-08-10
xuchonglang/investing-for-beginners · 上手攻略
xuchonglang/investingforbeginners 是小隐寺投资百科的官方公开索引仓库,面向中文投资者,系统梳理了美股、期权与加密货币的完整知识框架。仓库不提供"买什么"的建议,而是帮助读者理解"自己正在买什么、风险来自哪里、投入资金前应该核对哪些信息"。 核心定位:用成熟且资料丰富的美股市场建立股票/ETF/财报/资产配置的基础框架,同时把…
数据与向量库 xuchonglang/investing-for-beginners Stars 3,228 Tom 2026-08-05
typedb/typedb · 上手攻略
TypeDB 是一个用 Rust 写成的下一代数据库,主打"为系统而生,而非为记录而生"。它用一个概念数据模型(conceptual data model)把关系型、文档型、图数据库的优势合并在一起,避免传统 RDBMS 里的对象关系阻抗不匹配(objectrelational mismatch)——也就是 Java/Python 程序员写业务时经常吐槽的"…
数据与向量库 typedb/typedb Stars 4,408 spark 2026-07-30
supervc-stack/VectorChord · 上手攻略
VectorChord(扩展名 vchord)是 PostgreSQL 上一款面向向量检索的扩展,由原 pgvecto.rs 团队(TensorChord)迭代而来。它把向量索引、Rerank 和量化压缩统一塞进 PG 里,目标是把"亿级向量表"和"普通业务表"放在同一套关系型基础设施上跑,不再引入额外的专用向量库。 它有几条主线卖点: 兼容 pgvecto…
数据与向量库 supervc-stack/VectorChord Stars 1,767 spark 2026-07-28
alibaba/zvec · 上手攻略
Zvec 是阿里巴巴通义实验室开源的进程内(inprocess)向量数据库,定位为"向量数据库领域的 SQLite"——直接以内嵌库的方式运行在你的应用程序中,无需部署独立的数据库服务进程。它基于阿里生产级 Proxima 向量检索引擎,支持稠密向量 + 稀疏向量 + 全文检索(FTS)混合检索,并内置 WAL 持久化、多进程并发读取等企业级特性。 当前版本…
数据与向量库 alibaba/zvec Stars 15,199 Tom 2026-07-19
withmarbleapp/os-taxonomy · 上手攻略
ostaxonomy(Marble Skill Taxonomy)是一个开放的小学阶段全科学习知识图谱,由教育科技公司 Marble 于 2025 年中开源发布。它把一个孩子小学期间(大约 5~12 岁)要学的内容拆成了 1,590 个极细粒度的「微主题」(microtopics),再通过 3,221 条有向无环图(DAG)边把它们串联起来——每条边标注了「…
数据与向量库 withmarbleapp/os-taxonomy Stars 3,947 Tom 2026-07-14
Canner/WrenAI · 上手攻略
Canner/WrenAI 是 开源 GenBI(Generative BI)引擎,核心能力是让 AI Agent 通过自然语言生成可信的 SQL 查询、可治理的业务仪表盘。它不是简单的 texttoSQL 工具——它通过一层开放 Context Layer(MDL 语义模型),把业务定义、数据血缘、查询记忆等「业务知识」注入 Agent 的推理过程,从根本…
数据与向量库 Canner/WrenAI Stars 17,219 Tom 2026-07-13
dolthub/dolt · 上手攻略
Dolt 是一个带版本控制的 SQL 数据库——把 Git 的协作模型带入了数据世界。你可以 fork、clone、branch、merge、push、pull 数据库表,就像对代码仓库操作一样。数据以 MySQL 兼容的 SQL 表形式存储,版本控制功能通过 SQL 内的系统表和存储过程暴露出来。 官方 slogan:"Git for Data"。 本质上…
数据与向量库 dolthub/dolt Stars 23,894 Tom 2026-07-13
Graphify-Labs/graphify · 上手攻略
Graphify 是一个让 AI 编程助手(Claude Code、Cursor、Codex 等)把任意代码仓库转化为可查询知识图谱的工具。本质是一个 Claude Code / AI Coding Agent 的 /graphify 技能(Skill):输入 /graphify .,它便将项目代码、文档、图片、视频全部映射为一张节点边图谱,之后你可以用自然…
数据与向量库 Graphify-Labs/graphify Stars 105,053 Jay 2026-07-12
simonlin1212/a-stock-data · 上手攻略
astockdata 是一个面向 AI 编程助手(Claude Code / OpenClaw / Codex)设计的 A 股全栈数据 Skill 文件,本质是一份结构化 Markdown 文档,内嵌全部可运行 Python 代码,可直接被 AI 读取并在对话中执行。 它解决的核心问题是:A股数据源极度分散——行情在通达信协议、研报在东财 PDF、资金流在另…
数据与向量库 simonlin1212/a-stock-data Stars 6,761 Tom 2026-07-11
siyuan-note/siyuan · 上手攻略
SiYuan(思源笔记)是一款隐私优先、可完全自托管的个人知识管理(PKM)软件,使用 TypeScript + Go 双语言开发,Stars 约 4.5 万,周增约 +14。它以「块(Block)」为最小数据单元,支持块级引用和双向链接(类似 Roam Research / Obsidian),采用 Markdown 所见即所得(WYSIWYG)编辑体验,…
数据与向量库 siyuan-note/siyuan Stars 45,719 Tom 2026-07-10
Snailclimb/JavaGuide · 上手攻略
JavaGuide 是 GitHub 上规模最大的 Java 后端面试知识库,涵盖 Java 基础、并发、JVM、数据库(MySQL/Redis/MongoDB)、计算机网络、操作系统、数据结构与算法、系统设计、常用框架(Spring/SpringBoot)等核心主题。除面试内容外,还包含 AI 应用开发指南(AIGuide 子仓库),覆盖 LLM、Agen…
数据与向量库 Snailclimb/JavaGuide Stars 157,677 Tom 2026-07-10
milvus-io/milvus · 上手攻略
Milvus 是一款高性能、云原生的向量数据库,专为大规模向量 ANN(近似最近邻)搜索场景设计。它能够存储十亿级向量,支持实时插入与查询,广泛用于 AI 应用中的语义搜索、图像检索、RAG(检索增强生成)等场景。 核心特点: 官方提供完全托管云服务 Zilliz Cloud。 1. 向量数据量大时搜索慢 — 传统数据库无法高效做向量相似度搜索,Milvus…
数据与向量库 milvus-io/milvus Stars 45,770 Jay 2026-07-10
awesomedata/awesome-public-datasets · 上手攻略
awesomepublicdatasets 是 GitHub 上规模最大、分类最齐全的高质量公开数据集精选列表。它以主题(Topic)为导向,将来自政府、科研机构、高校、企业的公开数据按领域逐一整理,涵盖农业、生物学、化学、气候、经济、教育、能源、地理信息、政府数据、医疗健康、图像处理、机器学习、自然语言、神经科学、物理、公共领域、社交网络、体育、交通等 3…
数据与向量库 awesomedata/awesome-public-datasets Stars 78,033 Jay 2026-07-09