Vespa 是 Yahoo(现 Verizon Media)开源的企业级 AI 搜索与推荐平台,定位并非单纯的向量数据库,而是将向量检索、全文搜索、结构化数据查询、分布式模型推理全部整合在单一分布式引擎内。用户无需组合 Elasticsearch + Milvus + 推理服务等多家基础设施,一套 Vespa 就能完成从数据索引到结果排序的全部工作。全球生产…
仓库攻略
736 篇 · 726 个项目 · tom
UltraRAG 是由清华大学 THUNLP、东北大学 NEUIR、OpenBMB、AI9stars 联合推出的低代码 RAG 开发框架,基于 MCP(Model Context Protocol)架构设计。它将 RAG 的核心组件(检索器 Retriever、生成器 Generation、语料处理 Corpus、评估 Evaluation)拆解为独立的 M…
这是一份学术论文写作最佳实践指南,由 EPFL(洛桑联邦理工学院)研究团队维护,收集了他们在撰写 LaTeX 学术论文过程中积累的排版、图表、文献管理经验。仓库以 Markdown + LaTeX 示例代码的形式呈现,涵盖从"一行一句"源码原则到 Python/Matlab 图表生成规范的全链路技巧。 它不是工具库,不需要安装,是纯经验文档,适合在写论文时随…
Nasiko 是一个面向 AI Agent 的开发者控制平面(Developer Control Plane),用 Rust 编写,核心定位是:运行多个 Agent 时,用单一进程解决"谁调用谁、谁持有哪个 key、调用成本几何、为什么失败"这四个工程难题。 它基于 A2A 协议(AgenttoAgent Protocol)工作——任何讲 A2A 的 Age…
EasyPhoto 是一个 Stable Diffusion WebUI 插件,用于生成 AI 人像写真——上传 5~20 张个人照片训练专属的"数字分身"(LoRA 模型),之后即可用这个分身在任意场景下生成写真图片。 核心能力: 由阿里巴巴 PAI(Platform for AI)团队开发维护,开源于 2023 年,配套有论文(arXiv:2310.04…
Genkit 是 Google Firebase 团队开源的全栈 AI 应用开发框架,支持 JavaScript/TypeScript(生产就绪)、Go(生产就绪)、Python(Beta)、Dart(Preview)四种语言,可对接 Google Gemini、OpenAI、Anthropic、Ollama 等主流模型厂商。 核心理念:一套 API 走天下…
IndexTTS 是阿里巴巴 Index 团队开源的零样本(ZeroShot)语音克隆系统,用一段参考音频(10~30秒)即可复刻任意人的音色,生成对应文本的语音。当前稳定版为 IndexTTS2.5(2026年8月10日发布),支持中文、英语、日语、西班牙语、阿拉伯语五种语言,并在多语言跨音色任务上达到了开源 SOTA 水平。 核心能力: IndexTTS…
CyberStrikeAI 是一个用 Go 语言编写的 AI 原生渗透测试平台,官方定位是"intent becomes governed execution"——将自然语言意图转换为可治理的渗透测试行动,同时保留完整审计轨迹。 核心架构:Go 后端 + Eino 驱动的 Agent 引擎 + MCP 原生工具 + RAG 知识库 + 可视化工作流 + 攻击…
AudioGPT是由 AIGCAudio 团队开源的多模态音频理解和生成框架,发布于 2023 年 4 月(arXiv:2304.12995)。其核心设计思路是:将 LLM(大语言模型)作为音频任务的统一调度层,底层对接各类音频/语音专有的预训练基础模型(Foundation Models),用户通过自然语言 Prompt 控制音频生成与理解任务。 GitH…
pytorch/examples 是 PyTorch 官方维护的示例仓库,汇集了 PyTorch 官方团队编写的各领域高质量参考实现。与 PyTorch Tutorials 不同,这些示例追求代码简洁、独立可运行、少依赖,每个子目录对应一个完整任务,读者可以直接把代码复制到自己的项目中使用或改写。覆盖领域包括:MNIST 手写数字识别(含多种变体)、VAE、…
labelImg 是一个开源的图形化图像标注工具,由 Tzutalin 开发维护,现归属 HumanSignal(Label Studio 社区)管理。它用 Python + Qt 编写,提供直观的 GUI,让用户通过鼠标框选来标注目标物体,生成标准格式的标注文件。标注结果支持 PASCAL VOC XML、YOLO TXT 和 CreateML JSON …
CLIP(Contrastive LanguageImage PreTraining)是 OpenAI 在 2021 年发布的图文多模态模型,论文为 Learning Transferable Visual Models From Natural Language Supervision。它的核心思想是用大规模图文配对数据训练一个联合 embedding 空…
EasyOCR 是一个用 PyTorch 开发的通用 OCR(光学字符识别)Python 库,开箱即用,支持 80+ 语言,涵盖 Latin、CJK(简繁体中文、日文、韩文)、Arabic、Devanagari、Cyrillic 等所有主流书写系统,同时处理自然场景文本和文档密集文本。 v1.7.2(2024 年 9 月)是当前最新正式版。自 2020 年起…
dshai4scholar 是 DeepSeek Harness(dsh)的官方学术文献插件,提供 38 个原生 Agent 工具,覆盖文献检索、全文获取、引用管理、科学图表生成等科研写作全流程。 它本质上是一个 Node.js 包(dsh 插件),安装后在 dsh web 界面中注册 38 个工具,并通过 ai4scholar.net 的 API 接入 S…
Open Science 是一个开源、localfirst、modelagnostic 的 AI 科研工作台,由专用的 AI Agent 驱动,帮助研究者完成从文献调研、假设生成到代码执行、数据分析、可视化、报告产出的全流程,所有结果都可追溯到产生它的完整活动记录。 它的核心定位是:把大模型 Agent 变成一个可信赖的科研搭档,而非一个聊天玩具。运行在研究…
OpenMetadata 是一个开源的数据上下文层与元数据管理平台,定位为「AI 时代的数据目录 + 组织记忆 + 语义治理中枢」。它将技术元数据、数据质量信号、血缘(Lineage)、所有权、使用量、治理策略、对话记忆、业务语义(Glossary/Classification/Metrics)全部连接到一个统一的元数据知识图谱中,供人类数据团队、AI 助手…
Vanna 是一个基于检索增强生成(RAG)的 TexttoSQL 开源框架,帮助开发者用自然语言查询 SQL 数据库。v2.0 是完全重写版本(与 v0.x 不兼容),核心定位从「RAG + LLM 生成 SQL」升级为「面向企业的用户感知型数据分析 Agent 平台」——每个组件都知道当前操作用户是谁,并自动做行级别权限过滤。 核心能力: Stars:约…
重要声明:Mozilla DeepSpeech 项目已在 2023 年左右正式宣布 DISCONTINUED(终止维护)。最新版本为 v0.9.3(发布于 ~2021 年),无后续更新。预训练模型文件仍在 GitHub Releases 可下载,但不再有安全更新或新功能。 如果你需要离线语音识别,推荐评估替代方案:Whisper(OpenAI)、Whispe…
🐸TTS(coquiai/TTS)是 Mozilla 语音团队孵化的开源文本转语音深度学习工具包,支持从零训练模型、Finetuning 和推理,生产和研究均可用。最新版本 ⓍTTS v2 支持 16 种语言,还支持语音克隆(voice cloning)和语音转换(voice conversion)。它底层基于 TensorFlow / PyTorch,内置…
OpenMausBot 是 macOS / Windows 桌面应用,将 Claude、Codex、Grok 等本地 CLI 工具封装为一个多机器人消息应用。每个机器人是一个真实运行的 AI Agent,有自己的性格、模型、记忆和可连接的 500+ 第三方应用(通过 Composio)。本质上它是 Grok Bot 的开源实现,核心思路是:把 AI Agen…
Prompt Optimizer 是一款开源 AI 提示词优化工具,通过多轮迭代改进帮助用户写出更高质量的提示词,从而获得更好的 AI 输出。支持 Web 应用、桌面客户端、Chrome 扩展和 Docker 部署四种形态,可对接 OpenAI、DeepSeek、Gemini、Grok、Zhipu AI、SiliconFlow、MiniMax 等主流模型,并…
Bark 是 Suno 出品的基于 Transformer 的文本到音频生成模型,可以生成高真实度的多语言语音、音乐、背景音和简单音效。模型还能生成非语言音频,如笑声、叹息声、哭声等。 与传统的 TTS(TexttoSpeech)不同,Bark 是完全生成式的文本到音频模型(类似 GPT 之于文本,而非拼接式 TTS),输入文字后不经过音素中介,直接转换为音…
OpenAnalytics 是一个开源、自托管、无 Cookie 的网站流量分析平台,主打隐私优先和数据主权。支持页面浏览量、自定义事件、会话追踪、Web Vitals、漏斗分析、留存分析等功能,并原生集成 Stripe 收入归因、MCP 服务器和 CLI 工具。 定位类似 Plausible Analytics 和 Umami,但架构上更重:后端采用 Po…
GPT4All 是由 Nomic AI 开发的开源本地大模型运行工具,核心目标是让任何人在不需要 GPU、不需要 API key、不需要云服务的情况下,在自己的电脑(笔记本、台式机)上跑大语言模型(LLM)。 本质上是基于 llama.cpp 的工程封装,提供三件套: 桌面应用(GPT4All Desktop):图形界面聊天,支持 LocalDocs(本地文…
geekcompany/ResumeSample 是国内最早系统整理程序员简历模板的开源项目之一,由程序员技术简历平台 JobDeer(工作鹿)提供。仓库收录了 PHP、iOS、Android、Web 前端、Java、C/C++、NodeJS、架构师、通用程序员等 9 类技术岗位的 Markdown 格式简历模板,每类都附带详细的填写说明和真实场景的写法示范…
Leey21/awesomeairesearchwriting 是一个面向中文科研人员的 AI 辅助论文写作开源指南库。核心价值在于:将 MSRA、Seed、SH AI Lab 等顶尖研究机构研究员,以及北大、中科大、上交硕博同学的日常写作技巧系统化整理,以可直接复制的 Prompt 模板形式开放。 本质上是一个拿来即用的科研写作 Prompt 大全,覆盖从…
OCRmyPDF 是一个为 PDF 添加 OCR 文字层的命令行工具,它调用 Tesseract OCR 引擎,将扫描件、影印件等图片型 PDF 转化为可搜索、可复制文字的 PDF/A(适合长期归档的可移植 PDF 子集)。 它的核心价值在于「精准」——OCR 文字会精确地嵌入到原始图片下方,保证复制粘贴时位置准确,不出现文字错位;输出文件通常比输入更小(经…
textgen(全称 oobabooga/textgenerationwebui)是一个开源本地大模型桌面应用,支持文本生成、视觉理解(多模态)、工具调用、网页搜索、LoRA 微调,以及 OpenAI / Anthropic 兼容 API。口号是「100% 离线、零遥测」——不需要任何外部服务,所有模型和数据都在你自己的机器上。 它是原本大名鼎鼎的「text…
Crawl4AI 是 GitHub Star 数最多的开源网页爬虫(75,960 ★,数据截至 20260817),专为将网页转化为 LLM 可直接消费的 Markdown 而设计。相比传统爬虫输出 HTML 碎片,Crawl4AI 输出结构清晰、噪音少、带引用标注的 Markdown,特别适合 RAG pipeline、Agent 数据摄取和大规模数据采集…
DeepResearch_AI 是一个 AI 驱动的多智能体研究工作空间,基于 LangGraph + FastAPI 构建,支持两种研究模式: 1. DeepSearch(快速模式):5 个 researcher agent 并行 fanout + 聚合,约 12 分钟产出带引用的结构化网络研究报告 2. Research Mode(深度模式):25 个 …