⚠️ 本稿数字与命令以 README 与 docs.privategpt.dev 抓取为准;命令中 qwen3.5:35b、mxbaiembedlarge 等具体模型名取自 README Quickstart,未经独立复现,请按你的硬件与显存重新核对。 PrivateGPT 是 Zylon 公司在 2023 年那个"本地聊天 PDF"爆款脚本基础上重写出来的…
仓库攻略
540 篇 · 535 个项目 · LLM 基础设施
Bark 是 Suno 出品的基于 Transformer 的文本到音频生成模型,可以生成高真实度的多语言语音、音乐、背景音和简单音效。模型还能生成非语言音频,如笑声、叹息声、哭声等。 与传统的 TTS(TexttoSpeech)不同,Bark 是完全生成式的文本到音频模型(类似 GPT 之于文本,而非拼接式 TTS),输入文字后不经过音素中介,直接转换为音…
OpenAnalytics 是一个开源、自托管、无 Cookie 的网站流量分析平台,主打隐私优先和数据主权。支持页面浏览量、自定义事件、会话追踪、Web Vitals、漏斗分析、留存分析等功能,并原生集成 Stripe 收入归因、MCP 服务器和 CLI 工具。 定位类似 Plausible Analytics 和 Umami,但架构上更重:后端采用 Po…
GPT4All 是由 Nomic AI 开发的开源本地大模型运行工具,核心目标是让任何人在不需要 GPU、不需要 API key、不需要云服务的情况下,在自己的电脑(笔记本、台式机)上跑大语言模型(LLM)。 本质上是基于 llama.cpp 的工程封装,提供三件套: 桌面应用(GPT4All Desktop):图形界面聊天,支持 LocalDocs(本地文…
textgen(全称 oobabooga/textgenerationwebui)是一个开源本地大模型桌面应用,支持文本生成、视觉理解(多模态)、工具调用、网页搜索、LoRA 微调,以及 OpenAI / Anthropic 兼容 API。口号是「100% 离线、零遥测」——不需要任何外部服务,所有模型和数据都在你自己的机器上。 它是原本大名鼎鼎的「text…
Crawl4AI 是 GitHub Star 数最多的开源网页爬虫(75,960 ★,数据截至 20260817),专为将网页转化为 LLM 可直接消费的 Markdown 而设计。相比传统爬虫输出 HTML 碎片,Crawl4AI 输出结构清晰、噪音少、带引用标注的 Markdown,特别适合 RAG pipeline、Agent 数据摄取和大规模数据采集…
binaryhusky/gpt_academic(GPT Academic)是一个为 GPT / GLM 等大语言模型打造的实用化交互界面,特别针对论文阅读、润色、翻译、写作场景深度优化。项目采用模块化插件设计,支持自定义快捷按钮、Python / C++ 项目剖析、ArXiv 论文翻译总结、LaTeX 全文翻译校对等30+ 功能,并行支持 ChatGPT、…
DeepResearch_AI 是一个 AI 驱动的多智能体研究工作空间,基于 LangGraph + FastAPI 构建,支持两种研究模式: 1. DeepSearch(快速模式):5 个 researcher agent 并行 fanout + 聚合,约 12 分钟产出带引用的结构化网络研究报告 2. Research Mode(深度模式):25 个 …
StarlightSearch/EmbedAnything 是一个用 Rust 构建的高性能、多模态 embedding 管道。它支持从文本、图片、音频、PDF、网站等多种来源生成向量嵌入,并与 Milvus、Weaviate、Elastic、SingleStore 等主流向量数据库无缝对接,核心卖点是零 PyTorch 依赖、低内存占用、流式索引,已在 E…
LFM2.52.6B 是 Liquid AI 在 2026 年 8 月初开源的一个 2.6B 参数端侧 Agent 模型,DeepSeekV4Flash0731 是 DeepSeek 同月发布的一个 284B 总参数 / 13B 激活参数 MoE 推理优化模型(20260731 发布)。2026 年 8 月 6 日,atomic.chat 在 4× RTX …
MinerU 是由 OpenDataLab(上海人工智能实验室关联开源组织)开发的高精度文档解析引擎,于 2024 年开源。其核心能力是:将 PDF、DOCX、PPTX、XLSX、图片、网页等复杂文档,转换为 LLM 可直接消费的 Markdown 或 JSON 格式,同时保留阅读顺序、标题层级、表格结构、公式 LaTeX 等语义信息。 MinerU 最早服…
mlabonne/llmcourse 是由法国机器学习工程师 Maxime Labonne 维护的一套免费、开源的大语言模型(LLM)学习路径仓库,GitHub Stars 超过 81,000(2026年8月)。它不是传统意义上的"课程",而是一份精心编排的知识图谱——包含路线图(roadmap)、Colab Notebook 实践代码、配套博客文章,覆盖从…
Stable Diffusion 是 CompVis 团队(海德堡大学)开发的潜在扩散模型(Latent Diffusion Model),通过文本提示生成照片级图像。该项目是 Stability AI 和 Runway 合作的产物,在 2022 年 CVPR 以 Oral 论文发表,相关论文 HighResolution Image Synthesis w…
DAIR.AI 出品的 Prompt Engineering Guide,是一个聚合了提示工程领域最新论文、学习路径、实战技巧和工具资源的开源知识库。2022年2月登顶 Hacker News 热榜,2024年1月突破 300 万学习者,目前在 GitHub 拥有约 77.5k Stars、8.5k Forks(MIT 许可证),支持 13 种语言翻译。 它…
pi 是由 earendilworks 开发的轻量级终端 AI Agent 工具包,包含四个核心 npm 包: | 包 | 说明 | ||| | @earendilworks/picodingagent | 交互式编码 Agent CLI | | @earendilworks/piagentcore | Agent 运行时(工具调用 + 状态管理)| | @…
llama.cpp 是一个纯 C/C++ 实现的高性能 LLM 推理框架,核心目标是在各种硬件上以最小化依赖和最优性能跑本地大模型。它基于底层的 ggml 库构建,支持 FP16 和 GGUF 量化格式,Star 122,572(无周增,长期稳定),是本地 LLM 推理领域最活跃的开源项目之一。 核心特点: 纯 C/C++ 实现,无外部依赖(除少量单文件 H…
DSH 插件市场(DSH Plugin Marketplace)是一个为 DeepSeek Harness(DSH) 打造的插件市场插件,通过在 DSH Web GUI 的设置页面中嵌入一个卡片列表界面,让用户无需命令行即可浏览、安装、更新 GitHub 上全部打有 dshplugin topic 的插件,以及 14000+ 通用 Skills(来自 age…
PaperOrchestra 是 Google 研究团队(Song et al., 2026)提出的一种多智能体学术论文写作框架(arXiv:2604.05018),其核心思路是用 5 个专责 Agent 流水线协作,把零散的研究材料(想法、实验记录、图表)转化为可直接投稿的 LaTeX 论文。 Ar9av/PaperOrchestra 则是将这篇论文的实现…
jezweb/claudeskills 是一个面向 Claude Code CLI 的 Skill 集合仓库,收录了 50+ 个经过结构化封装的 Skill,覆盖全栈开发(Cloudflare、React、Tailwind v4)、AI 集成、数据库、支付、DevOps、SEO、文档生成、商业写作等常见场景。 换句话说:这是一套开箱即用的 Claude Co…
Nerve(The Simple Agent Development Kit)是一个用 YAML + CLI 构建、运行、评测和编排 LLM Agent 的轻量框架。它的核心理念是声明式 Agent:用 YAML 定义 system prompt、task、tools 和 variables,一个文件搞定一个 Agent,再通过 nerve CLI 驱动执行…
freebuffproxy 是一个本地网关,把 FreeBuff/Codebuff 的免费 AI 编程模型(deepseekv4flash 等)以 OpenAI 兼容接口(/v1/chat/completions)暴露给任意工具——OpenCode、pi、9router、LiteLLM 或自己的脚本。 它的核心价值是"翻译 + 池化 + 隐匿": FreeB…
dshpluginwritingguard 是 DeepSeek Harness(DSH)的论文写作守卫插件,在论文撰写和修改过程中自动检测常见 AI 写作风格、修改残留、防御性表达与机械化句式,同时提供 Scholarship Lock 功能在 AI 润色时保护科研事实(数字、p值、图表编号等核心实体不被悄悄改动)。定位是学术写作 linter——不是"写…
2026 年 7 月 28 日,Model Context Protocol(MCP)正式发布了有史以来最大的一次协议版本更新,版本号 20260728。核心变化:MCP 从有状态的双向协议彻底改为请求/响应式的无状态协议。 附带 HTTP 路由增强、缓存指令、企业级授权加固、长任务扩展,以及一个正式的废弃政策窗口。 根据 MCP 官方博文,MCP 在各 T…
PixelleMCP 是一个基于 MCP 协议的开源多模态 AIGC 解决方案,核心思路是把 ComfyUI 工作流一键转成 MCP 工具,让 LLM(Claude Desktop、Cursor 等)通过自然语言直接驱动 ComfyUI 图像生成。它支持本地 ComfyUI 和云端 RunningHub 两种执行引擎,提供 Web 界面、MCP 服务器和文件…
ASReview LAB(Active Learning for Systematic Reviews LAB)是一个面向系统综述(Systematic Review)场景的主动学习筛选工具,由荷兰 Utrecht University 研究团队开发并在 Nature Machine Intelligence 上发表。 系统综述是学术研究中的基础方法:研究者…
IntellAgent 是一个多智能体(multiagent)框架,专注于对话式 AI Agent 的系统性评测与诊断。 传统 agent 评测依赖人工构造测试用例,数量有限且难以覆盖真实世界的长尾边界情况。IntellAgent 的思路是:给定你的 agent 描述(prompt、工具定义、数据库 schema),自动生成数千种真实感强的边缘场景(edge…
mysql_mcp_server 是一个 Model Context Protocol (MCP) 服务器,让支持 MCP 协议的 AI 客户端(Claude Desktop、Claude Code、Autohand Code 等)能够以结构化、受控的方式查询、操作 MySQL 数据库。它是用 Python 实现的轻量级服务端,不做 ORM、不替代数据库工具…
NVIDIA Video Search and Summarization(VSS)Blueprint 是一套GPU 加速的视频语义理解和分析参考架构。它将视觉语言模型(VLM,如 NVIDIA Cosmos)、大语言模型(LLM,如 Nemotron)、RAG 和 NVIDIA NIM 微服务整合在一起,实现用自然语言搜索视频内容、实时异常检测、视频问答和…
CodeGraphRAG 是一个面向多语言代码库的 AI 问答与编辑系统。它用 Treesitter 解析源码,构建代码结构知识图谱存入 Memgraph,再用自然语言驱动 Cypher 查询,实现代码问答、编辑和优化。整个流程对用户屏蔽了图数据库细节——只需一条 CLI 命令,就能把一个陌生仓库变成可对话的智能体。 核心思路:把代码当知识图谱来索引,而不是…
MaxText 是 Google AIHypercomputer 团队开源的高性能、高可扩展 LLM 训练与后训练库,全部用纯 Python/JAX 编写,目标是 TPU 和 NVIDIA GPU 上的高效分布式训练与微调。官方于 20250915 发布 PyPI 包,当前稳定版本 0.2.3(2026 年初)。 MaxText 的定位是"LLM 项目发射台…