Guides · organized/guides

仓库攻略

126 篇 · 125 个项目 · tom · 多模态

vllm-project/vllm-omni · 上手攻略
vLLMOmni 是 vLLM 社区推出的全模式(omnimodality)推理框架,将 vLLM 的高性能 LLM 推理能力扩展到任意到任意的多模态模型——不只是理解图像/视频/音频,而是能同时生成多种模态的输出(文本+图像+视频+音频)。 支持的输出类型: 一句话概括:vLLM 在多模态生成领域的扩展,让研究者和企业能用生产级性能跑 OmniModali…
LLM 基础设施 vllm-project/vllm-omni Stars 6,027 Tom 2026-07-13
NVIDIA-NeMo/Speech · 上手攻略
NVIDIA NeMo Speech 是 NVIDIA 推出的专注于语音 AI 的开源框架,支持自动语音识别(ASR)、语音合成(TTS)和语音大模型(Speech LLM)三大方向。它是从原 NVIDIA/NeMo 大一统仓库中拆分出来的独立版本(2026 年 6 月正式发布首个 release),专门面向需要训练和微调语音模型的 연구人员和 PyTorc…
多模态 NVIDIA-NeMo/Speech Stars 18,087 Tom 2026-07-13
Solido/awesome-flutter · 上手攻略
awesomeflutter 是 Flutter 生态中最老牌、最全面的精选列表之一,由 Solido 团队维护(Flutter 官方也曾推荐)。它按类别收录了最优质的 Flutter 库、工具、教程、文章、开源 App 和模板——简单说,如果你用 Flutter,这个列表是你找轮子、找教程、找灵感的第一站。 涵盖范围:状态管理、路由导航、UI 组件、图表、…
工程化 Solido/awesome-flutter Stars 60,877 Tom 2026-07-12
steven2358/awesome-generative-ai · 上手攻略
一个精选的现代生成式人工智能(Generative AI)项目与服务导航列表,由 steven2358 维护。列表覆盖文本、编程、Agent、图像、视频、音频六大方向,精选收录各领域有代表性的开源模型、商业 API、研究论文和应用项目。 截至目前已收录数百个条目,按主题分类组织,涵盖从 GPT4、DALL·E 3、Sora 等商业巨头的产品,到 Llama、…
工程化 steven2358/awesome-generative-ai Stars 12,483 Tom 2026-07-12
VoltAgent/awesome-openclaw-skills · 上手攻略
VoltAgent 出品的 awesome 精选列表,精选 ClawHub(OpenClaw 官方技能注册表)中经过人工审核的优质技能,截至 2026 年已收录超过 5300+ 个社区技能,按场景分类整理。 OpenClaw 是一款本地运行的 AI 助手,技能(Skills)扩展其核心能力,使其能操作 GitHub、Slack、Gmail、外部 API 等。…
Agent 智能体 VoltAgent/awesome-openclaw-skills Stars 51,874 Tom 2026-07-12
HandsOnLLM/Hands-On-Large-Language-Models · 上手攻略
HandsOn Large Language Models(O'Reilly,2024)是 Jay Alammar(《The Illustrated GPT2》作者)和 Maarten Grootendorst(Hugging Face 社区明星博主)合著的技术书籍,其官方配套代码仓库。仓库以 Jupyter Notebook 形式覆盖了从语言模型基础、To…
工程化 HandsOnLLM/Hands-On-Large-Language-Models Stars 27,726 Tom 2026-07-12
deepset-ai/haystack · 上手攻略
Haystack 是由 deepset(一家专注于 NLP 和 LLM 的德国公司)维护的开源 AI 编排框架,用于构建生产就绪的 LLM 应用。它的核心理念是"透明编排"——对检索(Retrieval)、路由(Routing)、记忆(Memory)和生成(Generation)每一步都有显式控制,开发者清楚知道数据在管道中如何流转。 简单说:Haystac…
Agent 智能体 deepset-ai/haystack Stars 26,175 Tom 2026-07-11
patchy631/ai-engineering-hub · 上手攻略
AI Engineering Hub 是一个收录了 93+ 个生产就绪 AI 项目的开源教程库,涵盖 LLM、RAG、AI Agent 的完整实战项目,每个项目都附带可运行的代码和详细说明。 它不是一个大模型或框架本身,而是一个学习路径 + 项目索引:从最基础的 OCR 识别、聊天机器人,到高级的 Agent 编排、模型微调、生产部署,全部都有按难度分类的实…
Agent 智能体 patchy631/ai-engineering-hub Stars 36,928 Tom 2026-07-11
zoicware/RemoveWindowsAI · 上手攻略
RemoveWindowsAI 是一个 PowerShell 脚本工具,专门用于在 Windows 11 系统上强制移除、禁用微软内置的各类 AI 功能,包括但不限于: Windows Copilot(系统级 AI 助手) Windows Recall(活动历史快照功能) Microsoft Copilot in Edge AI Input Insights…
安全与风险 zoicware/RemoveWindowsAI Stars 12,715 Tom 2026-07-11
pathwaycom/llm-app · 上手攻略
Pathway llmapp 是一套开箱即用的 RAG(检索增强生成)与 AI 流水线云模板集合。它基于 Pathway Live Data Framework,核心解决"数据源实时变化 → RAG 系统如何及时感知并更新索引"这个问题。与传统 VectorDB(如 Pinecone、Milvus)需要独立 ETL 管道不同,Pathway 在内存中直接处理…
RAG 检索增强 pathwaycom/llm-app Stars 59,079 Tom 2026-07-10
mudler/LocalAI · 上手攻略
LocalAI 是一个开源的本地 AI 推理引擎,2026 年 7 月 Stars 约 4.7 万,周增约 +126。核心理念是「小核心 + 按需加载后端」:每个后端(llama.cpp、vLLM、whisper.cpp、stablediffusion、MLX 等)都是独立的 OCI 镜像,只在你需要某类模型时才拉取安装。最新稳定版为 v4.3.0(2026…
多模态 mudler/LocalAI Stars 48,383 Tom 2026-07-10
google-ai-edge/mediapipe · 上手攻略
MediaPipe 是 Google 开源的端侧机器学习框架,专注于在手机(Android/iOS)、Web、桌面、边缘设备和 IoT 上实时运行 ML 模型。它不是训练框架,而是推理框架——帮你把 Google 训练好的模型快速部署到各类设备上,以低延迟处理图像、视频、音频和文本。 Google 于 2023 年将 MediaPipe 主开发文档迁移至 d…
多模态 google-ai-edge/mediapipe Stars 36,566 Tom 2026-07-10
kestra-io/kestra · 上手攻略
Kestra 是一个开源的事件驱动编排与调度平台,用于构建数据管道、AI 工作流和基础设施自动化。它的核心设计理念是:Everything as Code + Everything from UI——你既可以在可视化界面里拖拽构建工作流,也可以把 YAML 定义提交到 Git,用 CI/CD 管理版本。 定位上,它接近 Apache Airflow 的功能复…
工程化 kestra-io/kestra Stars 27,748 Tom 2026-07-09
Andyyyy64/whichllm · 上手攻略
whichllm 是一个本地大模型硬件适配工具,一条命令帮你找出"在你的电脑上真正能跑且表现最好"的本地 LLM。它不是模型本身,而是一个智能选型引擎:读取你机器的 GPU/CPU/RAM 配置,去 HuggingFace 实时拉模型列表和基准测试数据,然后给你一份排名。 核心哲学:参数量不等于性能。一个 27B Q5 量化模型可能比 32B Q2 更快更准…
评测基准 Andyyyy64/whichllm Stars 6,205 Tom 2026-07-09
XiaomiMiMo/MiMo-Code · 上手攻略
MiMo Code 是小米 MiMo AI 团队开源的终端原生 AI 编程智能体,基于开源项目 OpenCode 进行二次开发,2026 年 6 月 10 日以 MIT 许可证发布。 它的核心定位是一个"住在你电脑里的 AI 编程搭档"——能读写代码、执行命令、管理 Git,并且通过持久化记忆系统,在多次会话中持续理解项目上下文、自动进化。 MiMo Cod…
Agent 智能体 XiaomiMiMo/MiMo-Code Stars 12,682 Tom 2026-07-08
op7418/guizang-social-card-skill · 上手攻略
guizangsocialcardskill 是一个面向 Claude Code / Codex 等 AI Agent 的图文卡片生成技能(Skill),专门用于从文章、截图、产品笔记、照片或视频素材,自动生成小红书 / Rednote 图文组图、Live Photo 动态卡片,以及公众号 21:9 + 1:1 封面对。 它的核心设计哲学是:把"做一张好看的…
多模态 op7418/guizang-social-card-skill Stars 5,512 Tom 2026-07-08
WUBING2023/PaperSpine · 上手攻略
PaperSpine 是一个以"贡献为先、面向审稿人"为核心理念的学术写作系统,支持 Claude Code、Codex、OpenClaw 和 Hermes CLI 四个 AI Agent 宿主。它将学术论文写作拆解为 12 个有序阶段,每阶段有强制关卡(gate),不允许跳步,必须逐关通过才能进入下一阶段。 V4(当前版本 4.0.0)是重大升级:原本 1…
多模态 WUBING2023/PaperSpine Stars 4,041 Tom 2026-07-08
VectifyAI/PageIndex · 上手攻略
PageIndex 是一个无向量、基于推理的 RAG(检索增强生成)引擎,由 Vectify AI 开发。其核心理念是:传统向量 RAG 依赖"语义相似度"做检索,但这不等于"真正相关"——尤其在金融报告、法律文书、医疗文献等高度专业化的长文档场景,"相似"和"相关"的差距尤为明显。 PageIndex 模拟人类阅读长文档的方式——先看目录,再顺着结构找答案…
RAG 检索增强 VectifyAI/PageIndex Stars 35,126 Tom 2026-07-08
StarTrail-org/PixelRAG · 上手攻略
PixelRAG 是一个基于视觉渲染的 RAG(检索增强生成)系统,核心思想:把文档(网页、PDF)渲染成截图切片(screenshot tiles),再对图片做向量检索,而不是解析 HTML 提取文本。传统 RAG 丢掉的表格、图表、排版信息,在 PixelRAG 里完整保留,读者模型可以直接"看"到原始视觉布局。 源自 Berkeley SkyLab、B…
RAG 检索增强 StarTrail-org/PixelRAG Stars 7,303 Tom 2026-07-08
activeloopai/deeplake · 上手攻略
Deep Lake 是 AI 数据运行时(AI Data Runtime),由 Activeloop 提供。其核心定位是:专为 AI 应用设计的多模态数据库,同时支持向量检索、数据版本控制和多模态原始数据存储。 与只存 embedding 的向量数据库不同,Deep Lake 可以存任意类型的原始数据——图片、视频、音频、PDF、文本、embedding 向…
Agent 智能体 activeloopai/deeplake Stars 9,227 Tom 2026-07-08
sgl-project/sglang · 上手攻略
SGLang 是一个高性能大语言模型(及多模态模型)推理 serving 框架,由 LMSYS 组织开发维护(Apache2.0 许可证)。它的核心定位是 vLLM 的直接竞争对手,在多项 benchmark 上展示出更高的吞吐量和更低的延迟。SGLang 底层基于 PyTorch,支持 RadixAttention(前缀缓存)、连续批处理(continuo…
LLM 基础设施 sgl-project/sglang Stars 31,657 Tom 2026-07-07
Mintplex-Labs/anything-llm · 上手攻略
AnythingLLM 是一个本地优先的 AllinOne AI 应用平台,用 MIT 许可证开源(JavaScript),Stars 62,686,周增 +322,已达生产就绪级别。它让用户无需重复"租用 AI 智能"——在自己的服务器或电脑上,连接任意 LLM(本地或云端),管理知识库、操作 AI Agent、构建自动化工作流。 核心定位:私有化部署的 …
Agent 智能体 Mintplex-Labs/anything-llm Stars 64,576 Tom 2026-07-07
ScrapeGraphAI/Scrapegraph-ai · 上手攻略
ScrapeGraphAI 是一个基于 LLM 的 Python 爬虫库,用自然语言描述你想提取什么,它就能自动搞定——无需写 CSS 选择器、XPath,也无需分析网页结构。它背后的设计逻辑是把网页 scraping 当作一个有向图(Graph)来执行:LLM 作为图节点之间的"路由器",决定如何遍历页面、提取什么数据。 简单说:你告诉它要什么,它用 LL…
RAG 检索增强 ScrapeGraphAI/Scrapegraph-ai Stars 29,344 Tom 2026-07-07
vllm-project/vllm · 上手攻略
vLLM 是一个高吞吐量、内存高效的 LLM 推理与服务引擎,最初由 UC Berkeley Sky Computing Lab 开发,现已成长为全球最活跃的开源 AI 基础设施项目之一,拥有来自 2000+ 贡献者的社区支持。 核心突破是 PagedAttention 技术——受操作系统虚拟内存分页启发,将 KV Cache 切分成小块动态管理,显著减少显…
LLM 基础设施 vllm-project/vllm Stars 88,728 Tom 2026-07-07
teamchong/pxpipe · 上手攻略
pxpipe 是一个本地请求代理,专门用来降低 Claude Code(以及其他基于 Anthropic API 的 Agent)的 token 消耗。它通过将大量文本内容(系统提示词、工具文档、历史记录)渲染为图片,再通过视觉通道传输,从而大幅压缩输入 token 数量。 核心逻辑:一张图片的 token 成本由像素尺寸决定,而不是内容长度。实测 dens…
多模态 teamchong/pxpipe Stars 6,425 Tom 2026-07-07
BerriAI/litellm · 上手攻略
LiteLLM 是一个统一调用 100+ 大模型 API 的 Python 库 + AI Gateway(代理服务器),用 OpenAI 格式作为统一接口,抹平各 provider(OpenAI、Anthropic、Gemini、Bedrock、Azure、HuggingFace、VLLM、NVIDIA NIM 等)的 API 差异,同时提供成本追踪、虚拟 …
LLM 基础设施 BerriAI/litellm Stars 56,075 Tom 2026-07-07
rohitg00/ai-engineering-from-scratch · 上手攻略
aiengineeringfromscratch 是一个从数学基础到多 Agent 生产部署的系统性 AI 工程课程,包含 503 节课程、20 个阶段,覆盖 Python / TypeScript / Rust / Julia 四种语言,MIT 许可证,完全免费。 它的核心理念是 Build It Before You Use It——在学习任何框架或工具…
工程化 rohitg00/ai-engineering-from-scratch Stars 46,486 Tom 2026-07-07
baidu/Unlimited-OCR · 上手攻略
UnlimitedOCR 是百度开源的多模态文档解析模型,定位是「一键长文档解析」——单张图片、PDF 多页、整本手册均可一次性处理,输出结构化文本。发布于 2026 年 6 月,arXiv 论文编号 2606.23050。 官方将其定位为对 DeepSeekOCR 的进一步推进,核心能力: 传统 OCR + NLP 管道有三个常见痛点: 1. 多步骤串联:…
多模态 baidu/Unlimited-OCR Stars 23,399 Tom 2026-07-06
Anil-matcha/Open-Generative-AI · 上手攻略
Open Generative AI(简称 OGA)是一个免费的、开源的 AI 图像与视频生成桌面应用,内置 200+ 模型(Flux、Midjourney、Kling、Sora、Veo、Seedance 2.5 等),无内容过滤器、无审查,MIT 协议可自托管,本质上是 MuAPI.ai 的前端桌面封装。 核心定位:绕过商业 AI 视频平台的内容限制,让用…
多模态 Anil-matcha/Open-Generative-AI Stars 26,047 Tom 2026-07-05
ruvnet/RuView · 上手攻略
RuView 是一个基于 WiFi CSI(信道状态信息) 的空间智能感知系统——利用普通路由器发出的无线信号,经墙壁反射后的人体扰动来检测:有人在与否、呼吸频率、心率、跌倒、活动姿态、房间占用情况。全程不需要任何摄像头、麦克风或可穿戴设备。 核心技术:用 ESP32 板子 + Cognitum Seed(边缘 AI 协处理器)读取 WiFi CSI 数据,…
多模态 ruvnet/RuView Stars 89,443 Tom 2026-07-05