PaddleOCR 是百度飞桨(PaddlePaddle)团队开源的多功能 OCR 与文档解析工具包,GitHub Stars 超 8.4 万,被 Dify、RAGFlow、Cherry Studio 等主流项目深度集成。它不只是一套光学字符识别引擎,更是一个覆盖"图片→结构化数据"完整流程的文档 AI 基础设施。 当前稳定版本为 PaddleOCR 3.6…
仓库攻略
231 篇 · 228 个项目 · 多模态
vLLM 是一个高吞吐量、内存高效的 LLM 推理与服务引擎,最初由 UC Berkeley Sky Computing Lab 开发,现已成长为全球最活跃的开源 AI 基础设施项目之一,拥有来自 2000+ 贡献者的社区支持。 核心突破是 PagedAttention 技术——受操作系统虚拟内存分页启发,将 KV Cache 切分成小块动态管理,显著减少显…
ianxiaoheiillustrations 是一个面向 AI Agent(尤其是 Codex)的中文正文配图生成 Skill。它指导 AI 把中文文章、帖子、博客、方法论内容里的判断、流程、状态和隐喻,转化成一张张白底、手绘、怪诞但清爽的 16:9 正文配图。 核心特点:生成的不是通用插画 prompt,也不是 PPT 信息图模板,而是先理解文章认知锚点…
pxpipe 是一个本地请求代理,专门用来降低 Claude Code(以及其他基于 Anthropic API 的 Agent)的 token 消耗。它通过将大量文本内容(系统提示词、工具文档、历史记录)渲染为图片,再通过视觉通道传输,从而大幅压缩输入 token 数量。 核心逻辑:一张图片的 token 成本由像素尺寸决定,而不是内容长度。实测 dens…
LiteLLM 是一个统一调用 100+ 大模型 API 的 Python 库 + AI Gateway(代理服务器),用 OpenAI 格式作为统一接口,抹平各 provider(OpenAI、Anthropic、Gemini、Bedrock、Azure、HuggingFace、VLLM、NVIDIA NIM 等)的 API 差异,同时提供成本追踪、虚拟 …
aiengineeringfromscratch 是一个从数学基础到多 Agent 生产部署的系统性 AI 工程课程,包含 503 节课程、20 个阶段,覆盖 Python / TypeScript / Rust / Julia 四种语言,MIT 许可证,完全免费。 它的核心理念是 Build It Before You Use It——在学习任何框架或工具…
lottie 是 Diffusion Studio 出品的开源 Skill(工具包),让 Claude Code 或 Codex 等 Coding Agent 通过自然语言指令直接生成可投产级别的 Lottie 动画 JSON 文件。 它的核心工作流是:你在对话中描述想要的动画效果(基于 SVG、截图或真实数据),Agent 调用 diffusionstud…
UnlimitedOCR 是百度开源的多模态文档解析模型,定位是「一键长文档解析」——单张图片、PDF 多页、整本手册均可一次性处理,输出结构化文本。发布于 2026 年 6 月,arXiv 论文编号 2606.23050。 官方将其定位为对 DeepSeekOCR 的进一步推进,核心能力: 传统 OCR + NLP 管道有三个常见痛点: 1. 多步骤串联:…
Open Generative AI(简称 OGA)是一个免费的、开源的 AI 图像与视频生成桌面应用,内置 200+ 模型(Flux、Midjourney、Kling、Sora、Veo、Seedance 2.5 等),无内容过滤器、无审查,MIT 协议可自托管,本质上是 MuAPI.ai 的前端桌面封装。 核心定位:绕过商业 AI 视频平台的内容限制,让用…
RuView 是一个基于 WiFi CSI(信道状态信息) 的空间智能感知系统——利用普通路由器发出的无线信号,经墙壁反射后的人体扰动来检测:有人在与否、呼吸频率、心率、跌倒、活动姿态、房间占用情况。全程不需要任何摄像头、麦克风或可穿戴设备。 核心技术:用 ESP32 板子 + Cognitum Seed(边缘 AI 协处理器)读取 WiFi CSI 数据,…
OOMWOO 是一个完全开源的自制扫地机器人项目,目标是用树莓派(Raspberry Pi 5)、ROS2、Home Assistant 和 3D 打印技术,打造一台价格亲民、支持 2D LiDAR 地图构建与自主导航的家用清洁机器人。Apache License 2.0(代码),Stars 3.4k,当前版本 v0(barebones 阶段)。 项目核心特…
unitymcp(MCP for Unity)是一个基于 Model Context Protocol(MCP)的 Unity 编辑器桥接工具,让 AI 助手(Claude、Codex、Cursor、VS Code 等 MCP 兼容客户端)能够直接操控 Unity Editor——创建场景和 GameObject、编写 C# 脚本、管理资产、运行测试、构建项…
obsidianskills 是由 kepano(Obsidian 核心插件开发者)维护的 Agent Skills 集合,让 AI 编程助手(Claude Code、Codex、OpenCode 等)能够理解并操作 Obsidian 的专有格式。遵循 Agent Skills 规范,以 .claude/skills/ 目录结构 + SKILL.md 元数据…
HyperFrames 是 HeyGen 开源的HTML 到 MP4 视频渲染框架,stars 33K+(另有同名仓库差异),周增 +651。核心能力:用写网页的方式定义视频——视频即 HTML,动画即 seekable 动画,渲染引擎通过 headless Chrome seek 到指定帧并用 FFmpeg 编码输出确定性 MP4。 设计上深度面向 AI …
aiwebsiteclonertemplate 是一个可复用的 AI 网站克隆模板项目,用 AI Coding Agent(推荐 Claude Code)将任意公开网站逆向重建为一个干净的 Next.js 现代代码库。 核心思路:给 AI Agent 一个 URL,Agent 自动完成截图、设计 token 提取、组件规格撰写、并行构建、最终组装——你只需要…
Open Design 是 Claude Design(Anthropic 2026 年 4 月发布的 AI 设计工具)的开源替代方案。它是一个本地优先的 Agentic 设计工作空间,让你的代码 Agent(Claude Code / Codex / Cursor 等)直接成为设计引擎,输出真实可用的原型页面、数据看板、演示文稿、图片和视频。 核心特点: …
UI UX Pro Max Skill 是一个面向 AI coding agent 的设计智能 Skill,核心功能是 Design System Generator(设计系统生成器)——根据你描述的项目类型,自动推理并输出完整的设计系统:页面模式、配色、字体、动效、行业反模式、交付检查清单,全部结构化输出。 它不是一次生成一个按钮样式,而是根据"我要做一个…
对照 CNN 的局部归纳偏置、ViT 的规模化学习、CLIP 的图文对齐与 Diffusion 的可控生成。 先掌握表征学习的变化,再进入生成模型;不建议把所有架构只按发表时间排列。