Guides · organized/guides

仓库攻略

9 篇 · 9 个项目 · 多模态 · tom · RAG 检索增强

rookiestar28/ComfyUI-OpenClaw · 上手攻略
ComfyUIOpenClaw 是 ComfyUI 的安全优先编排层,将 ComfyUI 从纯生成工具升级为可自动化、可管控的生产级 AI 工厂。核心思路是:在不修改 ComfyUI 本身的前提下,通过自定义节点 + 嵌入式 HTTP API + 独立管理控制台,把 ComfyUI 变成一个可靠的自动化目标。 项目自称"安全第一",体现在:RBAC 权限控制…
多模态 rookiestar28/ComfyUI-OpenClaw Stars 557 Tom 2026-08-27
all-in-aigc/aiwallpaper · 上手攻略
allinaigc/aiwallpaper 是一个开源 AI 壁纸生成 Web 应用,用户输入文字描述即可生成定制壁纸。核心技术基于扩散模型(推测为 OpenAI DALLE 或 GPT Image API),产品层面是一套完整的 SaaS 前后端架构,集成了用户认证、支付、对象存储和数据库,适合作为"AI 生成式 Web 应用"的参考样板。 官方在线演示:…
多模态 all-in-aigc/aiwallpaper Stars 716 Tom 2026-08-26
LearnPrompt/LearnPrompt · 上手攻略
LearnPrompt 是一个永久免费开源的中文 AI 学习教程仓库,由 B站 up 主"卡尔的AI沃茨"(GitHub @LearnPrompt)维护。它起步于 2023 年的 AIGC 工具教程(ChatGPT、Midjourney、Stable Diffusion),如今已演化为一套面向真实工作场景的 AI Native 教程体系,涵盖 Claude …
多模态 LearnPrompt/LearnPrompt Stars 2,580 Tom 2026-08-20
JaidedAI/EasyOCR · 上手攻略
EasyOCR 是一个用 PyTorch 开发的通用 OCR(光学字符识别)Python 库,开箱即用,支持 80+ 语言,涵盖 Latin、CJK(简繁体中文、日文、韩文)、Arabic、Devanagari、Cyrillic 等所有主流书写系统,同时处理自然场景文本和文档密集文本。 v1.7.2(2024 年 9 月)是当前最新正式版。自 2020 年起…
多模态 JaidedAI/EasyOCR Stars 29,861 Tom 2026-08-18
NVIDIA-AI-Blueprints/video-search-and-summarization · 上手攻略
NVIDIA Video Search and Summarization(VSS)Blueprint 是一套GPU 加速的视频语义理解和分析参考架构。它将视觉语言模型(VLM,如 NVIDIA Cosmos)、大语言模型(LLM,如 Nemotron)、RAG 和 NVIDIA NIM 微服务整合在一起,实现用自然语言搜索视频内容、实时异常检测、视频问答和…
多模态 NVIDIA-AI-Blueprints/video-search-and-summarization Stars 1,790 Tom 2026-08-15
Moonvy/OpenPromptStudio · 上手攻略
Moonvy/OpenPromptStudio(又称 OPS · Open Prompt Studio)是一个面向 AIGC 创作者的中文提示词(Prompt)可视化编辑器。它的核心功能是把 Midjourney 等文生图模型的提示词拆解成可编辑的结构化组件,支持翻译、可视化预览、图片导出和提示词词典管理。 该工具诞生于 2023 年,主打"所见即所得"的提…
多模态 Moonvy/OpenPromptStudio Stars 6,648 Tom 2026-08-11
img2threejs/img2threejs · 上手攻略
img2threejs 是一个代码优先的图像→3D 重建工具。你给它一张参考图,它生成一段 TypeScript 代码,在浏览器里跑出一个 THREE.Group 工厂函数——所有几何体都由原始几何体(BoxGeometry、CylinderGeometry 等)、程序化着色器和生成式几何拼出来,没有 mesh 文件,没有 GLB 下载,产物天然是"代码"而…
多模态 img2threejs/img2threejs Stars 10,708 Tom 2026-07-26
mudler/LocalAI · 上手攻略
LocalAI 是一个开源的本地 AI 推理引擎,2026 年 7 月 Stars 约 4.7 万,周增约 +126。核心理念是「小核心 + 按需加载后端」:每个后端(llama.cpp、vLLM、whisper.cpp、stablediffusion、MLX 等)都是独立的 OCI 镜像,只在你需要某类模型时才拉取安装。最新稳定版为 v4.3.0(2026…
多模态 mudler/LocalAI Stars 48,383 Tom 2026-07-10
baidu/Unlimited-OCR · 上手攻略
UnlimitedOCR 是百度开源的多模态文档解析模型,定位是「一键长文档解析」——单张图片、PDF 多页、整本手册均可一次性处理,输出结构化文本。发布于 2026 年 6 月,arXiv 论文编号 2606.23050。 官方将其定位为对 DeepSeekOCR 的进一步推进,核心能力: 传统 OCR + NLP 管道有三个常见痛点: 1. 多步骤串联:…
多模态 baidu/Unlimited-OCR Stars 23,399 Tom 2026-07-06