labelImg 是一个开源的图形化图像标注工具,由 Tzutalin 开发维护,现归属 HumanSignal(Label Studio 社区)管理。它用 Python + Qt 编写,提供直观的 GUI,让用户通过鼠标框选来标注目标物体,生成标准格式的标注文件。标注结果支持 PASCAL VOC XML、YOLO TXT 和 CreateML JSON …
仓库攻略
160 篇 · 159 个项目 · tom · 多模态
CLIP(Contrastive LanguageImage PreTraining)是 OpenAI 在 2021 年发布的图文多模态模型,论文为 Learning Transferable Visual Models From Natural Language Supervision。它的核心思想是用大规模图文配对数据训练一个联合 embedding 空…
EasyOCR 是一个用 PyTorch 开发的通用 OCR(光学字符识别)Python 库,开箱即用,支持 80+ 语言,涵盖 Latin、CJK(简繁体中文、日文、韩文)、Arabic、Devanagari、Cyrillic 等所有主流书写系统,同时处理自然场景文本和文档密集文本。 v1.7.2(2024 年 9 月)是当前最新正式版。自 2020 年起…
OCRmyPDF 是一个为 PDF 添加 OCR 文字层的命令行工具,它调用 Tesseract OCR 引擎,将扫描件、影印件等图片型 PDF 转化为可搜索、可复制文字的 PDF/A(适合长期归档的可移植 PDF 子集)。 它的核心价值在于「精准」——OCR 文字会精确地嵌入到原始图片下方,保证复制粘贴时位置准确,不出现文字错位;输出文件通常比输入更小(经…
textgen(全称 oobabooga/textgenerationwebui)是一个开源本地大模型桌面应用,支持文本生成、视觉理解(多模态)、工具调用、网页搜索、LoRA 微调,以及 OpenAI / Anthropic 兼容 API。口号是「100% 离线、零遥测」——不需要任何外部服务,所有模型和数据都在你自己的机器上。 它是原本大名鼎鼎的「text…
dshvisionrouter 是 DeepSeek Harness(DSH)的视觉增强插件,专为"只能处理文本"的 Agent 提供图像理解能力。它的核心思路是:把看图变成一次普通的工具调用,让 Agent 可以用 vision_ground、vision_crop、vision_describe 等 11 个像素级工具按需操作图像,而不是把图片压缩成一段…
Stable Diffusion 是 CompVis 团队(海德堡大学)开发的潜在扩散模型(Latent Diffusion Model),通过文本提示生成照片级图像。该项目是 Stability AI 和 Runway 合作的产物,在 2022 年 CVPR 以 Oral 论文发表,相关论文 HighResolution Image Synthesis w…
secondbrainskills 是一组为 Claude Code 打造的自定义 Skills 合集,将 Claude Code 从单纯的代码助手扩展为「第二大脑」——能够系统性捕获、组织和运营知识的工作流系统。 核心哲学是渐进式上下文披露(Progressive Disclosure of Context):Claude 只在需要时才加载详细指令,保持上…
llama.cpp 是一个纯 C/C++ 实现的高性能 LLM 推理框架,核心目标是在各种硬件上以最小化依赖和最优性能跑本地大模型。它基于底层的 ggml 库构建,支持 FP16 和 GGUF 量化格式,Star 122,572(无周增,长期稳定),是本地 LLM 推理领域最活跃的开源项目之一。 核心特点: 纯 C/C++ 实现,无外部依赖(除少量单文件 H…
dshtianshutui(npm 包名 @huiliyi37/dshtianshutui)是 DeepSeek Harness(官方 CLI @deepseekai/dsh)的交互式终端极简风格 UI 插件。它以自研 ANSI 渲染为核心,在官方 Web UI 之外提供类 Claude Code 风格的纯终端对话界面,并叠加了 TDD 工作流、证据门、视觉…
dshwebui 是给 DeepSeek Harness(以下简称 DSH)Web GUI 的一站式插件与皮肤全家桶,通过官方 profile 机制挂载,不改 DSH 源码。所有插件以 npm 包发布(@linxin666/ scope),可逐个安装也可一次性装齐。 仓库包含 11 个子包,核心能力如下: | 能力 | 说明 | ||| | 梁神模式 | 面…
PixelleMCP 是一个基于 MCP 协议的开源多模态 AIGC 解决方案,核心思路是把 ComfyUI 工作流一键转成 MCP 工具,让 LLM(Claude Desktop、Cursor 等)通过自然语言直接驱动 ComfyUI 图像生成。它支持本地 ComfyUI 和云端 RunningHub 两种执行引擎,提供 Web 界面、MCP 服务器和文件…
NVIDIA Video Search and Summarization(VSS)Blueprint 是一套GPU 加速的视频语义理解和分析参考架构。它将视觉语言模型(VLM,如 NVIDIA Cosmos)、大语言模型(LLM,如 Nemotron)、RAG 和 NVIDIA NIM 微服务整合在一起,实现用自然语言搜索视频内容、实时异常检测、视频问答和…
Pix2Text(简称 P2T)是一个开源 Python 工具,核心功能是把图片(含数学公式、表格、版面布局)识别并转换为 Markdown 格式,定位是 Mathpix 的免费开源替代品。 2025 年 7 月升级到 V1.1.4 后,数学公式检测(MFD)和识别(MFR)模型均已升级到 1.5 版本,版面分析引入 DocLayoutYOLO 模型,整体识…
封神榜(FengshenbangLM) 是 IDEA 研究院认知计算与自然语言研究中心(CCNL)主导的中文大模型开源体系,2021 年 11 月由沈向洋在 IDEA 大会上正式发布。定位是"中文认知智能的基础设施",旗下包含 6 大模型系列,覆盖从语言理解到多模态生成的完整 NLP 任务。 三个子项目协同工作: Fengshenbang Model:预训练…
youtubetoebook 是一个将 YouTube 频道视频自动转成 EPUB 电子书的 Python 工具链。它的工作流是:抓频道最新视频 → 提取字幕 → 丢给 Claude 改写成杂志风文章 → 打包成 EPUB → 可选邮件推送。作为 Claude Code Skill 使用时,对话中一句"Set up YouTube to ebook for …
Humanize PPT 是一个 AI Agent Skill(Codex / Claude Code / Hermes 等),核心功能是把任意资料编排成一条"能上台讲"的演讲线,而不是一堆"只能看"的漂亮页面。它不做渲染,而是指挥下游渲染 skill 出图出视频,编排完后跑自动演讲体检,最后交付演讲模式或原生 PPTX。 它的核心理论叫 AST(Audie…
sorafm 是一个基于 Next.js 的开源 Sora AI 视频生成 Web 应用,提供可视化界面来管理和展示由 OpenAI Sora 生成的 AI 视频内容。项目支持 Docker 部署,可以在本地或私有服务器上快速搭建一个 Sora 视频展示站点。 技术栈:Next.js(前端框架)+ PostgreSQL(数据库)+ Tailwind CSS(…
genieincodebottle/generativeai 是一个 GenAI 全景学习资源库,自称「一站式 GenAI 学习中心」。内容覆盖完整学习路线图(Roadmap)、22 个学习 track、300+ 模块、9 个实战项目、面试准备(13 个模块)、简历优化,以及大量配套 PDF / Notebook 资源。配套运营一个独立平台 AIML Com…
NVIDIA/GenerativeAIExamples 是 NVIDIA 官方的生成式 AI 参考工作流仓库,针对加速基础设施(GPU/NIM 微服务)做了深度优化,涵盖 RAG 管道、Agentic 工作流、知识图谱、视觉 NIM 工作流、Data Flywheel 完整闭环等场景。当前最新 release 为 v0.8.x(2025 年),目录结构已完成…
HITszTMG/VideoClaw 是一个面向创意视频生产的 AI 导演系统,来自哈尔滨工业大学(深圳)TMG 实验室。它不是单点式的文生视频工具,而是一条覆盖"剧本策划 → 角色/场景设计 → 分镜规划 → 参考图生成 → 视频生成 → 后期剪辑"的全流程生产线。 用户只需给出一句想法或故事梗概,VideoClaw 就会自动拆解为可执行的影视工作流,生成…
Skylight 是一个将头顶飞机实时投影到天花板的开源项目。配合 RTLSDR 接收器和解码程序,它把 ADSB 信号渲染成画面:飞机以机型专属图标(宽体客机、支线客机、直升机螺旋桨旋转)叠加在真实星空层(太阳、月亮、行星、ISS 人造卫星)上,投影到天花板上——就像给屋顶装了一扇透视窗。 核心价值:"X光看屋顶" —— 你听到头顶有飞机飞过,它同时也划过…
Remotion Agent Skills 是 Remotion 官方维护的 AI Agent 技能库,定义了在 Remotion 项目中工作的最佳实践。通过 npx skills add 安装后,Claude Code、Codex、Kimi Code、Cursor 等 AI 编程助手就能"懂得"如何正确地生成 Remotion 视频代码,而不只是盲目生成 …
FlashRAG 是中国人民大学 NLPIR 实验室开源的 RAG(检索增强生成)研究 Python 工具包,已被 WWW 2025 Resource Track 接收。 核心理念:RAG 研究门槛高——需要分别找数据集、实现各算法、搭评估流程,碎片化严重。FlashRAG 提供一站式解决方案:36 个预处理基准数据集 + 23 个 SOTA RAG 算法(…
agentspriteforge 是一个面向 AI 编程助手(Codex / Grok Build)的 2D 游戏资产生成 Skill 合集。用户用自然语言描述想要的精灵、地图或动画,AI 助手自动完成:图像生成 → 本地脚本后处理 → 导出 engineready 资产。全程无需手动操作像素。 核心不是一堆提示词模板,而是一个流水线框架:AI 判断资产类型…
devbrowser 是一个让 AI Agent(如 Claude Code、Codex)直接控制浏览器的 Claude Skill。它通过在 QuickJS WASM 沙箱中执行 JavaScript 脚本,实现浏览器自动化操作,同时保证宿主系统安全——脚本没有文件系统或网络访问权限。 核心定位:在 AI Coding 场景下,提供比传统 Playwrig…
代表攻略
WeThinkIn/AIGC-Interview-Book · 上手攻略
《三年面试五年模拟》是一份中文开源 AIGC / 大模型 / AI Agent 算法工程师面试百科全书,由 AIGCmagic 社区维护,GitHub 星标 4276(截至 20260809,周增 +21)。内容分为算法岗和开发岗两大方向:算法岗覆盖 AIGC、LLM 大模型、AI Agent、具身智能、传统深度学习、计算机视觉、自然语言处理、强化学习、自动…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
WeThinkIn/AIGC-Interview-Book
Stars 4,823
代表
WeThinkIn/AIGC-Interview-Book
Stars 4,823
firstmate 是一个多 Agent 编队运行框架(agent distro),其核心理念是: 你只和一个 Agent(first mate / 大副)说话,它来管理一整支 Agent 团队(crew),在独立 git worktree 中并行完成任务,最终把结果交给你。 作者将你自己定位为"船长"(captain),firstmate 是你的"大副",…
MeiGen(美哏)是一个开源 MCP(Model Context Protocol)服务器,让 AI 编程工具直接变身专业 AI 设计师。它集成了 9 个 MCP 工具 + 1446 条精挑提示词,覆盖图片生成、视频生成、灵感搜索、产品摄影、海报设计等任务,支持 GPT Image 2、Midjourney V8.1、Flux 2 Klein、Seedan…
MengTo(梦溪)是一个设计圈知名创作者(著有《Design + Code》),其 Skills 仓库是一套精选的 AI Agent Skill 集合,专门服务设计师和开发者使用 Codex、Claude、Cursor 等 AI 编码工具构建高质量 UI、游戏和前端工作流。 每个 Skill 是一个独立文件夹,内含 SKILL.md(技能定义)、可选的 R…