Stable Diffusion 是 CompVis 团队(海德堡大学)开发的潜在扩散模型(Latent Diffusion Model),通过文本提示生成照片级图像。该项目是 Stability AI 和 Runway 合作的产物,在 2022 年 CVPR 以 Oral 论文发表,相关论文 HighResolution Image Synthesis w…
仓库攻略
124 篇 · 123 个项目 · tom · 多模态
secondbrainskills 是一组为 Claude Code 打造的自定义 Skills 合集,将 Claude Code 从单纯的代码助手扩展为「第二大脑」——能够系统性捕获、组织和运营知识的工作流系统。 核心哲学是渐进式上下文披露(Progressive Disclosure of Context):Claude 只在需要时才加载详细指令,保持上…
llama.cpp 是一个纯 C/C++ 实现的高性能 LLM 推理框架,核心目标是在各种硬件上以最小化依赖和最优性能跑本地大模型。它基于底层的 ggml 库构建,支持 FP16 和 GGUF 量化格式,Star 122,572(无周增,长期稳定),是本地 LLM 推理领域最活跃的开源项目之一。 核心特点: 纯 C/C++ 实现,无外部依赖(除少量单文件 H…
dshtianshutui(npm 包名 @huiliyi37/dshtianshutui)是 DeepSeek Harness(官方 CLI @deepseekai/dsh)的交互式终端极简风格 UI 插件。它以自研 ANSI 渲染为核心,在官方 Web UI 之外提供类 Claude Code 风格的纯终端对话界面,并叠加了 TDD 工作流、证据门、视觉…
dshwebui 是给 DeepSeek Harness(以下简称 DSH)Web GUI 的一站式插件与皮肤全家桶,通过官方 profile 机制挂载,不改 DSH 源码。所有插件以 npm 包发布(@linxin666/ scope),可逐个安装也可一次性装齐。 仓库包含 11 个子包,核心能力如下: | 能力 | 说明 | ||| | 梁神模式 | 面…
PixelleMCP 是一个基于 MCP 协议的开源多模态 AIGC 解决方案,核心思路是把 ComfyUI 工作流一键转成 MCP 工具,让 LLM(Claude Desktop、Cursor 等)通过自然语言直接驱动 ComfyUI 图像生成。它支持本地 ComfyUI 和云端 RunningHub 两种执行引擎,提供 Web 界面、MCP 服务器和文件…
NVIDIA Video Search and Summarization(VSS)Blueprint 是一套GPU 加速的视频语义理解和分析参考架构。它将视觉语言模型(VLM,如 NVIDIA Cosmos)、大语言模型(LLM,如 Nemotron)、RAG 和 NVIDIA NIM 微服务整合在一起,实现用自然语言搜索视频内容、实时异常检测、视频问答和…
Pix2Text(简称 P2T)是一个开源 Python 工具,核心功能是把图片(含数学公式、表格、版面布局)识别并转换为 Markdown 格式,定位是 Mathpix 的免费开源替代品。 2025 年 7 月升级到 V1.1.4 后,数学公式检测(MFD)和识别(MFR)模型均已升级到 1.5 版本,版面分析引入 DocLayoutYOLO 模型,整体识…
封神榜(FengshenbangLM) 是 IDEA 研究院认知计算与自然语言研究中心(CCNL)主导的中文大模型开源体系,2021 年 11 月由沈向洋在 IDEA 大会上正式发布。定位是"中文认知智能的基础设施",旗下包含 6 大模型系列,覆盖从语言理解到多模态生成的完整 NLP 任务。 三个子项目协同工作: Fengshenbang Model:预训练…
youtubetoebook 是一个将 YouTube 频道视频自动转成 EPUB 电子书的 Python 工具链。它的工作流是:抓频道最新视频 → 提取字幕 → 丢给 Claude 改写成杂志风文章 → 打包成 EPUB → 可选邮件推送。作为 Claude Code Skill 使用时,对话中一句"Set up YouTube to ebook for …
Humanize PPT 是一个 AI Agent Skill(Codex / Claude Code / Hermes 等),核心功能是把任意资料编排成一条"能上台讲"的演讲线,而不是一堆"只能看"的漂亮页面。它不做渲染,而是指挥下游渲染 skill 出图出视频,编排完后跑自动演讲体检,最后交付演讲模式或原生 PPTX。 它的核心理论叫 AST(Audie…
sorafm 是一个基于 Next.js 的开源 Sora AI 视频生成 Web 应用,提供可视化界面来管理和展示由 OpenAI Sora 生成的 AI 视频内容。项目支持 Docker 部署,可以在本地或私有服务器上快速搭建一个 Sora 视频展示站点。 技术栈:Next.js(前端框架)+ PostgreSQL(数据库)+ Tailwind CSS(…
genieincodebottle/generativeai 是一个 GenAI 全景学习资源库,自称「一站式 GenAI 学习中心」。内容覆盖完整学习路线图(Roadmap)、22 个学习 track、300+ 模块、9 个实战项目、面试准备(13 个模块)、简历优化,以及大量配套 PDF / Notebook 资源。配套运营一个独立平台 AIML Com…
NVIDIA/GenerativeAIExamples 是 NVIDIA 官方的生成式 AI 参考工作流仓库,针对加速基础设施(GPU/NIM 微服务)做了深度优化,涵盖 RAG 管道、Agentic 工作流、知识图谱、视觉 NIM 工作流、Data Flywheel 完整闭环等场景。当前最新 release 为 v0.8.x(2025 年),目录结构已完成…
HITszTMG/VideoClaw 是一个面向创意视频生产的 AI 导演系统,来自哈尔滨工业大学(深圳)TMG 实验室。它不是单点式的文生视频工具,而是一条覆盖"剧本策划 → 角色/场景设计 → 分镜规划 → 参考图生成 → 视频生成 → 后期剪辑"的全流程生产线。 用户只需给出一句想法或故事梗概,VideoClaw 就会自动拆解为可执行的影视工作流,生成…
Skylight 是一个将头顶飞机实时投影到天花板的开源项目。配合 RTLSDR 接收器和解码程序,它把 ADSB 信号渲染成画面:飞机以机型专属图标(宽体客机、支线客机、直升机螺旋桨旋转)叠加在真实星空层(太阳、月亮、行星、ISS 人造卫星)上,投影到天花板上——就像给屋顶装了一扇透视窗。 核心价值:"X光看屋顶" —— 你听到头顶有飞机飞过,它同时也划过…
Remotion Agent Skills 是 Remotion 官方维护的 AI Agent 技能库,定义了在 Remotion 项目中工作的最佳实践。通过 npx skills add 安装后,Claude Code、Codex、Kimi Code、Cursor 等 AI 编程助手就能"懂得"如何正确地生成 Remotion 视频代码,而不只是盲目生成 …
FlashRAG 是中国人民大学 NLPIR 实验室开源的 RAG(检索增强生成)研究 Python 工具包,已被 WWW 2025 Resource Track 接收。 核心理念:RAG 研究门槛高——需要分别找数据集、实现各算法、搭评估流程,碎片化严重。FlashRAG 提供一站式解决方案:36 个预处理基准数据集 + 23 个 SOTA RAG 算法(…
agentspriteforge 是一个面向 AI 编程助手(Codex / Grok Build)的 2D 游戏资产生成 Skill 合集。用户用自然语言描述想要的精灵、地图或动画,AI 助手自动完成:图像生成 → 本地脚本后处理 → 导出 engineready 资产。全程无需手动操作像素。 核心不是一堆提示词模板,而是一个流水线框架:AI 判断资产类型…
devbrowser 是一个让 AI Agent(如 Claude Code、Codex)直接控制浏览器的 Claude Skill。它通过在 QuickJS WASM 沙箱中执行 JavaScript 脚本,实现浏览器自动化操作,同时保证宿主系统安全——脚本没有文件系统或网络访问权限。 核心定位:在 AI Coding 场景下,提供比传统 Playwrig…
代表攻略
WeThinkIn/AIGC-Interview-Book · 上手攻略
《三年面试五年模拟》是一份中文开源 AIGC / 大模型 / AI Agent 算法工程师面试百科全书,由 AIGCmagic 社区维护,GitHub 星标 4276(截至 20260809,周增 +21)。内容分为算法岗和开发岗两大方向:算法岗覆盖 AIGC、LLM 大模型、AI Agent、具身智能、传统深度学习、计算机视觉、自然语言处理、强化学习、自动…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
WeThinkIn/AIGC-Interview-Book
Stars 4,304
代表
WeThinkIn/AIGC-Interview-Book
Stars 4,304
firstmate 是一个多 Agent 编队运行框架(agent distro),其核心理念是: 你只和一个 Agent(first mate / 大副)说话,它来管理一整支 Agent 团队(crew),在独立 git worktree 中并行完成任务,最终把结果交给你。 作者将你自己定位为"船长"(captain),firstmate 是你的"大副",…
MeiGen(美哏)是一个开源 MCP(Model Context Protocol)服务器,让 AI 编程工具直接变身专业 AI 设计师。它集成了 9 个 MCP 工具 + 1446 条精挑提示词,覆盖图片生成、视频生成、灵感搜索、产品摄影、海报设计等任务,支持 GPT Image 2、Midjourney V8.1、Flux 2 Klein、Seedan…
MengTo(梦溪)是一个设计圈知名创作者(著有《Design + Code》),其 Skills 仓库是一套精选的 AI Agent Skill 集合,专门服务设计师和开发者使用 Codex、Claude、Cursor 等 AI 编码工具构建高质量 UI、游戏和前端工作流。 每个 Skill 是一个独立文件夹,内含 SKILL.md(技能定义)、可选的 R…
academichumanizer 是一个针对学术论文和基金申请书的 AI 写作风格修订 skill,专为 Claude Code、Codex、MorphMind 等 AI coding/prose agent 设计。它的核心目标不是"检测 AI 生成内容",而是消除 AI 辅助写作中的机械腔、模板腔,让文字回到作者自己的声音,同时严格保持学术严谨性。 与市…
VGGTOmega(VGGTΩ)是 Meta AI 与牛津大学视觉几何组(VGG)联合发布的单次前向 3D 重建模型,输入一组图像(单张到数百张),直接输出相机内外参数、深度图、置信度图和场景 token——无需传统 SfM/Colmap 的迭代优化步骤。模型入选 CVPR 2026 Best Paper Finalist,是前作 VGGT(CVPR 202…
gcminimalzineposter 是一个 Codex(OpenAI 官方 AI 编程助手)技能,专门将任意主题、句子、物件、情绪、文章构想、照片或内容简报,转化为一张安静、极简 ZINE 风格编辑海报的提示词,并直接生成对应的位图图像。 它不是通用的图片生成工具——所有输出都围绕一种独特的美学:竖版 3:5 比例、70%–90% 留白、日式/韩式独立 …
Agency Agents 是一个面向 AI 编码工具的专家 Agent 人格库,以 Markdown 文件形式提供,每个 Agent 都有独立人格、专长域、可交付成果和工作流程。目前支持 Claude Code、Cursor、Codex、OpenCode、Gemini CLI、OpenClaw 等主流 Coding Agent,另有工程、安全、嵌入式、合规…
Transformers 是 Hugging Face 维护的 Python 库,提供超过 1M 个预训练模型检查点的统一加载、微调和推理接口。它覆盖文本(NLP)、计算机视觉、音频、视频和多模态五种模态,是目前最广泛使用的开源模型定义框架。 它的核心定位不是"又一个 PyTorch 工具箱",而是模型定义层的事实标准——如果一个模型在 transforme…
QM 是一个多人 AI 编程智能体平台,设计目标是让一个 AI 编程智能体服务于整个公司,而非仅限于个人助手。与传统单人 Copilot 不同,QM 通过「scope(作用域)」机制实现多用户隔离与协作: 核心:TypeScript / Node.js,HTTP 层用 Fastify Slack 插件:Scaffolded with Bolt Web UI:…