OmacVM 是一个开源项目,让你在 Mac 上运行 Omarchy(一个类 macOS 的 Linux 发行版)虚拟机时,获得接近原生 macOS 的体验。它的核心价值在于解决 VM 运行 Linux 时的"割裂感":Mac 的 WiFi、蓝牙、声音、键盘、触控板、显示器、Touch ID 等硬件能力可以通过 OmacVM Bridge 直接透传到虚拟机里…
仓库攻略
106 篇 · 105 个项目 · 多模态
PhotoCraft 是用纯 Rust 从零实现的开源 Adobe Photoshop 替代品,隶属于 ArtCraft 社区。与依赖 Electron/WebView 的方案不同,它使用 wgpu 作为 GPU 渲染后端,支持 Metal、Vulkan、DX12 和 WebGPU,覆盖 macOS、Windows、Linux、FreeBSD,并可通过 We…
oilui 是一个 AI 原生 UI 设计方法论框架,本质上是一套结构化设计流程(不是 Figma 插件,也不是代码库),通过一套明确的步骤让 AI Agent 生成高质量、可交付的网页或 App 界面设计。 它以 Claude Code Skill(或兼容 npx skills 的 Agent)的形式分发,安装后直接把设计任务交给 Agent,Agent …
BeefTV 是一款本地优先的轻量级 AI 原生视频创作工作台。它在一个自由画布上连接创意、模型与素材,支持从提示词或参考素材直接生成文字、图片、视频与音频,并允许用户对生成结果继续裁切、标注、局部重绘、拆分和组合迭代。 核心理念:AI 不是附加按钮,而是工作流的一部分。生成、参考与工具能力都长在画布上,结果写回后可继续编辑、可复用、可继续生成。 技术栈:桌…
PolymarketPerpetualBot 是一个面向 Polymarket 预测市场的终端交易机器人,基于 Polymarket 的 Polygon CLOB(Central Limit Order Book)API 构建。它以键盘驱动的 TUI(终端用户界面)呈现,集成了行情浏览、实时订单簿查看、策略引擎和持仓追踪四大模块,支持模拟交易(paper t…
BridgeClip 是一款开源 AI 视频剪辑桌面应用,由 BridgeMind 开发,核心场景是将播客、直播、YouTube/Twitch 录播自动剪辑成带字幕的短视频片段。它本质上是一条本地 AI 流水线:用 ytdlp 下载源视频或解析链接 → 调用 OpenRouter 上的转录模型生成时间轴字幕 → 调度 LLM 找出"最有传播力的时刻" → 用…
§0 自检:1) 公开 README 抓取 ✓ · 2) GitHub 200 OK ✓ · 3) Android/iOS 构建命令均来自 README ✓ · 4) 许可证 PolyForm Noncommercial 1.0.0(README 显式标注)✓ · 5) 反方 v2 三段式按主线分布(见 §6)✓ · 6) 立标候选(主分类:移动端本地多模态…
§0 自检:1) 公开 README 抓取 ✓ · 2) GitHub 200 OK ✓ · 3) 安装/卸载命令均来自 README ✓ · 4) whisper 模型大小 1.6 GB 由 README 给出 ✓ · 5) 反方 v2 三段式按主线分布(见 §6)✓ · 6) 立标候选(主分类: 桌面端会议录制;副分类: 本地 ASR;★ 候选)✓ · …
YuE2Studio 是 YuE2(MAP 团队开源歌曲模型)的桌面工作室。YuE2 是一个约 30 亿参数的音乐生成模型,输入歌词和风格描述,先写一份可编辑的乐谱(ABC 记谱法),再基于乐谱演唱为完整歌曲——含人声、伴奏、节拍结构(引子/主歌/副歌/桥段/尾奏)。 传统 AI 音乐工具生成后无法修改,YuE2Studio 的核心差异化在于乐谱先行、演出可…
AI Model World(大模型世界)是一个把 500+ 大模型可视化成像素小镇的互动网站。每个模型是某家厂商"小屋"里的一个像素角色,网站首页八块领奖台分别标注"今日最聪明""最会编程""最划算""最便宜""记性最好""最新发布""国内最强""开源最强",三秒扫完当天格局。背后数据来自 models.dev、Epoch AI、LiveBench、Hug…
doubaosay 是一款面向 Linux(Hyprland/Wayland 和原生 X11) 的独立语音输入应用,基于 GTK4 构建,默认使用豆包网页账号识别(免费),也可切换到火山引擎官方 Seed ASR 2.0 API(按量付费)。核心功能是让你在任意 Linux 应用里用快捷键触发语音输入,识别结果自动粘贴或直接打字进目标窗口。 它不是一个 AI…
academicwritingskills 是面向 Claude Code / ChatGPT / Codex / OpenCode / Hermes Agent 等 Agent Skills 兼容客户端的论文写作 skill 套件(MIT 协议,Star ~49、周增 +16)。它把"研究定位 → 论点架构 → 扩展大纲 → 证据驱动的写作 → 双向对齐 …
⚠️ 数据来源:仅 GitHub README 原文 + Remotion / Claude Code / Codex 官网(截至 20260913 抓取)。web_search 命中的 X、Instagram、SkillsLLM 等三方页视为不可信,不引用其 stars / forks 数字。本文不下 npm、不跑 Remotion、不发 TTS 调用。 …
DLSS5NeuralScreen 将 NVIDIA DLSS 5 神经渲染技术应用到整个 Windows 桌面,实时提升所有画面质量。游戏、视频、图片、文档——屏幕上的一切都经过和 DLSS 5 游戏相同的神经网络处理后输出,实现全局画面增强。项目基于泄露的 NVIDIA 310.8.0 运行时(sm_75/86/89/120 内核,支持 RTX 2050…
Sa2VA 是字节跳动 Seed 团队联合 UC Merced / WHU / PKU 在 2026 年开源的 Pixel LLM 系列旗舰仓库,核心论文《Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos》已被 IEEE TPAMI 202…
pierrenade/shortvideogeneratorAI 是一个将 YouTube 视频或本地视频自动转化为竖屏短视频(Shorts / Reels)的开源工具,主打免费、无水印、AI 驱动的精彩片段提取 + 字幕 + 配音全流程一条龙。 它的核心链路是:输入 YouTube 链接(或本地视频)→ fasterwhisper 字幕提取 → LLM 识…
PyGPT 是一个开源桌面 AI 助手,用 Python 开发,支持 Linux / Windows 1011 / Mac 三平台。它的工作方式类似 ChatGPT,但完全离线运行在你自己电脑上——API 密钥你自己管,数据不经过任何第三方服务器。 当前版本 2.8.6(build 20260903),支持从 GPT5、GPT4、o1/o3/o4,到 Goo…
course2md 是一个将 YouTube、Bilibili 或本地视频(网课、录屏、会议录像)转换为带截图的图文 Markdown / HTML 讲义的命令行工具。核心流程:下载视频 → 按画面变化采样关键帧截图 → 语音识别转文字 → 自动对齐文字与截图 → 输出结构化笔记。最新版本 v0.7.0(2026) 新增断点续传与 LLM 字幕润色功能。 看…
OMNI 是一个 Rust 写的本地 CLI + host hooks 套件,专为 agent 宿主(Claude Code、Codex CLI、Gemini CLI、OpenClaw、Cursor、Aider、Hermes、Pi、Cline、Roo、Copilot 等)做工具输出瘦身。它有两件普通过滤器做不到的事,下面分别展开。它做两件普通过滤器做不到的事…
「早耳」(hayamimi,日语"快耳"之意)是一个纯 CPU 运行的实时多语言语音转文字工具,主打"开口即出字幕"的极低延迟体验。核心设计理念是:不用 GPU、不用云端 API、一台普通电脑 + 2GB 内存就能跑。 它不依赖 Whisper 单一模型打天下,而是通过 sherpaonnx 调度一个包含 5 条路由的多模型 специалист 体系——每…
代表攻略
wshzd/Awesome-AIGC · 上手攻略
wshzd/AwesomeAIGC 是一份中文 AIGC 资料汇总型仓库,以「论文分享 / 访谈 / 模型评测 / 行业动态」为单位收录条目,附带外链(arXiv、知乎、微信公众号、B 站等)。与 f/awesomechatgptprompts、Hannibal046/AwesomeLLM 这类以英文为主的清单相比,它的定位是中文圈 AIGC 早期热度阶段的…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
wshzd/Awesome-AIGC
Stars 873
代表
gongminmin/awesome-aigc
Stars 569
Melodisco 是一款开源的 AI 音乐播放器,由独立开发者 idoubi 构建,所属组织 allinaigc。与传统音乐播放器不同,Melodisco 的核心能力是探索和播放 AI 生成的音轨,并提供音乐生成功能(通过 Suno 合作/集成),帮助用户在 AI 音乐快速崛起的大背景下发现和体验 AI 生成的音乐内容。 该项目托管于 GitHub(Sta…
ComfyUIOpenClaw 是 ComfyUI 的安全优先编排层,将 ComfyUI 从纯生成工具升级为可自动化、可管控的生产级 AI 工厂。核心思路是:在不修改 ComfyUI 本身的前提下,通过自定义节点 + 嵌入式 HTTP API + 独立管理控制台,把 ComfyUI 变成一个可靠的自动化目标。 项目自称"安全第一",体现在:RBAC 权限控制…
DSH Deep Whale 是 DeepSeek Harness(DSH)Web GUI 的鲸鱼娘系列主题皮肤仓库,由两个独立皮肤包(maidatelier / orcalink)和一个皮肤管理器组成,采用 CC BYNCSA 4.0 许可证开源发布。适合 DeepSeek Harness 用户个性化定制界面。 注意:这是主题皮肤,不是功能插件,不影响 D…
内容待复核
hitcslj/Awesome-AIGC-3D · 上手攻略
这是一份由香港科技大学(HKUST)团队维护的 AIGC 3D 论文精选列表,当前版本(v2.0,202604)已升级为一份生产导向的 3D 生成综述,通过二维分类法系统整理了从数据基座到场景组装的完整 3D AIGC 论文图谱。 核心定位:不是代码仓库,而是一份持续更新的 living survey,帮你快速定位某个子领域(如"文本生成角色骨骼绑定"或"世…
内容待复核
Kobaayyy/Awesome-CVPR2026-CVPR2025-ICCV2025-CVPR2024-ECCV2026-ECCV2024-AIGC · 上手攻略
这是一个 GitHub Awesome 类仓库,整理汇总 CVPR 2024–2026、ICCV 2025、ECCV 2024 和 2026 六大视觉顶会中与 AIGC(AIGenerated Content)相关的论文和代码,按任务类型分类组织。涵盖图像生成、图像编辑、视频生成、视频编辑、3D 生成、3D 编辑和多模态大语言模型七大方向,是跟踪 AIGC …
allinaigc/aiwallpaper 是一个开源 AI 壁纸生成 Web 应用,用户输入文字描述即可生成定制壁纸。核心技术基于扩散模型(推测为 OpenAI DALLE 或 GPT Image API),产品层面是一套完整的 SaaS 前后端架构,集成了用户认证、支付、对象存储和数据库,适合作为"AI 生成式 Web 应用"的参考样板。 官方在线演示:…
OCR It 是一款 Chrome / Firefox 浏览器扩展,解决一个具体问题:无法选文字的扫描文档、PDF 阅读器、幻灯片网页,用一次快捷键把页面截图 OCR 成文本。它的核心特性是本地离线 OCR——内置 Tesseract 引擎,截图片段完全在本地处理,扩展本身不发出任何网络请求,不调用任何云端 API。适合扫了整本纸质书或 PDF 后想提取全文…
coderonion/awesomellmandaigc 是一个 LLM / VLM / VLA / AIGC 领域的精选资源列表(Awesome List),按 Framework(模型/训练/推理/量化/RAG)、Application(IDE/聊天机器人/具身智能/代码助手/知识库等)、Dataset、Learning Resources、Commun…
AI Audio Datasets(AIADS)是一个持续更新的开源知识库,汇集了语音(Speech)、音乐(Music)和音效(Sound Effect)三大类高质量音频数据集,旨在为生成式 AI、AIGC、模型训练、智能音频工具开发和音频应用提供训练数据资源。仓库本身是一个精心分类的导航索引,每个数据集条目都附带了官方来源链接、数据规模说明和适用任务标注…