研究库 实战攻略
Guides · organized/guides

仓库攻略

69 篇 · 69 个项目 · 多模态 · tom

gillesgoetsch/OmacVM · 上手攻略
OmacVM 是一个开源项目,让你在 Mac 上运行 Omarchy(一个类 macOS 的 Linux 发行版)虚拟机时,获得接近原生 macOS 的体验。它的核心价值在于解决 VM 运行 Linux 时的"割裂感":Mac 的 WiFi、蓝牙、声音、键盘、触控板、显示器、Touch ID 等硬件能力可以通过 OmacVM Bridge 直接透传到虚拟机里…
多模态 gillesgoetsch/OmacVM Stars 150 Tom 2026-10-07
storytold/photocraft · 上手攻略
PhotoCraft 是用纯 Rust 从零实现的开源 Adobe Photoshop 替代品,隶属于 ArtCraft 社区。与依赖 Electron/WebView 的方案不同,它使用 wgpu 作为 GPU 渲染后端,支持 Metal、Vulkan、DX12 和 WebGPU,覆盖 macOS、Windows、Linux、FreeBSD,并可通过 We…
多模态 storytold/photocraft Stars 8,993 Tom 2026-10-07
oil-oil/oil-ui · 上手攻略
oilui 是一个 AI 原生 UI 设计方法论框架,本质上是一套结构化设计流程(不是 Figma 插件,也不是代码库),通过一套明确的步骤让 AI Agent 生成高质量、可交付的网页或 App 界面设计。 它以 Claude Code Skill(或兼容 npx skills 的 Agent)的形式分发,安装后直接把设计任务交给 Agent,Agent …
多模态 oil-oil/oil-ui Stars 581 Tom 2026-10-06
glanderness/BeefTV · 上手攻略
BeefTV 是一款本地优先的轻量级 AI 原生视频创作工作台。它在一个自由画布上连接创意、模型与素材,支持从提示词或参考素材直接生成文字、图片、视频与音频,并允许用户对生成结果继续裁切、标注、局部重绘、拆分和组合迭代。 核心理念:AI 不是附加按钮,而是工作流的一部分。生成、参考与工具能力都长在画布上,结果写回后可继续编辑、可复用、可继续生成。 技术栈:桌…
多模态 glanderness/BeefTV Stars 566 Tom 2026-09-29
gulelmatthews/Polymarket-Perpetual-Bot · 上手攻略
PolymarketPerpetualBot 是一个面向 Polymarket 预测市场的终端交易机器人,基于 Polymarket 的 Polygon CLOB(Central Limit Order Book)API 构建。它以键盘驱动的 TUI(终端用户界面)呈现,集成了行情浏览、实时订单簿查看、策略引擎和持仓追踪四大模块,支持模拟交易(paper t…
多模态 gulelmatthews/Polymarket-Perpetual-Bot Stars 183 Tom 2026-09-28
bridge-mind/bridgeclip · 上手攻略
BridgeClip 是一款开源 AI 视频剪辑桌面应用,由 BridgeMind 开发,核心场景是将播客、直播、YouTube/Twitch 录播自动剪辑成带字幕的短视频片段。它本质上是一条本地 AI 流水线:用 ytdlp 下载源视频或解析链接 → 调用 OpenRouter 上的转录模型生成时间轴字幕 → 调度 LLM 找出"最有传播力的时刻" → 用…
多模态 bridge-mind/bridgeclip Stars 195 Tom 2026-09-26
timoncool/YuE2-Studio · 上手攻略
YuE2Studio 是 YuE2(MAP 团队开源歌曲模型)的桌面工作室。YuE2 是一个约 30 亿参数的音乐生成模型,输入歌词和风格描述,先写一份可编辑的乐谱(ABC 记谱法),再基于乐谱演唱为完整歌曲——含人声、伴奏、节拍结构(引子/主歌/副歌/桥段/尾奏)。 传统 AI 音乐工具生成后无法修改,YuE2Studio 的核心差异化在于乐谱先行、演出可…
多模态 timoncool/YuE2-Studio Stars 275 Tom 2026-09-25
quanru/doubao-say · 上手攻略
doubaosay 是一款面向 Linux(Hyprland/Wayland 和原生 X11) 的独立语音输入应用,基于 GTK4 构建,默认使用豆包网页账号识别(免费),也可切换到火山引擎官方 Seed ASR 2.0 API(按量付费)。核心功能是让你在任意 Linux 应用里用快捷键触发语音输入,识别结果自动粘贴或直接打字进目标窗口。 它不是一个 AI…
多模态 quanru/doubao-say Stars 64 Tom 2026-09-18
perseval-BLR/DLSS5-NeuralScreen · 上手攻略
DLSS5NeuralScreen 将 NVIDIA DLSS 5 神经渲染技术应用到整个 Windows 桌面,实时提升所有画面质量。游戏、视频、图片、文档——屏幕上的一切都经过和 DLSS 5 游戏相同的神经网络处理后输出,实现全局画面增强。项目基于泄露的 NVIDIA 310.8.0 运行时(sm_75/86/89/120 内核,支持 RTX 2050…
多模态 perseval-BLR/DLSS5-NeuralScreen Stars 516 Tom 2026-09-13
pierrenade/short-video-generator-AI · 上手攻略
pierrenade/shortvideogeneratorAI 是一个将 YouTube 视频或本地视频自动转化为竖屏短视频(Shorts / Reels)的开源工具,主打免费、无水印、AI 驱动的精彩片段提取 + 字幕 + 配音全流程一条龙。 它的核心链路是:输入 YouTube 链接(或本地视频)→ fasterwhisper 字幕提取 → LLM 识…
多模态 pierrenade/short-video-generator-AI Stars 1,148 Tom 2026-09-08
szczyglis-dev/py-gpt · 上手攻略
PyGPT 是一个开源桌面 AI 助手,用 Python 开发,支持 Linux / Windows 1011 / Mac 三平台。它的工作方式类似 ChatGPT,但完全离线运行在你自己电脑上——API 密钥你自己管,数据不经过任何第三方服务器。 当前版本 2.8.6(build 20260903),支持从 GPT5、GPT4、o1/o3/o4,到 Goo…
多模态 szczyglis-dev/py-gpt Stars 1,904 Tom 2026-09-04
mizorewww/course2md · 上手攻略
course2md 是一个将 YouTube、Bilibili 或本地视频(网课、录屏、会议录像)转换为带截图的图文 Markdown / HTML 讲义的命令行工具。核心流程:下载视频 → 按画面变化采样关键帧截图 → 语音识别转文字 → 自动对齐文字与截图 → 输出结构化笔记。最新版本 v0.7.0(2026) 新增断点续传与 LLM 字幕润色功能。 看…
多模态 mizorewww/course2md Stars 227 Tom 2026-09-03
oboroge0/hayamimi · 上手攻略
「早耳」(hayamimi,日语"快耳"之意)是一个纯 CPU 运行的实时多语言语音转文字工具,主打"开口即出字幕"的极低延迟体验。核心设计理念是:不用 GPU、不用云端 API、一台普通电脑 + 2GB 内存就能跑。 它不依赖 Whisper 单一模型打天下,而是通过 sherpaonnx 调度一个包含 5 条路由的多模型 специалист 体系——每…
多模态 oboroge0/hayamimi Stars 313 Tom 2026-08-27
gongminmin/awesome-aigc · 上手攻略
gongminmin/awesomeaigc 是一个 AIGC(AI Generated Content)技术分类索引库,按模态(文本→图像→视频→3D→语音→音乐)和任务类型对主流 AIGC 项目进行结构化整理。每个条目标注 TRL(Technology Readiness Level,技术成熟度等级),参考 NASA TRL 标准,从 1(基础原理)到 …
多模态 gongminmin/awesome-aigc Stars 569 Tom 2026-08-27
all-in-aigc/melodisco · 上手攻略
Melodisco 是一款开源的 AI 音乐播放器,由独立开发者 idoubi 构建,所属组织 allinaigc。与传统音乐播放器不同,Melodisco 的核心能力是探索和播放 AI 生成的音轨,并提供音乐生成功能(通过 Suno 合作/集成),帮助用户在 AI 音乐快速崛起的大背景下发现和体验 AI 生成的音乐内容。 该项目托管于 GitHub(Sta…
多模态 all-in-aigc/melodisco Stars 514 Tom 2026-08-27
rookiestar28/ComfyUI-OpenClaw · 上手攻略
ComfyUIOpenClaw 是 ComfyUI 的安全优先编排层,将 ComfyUI 从纯生成工具升级为可自动化、可管控的生产级 AI 工厂。核心思路是:在不修改 ComfyUI 本身的前提下,通过自定义节点 + 嵌入式 HTTP API + 独立管理控制台,把 ComfyUI 变成一个可靠的自动化目标。 项目自称"安全第一",体现在:RBAC 权限控制…
多模态 rookiestar28/ComfyUI-OpenClaw Stars 557 Tom 2026-08-27
Small-tailqwq/dsh-deep-whale · 上手攻略
DSH Deep Whale 是 DeepSeek Harness(DSH)Web GUI 的鲸鱼娘系列主题皮肤仓库,由两个独立皮肤包(maidatelier / orcalink)和一个皮肤管理器组成,采用 CC BYNCSA 4.0 许可证开源发布。适合 DeepSeek Harness 用户个性化定制界面。 注意:这是主题皮肤,不是功能插件,不影响 D…
多模态 Small-tailqwq/dsh-deep-whale Stars 669 Tom 2026-08-26
内容待复核
hitcslj/Awesome-AIGC-3D · 上手攻略
这是一份由香港科技大学(HKUST)团队维护的 AIGC 3D 论文精选列表,当前版本(v2.0,202604)已升级为一份生产导向的 3D 生成综述,通过二维分类法系统整理了从数据基座到场景组装的完整 3D AIGC 论文图谱。 核心定位:不是代码仓库,而是一份持续更新的 living survey,帮你快速定位某个子领域(如"文本生成角色骨骼绑定"或"世…
多模态 hitcslj/Awesome-AIGC-3D Stars 787 Tom 2026-08-26
内容待复核
Kobaayyy/Awesome-CVPR2026-CVPR2025-ICCV2025-CVPR2024-ECCV2026-ECCV2024-AIGC · 上手攻略
这是一个 GitHub Awesome 类仓库,整理汇总 CVPR 2024–2026、ICCV 2025、ECCV 2024 和 2026 六大视觉顶会中与 AIGC(AIGenerated Content)相关的论文和代码,按任务类型分类组织。涵盖图像生成、图像编辑、视频生成、视频编辑、3D 生成、3D 编辑和多模态大语言模型七大方向,是跟踪 AIGC …
多模态 Kobaayyy/Awesome-CVPR2026-CVPR2025-ICCV2025-CVPR2024-ECCV2026-ECCV2024-AIGC Stars 674 Tom 2026-08-26
all-in-aigc/aiwallpaper · 上手攻略
allinaigc/aiwallpaper 是一个开源 AI 壁纸生成 Web 应用,用户输入文字描述即可生成定制壁纸。核心技术基于扩散模型(推测为 OpenAI DALLE 或 GPT Image API),产品层面是一套完整的 SaaS 前后端架构,集成了用户认证、支付、对象存储和数据库,适合作为"AI 生成式 Web 应用"的参考样板。 官方在线演示:…
多模态 all-in-aigc/aiwallpaper Stars 716 Tom 2026-08-26
thiagotigaz/ocr-it · 上手攻略
OCR It 是一款 Chrome / Firefox 浏览器扩展,解决一个具体问题:无法选文字的扫描文档、PDF 阅读器、幻灯片网页,用一次快捷键把页面截图 OCR 成文本。它的核心特性是本地离线 OCR——内置 Tesseract 引擎,截图片段完全在本地处理,扩展本身不发出任何网络请求,不调用任何云端 API。适合扫了整本纸质书或 PDF 后想提取全文…
多模态 thiagotigaz/ocr-it Stars 234 Tom 2026-08-26
FutureUniant/Tailor · 上手攻略
Tailor(中文名:泰勒)是一款本地运行的 AI 视频处理桌面工具,涵盖视频智能裁剪、视频生成和视频优化三大类共 10 种功能。核心特点是点点鼠标即可完成专业级剪辑,无需复杂的命令行操作,特别适合中文用户和短视频创作者。 ⚠️ 平台限制:目前仅支持 Windows。macOS 和 Linux 用户需通过虚拟机或双系统运行。最新版本为 20240807,功能…
多模态 FutureUniant/Tailor Stars 1,107 Tom 2026-08-23
kingyiusuen/image-to-latex · 上手攻略
imagetolatex 是一个将数学公式图像转换为 LaTeX 代码的深度学习项目,使用 ResNet18 作为图像编码器、Transformer 作为解码器,在 im2latex100k 数据集上训练,测试集字符错误率(CER)约为 0.17。项目为独立研究者作品,没有商业依赖,适合学术写作者、科研人员和教育场景快速将印刷或手写的数学公式转为可编辑 La…
多模态 kingyiusuen/image-to-latex Stars 2,160 Tom 2026-08-21
aigc-apps/EasyAnimate · 上手攻略
EasyAnimate 是阿里巴巴 PAI 团队开源的端到端视频生成 Pipeline,基于 Diffusion Transformer(DiT)架构,支持文生视频、图生视频、视频生视频及多种控制条件(姿态/Canny/深度/相机轨迹)。最新版本 V5.1 提供 7B 和 12B 两种规模,支持中英文双语提示词,是目前开源生态中支持控制类型最丰富的视频生成方…
多模态 aigc-apps/EasyAnimate Stars 2,266 Tom 2026-08-21
all-in-aigc/aicover · 上手攻略
aicover 是一个用 Next.js 构建的全栈 Web 应用,通过 AI 生成微信红包封面图片。用户在应用中输入文字描述,系统自动生成符合微信红包封面规范的精美图片,可直接用于微信红包发放。 微信红包封面是微信在节假日(尤其春节期间)推出的定制化功能,个人和企业均可申请制作。由于微信对封面图片有尺寸、格式、内容合规等严格要求,从零设计门槛较高。aico…
多模态 all-in-aigc/aicover Stars 1,807 Tom 2026-08-21
aigc-apps/VideoX-Fun · 上手攻略
VideoXFun 是阿里巴巴 PAI 团队开源的端到端 AI 视频生成流水线,基于 Diffusion Transformer(DiT)架构,支持文生视频(T2V)、图生视频(I2V)、视频生视频(V2V)、控制视频生成(ControlNet 类)以及 LoRA 微调训练。项目同时支持 CogVideoXFun 系列和 Wan2.1Fun 系列模型,覆盖从…
多模态 aigc-apps/VideoX-Fun Stars 2,192 Tom 2026-08-21
LearnPrompt/LearnPrompt · 上手攻略
LearnPrompt 是一个永久免费开源的中文 AI 学习教程仓库,由 B站 up 主"卡尔的AI沃茨"(GitHub @LearnPrompt)维护。它起步于 2023 年的 AIGC 工具教程(ChatGPT、Midjourney、Stable Diffusion),如今已演化为一套面向真实工作场景的 AI Native 教程体系,涵盖 Claude …
多模态 LearnPrompt/LearnPrompt Stars 2,580 Tom 2026-08-20
HiLab-git/SSL4MIS · 上手攻略
SSL4MIS(Semi Supervised Learning for Medical Image Segmentation)是一个医学影像分割领域的半监督学习论文与代码汇总仓库,由 HiLab 团队维护。它不是一个可以直接跑起来的框架或工具,而是一个持续更新的文献 + 代码索引库——追踪这个领域从 2019 年至今几乎所有重要的论文及其官方实现。 每一项…
多模态 HiLab-git/SSL4MIS Stars 2,671 Tom 2026-08-20
aigc-apps/sd-webui-EasyPhoto · 上手攻略
EasyPhoto 是一个 Stable Diffusion WebUI 插件,用于生成 AI 人像写真——上传 5~20 张个人照片训练专属的"数字分身"(LoRA 模型),之后即可用这个分身在任意场景下生成写真图片。 核心能力: 由阿里巴巴 PAI(Platform for AI)团队开发维护,开源于 2023 年,配套有论文(arXiv:2310.04…
多模态 aigc-apps/sd-webui-EasyPhoto Stars 5,153 Tom 2026-08-19
index-tts/index-tts · 上手攻略
IndexTTS 是阿里巴巴 Index 团队开源的零样本(ZeroShot)语音克隆系统,用一段参考音频(10~30秒)即可复刻任意人的音色,生成对应文本的语音。当前稳定版为 IndexTTS2.5(2026年8月10日发布),支持中文、英语、日语、西班牙语、阿拉伯语五种语言,并在多语言跨音色任务上达到了开源 SOTA 水平。 核心能力: IndexTTS…
多模态 index-tts/index-tts Stars 22,384 Tom 2026-08-19