研究库 实战攻略
Guides · organized/guides

仓库攻略

72 篇 · 71 个项目 · 多模态 · 多模态

storytold/photocraft · 上手攻略
PhotoCraft 是用纯 Rust 从零实现的开源 Adobe Photoshop 替代品,隶属于 ArtCraft 社区。与依赖 Electron/WebView 的方案不同,它使用 wgpu 作为 GPU 渲染后端,支持 Metal、Vulkan、DX12 和 WebGPU,覆盖 macOS、Windows、Linux、FreeBSD,并可通过 We…
多模态 storytold/photocraft Stars 8,993 Tom 2026-10-07
glanderness/BeefTV · 上手攻略
BeefTV 是一款本地优先的轻量级 AI 原生视频创作工作台。它在一个自由画布上连接创意、模型与素材,支持从提示词或参考素材直接生成文字、图片、视频与音频,并允许用户对生成结果继续裁切、标注、局部重绘、拆分和组合迭代。 核心理念:AI 不是附加按钮,而是工作流的一部分。生成、参考与工具能力都长在画布上,结果写回后可继续编辑、可复用、可继续生成。 技术栈:桌…
多模态 glanderness/BeefTV Stars 566 Tom 2026-09-29
gulelmatthews/Polymarket-Perpetual-Bot · 上手攻略
PolymarketPerpetualBot 是一个面向 Polymarket 预测市场的终端交易机器人,基于 Polymarket 的 Polygon CLOB(Central Limit Order Book)API 构建。它以键盘驱动的 TUI(终端用户界面)呈现,集成了行情浏览、实时订单簿查看、策略引擎和持仓追踪四大模块,支持模拟交易(paper t…
多模态 gulelmatthews/Polymarket-Perpetual-Bot Stars 183 Tom 2026-09-28
bridge-mind/bridgeclip · 上手攻略
BridgeClip 是一款开源 AI 视频剪辑桌面应用,由 BridgeMind 开发,核心场景是将播客、直播、YouTube/Twitch 录播自动剪辑成带字幕的短视频片段。它本质上是一条本地 AI 流水线:用 ytdlp 下载源视频或解析链接 → 调用 OpenRouter 上的转录模型生成时间轴字幕 → 调度 LLM 找出"最有传播力的时刻" → 用…
多模态 bridge-mind/bridgeclip Stars 195 Tom 2026-09-26
timmyy123/LLM-Hub · 上手攻略
§0 自检:1) 公开 README 抓取 ✓ · 2) GitHub 200 OK ✓ · 3) Android/iOS 构建命令均来自 README ✓ · 4) 许可证 PolyForm Noncommercial 1.0.0(README 显式标注)✓ · 5) 反方 v2 三段式按主线分布(见 §6)✓ · 6) 立标候选(主分类:移动端本地多模态…
多模态 timmyy123/LLM-Hub Stars 594 spark 2026-09-26
liyupi/ai-model-world · 上手攻略
AI Model World(大模型世界)是一个把 500+ 大模型可视化成像素小镇的互动网站。每个模型是某家厂商"小屋"里的一个像素角色,网站首页八块领奖台分别标注"今日最聪明""最会编程""最划算""最便宜""记性最好""最新发布""国内最强""开源最强",三秒扫完当天格局。背后数据来自 models.dev、Epoch AI、LiveBench、Hug…
多模态 liyupi/ai-model-world Stars 144 Jay 2026-09-20
WenyuChiou/academic-writing-skills · 上手攻略
academicwritingskills 是面向 Claude Code / ChatGPT / Codex / OpenCode / Hermes Agent 等 Agent Skills 兼容客户端的论文写作 skill 套件(MIT 协议,Star ~49、周增 +16)。它把"研究定位 → 论点架构 → 扩展大纲 → 证据驱动的写作 → 双向对齐 …
多模态 WenyuChiou/academic-writing-skills Stars 88 spark 2026-09-16
Vincentwei1021/anything2explainer · 上手攻略
⚠️ 数据来源:仅 GitHub README 原文 + Remotion / Claude Code / Codex 官网(截至 20260913 抓取)。web_search 命中的 X、Instagram、SkillsLLM 等三方页视为不可信,不引用其 stars / forks 数字。本文不下 npm、不跑 Remotion、不发 TTS 调用。 …
多模态 Vincentwei1021/anything2explainer Stars 1,040 spark 2026-09-13
bytedance/Sa2VA · 上手攻略
Sa2VA 是字节跳动 Seed 团队联合 UC Merced / WHU / PKU 在 2026 年开源的 Pixel LLM 系列旗舰仓库,核心论文《Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos》已被 IEEE TPAMI 202…
多模态 bytedance/Sa2VA Stars 1,666 spark 2026-09-08
pierrenade/short-video-generator-AI · 上手攻略
pierrenade/shortvideogeneratorAI 是一个将 YouTube 视频或本地视频自动转化为竖屏短视频(Shorts / Reels)的开源工具,主打免费、无水印、AI 驱动的精彩片段提取 + 字幕 + 配音全流程一条龙。 它的核心链路是:输入 YouTube 链接(或本地视频)→ fasterwhisper 字幕提取 → LLM 识…
多模态 pierrenade/short-video-generator-AI Stars 1,148 Tom 2026-09-08
szczyglis-dev/py-gpt · 上手攻略
PyGPT 是一个开源桌面 AI 助手,用 Python 开发,支持 Linux / Windows 1011 / Mac 三平台。它的工作方式类似 ChatGPT,但完全离线运行在你自己电脑上——API 密钥你自己管,数据不经过任何第三方服务器。 当前版本 2.8.6(build 20260903),支持从 GPT5、GPT4、o1/o3/o4,到 Goo…
多模态 szczyglis-dev/py-gpt Stars 1,904 Tom 2026-09-04
mizorewww/course2md · 上手攻略
course2md 是一个将 YouTube、Bilibili 或本地视频(网课、录屏、会议录像)转换为带截图的图文 Markdown / HTML 讲义的命令行工具。核心流程:下载视频 → 按画面变化采样关键帧截图 → 语音识别转文字 → 自动对齐文字与截图 → 输出结构化笔记。最新版本 v0.7.0(2026) 新增断点续传与 LLM 字幕润色功能。 看…
多模态 mizorewww/course2md Stars 227 Tom 2026-09-03
fajarhide/omni · 上手攻略
OMNI 是一个 Rust 写的本地 CLI + host hooks 套件,专为 agent 宿主(Claude Code、Codex CLI、Gemini CLI、OpenClaw、Cursor、Aider、Hermes、Pi、Cline、Roo、Copilot 等)做工具输出瘦身。它有两件普通过滤器做不到的事,下面分别展开。它做两件普通过滤器做不到的事…
多模态 fajarhide/omni Stars 360 spark 2026-09-02
代表攻略
wshzd/Awesome-AIGC · 上手攻略
wshzd/AwesomeAIGC 是一份中文 AIGC 资料汇总型仓库,以「论文分享 / 访谈 / 模型评测 / 行业动态」为单位收录条目,附带外链(arXiv、知乎、微信公众号、B 站等)。与 f/awesomechatgptprompts、Hannibal046/AwesomeLLM 这类以英文为主的清单相比,它的定位是中文圈 AIGC 早期热度阶段的…
多模态 wshzd/Awesome-AIGC Stars 873 spark 2026-08-23
同类项目 2展开比较

同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。

wshzd/Awesome-AIGC Stars 873 代表
rookiestar28/ComfyUI-OpenClaw · 上手攻略
ComfyUIOpenClaw 是 ComfyUI 的安全优先编排层,将 ComfyUI 从纯生成工具升级为可自动化、可管控的生产级 AI 工厂。核心思路是:在不修改 ComfyUI 本身的前提下,通过自定义节点 + 嵌入式 HTTP API + 独立管理控制台,把 ComfyUI 变成一个可靠的自动化目标。 项目自称"安全第一",体现在:RBAC 权限控制…
多模态 rookiestar28/ComfyUI-OpenClaw Stars 557 Tom 2026-08-27
内容待复核
Kobaayyy/Awesome-CVPR2026-CVPR2025-ICCV2025-CVPR2024-ECCV2026-ECCV2024-AIGC · 上手攻略
这是一个 GitHub Awesome 类仓库,整理汇总 CVPR 2024–2026、ICCV 2025、ECCV 2024 和 2026 六大视觉顶会中与 AIGC(AIGenerated Content)相关的论文和代码,按任务类型分类组织。涵盖图像生成、图像编辑、视频生成、视频编辑、3D 生成、3D 编辑和多模态大语言模型七大方向,是跟踪 AIGC …
多模态 Kobaayyy/Awesome-CVPR2026-CVPR2025-ICCV2025-CVPR2024-ECCV2026-ECCV2024-AIGC Stars 674 Tom 2026-08-26
coderonion/awesome-llm-and-aigc · 上手攻略
coderonion/awesomellmandaigc 是一个 LLM / VLM / VLA / AIGC 领域的精选资源列表(Awesome List),按 Framework(模型/训练/推理/量化/RAG)、Application(IDE/聊天机器人/具身智能/代码助手/知识库等)、Dataset、Learning Resources、Commun…
多模态 coderonion/awesome-llm-and-aigc Stars 811 Jay 2026-08-25
FutureUniant/Tailor · 上手攻略
Tailor(中文名:泰勒)是一款本地运行的 AI 视频处理桌面工具,涵盖视频智能裁剪、视频生成和视频优化三大类共 10 种功能。核心特点是点点鼠标即可完成专业级剪辑,无需复杂的命令行操作,特别适合中文用户和短视频创作者。 ⚠️ 平台限制:目前仅支持 Windows。macOS 和 Linux 用户需通过虚拟机或双系统运行。最新版本为 20240807,功能…
多模态 FutureUniant/Tailor Stars 1,107 Tom 2026-08-23
kingyiusuen/image-to-latex · 上手攻略
imagetolatex 是一个将数学公式图像转换为 LaTeX 代码的深度学习项目,使用 ResNet18 作为图像编码器、Transformer 作为解码器,在 im2latex100k 数据集上训练,测试集字符错误率(CER)约为 0.17。项目为独立研究者作品,没有商业依赖,适合学术写作者、科研人员和教育场景快速将印刷或手写的数学公式转为可编辑 La…
多模态 kingyiusuen/image-to-latex Stars 2,160 Tom 2026-08-21
aigc-apps/EasyAnimate · 上手攻略
EasyAnimate 是阿里巴巴 PAI 团队开源的端到端视频生成 Pipeline,基于 Diffusion Transformer(DiT)架构,支持文生视频、图生视频、视频生视频及多种控制条件(姿态/Canny/深度/相机轨迹)。最新版本 V5.1 提供 7B 和 12B 两种规模,支持中英文双语提示词,是目前开源生态中支持控制类型最丰富的视频生成方…
多模态 aigc-apps/EasyAnimate Stars 2,266 Tom 2026-08-21
aigc-apps/VideoX-Fun · 上手攻略
VideoXFun 是阿里巴巴 PAI 团队开源的端到端 AI 视频生成流水线,基于 Diffusion Transformer(DiT)架构,支持文生视频(T2V)、图生视频(I2V)、视频生视频(V2V)、控制视频生成(ControlNet 类)以及 LoRA 微调训练。项目同时支持 CogVideoXFun 系列和 Wan2.1Fun 系列模型,覆盖从…
多模态 aigc-apps/VideoX-Fun Stars 2,192 Tom 2026-08-21
HiLab-git/SSL4MIS · 上手攻略
SSL4MIS(Semi Supervised Learning for Medical Image Segmentation)是一个医学影像分割领域的半监督学习论文与代码汇总仓库,由 HiLab 团队维护。它不是一个可以直接跑起来的框架或工具,而是一个持续更新的文献 + 代码索引库——追踪这个领域从 2019 年至今几乎所有重要的论文及其官方实现。 每一项…
多模态 HiLab-git/SSL4MIS Stars 2,671 Tom 2026-08-20
aigc-apps/sd-webui-EasyPhoto · 上手攻略
EasyPhoto 是一个 Stable Diffusion WebUI 插件,用于生成 AI 人像写真——上传 5~20 张个人照片训练专属的"数字分身"(LoRA 模型),之后即可用这个分身在任意场景下生成写真图片。 核心能力: 由阿里巴巴 PAI(Platform for AI)团队开发维护,开源于 2023 年,配套有论文(arXiv:2310.04…
多模态 aigc-apps/sd-webui-EasyPhoto Stars 5,153 Tom 2026-08-19
index-tts/index-tts · 上手攻略
IndexTTS 是阿里巴巴 Index 团队开源的零样本(ZeroShot)语音克隆系统,用一段参考音频(10~30秒)即可复刻任意人的音色,生成对应文本的语音。当前稳定版为 IndexTTS2.5(2026年8月10日发布),支持中文、英语、日语、西班牙语、阿拉伯语五种语言,并在多语言跨音色任务上达到了开源 SOTA 水平。 核心能力: IndexTTS…
多模态 index-tts/index-tts Stars 22,384 Tom 2026-08-19
open-mmlab/mmagic · 上手攻略
MMagic(Multimodal Advanced, Generative, and Intelligent Creation)是 OpenMMLab 体系下的 AIGC 工具箱,是 MMEditing 与 MMGeneration 合并后的统一继承者。它提供从底层 PyTorch 训练到高层 MMagicInferencer 的全套接口,覆盖图像 / 视…
多模态 open-mmlab/mmagic Stars 7,452 spark 2026-08-18
pytorch/examples · 上手攻略
pytorch/examples 是 PyTorch 官方维护的示例仓库,汇集了 PyTorch 官方团队编写的各领域高质量参考实现。与 PyTorch Tutorials 不同,这些示例追求代码简洁、独立可运行、少依赖,每个子目录对应一个完整任务,读者可以直接把代码复制到自己的项目中使用或改写。覆盖领域包括:MNIST 手写数字识别(含多种变体)、VAE、…
多模态 pytorch/examples Stars 23,986 Tom 2026-08-18
HumanSignal/labelImg · 上手攻略
labelImg 是一个开源的图形化图像标注工具,由 Tzutalin 开发维护,现归属 HumanSignal(Label Studio 社区)管理。它用 Python + Qt 编写,提供直观的 GUI,让用户通过鼠标框选来标注目标物体,生成标准格式的标注文件。标注结果支持 PASCAL VOC XML、YOLO TXT 和 CreateML JSON …
多模态 HumanSignal/labelImg Stars 25,069 Tom 2026-08-18
JaidedAI/EasyOCR · 上手攻略
EasyOCR 是一个用 PyTorch 开发的通用 OCR(光学字符识别)Python 库,开箱即用,支持 80+ 语言,涵盖 Latin、CJK(简繁体中文、日文、韩文)、Arabic、Devanagari、Cyrillic 等所有主流书写系统,同时处理自然场景文本和文档密集文本。 v1.7.2(2024 年 9 月)是当前最新正式版。自 2020 年起…
多模态 JaidedAI/EasyOCR Stars 29,861 Tom 2026-08-18
ocrmypdf/OCRmyPDF · 上手攻略
OCRmyPDF 是一个为 PDF 添加 OCR 文字层的命令行工具,它调用 Tesseract OCR 引擎,将扫描件、影印件等图片型 PDF 转化为可搜索、可复制文字的 PDF/A(适合长期归档的可移植 PDF 子集)。 它的核心价值在于「精准」——OCR 文字会精确地嵌入到原始图片下方,保证复制粘贴时位置准确,不出现文字错位;输出文件通常比输入更小(经…
多模态 ocrmypdf/OCRmyPDF Stars 34,348 Tom 2026-08-17
oobabooga/textgen · 上手攻略
textgen(全称 oobabooga/textgenerationwebui)是一个开源本地大模型桌面应用,支持文本生成、视觉理解(多模态)、工具调用、网页搜索、LoRA 微调,以及 OpenAI / Anthropic 兼容 API。口号是「100% 离线、零遥测」——不需要任何外部服务,所有模型和数据都在你自己的机器上。 它是原本大名鼎鼎的「text…
多模态 oobabooga/textgen Stars 47,519 Tom 2026-08-17