Guides · organized/guides

仓库攻略

48 篇 · 48 个项目 · 多模态 · tom

FutureUniant/Tailor · 上手攻略
Tailor(中文名:泰勒)是一款本地运行的 AI 视频处理桌面工具,涵盖视频智能裁剪、视频生成和视频优化三大类共 10 种功能。核心特点是点点鼠标即可完成专业级剪辑,无需复杂的命令行操作,特别适合中文用户和短视频创作者。 ⚠️ 平台限制:目前仅支持 Windows。macOS 和 Linux 用户需通过虚拟机或双系统运行。最新版本为 20240807,功能…
多模态 FutureUniant/Tailor Stars 1,107 Tom 2026-08-23
kingyiusuen/image-to-latex · 上手攻略
imagetolatex 是一个将数学公式图像转换为 LaTeX 代码的深度学习项目,使用 ResNet18 作为图像编码器、Transformer 作为解码器,在 im2latex100k 数据集上训练,测试集字符错误率(CER)约为 0.17。项目为独立研究者作品,没有商业依赖,适合学术写作者、科研人员和教育场景快速将印刷或手写的数学公式转为可编辑 La…
多模态 kingyiusuen/image-to-latex Stars 2,160 Tom 2026-08-21
aigc-apps/EasyAnimate · 上手攻略
EasyAnimate 是阿里巴巴 PAI 团队开源的端到端视频生成 Pipeline,基于 Diffusion Transformer(DiT)架构,支持文生视频、图生视频、视频生视频及多种控制条件(姿态/Canny/深度/相机轨迹)。最新版本 V5.1 提供 7B 和 12B 两种规模,支持中英文双语提示词,是目前开源生态中支持控制类型最丰富的视频生成方…
多模态 aigc-apps/EasyAnimate Stars 2,266 Tom 2026-08-21
all-in-aigc/aicover · 上手攻略
aicover 是一个用 Next.js 构建的全栈 Web 应用,通过 AI 生成微信红包封面图片。用户在应用中输入文字描述,系统自动生成符合微信红包封面规范的精美图片,可直接用于微信红包发放。 微信红包封面是微信在节假日(尤其春节期间)推出的定制化功能,个人和企业均可申请制作。由于微信对封面图片有尺寸、格式、内容合规等严格要求,从零设计门槛较高。aico…
多模态 all-in-aigc/aicover Stars 1,807 Tom 2026-08-21
aigc-apps/VideoX-Fun · 上手攻略
VideoXFun 是阿里巴巴 PAI 团队开源的端到端 AI 视频生成流水线,基于 Diffusion Transformer(DiT)架构,支持文生视频(T2V)、图生视频(I2V)、视频生视频(V2V)、控制视频生成(ControlNet 类)以及 LoRA 微调训练。项目同时支持 CogVideoXFun 系列和 Wan2.1Fun 系列模型,覆盖从…
多模态 aigc-apps/VideoX-Fun Stars 2,192 Tom 2026-08-21
LearnPrompt/LearnPrompt · 上手攻略
LearnPrompt 是一个永久免费开源的中文 AI 学习教程仓库,由 B站 up 主"卡尔的AI沃茨"(GitHub @LearnPrompt)维护。它起步于 2023 年的 AIGC 工具教程(ChatGPT、Midjourney、Stable Diffusion),如今已演化为一套面向真实工作场景的 AI Native 教程体系,涵盖 Claude …
多模态 LearnPrompt/LearnPrompt Stars 2,580 Tom 2026-08-20
HiLab-git/SSL4MIS · 上手攻略
SSL4MIS(Semi Supervised Learning for Medical Image Segmentation)是一个医学影像分割领域的半监督学习论文与代码汇总仓库,由 HiLab 团队维护。它不是一个可以直接跑起来的框架或工具,而是一个持续更新的文献 + 代码索引库——追踪这个领域从 2019 年至今几乎所有重要的论文及其官方实现。 每一项…
多模态 HiLab-git/SSL4MIS Stars 2,671 Tom 2026-08-20
aigc-apps/sd-webui-EasyPhoto · 上手攻略
EasyPhoto 是一个 Stable Diffusion WebUI 插件,用于生成 AI 人像写真——上传 5~20 张个人照片训练专属的"数字分身"(LoRA 模型),之后即可用这个分身在任意场景下生成写真图片。 核心能力: 由阿里巴巴 PAI(Platform for AI)团队开发维护,开源于 2023 年,配套有论文(arXiv:2310.04…
多模态 aigc-apps/sd-webui-EasyPhoto Stars 5,153 Tom 2026-08-19
index-tts/index-tts · 上手攻略
IndexTTS 是阿里巴巴 Index 团队开源的零样本(ZeroShot)语音克隆系统,用一段参考音频(10~30秒)即可复刻任意人的音色,生成对应文本的语音。当前稳定版为 IndexTTS2.5(2026年8月10日发布),支持中文、英语、日语、西班牙语、阿拉伯语五种语言,并在多语言跨音色任务上达到了开源 SOTA 水平。 核心能力: IndexTTS…
多模态 index-tts/index-tts Stars 22,384 Tom 2026-08-19
AIGC-Audio/AudioGPT · 上手攻略
AudioGPT是由 AIGCAudio 团队开源的多模态音频理解和生成框架,发布于 2023 年 4 月(arXiv:2304.12995)。其核心设计思路是:将 LLM(大语言模型)作为音频任务的统一调度层,底层对接各类音频/语音专有的预训练基础模型(Foundation Models),用户通过自然语言 Prompt 控制音频生成与理解任务。 GitH…
多模态 AIGC-Audio/AudioGPT Stars 10,171 Tom 2026-08-18
pytorch/examples · 上手攻略
pytorch/examples 是 PyTorch 官方维护的示例仓库,汇集了 PyTorch 官方团队编写的各领域高质量参考实现。与 PyTorch Tutorials 不同,这些示例追求代码简洁、独立可运行、少依赖,每个子目录对应一个完整任务,读者可以直接把代码复制到自己的项目中使用或改写。覆盖领域包括:MNIST 手写数字识别(含多种变体)、VAE、…
多模态 pytorch/examples Stars 23,986 Tom 2026-08-18
HumanSignal/labelImg · 上手攻略
labelImg 是一个开源的图形化图像标注工具,由 Tzutalin 开发维护,现归属 HumanSignal(Label Studio 社区)管理。它用 Python + Qt 编写,提供直观的 GUI,让用户通过鼠标框选来标注目标物体,生成标准格式的标注文件。标注结果支持 PASCAL VOC XML、YOLO TXT 和 CreateML JSON …
多模态 HumanSignal/labelImg Stars 25,069 Tom 2026-08-18
JaidedAI/EasyOCR · 上手攻略
EasyOCR 是一个用 PyTorch 开发的通用 OCR(光学字符识别)Python 库,开箱即用,支持 80+ 语言,涵盖 Latin、CJK(简繁体中文、日文、韩文)、Arabic、Devanagari、Cyrillic 等所有主流书写系统,同时处理自然场景文本和文档密集文本。 v1.7.2(2024 年 9 月)是当前最新正式版。自 2020 年起…
多模态 JaidedAI/EasyOCR Stars 29,861 Tom 2026-08-18
mozilla/DeepSpeech · 上手攻略
重要声明:Mozilla DeepSpeech 项目已在 2023 年左右正式宣布 DISCONTINUED(终止维护)。最新版本为 v0.9.3(发布于 ~2021 年),无后续更新。预训练模型文件仍在 GitHub Releases 可下载,但不再有安全更新或新功能。 如果你需要离线语音识别,推荐评估替代方案:Whisper(OpenAI)、Whispe…
多模态 mozilla/DeepSpeech Stars 26,770 Tom 2026-08-18
coqui-ai/TTS · 上手攻略
🐸TTS(coquiai/TTS)是 Mozilla 语音团队孵化的开源文本转语音深度学习工具包,支持从零训练模型、Finetuning 和推理,生产和研究均可用。最新版本 ⓍTTS v2 支持 16 种语言,还支持语音克隆(voice cloning)和语音转换(voice conversion)。它底层基于 TensorFlow / PyTorch,内置…
多模态 coqui-ai/TTS Stars 45,852 Tom 2026-08-18
ocrmypdf/OCRmyPDF · 上手攻略
OCRmyPDF 是一个为 PDF 添加 OCR 文字层的命令行工具,它调用 Tesseract OCR 引擎,将扫描件、影印件等图片型 PDF 转化为可搜索、可复制文字的 PDF/A(适合长期归档的可移植 PDF 子集)。 它的核心价值在于「精准」——OCR 文字会精确地嵌入到原始图片下方,保证复制粘贴时位置准确,不出现文字错位;输出文件通常比输入更小(经…
多模态 ocrmypdf/OCRmyPDF Stars 34,348 Tom 2026-08-17
oobabooga/textgen · 上手攻略
textgen(全称 oobabooga/textgenerationwebui)是一个开源本地大模型桌面应用,支持文本生成、视觉理解(多模态)、工具调用、网页搜索、LoRA 微调,以及 OpenAI / Anthropic 兼容 API。口号是「100% 离线、零遥测」——不需要任何外部服务,所有模型和数据都在你自己的机器上。 它是原本大名鼎鼎的「text…
多模态 oobabooga/textgen Stars 47,519 Tom 2026-08-17
ysr666/dsh-vision-router · 上手攻略
dshvisionrouter 是 DeepSeek Harness(DSH)的视觉增强插件,专为"只能处理文本"的 Agent 提供图像理解能力。它的核心思路是:把看图变成一次普通的工具调用,让 Agent 可以用 vision_ground、vision_crop、vision_describe 等 11 个像素级工具按需操作图像,而不是把图片压缩成一段…
多模态 ysr666/dsh-vision-router Stars 841 Tom 2026-08-17
CompVis/stable-diffusion · 上手攻略
Stable Diffusion 是 CompVis 团队(海德堡大学)开发的潜在扩散模型(Latent Diffusion Model),通过文本提示生成照片级图像。该项目是 Stability AI 和 Runway 合作的产物,在 2022 年 CVPR 以 Oral 论文发表,相关论文 HighResolution Image Synthesis w…
多模态 CompVis/stable-diffusion Stars 73,272 Tom 2026-08-17
poleHansen/baibaiAIGC · 上手攻略
baibaiAIGC(发音近似"拜拜 AIGC")是一个中文/英文论文与学术/技术文档的降 AIGC 改写工具集,目标是通过结构化的多轮 prompt 降低文本中的模板化、机械化 AI 写作痕迹,同时保持原意、术语和结构不变。它不是检测规避器,而是通过真正的改写让文字读起来更像人写的。 核心作者是 poleHansen,项目托管于 GitHub,Star 9…
多模态 poleHansen/baibaiAIGC Stars 945 Tom 2026-08-16
NVIDIA-AI-Blueprints/video-search-and-summarization · 上手攻略
NVIDIA Video Search and Summarization(VSS)Blueprint 是一套GPU 加速的视频语义理解和分析参考架构。它将视觉语言模型(VLM,如 NVIDIA Cosmos)、大语言模型(LLM,如 Nemotron)、RAG 和 NVIDIA NIM 微服务整合在一起,实现用自然语言搜索视频内容、实时异常检测、视频问答和…
多模态 NVIDIA-AI-Blueprints/video-search-and-summarization Stars 1,790 Tom 2026-08-15
breezedeus/Pix2Text · 上手攻略
Pix2Text(简称 P2T)是一个开源 Python 工具,核心功能是把图片(含数学公式、表格、版面布局)识别并转换为 Markdown 格式,定位是 Mathpix 的免费开源替代品。 2025 年 7 月升级到 V1.1.4 后,数学公式检测(MFD)和识别(MFR)模型均已升级到 1.5 版本,版面分析引入 DocLayoutYOLO 模型,整体识…
多模态 breezedeus/Pix2Text Stars 3,213 Tom 2026-08-13
ItsssssJack/power-design · 上手攻略
Power Design 是一个 Claude Code Skill,通过品牌 DNA(Brand DNA)搭配编码化设计原则(20 条幻灯片规则 + 20 条网页规则)生成两类输出:演讲 deck 和响应式网站。它的核心主张是"每个输出既符合品牌调性,又满足客观设计标准",不是生成"带紫色渐变的六条项目符号封面"。 两套规则书分别来自:Tufte、Duar…
多模态 ItsssssJack/power-design Stars 603 Tom 2026-08-13
all-in-aigc/sorafm · 上手攻略
sorafm 是一个基于 Next.js 的开源 Sora AI 视频生成 Web 应用,提供可视化界面来管理和展示由 OpenAI Sora 生成的 AI 视频内容。项目支持 Docker 部署,可以在本地或私有服务器上快速搭建一个 Sora 视频展示站点。 技术栈:Next.js(前端框架)+ PostgreSQL(数据库)+ Tailwind CSS(…
多模态 all-in-aigc/sorafm Stars 1,152 Tom 2026-08-12
HITsz-TMG/VideoClaw · 上手攻略
HITszTMG/VideoClaw 是一个面向创意视频生产的 AI 导演系统,来自哈尔滨工业大学(深圳)TMG 实验室。它不是单点式的文生视频工具,而是一条覆盖"剧本策划 → 角色/场景设计 → 分镜规划 → 参考图生成 → 视频生成 → 后期剪辑"的全流程生产线。 用户只需给出一句想法或故事梗概,VideoClaw 就会自动拆解为可执行的影视工作流,生成…
多模态 HITsz-TMG/VideoClaw Stars 1,685 Tom 2026-08-11
Moonvy/OpenPromptStudio · 上手攻略
Moonvy/OpenPromptStudio(又称 OPS · Open Prompt Studio)是一个面向 AIGC 创作者的中文提示词(Prompt)可视化编辑器。它的核心功能是把 Midjourney 等文生图模型的提示词拆解成可编辑的结构化组件,支持翻译、可视化预览、图片导出和提示词词典管理。 该工具诞生于 2023 年,主打"所见即所得"的提…
多模态 Moonvy/OpenPromptStudio Stars 6,648 Tom 2026-08-11
modstart-lib/aigcpanel · 上手攻略
AIGCPanel 是一款一站式 AI 数字人桌面应用,支持 Windows / macOS / Linux 三平台,定位是让没有深厚技术背景的普通用户也能快速上手本地 AI 模型,生成数字人视频、合成 / 克隆声音、操作 25+ 音视频处理工具。软件基于 Electron + Vue 3 + TypeScript 构建,数据存储使用 bettersqlit…
多模态 modstart-lib/aigcpanel Stars 5,434 Tom 2026-08-10
TypeTale/TypeTale · 上手攻略
字字动画(TypeTale)是一款国产 AIGC 视频创作软件,主要面向 AI 短剧、AI 电影和小说推文(网文转视频)场景。核心思路:从文案到视频的全链路 AI 创作,涵盖文案预处理、智能分镜、图片生成、视频生成、对口型、音频合成,最终一键导出剪映草稿。 承诺现有功能永久免费,提供算力云/仙宫云完整镜像和本地 AI 整合包。系统要求:Windows,推荐 …
多模态 TypeTale/TypeTale Stars 776 Tom 2026-08-10
aldegad/sprite-gen · 上手攻略
spritegen 是一个面向游戏美术的 AI 驱动精灵图(sprite atlas)生成 pipeline,以 Codex/Claude Skill 形式运行。给一张角色基础图,它驱动 AI 图像模型逐动作状态(idle、jump、attack…)生成一行帧图,依次完成去背景、连通分量提取、帧切割、帧级别校正,最后打包出一张含真实 alpha 通道的透明精…
多模态 aldegad/sprite-gen Stars 667 Tom 2026-08-09
facebookresearch/vggt-omega · 上手攻略
VGGTOmega(VGGTΩ)是 Meta AI 与牛津大学视觉几何组(VGG)联合发布的单次前向 3D 重建模型,输入一组图像(单张到数百张),直接输出相机内外参数、深度图、置信度图和场景 token——无需传统 SfM/Colmap 的迭代优化步骤。模型入选 CVPR 2026 Best Paper Finalist,是前作 VGGT(CVPR 202…
多模态 facebookresearch/vggt-omega Stars 3,471 Tom 2026-08-06