Guides · organized/guides

仓库攻略

78 篇 · 78 个项目 · 多模态

HITsz-TMG/VideoClaw · 上手攻略
HITszTMG/VideoClaw 是一个面向创意视频生产的 AI 导演系统,来自哈尔滨工业大学(深圳)TMG 实验室。它不是单点式的文生视频工具,而是一条覆盖"剧本策划 → 角色/场景设计 → 分镜规划 → 参考图生成 → 视频生成 → 后期剪辑"的全流程生产线。 用户只需给出一句想法或故事梗概,VideoClaw 就会自动拆解为可执行的影视工作流,生成…
多模态 HITsz-TMG/VideoClaw Stars 1,685 Tom 2026-08-11
Moonvy/OpenPromptStudio · 上手攻略
Moonvy/OpenPromptStudio(又称 OPS · Open Prompt Studio)是一个面向 AIGC 创作者的中文提示词(Prompt)可视化编辑器。它的核心功能是把 Midjourney 等文生图模型的提示词拆解成可编辑的结构化组件,支持翻译、可视化预览、图片导出和提示词词典管理。 该工具诞生于 2023 年,主打"所见即所得"的提…
多模态 Moonvy/OpenPromptStudio Stars 6,648 Tom 2026-08-11
modstart-lib/aigcpanel · 上手攻略
AIGCPanel 是一款一站式 AI 数字人桌面应用,支持 Windows / macOS / Linux 三平台,定位是让没有深厚技术背景的普通用户也能快速上手本地 AI 模型,生成数字人视频、合成 / 克隆声音、操作 25+ 音视频处理工具。软件基于 Electron + Vue 3 + TypeScript 构建,数据存储使用 bettersqlit…
多模态 modstart-lib/aigcpanel Stars 5,434 Tom 2026-08-10
TypeTale/TypeTale · 上手攻略
字字动画(TypeTale)是一款国产 AIGC 视频创作软件,主要面向 AI 短剧、AI 电影和小说推文(网文转视频)场景。核心思路:从文案到视频的全链路 AI 创作,涵盖文案预处理、智能分镜、图片生成、视频生成、对口型、音频合成,最终一键导出剪映草稿。 承诺现有功能永久免费,提供算力云/仙宫云完整镜像和本地 AI 整合包。系统要求:Windows,推荐 …
多模态 TypeTale/TypeTale Stars 776 Tom 2026-08-10
aldegad/sprite-gen · 上手攻略
spritegen 是一个面向游戏美术的 AI 驱动精灵图(sprite atlas)生成 pipeline,以 Codex/Claude Skill 形式运行。给一张角色基础图,它驱动 AI 图像模型逐动作状态(idle、jump、attack…)生成一行帧图,依次完成去背景、连通分量提取、帧切割、帧级别校正,最后打包出一张含真实 alpha 通道的透明精…
多模态 aldegad/sprite-gen Stars 667 Tom 2026-08-09
liyue-aigc/female-portrait-director · 上手攻略
femaleportraitdirector 是一个模块化的 Codex Skill(也兼容 Claude Code / Cursor / GitHub Copilot / Gemini CLI),作用是把零散的人像参数——如风格、场景、服装、情绪——转化为一组结构化的、可以直接复制使用的 AI 生图提示词,输出包含最终提示词(5 个完整段落)和独立的负面约…
多模态 liyue-aigc/female-portrait-director Stars 1,336 Jay 2026-08-09
Moonlit-Pages/AIGC-Detector-Rewriter-Skill · 上手攻略
AIGCDetectorRewriterSkill 是一个面向学术论文写作的 AI 生成内容(AIGC)风险检测与最小化改写技能,兼容 OpenClaw 与 HermesAgent。支持英文论文、中文论文(含中文模板化表达检测),针对 Turnitin AI 检测、知网 AIGC 检测等主流工具提供保守改写方案。 核心原则:最小化改写——不重写全文,不过度润…
多模态 Moonlit-Pages/AIGC-Detector-Rewriter-Skill Stars 488 Jay 2026-08-08
MisoLabsAI/MisoTTS · 上手攻略
Miso TTS 是 Miso Labs 开发的一个80 亿参数高表现力文本转对话语音模型(8B parameters),灵感来源于 Sesame 的 CSM(Conversational Speech Model)架构。它使用 RVQ Transformer( Residual Vector Quantization Transformer)架构,结合 L…
多模态 MisoLabsAI/MisoTTS Stars 3,131 Jay 2026-08-07
facebookresearch/vggt-omega · 上手攻略
VGGTOmega(VGGTΩ)是 Meta AI 与牛津大学视觉几何组(VGG)联合发布的单次前向 3D 重建模型,输入一组图像(单张到数百张),直接输出相机内外参数、深度图、置信度图和场景 token——无需传统 SfM/Colmap 的迭代优化步骤。模型入选 CVPR 2026 Best Paper Finalist,是前作 VGGT(CVPR 202…
多模态 facebookresearch/vggt-omega Stars 3,471 Tom 2026-08-06
dramaclaw/dramaclaw · 上手攻略
DramaClaw 是一套"工业级短剧 AIGC 生产线"的社区版(Community Edition / CE),由 dramaclaw 团队自用后开源。它把"小说 → 知识图谱 → 分集/分镜 → 剧本 → 分镜图与首帧 → 配音 → 合成成片"整条链封装在一个 Docker 编排里,强调"一套跑到底、关掉浏览器也能交付成片",目标是把原本只有大厂才拼得…
多模态 dramaclaw/dramaclaw Stars 3,493 spark 2026-08-06
LiamGvchi/gc-minimal-zine-poster · 上手攻略
gcminimalzineposter 是一个 Codex(OpenAI 官方 AI 编程助手)技能,专门将任意主题、句子、物件、情绪、文章构想、照片或内容简报,转化为一张安静、极简 ZINE 风格编辑海报的提示词,并直接生成对应的位图图像。 它不是通用的图片生成工具——所有输出都围绕一种独特的美学:竖版 3:5 比例、70%–90% 留白、日式/韩式独立 …
多模态 LiamGvchi/gc-minimal-zine-poster Stars 5,385 Tom 2026-08-06
huggingface/transformers · 上手攻略
Transformers 是 Hugging Face 维护的 Python 库,提供超过 1M 个预训练模型检查点的统一加载、微调和推理接口。它覆盖文本(NLP)、计算机视觉、音频、视频和多模态五种模态,是目前最广泛使用的开源模型定义框架。 它的核心定位不是"又一个 PyTorch 工具箱",而是模型定义层的事实标准——如果一个模型在 transforme…
多模态 huggingface/transformers Stars 163,296 Tom 2026-08-04
digimata/quill · 上手攻略
quill 是一个超轻量、纯本地运行的 macOS 会议录音 + 自动转写工具。一个菜单栏图标,点击录音,再点停止,自动在机器上完成转写,生成带说话人标签的文本记录。所有数据永不离开本机,无需账户、无需联网、无需订阅。 它名字的灵感来自羽毛(羽毛笔),是 digimata 工具链中的"录音 + 转写"担当(兄弟项目是 parrot)。整个工具是一个 Swif…
多模态 digimata/quill Stars 3,763 Jay 2026-08-01
Vincentwei1021/video-shotcraft · 上手攻略
videoshotcraft 是一个 AI Agent 技能,专门用于让 Claude Code 或 Codex 变身电影感产品宣传片制作工作室。它提供 104 张镜头配方卡(shot recipe cards)、161 条动态预览、161 种运动风格,以及一套经过实战验证的六阶段制作流水线。底层渲染引擎是 Remotion(用 React/TSX 写视频)…
多模态 Vincentwei1021/video-shotcraft Stars 4,535 Jay 2026-08-01
jd-opensource/xllm · 上手攻略
xLLM 是京东开源的高性能 LLM/VLM/DiT/REC 推理引擎,托管于 OpenAtom 基金会,核心定位是在多种国产 AI 加速器上实现企业级高吞吐推理。它于 2025 年 10 月发布技术报告(arXiv:2510.14686),已在京东内部支持客服(JingYan AI)、营销推荐、商品理解等多个核心业务日产环境运行。 架构上分为两层:xLLM…
多模态 jd-opensource/xllm Stars 1,390 Tom 2026-07-31
waybarrios/vllm-mlx · 上手攻略
vllmmlx 是一个专为 Apple Silicon(M 系列芯片)打造的推理服务器,核心思路是:把 vLLM 在 CUDA 硬件上的核心优化(连续批处理、页级 KV 缓存、前缀缓存)移植到苹果的 MLX 框架上,通过 Metal 驱动统一内存直接跑模型,无需任何格式转换。 它同时暴露 OpenAI /v1/ 和 Anthropic /v1/message…
多模态 waybarrios/vllm-mlx Stars 1,447 Tom 2026-07-31
intentee/paddler · 上手攻略
Paddler 是一款用 Rust 写的开源 LLM/VLM 推理负载均衡与服务平台。架构非常克制:只有两个组件——balancer(对外暴露 OpenAI 兼容推理接口、管理面和 Web 控制台)和 agent(真正跑推理,注册到 balancer 上即可上线)。底层直接用 llama.cpp 推理引擎(fork 版本,Paddler 自己实现了 slot…
多模态 intentee/paddler Stars 1,651 spark 2026-07-28
img2threejs/img2threejs · 上手攻略
img2threejs 是一个代码优先的图像→3D 重建工具。你给它一张参考图,它生成一段 TypeScript 代码,在浏览器里跑出一个 THREE.Group 工厂函数——所有几何体都由原始几何体(BoxGeometry、CylinderGeometry 等)、程序化着色器和生成式几何拼出来,没有 mesh 文件,没有 GLB 下载,产物天然是"代码"而…
多模态 img2threejs/img2threejs Stars 10,708 Tom 2026-07-26
hoainho/img2threejs · 上手攻略
img2threejs 是一个代码驱动式图像→3D 重建工具。它接受一张物体参考图,通过 AI Agent(Claude Code / Codex / OpenCode)驱动一个分阶段质量门控流水线,输出一段 TypeScript Three.js 工厂函数,将该物体用几何体 Primitive、程序化材质和自定义几何重建出来——不是生成 mesh 文件,而…
多模态 hoainho/img2threejs Stars 4,176 Tom 2026-07-25
PaddlePaddle/FastDeploy · 上手攻略
FastDeploy 是百度飞桨(PaddlePaddle)团队推出的"LLM + VLM 推理部署工具包",主打工业级一键部署和国产芯片广覆盖。它的目标不是要替代 vLLM,而是站在 vLLM 接口的肩膀上,把 ERNIE、Qwen3、DeepSeekV3、PaddleOCRVL 等模型在 NVIDIA、昆仑芯 XPU、海光 DCU、天数 GPU、燧原 G…
多模态 PaddlePaddle/FastDeploy Stars 3,703 spark 2026-07-21
oso95/scroll-world · 上手攻略
scrollworld 是一个 AI Agent Skill(技能),运行在 Claude Code、Codex 或任何兼容 SKILL.md 的 AI 编程助手内。它能为一任意品牌或行业构建「滚动穿越3D世界」的沉浸式落地页——访客滚动页面时,摄影机从场景外部俯冲进入内部,再无缝飞入下一场景,全称无剪辑,像 Apple's scrollthrough 产品…
多模态 oso95/scroll-world Stars 7,924 Tom 2026-07-18
EvolvingLMMs-Lab/lmms-eval · 上手攻略
lmmseval(Python 包名 lmmseval,前身为 LMMsEval)是 EvolvingLMMsLab 维护的"统一多模态大模型评估工具包"。目标只有一个:让"同一个模型 + 同一个 benchmark + 同一套参数"在两台机器上跑出来数字一致,并且能覆盖文本、图像、视频、音频四大模态的 100+ 任务、30+ 模型后端。 它脱胎于 Eleu…
多模态 EvolvingLMMs-Lab/lmms-eval Stars 4,355 spark 2026-07-16
argmaxinc/argmax-oss-swift · 上手攻略
argmaxossswift 是 Argmax 公司开源的 Apple Silicon 上的端侧语音 AI Swift SDK 套件。一个 Swift Package 里打包了三个产品: WhisperKit — 用 OpenAI Whisper 做离线 语音转文字(ASR),模型跑在 Core ML 上。 TTSKit — 用 Qwen3TTS 做离线 文…
多模态 argmaxinc/argmax-oss-swift Stars 6,317 spark 2026-07-15
wandb/openui · 上手攻略
OpenUI 是 Weights & Biases(W&B)开源的一款"用自然语言描述 UI,立刻看到渲染结果"的工具。你可以输入"一个带搜索框的暗色 dashboard,顶部有用户头像",它会输出实时预览的 HTML/Svelte/React/Web Components;你可以继续用对话让它改样式、加组件、把生成的代码一键转成 React 等多端实现。官…
多模态 wandb/openui Stars 22,494 spark 2026-07-14
lukas-blecher/LaTeX-OCR · 上手攻略
LaTeXOCR(开源包名 pix2tex)是一个基于深度学习的 OCR 工具,专门把数学公式的图片还原为 LaTeX 代码。输入一张公式截图,输出对应的 LaTeX 文本——支持印刷公式也支持部分手写公式。 它由 ViT(Vision Transformer)编码器 + ResNet 主干网络 + Transformer 解码器 组成,在 im2latex…
多模态 lukas-blecher/LaTeX-OCR Stars 16,530 Jay 2026-07-14
内容待复核
BradyFU/Awesome-Multimodal-Large-Language-Models · 上手攻略
这是一份由南京大学 MIG 实验室(NJUMiG)维护的多模态大语言模型(Multimodal Large Language Models,MLLM)前沿论文合集,截至 2026 年 7 月已收录 17.9k+ Stars,是 MLLM 领域最全面、最活跃的社区驱动的学术索引之一。 它不是代码库,而是一个持续更新的知识库,系统整理了 MLLM 各个子方向的论…
多模态 BradyFU/Awesome-Multimodal-Large-Language-Models Stars 17,977 Tom 2026-07-14
Acly/krita-ai-diffusion · 上手攻略
kritaaidiffusion 是开发者 Acly 给开源绘图软件 Krita 写的生成式 AI 插件。它把扩散模型(Stable Diffusion 1.5 / XL / Illustrious / Flux、ZImage + ControlNet / IPAdapter)作为 Krita 的"生成式图层工具"暴露出来,强调两件事: 1. 精度与控制:用…
多模态 Acly/krita-ai-diffusion Stars 10,449 spark 2026-07-14
nexu-io/html-video · 上手攻略
htmlvideo 是 Open Design 团队出品的"AI 视频生成 metalayer":你跟本地 coding agent 说一句话(或丢一个链接),它把 HTML/CSS/数据变成真实 MP4 视频,全程在你电脑上渲染,不需要云端、不收单次渲染费。 它不绑定某个特定渲染引擎,而是一套适配器接口,render(input, ctx) 契约,任何后端…
多模态 nexu-io/html-video Stars 4,160 Tom 2026-07-14
NVIDIA-NeMo/Speech · 上手攻略
NVIDIA NeMo Speech 是 NVIDIA 推出的专注于语音 AI 的开源框架,支持自动语音识别(ASR)、语音合成(TTS)和语音大模型(Speech LLM)三大方向。它是从原 NVIDIA/NeMo 大一统仓库中拆分出来的独立版本(2026 年 6 月正式发布首个 release),专门面向需要训练和微调语音模型的 연구人员和 PyTorc…
多模态 NVIDIA-NeMo/Speech Stars 18,087 Tom 2026-07-13
ggml-org/whisper.cpp · 上手攻略
whisper.cpp 是 OpenAI Whisper 自动语音识别(ASR)模型的纯 C/C++ 实现,不依赖任何第三方 ML 框架。相比 Python 原版,它可以脱离 Python 环境、在各类硬件上高效运行,从树莓派、手机到 GPU 服务器都能部署。截至 2026 年 7 月最新稳定版为 v1.9.1,Stars 超过 5.1 万,是目前最流行的本…
多模态 ggml-org/whisper.cpp Stars 52,799 Jay 2026-07-12