Guides · organized/guides

仓库攻略

25 篇 · 25 个项目 · 多模态 · 工程化

内容待复核
hitcslj/Awesome-AIGC-3D · 上手攻略
这是一份由香港科技大学(HKUST)团队维护的 AIGC 3D 论文精选列表,当前版本(v2.0,202604)已升级为一份生产导向的 3D 生成综述,通过二维分类法系统整理了从数据基座到场景组装的完整 3D AIGC 论文图谱。 核心定位:不是代码仓库,而是一份持续更新的 living survey,帮你快速定位某个子领域(如"文本生成角色骨骼绑定"或"世…
多模态 hitcslj/Awesome-AIGC-3D Stars 787 Tom 2026-08-26
kingyiusuen/image-to-latex · 上手攻略
imagetolatex 是一个将数学公式图像转换为 LaTeX 代码的深度学习项目,使用 ResNet18 作为图像编码器、Transformer 作为解码器,在 im2latex100k 数据集上训练,测试集字符错误率(CER)约为 0.17。项目为独立研究者作品,没有商业依赖,适合学术写作者、科研人员和教育场景快速将印刷或手写的数学公式转为可编辑 La…
多模态 kingyiusuen/image-to-latex Stars 2,160 Tom 2026-08-21
LearnPrompt/LearnPrompt · 上手攻略
LearnPrompt 是一个永久免费开源的中文 AI 学习教程仓库,由 B站 up 主"卡尔的AI沃茨"(GitHub @LearnPrompt)维护。它起步于 2023 年的 AIGC 工具教程(ChatGPT、Midjourney、Stable Diffusion),如今已演化为一套面向真实工作场景的 AI Native 教程体系,涵盖 Claude …
多模态 LearnPrompt/LearnPrompt Stars 2,580 Tom 2026-08-20
coqui-ai/TTS · 上手攻略
🐸TTS(coquiai/TTS)是 Mozilla 语音团队孵化的开源文本转语音深度学习工具包,支持从零训练模型、Finetuning 和推理,生产和研究均可用。最新版本 ⓍTTS v2 支持 16 种语言,还支持语音克隆(voice cloning)和语音转换(voice conversion)。它底层基于 TensorFlow / PyTorch,内置…
多模态 coqui-ai/TTS Stars 45,852 Tom 2026-08-18
xmutfyh/dsh-plugin-writing-guard · 上手攻略
dshpluginwritingguard 是 DeepSeek Harness(DSH)的论文写作守卫插件,在论文撰写和修改过程中自动检测常见 AI 写作风格、修改残留、防御性表达与机械化句式,同时提供 Scholarship Lock 功能在 AI 润色时保护科研事实(数字、p值、图表编号等核心实体不被悄悄改动)。定位是学术写作 linter——不是"写…
多模态 xmutfyh/dsh-plugin-writing-guard Stars 22 Jay 2026-08-16
breezedeus/Pix2Text · 上手攻略
Pix2Text(简称 P2T)是一个开源 Python 工具,核心功能是把图片(含数学公式、表格、版面布局)识别并转换为 Markdown 格式,定位是 Mathpix 的免费开源替代品。 2025 年 7 月升级到 V1.1.4 后,数学公式检测(MFD)和识别(MFR)模型均已升级到 1.5 版本,版面分析引入 DocLayoutYOLO 模型,整体识…
多模态 breezedeus/Pix2Text Stars 3,213 Tom 2026-08-13
all-in-aigc/sorafm · 上手攻略
sorafm 是一个基于 Next.js 的开源 Sora AI 视频生成 Web 应用,提供可视化界面来管理和展示由 OpenAI Sora 生成的 AI 视频内容。项目支持 Docker 部署,可以在本地或私有服务器上快速搭建一个 Sora 视频展示站点。 技术栈:Next.js(前端框架)+ PostgreSQL(数据库)+ Tailwind CSS(…
多模态 all-in-aigc/sorafm Stars 1,152 Tom 2026-08-12
Moonvy/OpenPromptStudio · 上手攻略
Moonvy/OpenPromptStudio(又称 OPS · Open Prompt Studio)是一个面向 AIGC 创作者的中文提示词(Prompt)可视化编辑器。它的核心功能是把 Midjourney 等文生图模型的提示词拆解成可编辑的结构化组件,支持翻译、可视化预览、图片导出和提示词词典管理。 该工具诞生于 2023 年,主打"所见即所得"的提…
多模态 Moonvy/OpenPromptStudio Stars 6,648 Tom 2026-08-11
aldegad/sprite-gen · 上手攻略
spritegen 是一个面向游戏美术的 AI 驱动精灵图(sprite atlas)生成 pipeline,以 Codex/Claude Skill 形式运行。给一张角色基础图,它驱动 AI 图像模型逐动作状态(idle、jump、attack…)生成一行帧图,依次完成去背景、连通分量提取、帧切割、帧级别校正,最后打包出一张含真实 alpha 通道的透明精…
多模态 aldegad/sprite-gen Stars 667 Tom 2026-08-09
Moonlit-Pages/AIGC-Detector-Rewriter-Skill · 上手攻略
AIGCDetectorRewriterSkill 是一个面向学术论文写作的 AI 生成内容(AIGC)风险检测与最小化改写技能,兼容 OpenClaw 与 HermesAgent。支持英文论文、中文论文(含中文模板化表达检测),针对 Turnitin AI 检测、知网 AIGC 检测等主流工具提供保守改写方案。 核心原则:最小化改写——不重写全文,不过度润…
多模态 Moonlit-Pages/AIGC-Detector-Rewriter-Skill Stars 488 Jay 2026-08-08
dramaclaw/dramaclaw · 上手攻略
DramaClaw 是一套"工业级短剧 AIGC 生产线"的社区版(Community Edition / CE),由 dramaclaw 团队自用后开源。它把"小说 → 知识图谱 → 分集/分镜 → 剧本 → 分镜图与首帧 → 配音 → 合成成片"整条链封装在一个 Docker 编排里,强调"一套跑到底、关掉浏览器也能交付成片",目标是把原本只有大厂才拼得…
多模态 dramaclaw/dramaclaw Stars 3,493 spark 2026-08-06
Vincentwei1021/video-shotcraft · 上手攻略
videoshotcraft 是一个 AI Agent 技能,专门用于让 Claude Code 或 Codex 变身电影感产品宣传片制作工作室。它提供 104 张镜头配方卡(shot recipe cards)、161 条动态预览、161 种运动风格,以及一套经过实战验证的六阶段制作流水线。底层渲染引擎是 Remotion(用 React/TSX 写视频)…
多模态 Vincentwei1021/video-shotcraft Stars 4,535 Jay 2026-08-01
intentee/paddler · 上手攻略
Paddler 是一款用 Rust 写的开源 LLM/VLM 推理负载均衡与服务平台。架构非常克制:只有两个组件——balancer(对外暴露 OpenAI 兼容推理接口、管理面和 Web 控制台)和 agent(真正跑推理,注册到 balancer 上即可上线)。底层直接用 llama.cpp 推理引擎(fork 版本,Paddler 自己实现了 slot…
多模态 intentee/paddler Stars 1,651 spark 2026-07-28
PaddlePaddle/FastDeploy · 上手攻略
FastDeploy 是百度飞桨(PaddlePaddle)团队推出的"LLM + VLM 推理部署工具包",主打工业级一键部署和国产芯片广覆盖。它的目标不是要替代 vLLM,而是站在 vLLM 接口的肩膀上,把 ERNIE、Qwen3、DeepSeekV3、PaddleOCRVL 等模型在 NVIDIA、昆仑芯 XPU、海光 DCU、天数 GPU、燧原 G…
多模态 PaddlePaddle/FastDeploy Stars 3,703 spark 2026-07-21
EvolvingLMMs-Lab/lmms-eval · 上手攻略
lmmseval(Python 包名 lmmseval,前身为 LMMsEval)是 EvolvingLMMsLab 维护的"统一多模态大模型评估工具包"。目标只有一个:让"同一个模型 + 同一个 benchmark + 同一套参数"在两台机器上跑出来数字一致,并且能覆盖文本、图像、视频、音频四大模态的 100+ 任务、30+ 模型后端。 它脱胎于 Eleu…
多模态 EvolvingLMMs-Lab/lmms-eval Stars 4,355 spark 2026-07-16
wandb/openui · 上手攻略
OpenUI 是 Weights & Biases(W&B)开源的一款"用自然语言描述 UI,立刻看到渲染结果"的工具。你可以输入"一个带搜索框的暗色 dashboard,顶部有用户头像",它会输出实时预览的 HTML/Svelte/React/Web Components;你可以继续用对话让它改样式、加组件、把生成的代码一键转成 React 等多端实现。官…
多模态 wandb/openui Stars 22,494 spark 2026-07-14
lukas-blecher/LaTeX-OCR · 上手攻略
LaTeXOCR(开源包名 pix2tex)是一个基于深度学习的 OCR 工具,专门把数学公式的图片还原为 LaTeX 代码。输入一张公式截图,输出对应的 LaTeX 文本——支持印刷公式也支持部分手写公式。 它由 ViT(Vision Transformer)编码器 + ResNet 主干网络 + Transformer 解码器 组成,在 im2latex…
多模态 lukas-blecher/LaTeX-OCR Stars 16,530 Jay 2026-07-14
xorbitsai/inference(Xinference)· 上手攻略
Xinference(Xorbits Inference)是 xorbitsai 团队开源的统一推理服务平台,一行代码替换 GPT 为任意开源 LLM。它让你在本地、云端或笔记本上运行开源语言模型、语音模型和多模态模型,通过统一的 OpenAI 兼容 API 提供服务。 Xinference 的核心差异化在于:支持最多的推理引擎(vLLM、SGLang、ll…
多模态 xorbitsai/inference Stars 9,486 Jay 2026-07-11
oumi-ai/oumi · 上手攻略
Oumi 是一个开源的 LLM 全生命周期管理平台,覆盖从数据准备、微调训练、评估评测到部署上线的完整流程。它用统一 CLI(oumi)串联起 Transformers、TRL、vLLM、veRL 等主流训练推理库,让你用同一套配置在不同硬件规模(单卡 135M 到千卡 405B)下无缝切换。 支持 Gemma 4、Qwen3.5、Qwen3.6、GPTos…
多模态 oumi-ai/oumi Stars 9,369 Jay 2026-07-10
google-ai-edge/mediapipe · 上手攻略
MediaPipe 是 Google 开源的端侧机器学习框架,专注于在手机(Android/iOS)、Web、桌面、边缘设备和 IoT 上实时运行 ML 模型。它不是训练框架,而是推理框架——帮你把 Google 训练好的模型快速部署到各类设备上,以低延迟处理图像、视频、音频和文本。 Google 于 2023 年将 MediaPipe 主开发文档迁移至 d…
多模态 google-ai-edge/mediapipe Stars 36,566 Tom 2026-07-10
xLLM-AI/xllm · 上手攻略
xLLM 是由京东零售团队开发、现托管于 OpenAtom 基金会的高性能 LLM 推理引擎。它不是面向普通用户的 AI 产品,而是给企业级部署场景用的底层 Infra 工具——目标是让大模型的推理在特定 AI 加速器上跑得更快、更划算。 支持的模型类型不只有 LLM,还包括: LLM(大语言模型) VLM(视觉语言模型) DiT(扩散Transformer…
多模态 xLLM-AI/xllm Stars 1,516 Jay 2026-07-10
WUBING2023/PaperSpine · 上手攻略
PaperSpine 是一个以"贡献为先、面向审稿人"为核心理念的学术写作系统,支持 Claude Code、Codex、OpenClaw 和 Hermes CLI 四个 AI Agent 宿主。它将学术论文写作拆解为 12 个有序阶段,每阶段有强制关卡(gate),不允许跳步,必须逐关通过才能进入下一阶段。 V4(当前版本 4.0.0)是重大升级:原本 1…
多模态 WUBING2023/PaperSpine Stars 4,041 Tom 2026-07-08
HBAI-Ltd/Toonflow-app · 上手攻略
Toonflow(动画流)是一款开源一站式 AI 短剧创作工具,将小说或剧本快速转化为动画短剧。集成 AI 编剧(ScriptAgent)、智能分镜(ProductionAgent)、角色管理和视频生成,覆盖"策划 → 编剧 → 分镜 → 出片"全流程,官方称创作效率提升 10 倍以上。 官网: 文档: 内置详细说明) 传统短剧制作流程需要:编剧改编 → 分…
多模态 HBAI-Ltd/Toonflow-app Stars 13,701 Jay 2026-07-08
helloianneo/ian-xiaohei-illustrations · 上手攻略
ianxiaoheiillustrations 是一个面向 AI Agent(尤其是 Codex)的中文正文配图生成 Skill。它指导 AI 把中文文章、帖子、博客、方法论内容里的判断、流程、状态和隐喻,转化成一张张白底、手绘、怪诞但清爽的 16:9 正文配图。 核心特点:生成的不是通用插画 prompt,也不是 PPT 信息图模板,而是先理解文章认知锚点…
多模态 helloianneo/ian-xiaohei-illustrations Stars 8,494 Jay 2026-07-07
diffusionstudio/lottie · 上手攻略
lottie 是 Diffusion Studio 出品的开源 Skill(工具包),让 Claude Code 或 Codex 等 Coding Agent 通过自然语言指令直接生成可投产级别的 Lottie 动画 JSON 文件。 它的核心工作流是:你在对话中描述想要的动画效果(基于 SVG、截图或真实数据),Agent 调用 diffusionstud…
多模态 diffusionstudio/lottie Stars 5,020 Jay 2026-07-06