Guides · organized/guides

仓库攻略

19 篇 · 19 个项目 · 多模态 · jay

coderonion/awesome-llm-and-aigc · 上手攻略
coderonion/awesomellmandaigc 是一个 LLM / VLM / VLA / AIGC 领域的精选资源列表(Awesome List),按 Framework(模型/训练/推理/量化/RAG)、Application(IDE/聊天机器人/具身智能/代码助手/知识库等)、Dataset、Learning Resources、Commun…
多模态 coderonion/awesome-llm-and-aigc Stars 811 Jay 2026-08-25
Yuan-ManX/ai-audio-datasets · 上手攻略
AI Audio Datasets(AIADS)是一个持续更新的开源知识库,汇集了语音(Speech)、音乐(Music)和音效(Sound Effect)三大类高质量音频数据集,旨在为生成式 AI、AIGC、模型训练、智能音频工具开发和音频应用提供训练数据资源。仓库本身是一个精心分类的导航索引,每个数据集条目都附带了官方来源链接、数据规模说明和适用任务标注…
多模态 Yuan-ManX/ai-audio-datasets Stars 958 Jay 2026-08-23
xmutfyh/dsh-plugin-writing-guard · 上手攻略
dshpluginwritingguard 是 DeepSeek Harness(DSH)的论文写作守卫插件,在论文撰写和修改过程中自动检测常见 AI 写作风格、修改残留、防御性表达与机械化句式,同时提供 Scholarship Lock 功能在 AI 润色时保护科研事实(数字、p值、图表编号等核心实体不被悄悄改动)。定位是学术写作 linter——不是"写…
多模态 xmutfyh/dsh-plugin-writing-guard Stars 22 Jay 2026-08-16
liyue-aigc/female-portrait-director · 上手攻略
femaleportraitdirector 是一个模块化的 Codex Skill(也兼容 Claude Code / Cursor / GitHub Copilot / Gemini CLI),作用是把零散的人像参数——如风格、场景、服装、情绪——转化为一组结构化的、可以直接复制使用的 AI 生图提示词,输出包含最终提示词(5 个完整段落)和独立的负面约…
多模态 liyue-aigc/female-portrait-director Stars 1,336 Jay 2026-08-09
Moonlit-Pages/AIGC-Detector-Rewriter-Skill · 上手攻略
AIGCDetectorRewriterSkill 是一个面向学术论文写作的 AI 生成内容(AIGC)风险检测与最小化改写技能,兼容 OpenClaw 与 HermesAgent。支持英文论文、中文论文(含中文模板化表达检测),针对 Turnitin AI 检测、知网 AIGC 检测等主流工具提供保守改写方案。 核心原则:最小化改写——不重写全文,不过度润…
多模态 Moonlit-Pages/AIGC-Detector-Rewriter-Skill Stars 488 Jay 2026-08-08
MisoLabsAI/MisoTTS · 上手攻略
Miso TTS 是 Miso Labs 开发的一个80 亿参数高表现力文本转对话语音模型(8B parameters),灵感来源于 Sesame 的 CSM(Conversational Speech Model)架构。它使用 RVQ Transformer( Residual Vector Quantization Transformer)架构,结合 L…
多模态 MisoLabsAI/MisoTTS Stars 3,131 Jay 2026-08-07
digimata/quill · 上手攻略
quill 是一个超轻量、纯本地运行的 macOS 会议录音 + 自动转写工具。一个菜单栏图标,点击录音,再点停止,自动在机器上完成转写,生成带说话人标签的文本记录。所有数据永不离开本机,无需账户、无需联网、无需订阅。 它名字的灵感来自羽毛(羽毛笔),是 digimata 工具链中的"录音 + 转写"担当(兄弟项目是 parrot)。整个工具是一个 Swif…
多模态 digimata/quill Stars 3,763 Jay 2026-08-01
Vincentwei1021/video-shotcraft · 上手攻略
videoshotcraft 是一个 AI Agent 技能,专门用于让 Claude Code 或 Codex 变身电影感产品宣传片制作工作室。它提供 104 张镜头配方卡(shot recipe cards)、161 条动态预览、161 种运动风格,以及一套经过实战验证的六阶段制作流水线。底层渲染引擎是 Remotion(用 React/TSX 写视频)…
多模态 Vincentwei1021/video-shotcraft Stars 4,535 Jay 2026-08-01
lukas-blecher/LaTeX-OCR · 上手攻略
LaTeXOCR(开源包名 pix2tex)是一个基于深度学习的 OCR 工具,专门把数学公式的图片还原为 LaTeX 代码。输入一张公式截图,输出对应的 LaTeX 文本——支持印刷公式也支持部分手写公式。 它由 ViT(Vision Transformer)编码器 + ResNet 主干网络 + Transformer 解码器 组成,在 im2latex…
多模态 lukas-blecher/LaTeX-OCR Stars 16,530 Jay 2026-07-14
ggml-org/whisper.cpp · 上手攻略
whisper.cpp 是 OpenAI Whisper 自动语音识别(ASR)模型的纯 C/C++ 实现,不依赖任何第三方 ML 框架。相比 Python 原版,它可以脱离 Python 环境、在各类硬件上高效运行,从树莓派、手机到 GPU 服务器都能部署。截至 2026 年 7 月最新稳定版为 v1.9.1,Stars 超过 5.1 万,是目前最流行的本…
多模态 ggml-org/whisper.cpp Stars 52,799 Jay 2026-07-12
Lightricks/LTX-2 · 上手攻略
LTX2 是 Lightricks 开源的视频生成模型(当前版本 LTX2.3,22B 参数,2026 年 3 月 5 日发布),基于 DiT(Diffusion Transformer)架构。它是 2026 年视频生成领域里唯一同时具备以下三个特性的开源模型: 同步音视频生成(4K 视频 + 音频,一次扩散过程完成) 原生 4K 50fps 输出 完整开源…
多模态 Lightricks/LTX-2 Stars 8,560 Jay 2026-07-12
xorbitsai/inference(Xinference)· 上手攻略
Xinference(Xorbits Inference)是 xorbitsai 团队开源的统一推理服务平台,一行代码替换 GPT 为任意开源 LLM。它让你在本地、云端或笔记本上运行开源语言模型、语音模型和多模态模型,通过统一的 OpenAI 兼容 API 提供服务。 Xinference 的核心差异化在于:支持最多的推理引擎(vLLM、SGLang、ll…
多模态 xorbitsai/inference Stars 9,486 Jay 2026-07-11
oumi-ai/oumi · 上手攻略
Oumi 是一个开源的 LLM 全生命周期管理平台,覆盖从数据准备、微调训练、评估评测到部署上线的完整流程。它用统一 CLI(oumi)串联起 Transformers、TRL、vLLM、veRL 等主流训练推理库,让你用同一套配置在不同硬件规模(单卡 135M 到千卡 405B)下无缝切换。 支持 Gemma 4、Qwen3.5、Qwen3.6、GPTos…
多模态 oumi-ai/oumi Stars 9,369 Jay 2026-07-10
xLLM-AI/xllm · 上手攻略
xLLM 是由京东零售团队开发、现托管于 OpenAtom 基金会的高性能 LLM 推理引擎。它不是面向普通用户的 AI 产品,而是给企业级部署场景用的底层 Infra 工具——目标是让大模型的推理在特定 AI 加速器上跑得更快、更划算。 支持的模型类型不只有 LLM,还包括: LLM(大语言模型) VLM(视觉语言模型) DiT(扩散Transformer…
多模态 xLLM-AI/xllm Stars 1,516 Jay 2026-07-10
HBAI-Ltd/Toonflow-app · 上手攻略
Toonflow(动画流)是一款开源一站式 AI 短剧创作工具,将小说或剧本快速转化为动画短剧。集成 AI 编剧(ScriptAgent)、智能分镜(ProductionAgent)、角色管理和视频生成,覆盖"策划 → 编剧 → 分镜 → 出片"全流程,官方称创作效率提升 10 倍以上。 官网: 文档: 内置详细说明) 传统短剧制作流程需要:编剧改编 → 分…
多模态 HBAI-Ltd/Toonflow-app Stars 13,701 Jay 2026-07-08
PaddlePaddle/PaddleOCR · 上手攻略
PaddleOCR 是百度飞桨(PaddlePaddle)团队开源的多功能 OCR 与文档解析工具包,GitHub Stars 超 8.4 万,被 Dify、RAGFlow、Cherry Studio 等主流项目深度集成。它不只是一套光学字符识别引擎,更是一个覆盖"图片→结构化数据"完整流程的文档 AI 基础设施。 当前稳定版本为 PaddleOCR 3.6…
多模态 PaddlePaddle/PaddleOCR Stars 87,395 Jay 2026-07-07
helloianneo/ian-xiaohei-illustrations · 上手攻略
ianxiaoheiillustrations 是一个面向 AI Agent(尤其是 Codex)的中文正文配图生成 Skill。它指导 AI 把中文文章、帖子、博客、方法论内容里的判断、流程、状态和隐喻,转化成一张张白底、手绘、怪诞但清爽的 16:9 正文配图。 核心特点:生成的不是通用插画 prompt,也不是 PPT 信息图模板,而是先理解文章认知锚点…
多模态 helloianneo/ian-xiaohei-illustrations Stars 8,494 Jay 2026-07-07
diffusionstudio/lottie · 上手攻略
lottie 是 Diffusion Studio 出品的开源 Skill(工具包),让 Claude Code 或 Codex 等 Coding Agent 通过自然语言指令直接生成可投产级别的 Lottie 动画 JSON 文件。 它的核心工作流是:你在对话中描述想要的动画效果(基于 SVG、截图或真实数据),Agent 调用 diffusionstud…
多模态 diffusionstudio/lottie Stars 5,020 Jay 2026-07-06
XxHuberrr/Mineradio · 上手攻略
Mineradio 是一款面向 Windows 的沉浸式桌面音乐播放器,核心特色是将电影镜头语言、粒子视觉特效和歌词舞台整合在一起,创造接近现场演出的私人音乐空间。定位介于功能播放器与视听艺术装置之间——不只是听歌,是「看」音乐。 当前版本 v1.1.1(2026 年),基于 Electron 开发,支持网易云音乐和 QQ 音乐账号接入。 现有音乐播放器(S…
多模态 XxHuberrr/Mineradio Stars 9,412 Jay 2026-07-05