Guides · organized/guides

仓库攻略

78 篇 · 78 个项目 · 多模态

Lightricks/LTX-2 · 上手攻略
LTX2 是 Lightricks 开源的视频生成模型(当前版本 LTX2.3,22B 参数,2026 年 3 月 5 日发布),基于 DiT(Diffusion Transformer)架构。它是 2026 年视频生成领域里唯一同时具备以下三个特性的开源模型: 同步音视频生成(4K 视频 + 音频,一次扩散过程完成) 原生 4K 50fps 输出 完整开源…
多模态 Lightricks/LTX-2 Stars 8,560 Jay 2026-07-12
xorbitsai/inference(Xinference)· 上手攻略
Xinference(Xorbits Inference)是 xorbitsai 团队开源的统一推理服务平台,一行代码替换 GPT 为任意开源 LLM。它让你在本地、云端或笔记本上运行开源语言模型、语音模型和多模态模型,通过统一的 OpenAI 兼容 API 提供服务。 Xinference 的核心差异化在于:支持最多的推理引擎(vLLM、SGLang、ll…
多模态 xorbitsai/inference Stars 9,486 Jay 2026-07-11
oumi-ai/oumi · 上手攻略
Oumi 是一个开源的 LLM 全生命周期管理平台,覆盖从数据准备、微调训练、评估评测到部署上线的完整流程。它用统一 CLI(oumi)串联起 Transformers、TRL、vLLM、veRL 等主流训练推理库,让你用同一套配置在不同硬件规模(单卡 135M 到千卡 405B)下无缝切换。 支持 Gemma 4、Qwen3.5、Qwen3.6、GPTos…
多模态 oumi-ai/oumi Stars 9,369 Jay 2026-07-10
mudler/LocalAI · 上手攻略
LocalAI 是一个开源的本地 AI 推理引擎,2026 年 7 月 Stars 约 4.7 万,周增约 +126。核心理念是「小核心 + 按需加载后端」:每个后端(llama.cpp、vLLM、whisper.cpp、stablediffusion、MLX 等)都是独立的 OCI 镜像,只在你需要某类模型时才拉取安装。最新稳定版为 v4.3.0(2026…
多模态 mudler/LocalAI Stars 48,383 Tom 2026-07-10
google-ai-edge/mediapipe · 上手攻略
MediaPipe 是 Google 开源的端侧机器学习框架,专注于在手机(Android/iOS)、Web、桌面、边缘设备和 IoT 上实时运行 ML 模型。它不是训练框架,而是推理框架——帮你把 Google 训练好的模型快速部署到各类设备上,以低延迟处理图像、视频、音频和文本。 Google 于 2023 年将 MediaPipe 主开发文档迁移至 d…
多模态 google-ai-edge/mediapipe Stars 36,566 Tom 2026-07-10
xLLM-AI/xllm · 上手攻略
xLLM 是由京东零售团队开发、现托管于 OpenAtom 基金会的高性能 LLM 推理引擎。它不是面向普通用户的 AI 产品,而是给企业级部署场景用的底层 Infra 工具——目标是让大模型的推理在特定 AI 加速器上跑得更快、更划算。 支持的模型类型不只有 LLM,还包括: LLM(大语言模型) VLM(视觉语言模型) DiT(扩散Transformer…
多模态 xLLM-AI/xllm Stars 1,516 Jay 2026-07-10
op7418/guizang-social-card-skill · 上手攻略
guizangsocialcardskill 是一个面向 Claude Code / Codex 等 AI Agent 的图文卡片生成技能(Skill),专门用于从文章、截图、产品笔记、照片或视频素材,自动生成小红书 / Rednote 图文组图、Live Photo 动态卡片,以及公众号 21:9 + 1:1 封面对。 它的核心设计哲学是:把"做一张好看的…
多模态 op7418/guizang-social-card-skill Stars 5,512 Tom 2026-07-08
WUBING2023/PaperSpine · 上手攻略
PaperSpine 是一个以"贡献为先、面向审稿人"为核心理念的学术写作系统,支持 Claude Code、Codex、OpenClaw 和 Hermes CLI 四个 AI Agent 宿主。它将学术论文写作拆解为 12 个有序阶段,每阶段有强制关卡(gate),不允许跳步,必须逐关通过才能进入下一阶段。 V4(当前版本 4.0.0)是重大升级:原本 1…
多模态 WUBING2023/PaperSpine Stars 4,041 Tom 2026-07-08
HBAI-Ltd/Toonflow-app · 上手攻略
Toonflow(动画流)是一款开源一站式 AI 短剧创作工具,将小说或剧本快速转化为动画短剧。集成 AI 编剧(ScriptAgent)、智能分镜(ProductionAgent)、角色管理和视频生成,覆盖"策划 → 编剧 → 分镜 → 出片"全流程,官方称创作效率提升 10 倍以上。 官网: 文档: 内置详细说明) 传统短剧制作流程需要:编剧改编 → 分…
多模态 HBAI-Ltd/Toonflow-app Stars 13,701 Jay 2026-07-08
PaddlePaddle/PaddleOCR · 上手攻略
PaddleOCR 是百度飞桨(PaddlePaddle)团队开源的多功能 OCR 与文档解析工具包,GitHub Stars 超 8.4 万,被 Dify、RAGFlow、Cherry Studio 等主流项目深度集成。它不只是一套光学字符识别引擎,更是一个覆盖"图片→结构化数据"完整流程的文档 AI 基础设施。 当前稳定版本为 PaddleOCR 3.6…
多模态 PaddlePaddle/PaddleOCR Stars 87,395 Jay 2026-07-07
helloianneo/ian-xiaohei-illustrations · 上手攻略
ianxiaoheiillustrations 是一个面向 AI Agent(尤其是 Codex)的中文正文配图生成 Skill。它指导 AI 把中文文章、帖子、博客、方法论内容里的判断、流程、状态和隐喻,转化成一张张白底、手绘、怪诞但清爽的 16:9 正文配图。 核心特点:生成的不是通用插画 prompt,也不是 PPT 信息图模板,而是先理解文章认知锚点…
多模态 helloianneo/ian-xiaohei-illustrations Stars 8,494 Jay 2026-07-07
teamchong/pxpipe · 上手攻略
pxpipe 是一个本地请求代理,专门用来降低 Claude Code(以及其他基于 Anthropic API 的 Agent)的 token 消耗。它通过将大量文本内容(系统提示词、工具文档、历史记录)渲染为图片,再通过视觉通道传输,从而大幅压缩输入 token 数量。 核心逻辑:一张图片的 token 成本由像素尺寸决定,而不是内容长度。实测 dens…
多模态 teamchong/pxpipe Stars 6,425 Tom 2026-07-07
diffusionstudio/lottie · 上手攻略
lottie 是 Diffusion Studio 出品的开源 Skill(工具包),让 Claude Code 或 Codex 等 Coding Agent 通过自然语言指令直接生成可投产级别的 Lottie 动画 JSON 文件。 它的核心工作流是:你在对话中描述想要的动画效果(基于 SVG、截图或真实数据),Agent 调用 diffusionstud…
多模态 diffusionstudio/lottie Stars 5,020 Jay 2026-07-06
baidu/Unlimited-OCR · 上手攻略
UnlimitedOCR 是百度开源的多模态文档解析模型,定位是「一键长文档解析」——单张图片、PDF 多页、整本手册均可一次性处理,输出结构化文本。发布于 2026 年 6 月,arXiv 论文编号 2606.23050。 官方将其定位为对 DeepSeekOCR 的进一步推进,核心能力: 传统 OCR + NLP 管道有三个常见痛点: 1. 多步骤串联:…
多模态 baidu/Unlimited-OCR Stars 23,399 Tom 2026-07-06
Anil-matcha/Open-Generative-AI · 上手攻略
Open Generative AI(简称 OGA)是一个免费的、开源的 AI 图像与视频生成桌面应用,内置 200+ 模型(Flux、Midjourney、Kling、Sora、Veo、Seedance 2.5 等),无内容过滤器、无审查,MIT 协议可自托管,本质上是 MuAPI.ai 的前端桌面封装。 核心定位:绕过商业 AI 视频平台的内容限制,让用…
多模态 Anil-matcha/Open-Generative-AI Stars 26,047 Tom 2026-07-05
ruvnet/RuView · 上手攻略
RuView 是一个基于 WiFi CSI(信道状态信息) 的空间智能感知系统——利用普通路由器发出的无线信号,经墙壁反射后的人体扰动来检测:有人在与否、呼吸频率、心率、跌倒、活动姿态、房间占用情况。全程不需要任何摄像头、麦克风或可穿戴设备。 核心技术:用 ESP32 板子 + Cognitum Seed(边缘 AI 协处理器)读取 WiFi CSI 数据,…
多模态 ruvnet/RuView Stars 89,443 Tom 2026-07-05
XxHuberrr/Mineradio · 上手攻略
Mineradio 是一款面向 Windows 的沉浸式桌面音乐播放器,核心特色是将电影镜头语言、粒子视觉特效和歌词舞台整合在一起,创造接近现场演出的私人音乐空间。定位介于功能播放器与视听艺术装置之间——不只是听歌,是「看」音乐。 当前版本 v1.1.1(2026 年),基于 Electron 开发,支持网易云音乐和 QQ 音乐账号接入。 现有音乐播放器(S…
多模态 XxHuberrr/Mineradio Stars 9,412 Jay 2026-07-05
图像模型演进路线阅读指南
对照 CNN 的局部归纳偏置、ViT 的规模化学习、CLIP 的图文对齐与 Diffusion 的可控生成。 先掌握表征学习的变化,再进入生成模型;不建议把所有架构只按发表时间排列。
多模态 curator 2026-06-01