Guides · organized/guides

仓库攻略

56 篇 · 56 个项目 · 多模态 · 多模态

waybarrios/vllm-mlx · 上手攻略
vllmmlx 是一个专为 Apple Silicon(M 系列芯片)打造的推理服务器,核心思路是:把 vLLM 在 CUDA 硬件上的核心优化(连续批处理、页级 KV 缓存、前缀缓存)移植到苹果的 MLX 框架上,通过 Metal 驱动统一内存直接跑模型,无需任何格式转换。 它同时暴露 OpenAI /v1/ 和 Anthropic /v1/message…
多模态 waybarrios/vllm-mlx Stars 1,447 Tom 2026-07-31
intentee/paddler · 上手攻略
Paddler 是一款用 Rust 写的开源 LLM/VLM 推理负载均衡与服务平台。架构非常克制:只有两个组件——balancer(对外暴露 OpenAI 兼容推理接口、管理面和 Web 控制台)和 agent(真正跑推理,注册到 balancer 上即可上线)。底层直接用 llama.cpp 推理引擎(fork 版本,Paddler 自己实现了 slot…
多模态 intentee/paddler Stars 1,651 spark 2026-07-28
img2threejs/img2threejs · 上手攻略
img2threejs 是一个代码优先的图像→3D 重建工具。你给它一张参考图,它生成一段 TypeScript 代码,在浏览器里跑出一个 THREE.Group 工厂函数——所有几何体都由原始几何体(BoxGeometry、CylinderGeometry 等)、程序化着色器和生成式几何拼出来,没有 mesh 文件,没有 GLB 下载,产物天然是"代码"而…
多模态 img2threejs/img2threejs Stars 10,708 Tom 2026-07-26
hoainho/img2threejs · 上手攻略
img2threejs 是一个代码驱动式图像→3D 重建工具。它接受一张物体参考图,通过 AI Agent(Claude Code / Codex / OpenCode)驱动一个分阶段质量门控流水线,输出一段 TypeScript Three.js 工厂函数,将该物体用几何体 Primitive、程序化材质和自定义几何重建出来——不是生成 mesh 文件,而…
多模态 hoainho/img2threejs Stars 4,176 Tom 2026-07-25
oso95/scroll-world · 上手攻略
scrollworld 是一个 AI Agent Skill(技能),运行在 Claude Code、Codex 或任何兼容 SKILL.md 的 AI 编程助手内。它能为一任意品牌或行业构建「滚动穿越3D世界」的沉浸式落地页——访客滚动页面时,摄影机从场景外部俯冲进入内部,再无缝飞入下一场景,全称无剪辑,像 Apple's scrollthrough 产品…
多模态 oso95/scroll-world Stars 7,924 Tom 2026-07-18
EvolvingLMMs-Lab/lmms-eval · 上手攻略
lmmseval(Python 包名 lmmseval,前身为 LMMsEval)是 EvolvingLMMsLab 维护的"统一多模态大模型评估工具包"。目标只有一个:让"同一个模型 + 同一个 benchmark + 同一套参数"在两台机器上跑出来数字一致,并且能覆盖文本、图像、视频、音频四大模态的 100+ 任务、30+ 模型后端。 它脱胎于 Eleu…
多模态 EvolvingLMMs-Lab/lmms-eval Stars 4,355 spark 2026-07-16
lukas-blecher/LaTeX-OCR · 上手攻略
LaTeXOCR(开源包名 pix2tex)是一个基于深度学习的 OCR 工具,专门把数学公式的图片还原为 LaTeX 代码。输入一张公式截图,输出对应的 LaTeX 文本——支持印刷公式也支持部分手写公式。 它由 ViT(Vision Transformer)编码器 + ResNet 主干网络 + Transformer 解码器 组成,在 im2latex…
多模态 lukas-blecher/LaTeX-OCR Stars 16,530 Jay 2026-07-14
内容待复核
BradyFU/Awesome-Multimodal-Large-Language-Models · 上手攻略
这是一份由南京大学 MIG 实验室(NJUMiG)维护的多模态大语言模型(Multimodal Large Language Models,MLLM)前沿论文合集,截至 2026 年 7 月已收录 17.9k+ Stars,是 MLLM 领域最全面、最活跃的社区驱动的学术索引之一。 它不是代码库,而是一个持续更新的知识库,系统整理了 MLLM 各个子方向的论…
多模态 BradyFU/Awesome-Multimodal-Large-Language-Models Stars 17,977 Tom 2026-07-14
Acly/krita-ai-diffusion · 上手攻略
kritaaidiffusion 是开发者 Acly 给开源绘图软件 Krita 写的生成式 AI 插件。它把扩散模型(Stable Diffusion 1.5 / XL / Illustrious / Flux、ZImage + ControlNet / IPAdapter)作为 Krita 的"生成式图层工具"暴露出来,强调两件事: 1. 精度与控制:用…
多模态 Acly/krita-ai-diffusion Stars 10,449 spark 2026-07-14
nexu-io/html-video · 上手攻略
htmlvideo 是 Open Design 团队出品的"AI 视频生成 metalayer":你跟本地 coding agent 说一句话(或丢一个链接),它把 HTML/CSS/数据变成真实 MP4 视频,全程在你电脑上渲染,不需要云端、不收单次渲染费。 它不绑定某个特定渲染引擎,而是一套适配器接口,render(input, ctx) 契约,任何后端…
多模态 nexu-io/html-video Stars 4,160 Tom 2026-07-14
NVIDIA-NeMo/Speech · 上手攻略
NVIDIA NeMo Speech 是 NVIDIA 推出的专注于语音 AI 的开源框架,支持自动语音识别(ASR)、语音合成(TTS)和语音大模型(Speech LLM)三大方向。它是从原 NVIDIA/NeMo 大一统仓库中拆分出来的独立版本(2026 年 6 月正式发布首个 release),专门面向需要训练和微调语音模型的 연구人员和 PyTorc…
多模态 NVIDIA-NeMo/Speech Stars 18,087 Tom 2026-07-13
Lightricks/LTX-2 · 上手攻略
LTX2 是 Lightricks 开源的视频生成模型(当前版本 LTX2.3,22B 参数,2026 年 3 月 5 日发布),基于 DiT(Diffusion Transformer)架构。它是 2026 年视频生成领域里唯一同时具备以下三个特性的开源模型: 同步音视频生成(4K 视频 + 音频,一次扩散过程完成) 原生 4K 50fps 输出 完整开源…
多模态 Lightricks/LTX-2 Stars 8,560 Jay 2026-07-12
xorbitsai/inference(Xinference)· 上手攻略
Xinference(Xorbits Inference)是 xorbitsai 团队开源的统一推理服务平台,一行代码替换 GPT 为任意开源 LLM。它让你在本地、云端或笔记本上运行开源语言模型、语音模型和多模态模型,通过统一的 OpenAI 兼容 API 提供服务。 Xinference 的核心差异化在于:支持最多的推理引擎(vLLM、SGLang、ll…
多模态 xorbitsai/inference Stars 9,486 Jay 2026-07-11
mudler/LocalAI · 上手攻略
LocalAI 是一个开源的本地 AI 推理引擎,2026 年 7 月 Stars 约 4.7 万,周增约 +126。核心理念是「小核心 + 按需加载后端」:每个后端(llama.cpp、vLLM、whisper.cpp、stablediffusion、MLX 等)都是独立的 OCI 镜像,只在你需要某类模型时才拉取安装。最新稳定版为 v4.3.0(2026…
多模态 mudler/LocalAI Stars 48,383 Tom 2026-07-10
google-ai-edge/mediapipe · 上手攻略
MediaPipe 是 Google 开源的端侧机器学习框架,专注于在手机(Android/iOS)、Web、桌面、边缘设备和 IoT 上实时运行 ML 模型。它不是训练框架,而是推理框架——帮你把 Google 训练好的模型快速部署到各类设备上,以低延迟处理图像、视频、音频和文本。 Google 于 2023 年将 MediaPipe 主开发文档迁移至 d…
多模态 google-ai-edge/mediapipe Stars 36,566 Tom 2026-07-10
op7418/guizang-social-card-skill · 上手攻略
guizangsocialcardskill 是一个面向 Claude Code / Codex 等 AI Agent 的图文卡片生成技能(Skill),专门用于从文章、截图、产品笔记、照片或视频素材,自动生成小红书 / Rednote 图文组图、Live Photo 动态卡片,以及公众号 21:9 + 1:1 封面对。 它的核心设计哲学是:把"做一张好看的…
多模态 op7418/guizang-social-card-skill Stars 5,512 Tom 2026-07-08
WUBING2023/PaperSpine · 上手攻略
PaperSpine 是一个以"贡献为先、面向审稿人"为核心理念的学术写作系统,支持 Claude Code、Codex、OpenClaw 和 Hermes CLI 四个 AI Agent 宿主。它将学术论文写作拆解为 12 个有序阶段,每阶段有强制关卡(gate),不允许跳步,必须逐关通过才能进入下一阶段。 V4(当前版本 4.0.0)是重大升级:原本 1…
多模态 WUBING2023/PaperSpine Stars 4,041 Tom 2026-07-08
HBAI-Ltd/Toonflow-app · 上手攻略
Toonflow(动画流)是一款开源一站式 AI 短剧创作工具,将小说或剧本快速转化为动画短剧。集成 AI 编剧(ScriptAgent)、智能分镜(ProductionAgent)、角色管理和视频生成,覆盖"策划 → 编剧 → 分镜 → 出片"全流程,官方称创作效率提升 10 倍以上。 官网: 文档: 内置详细说明) 传统短剧制作流程需要:编剧改编 → 分…
多模态 HBAI-Ltd/Toonflow-app Stars 13,701 Jay 2026-07-08
PaddlePaddle/PaddleOCR · 上手攻略
PaddleOCR 是百度飞桨(PaddlePaddle)团队开源的多功能 OCR 与文档解析工具包,GitHub Stars 超 8.4 万,被 Dify、RAGFlow、Cherry Studio 等主流项目深度集成。它不只是一套光学字符识别引擎,更是一个覆盖"图片→结构化数据"完整流程的文档 AI 基础设施。 当前稳定版本为 PaddleOCR 3.6…
多模态 PaddlePaddle/PaddleOCR Stars 87,395 Jay 2026-07-07
helloianneo/ian-xiaohei-illustrations · 上手攻略
ianxiaoheiillustrations 是一个面向 AI Agent(尤其是 Codex)的中文正文配图生成 Skill。它指导 AI 把中文文章、帖子、博客、方法论内容里的判断、流程、状态和隐喻,转化成一张张白底、手绘、怪诞但清爽的 16:9 正文配图。 核心特点:生成的不是通用插画 prompt,也不是 PPT 信息图模板,而是先理解文章认知锚点…
多模态 helloianneo/ian-xiaohei-illustrations Stars 8,494 Jay 2026-07-07
teamchong/pxpipe · 上手攻略
pxpipe 是一个本地请求代理,专门用来降低 Claude Code(以及其他基于 Anthropic API 的 Agent)的 token 消耗。它通过将大量文本内容(系统提示词、工具文档、历史记录)渲染为图片,再通过视觉通道传输,从而大幅压缩输入 token 数量。 核心逻辑:一张图片的 token 成本由像素尺寸决定,而不是内容长度。实测 dens…
多模态 teamchong/pxpipe Stars 6,425 Tom 2026-07-07
diffusionstudio/lottie · 上手攻略
lottie 是 Diffusion Studio 出品的开源 Skill(工具包),让 Claude Code 或 Codex 等 Coding Agent 通过自然语言指令直接生成可投产级别的 Lottie 动画 JSON 文件。 它的核心工作流是:你在对话中描述想要的动画效果(基于 SVG、截图或真实数据),Agent 调用 diffusionstud…
多模态 diffusionstudio/lottie Stars 5,020 Jay 2026-07-06
baidu/Unlimited-OCR · 上手攻略
UnlimitedOCR 是百度开源的多模态文档解析模型,定位是「一键长文档解析」——单张图片、PDF 多页、整本手册均可一次性处理,输出结构化文本。发布于 2026 年 6 月,arXiv 论文编号 2606.23050。 官方将其定位为对 DeepSeekOCR 的进一步推进,核心能力: 传统 OCR + NLP 管道有三个常见痛点: 1. 多步骤串联:…
多模态 baidu/Unlimited-OCR Stars 23,399 Tom 2026-07-06
Anil-matcha/Open-Generative-AI · 上手攻略
Open Generative AI(简称 OGA)是一个免费的、开源的 AI 图像与视频生成桌面应用,内置 200+ 模型(Flux、Midjourney、Kling、Sora、Veo、Seedance 2.5 等),无内容过滤器、无审查,MIT 协议可自托管,本质上是 MuAPI.ai 的前端桌面封装。 核心定位:绕过商业 AI 视频平台的内容限制,让用…
多模态 Anil-matcha/Open-Generative-AI Stars 26,047 Tom 2026-07-05
ruvnet/RuView · 上手攻略
RuView 是一个基于 WiFi CSI(信道状态信息) 的空间智能感知系统——利用普通路由器发出的无线信号,经墙壁反射后的人体扰动来检测:有人在与否、呼吸频率、心率、跌倒、活动姿态、房间占用情况。全程不需要任何摄像头、麦克风或可穿戴设备。 核心技术:用 ESP32 板子 + Cognitum Seed(边缘 AI 协处理器)读取 WiFi CSI 数据,…
多模态 ruvnet/RuView Stars 89,443 Tom 2026-07-05
图像模型演进路线阅读指南
对照 CNN 的局部归纳偏置、ViT 的规模化学习、CLIP 的图文对齐与 Diffusion 的可控生成。 先掌握表征学习的变化,再进入生成模型;不建议把所有架构只按发表时间排列。
多模态 curator 2026-06-01