Guides · organized/guides

仓库攻略

19 篇 · 19 个项目 · 多模态 · 评测基准

内容待复核
hitcslj/Awesome-AIGC-3D · 上手攻略
这是一份由香港科技大学(HKUST)团队维护的 AIGC 3D 论文精选列表,当前版本(v2.0,202604)已升级为一份生产导向的 3D 生成综述,通过二维分类法系统整理了从数据基座到场景组装的完整 3D AIGC 论文图谱。 核心定位:不是代码仓库,而是一份持续更新的 living survey,帮你快速定位某个子领域(如"文本生成角色骨骼绑定"或"世…
多模态 hitcslj/Awesome-AIGC-3D Stars 787 Tom 2026-08-26
coderonion/awesome-llm-and-aigc · 上手攻略
coderonion/awesomellmandaigc 是一个 LLM / VLM / VLA / AIGC 领域的精选资源列表(Awesome List),按 Framework(模型/训练/推理/量化/RAG)、Application(IDE/聊天机器人/具身智能/代码助手/知识库等)、Dataset、Learning Resources、Commun…
多模态 coderonion/awesome-llm-and-aigc Stars 811 Jay 2026-08-25
wshzd/Awesome-AIGC · 上手攻略
wshzd/AwesomeAIGC 是一份中文 AIGC 资料汇总型仓库,以「论文分享 / 访谈 / 模型评测 / 行业动态」为单位收录条目,附带外链(arXiv、知乎、微信公众号、B 站等)。与 f/awesomechatgptprompts、Hannibal046/AwesomeLLM 这类以英文为主的清单相比,它的定位是中文圈 AIGC 早期热度阶段的…
多模态 wshzd/Awesome-AIGC Stars 873 spark 2026-08-23
HiLab-git/SSL4MIS · 上手攻略
SSL4MIS(Semi Supervised Learning for Medical Image Segmentation)是一个医学影像分割领域的半监督学习论文与代码汇总仓库,由 HiLab 团队维护。它不是一个可以直接跑起来的框架或工具,而是一个持续更新的文献 + 代码索引库——追踪这个领域从 2019 年至今几乎所有重要的论文及其官方实现。 每一项…
多模态 HiLab-git/SSL4MIS Stars 2,671 Tom 2026-08-20
index-tts/index-tts · 上手攻略
IndexTTS 是阿里巴巴 Index 团队开源的零样本(ZeroShot)语音克隆系统,用一段参考音频(10~30秒)即可复刻任意人的音色,生成对应文本的语音。当前稳定版为 IndexTTS2.5(2026年8月10日发布),支持中文、英语、日语、西班牙语、阿拉伯语五种语言,并在多语言跨音色任务上达到了开源 SOTA 水平。 核心能力: IndexTTS…
多模态 index-tts/index-tts Stars 22,384 Tom 2026-08-19
open-mmlab/mmagic · 上手攻略
MMagic(Multimodal Advanced, Generative, and Intelligent Creation)是 OpenMMLab 体系下的 AIGC 工具箱,是 MMEditing 与 MMGeneration 合并后的统一继承者。它提供从底层 PyTorch 训练到高层 MMagicInferencer 的全套接口,覆盖图像 / 视…
多模态 open-mmlab/mmagic Stars 7,452 spark 2026-08-18
JaidedAI/EasyOCR · 上手攻略
EasyOCR 是一个用 PyTorch 开发的通用 OCR(光学字符识别)Python 库,开箱即用,支持 80+ 语言,涵盖 Latin、CJK(简繁体中文、日文、韩文)、Arabic、Devanagari、Cyrillic 等所有主流书写系统,同时处理自然场景文本和文档密集文本。 v1.7.2(2024 年 9 月)是当前最新正式版。自 2020 年起…
多模态 JaidedAI/EasyOCR Stars 29,861 Tom 2026-08-18
NVIDIA-AI-Blueprints/video-search-and-summarization · 上手攻略
NVIDIA Video Search and Summarization(VSS)Blueprint 是一套GPU 加速的视频语义理解和分析参考架构。它将视觉语言模型(VLM,如 NVIDIA Cosmos)、大语言模型(LLM,如 Nemotron)、RAG 和 NVIDIA NIM 微服务整合在一起,实现用自然语言搜索视频内容、实时异常检测、视频问答和…
多模态 NVIDIA-AI-Blueprints/video-search-and-summarization Stars 1,790 Tom 2026-08-15
facebookresearch/vggt-omega · 上手攻略
VGGTOmega(VGGTΩ)是 Meta AI 与牛津大学视觉几何组(VGG)联合发布的单次前向 3D 重建模型,输入一组图像(单张到数百张),直接输出相机内外参数、深度图、置信度图和场景 token——无需传统 SfM/Colmap 的迭代优化步骤。模型入选 CVPR 2026 Best Paper Finalist,是前作 VGGT(CVPR 202…
多模态 facebookresearch/vggt-omega Stars 3,471 Tom 2026-08-06
jd-opensource/xllm · 上手攻略
xLLM 是京东开源的高性能 LLM/VLM/DiT/REC 推理引擎,托管于 OpenAtom 基金会,核心定位是在多种国产 AI 加速器上实现企业级高吞吐推理。它于 2025 年 10 月发布技术报告(arXiv:2510.14686),已在京东内部支持客服(JingYan AI)、营销推荐、商品理解等多个核心业务日产环境运行。 架构上分为两层:xLLM…
多模态 jd-opensource/xllm Stars 1,390 Tom 2026-07-31
waybarrios/vllm-mlx · 上手攻略
vllmmlx 是一个专为 Apple Silicon(M 系列芯片)打造的推理服务器,核心思路是:把 vLLM 在 CUDA 硬件上的核心优化(连续批处理、页级 KV 缓存、前缀缓存)移植到苹果的 MLX 框架上,通过 Metal 驱动统一内存直接跑模型,无需任何格式转换。 它同时暴露 OpenAI /v1/ 和 Anthropic /v1/message…
多模态 waybarrios/vllm-mlx Stars 1,447 Tom 2026-07-31
intentee/paddler · 上手攻略
Paddler 是一款用 Rust 写的开源 LLM/VLM 推理负载均衡与服务平台。架构非常克制:只有两个组件——balancer(对外暴露 OpenAI 兼容推理接口、管理面和 Web 控制台)和 agent(真正跑推理,注册到 balancer 上即可上线)。底层直接用 llama.cpp 推理引擎(fork 版本,Paddler 自己实现了 slot…
多模态 intentee/paddler Stars 1,651 spark 2026-07-28
img2threejs/img2threejs · 上手攻略
img2threejs 是一个代码优先的图像→3D 重建工具。你给它一张参考图,它生成一段 TypeScript 代码,在浏览器里跑出一个 THREE.Group 工厂函数——所有几何体都由原始几何体(BoxGeometry、CylinderGeometry 等)、程序化着色器和生成式几何拼出来,没有 mesh 文件,没有 GLB 下载,产物天然是"代码"而…
多模态 img2threejs/img2threejs Stars 10,708 Tom 2026-07-26
EvolvingLMMs-Lab/lmms-eval · 上手攻略
lmmseval(Python 包名 lmmseval,前身为 LMMsEval)是 EvolvingLMMsLab 维护的"统一多模态大模型评估工具包"。目标只有一个:让"同一个模型 + 同一个 benchmark + 同一套参数"在两台机器上跑出来数字一致,并且能覆盖文本、图像、视频、音频四大模态的 100+ 任务、30+ 模型后端。 它脱胎于 Eleu…
多模态 EvolvingLMMs-Lab/lmms-eval Stars 4,355 spark 2026-07-16
内容待复核
BradyFU/Awesome-Multimodal-Large-Language-Models · 上手攻略
这是一份由南京大学 MIG 实验室(NJUMiG)维护的多模态大语言模型(Multimodal Large Language Models,MLLM)前沿论文合集,截至 2026 年 7 月已收录 17.9k+ Stars,是 MLLM 领域最全面、最活跃的社区驱动的学术索引之一。 它不是代码库,而是一个持续更新的知识库,系统整理了 MLLM 各个子方向的论…
多模态 BradyFU/Awesome-Multimodal-Large-Language-Models Stars 17,977 Tom 2026-07-14
oumi-ai/oumi · 上手攻略
Oumi 是一个开源的 LLM 全生命周期管理平台,覆盖从数据准备、微调训练、评估评测到部署上线的完整流程。它用统一 CLI(oumi)串联起 Transformers、TRL、vLLM、veRL 等主流训练推理库,让你用同一套配置在不同硬件规模(单卡 135M 到千卡 405B)下无缝切换。 支持 Gemma 4、Qwen3.5、Qwen3.6、GPTos…
多模态 oumi-ai/oumi Stars 9,369 Jay 2026-07-10
xLLM-AI/xllm · 上手攻略
xLLM 是由京东零售团队开发、现托管于 OpenAtom 基金会的高性能 LLM 推理引擎。它不是面向普通用户的 AI 产品,而是给企业级部署场景用的底层 Infra 工具——目标是让大模型的推理在特定 AI 加速器上跑得更快、更划算。 支持的模型类型不只有 LLM,还包括: LLM(大语言模型) VLM(视觉语言模型) DiT(扩散Transformer…
多模态 xLLM-AI/xllm Stars 1,516 Jay 2026-07-10
teamchong/pxpipe · 上手攻略
pxpipe 是一个本地请求代理,专门用来降低 Claude Code(以及其他基于 Anthropic API 的 Agent)的 token 消耗。它通过将大量文本内容(系统提示词、工具文档、历史记录)渲染为图片,再通过视觉通道传输,从而大幅压缩输入 token 数量。 核心逻辑:一张图片的 token 成本由像素尺寸决定,而不是内容长度。实测 dens…
多模态 teamchong/pxpipe Stars 6,425 Tom 2026-07-07
baidu/Unlimited-OCR · 上手攻略
UnlimitedOCR 是百度开源的多模态文档解析模型,定位是「一键长文档解析」——单张图片、PDF 多页、整本手册均可一次性处理,输出结构化文本。发布于 2026 年 6 月,arXiv 论文编号 2606.23050。 官方将其定位为对 DeepSeekOCR 的进一步推进,核心能力: 传统 OCR + NLP 管道有三个常见痛点: 1. 多步骤串联:…
多模态 baidu/Unlimited-OCR Stars 23,399 Tom 2026-07-06