MindPipe 是一个统一的 LLM/VLM 模型压缩评估框架,用单一 main.py CLI 驱动 11 种量化方法、7 种剪枝方法、压缩微调联合流程,以及 PPL / lmevalharness 零样本 / VLMEvalKit 多模态三类评估。核心设计理念是:一次配置,全流程可复现。 ⚠️ 注意:本仓库同时支持 NVIDIA GPU 和华为昇腾 NP…
仓库攻略
29 篇 · 29 个项目 · LLM 基础设施 · 多模态
RTPLLM(RealTime PrefillDecode LLM)是阿里巴巴大模型推理团队开发的高性能 LLM 推理加速引擎,脱胎于 FasterTransformer,在其基础上融合了 TensorRTLLM 的部分 CUDA kernel 实现,并参考了 vLLM 的 PagedAttention 等设计。该项目已在阿里内部广泛落地,支持淘宝问问、淘宝…
Intel Neural Compressor 是 Intel 开源的模型压缩库,专注于 LLM/VLM 的低比特量化(Lowbit Quantization),覆盖 INT8、FP8、MXFP8、MXFP4、INT4、NVFP4 等多种低精度数据类型,支持 PyTorch、TensorFlow、JAX 三大框架。 其核心定位是:Intel 官方大模型推理优…
NeMo Curator 是 NVIDIA 出品的大规模多模态数据预处理与清洗工具包,专门为 LLM(及其他基础模型)预训练数据构建可复用的 GPU 加速流水线。覆盖文本、图像、视频、音频四种模态,核心能力包括:质量过滤、去重(精确/模糊/子串)、语言检测、分类、合成数据生成(SDG)。它由 RAPIDS(cuDF/cuML/cuGraph)+ Ray 驱动…
binaryhusky/gpt_academic(GPT Academic)是一个为 GPT / GLM 等大语言模型打造的实用化交互界面,特别针对论文阅读、润色、翻译、写作场景深度优化。项目采用模块化插件设计,支持自定义快捷按钮、Python / C++ 项目剖析、ArXiv 论文翻译总结、LaTeX 全文翻译校对等30+ 功能,并行支持 ChatGPT、…
StarlightSearch/EmbedAnything 是一个用 Rust 构建的高性能、多模态 embedding 管道。它支持从文本、图片、音频、PDF、网站等多种来源生成向量嵌入,并与 Milvus、Weaviate、Elastic、SingleStore 等主流向量数据库无缝对接,核心卖点是零 PyTorch 依赖、低内存占用、流式索引,已在 E…
llama.cpp 是一个纯 C/C++ 实现的高性能 LLM 推理框架,核心目标是在各种硬件上以最小化依赖和最优性能跑本地大模型。它基于底层的 ggml 库构建,支持 FP16 和 GGUF 量化格式,Star 122,572(无周增,长期稳定),是本地 LLM 推理领域最活跃的开源项目之一。 核心特点: 纯 C/C++ 实现,无外部依赖(除少量单文件 H…
封神榜(FengshenbangLM) 是 IDEA 研究院认知计算与自然语言研究中心(CCNL)主导的中文大模型开源体系,2021 年 11 月由沈向洋在 IDEA 大会上正式发布。定位是"中文认知智能的基础设施",旗下包含 6 大模型系列,覆盖从语言理解到多模态生成的完整 NLP 任务。 三个子项目协同工作: Fengshenbang Model:预训练…
nvidia_gpu_exporter 是一个用 Go 编写的 Prometheus GPU 指标导出器,底层调用 nvidiasmi(NVIDIA 系统管理接口)采集显卡实时状态——包括 GPU 利用率、显存占用、温度、功率、风扇转速、时钟频率等——并以 Prometheus 标准格式(/metrics 端点)暴露出来,可直接对接 Grafana 渲染监控…
NVIDIA/GenerativeAIExamples 是 NVIDIA 官方的生成式 AI 参考工作流仓库,针对加速基础设施(GPU/NIM 微服务)做了深度优化,涵盖 RAG 管道、Agentic 工作流、知识图谱、视觉 NIM 工作流、Data Flywheel 完整闭环等场景。当前最新 release 为 v0.8.x(2025 年),目录结构已完成…
TurboFieldfare 是一个用 Swift 6.2 + Metal 4 从零手写的 Gemma 4 26BA4B 推理运行时,专为 Apple Silicon Mac 设计。它的核心目标只有一个:让 8 GB 内存的 M 系列 MacBook Air 也能跑 Gemma 4 26B 大模型。 Gemma 4 26B 是一个 MoE(Mixtureof…
版本说明:仓库 README 中没有写死顶层版本号,文档站 inference.roboflow.com/using_inference/about 自称 "Inference 1.0",PyPI 上 inferencesdk 的最新轮转版本为 1.3.x(如 1.3.7)——下面的命令以当前 README 与 PyPI 通用写法为准,不写死小版本号,使用 …
提示:仓库 README、API 文档链接均指向 ort 2.0 系列,本攻略以当前 main 分支为准(最新示例分支标签为 v2.0.0rc.13,来自仓库 docs 与 examples 中给出的克隆命令)。若你看到更新 rc tag,请以 crates.io 与 docs.rs 的最新版为准。 ort 是 Rust 生态里跑 ONNX 模型的主流 cr…
提示:上游仓库标识写作 openvinotoolkit/openvino_notebooks(带下划线),按本攻略规则计算的文件 slug 为 openvinotoolkitopenvinonotebooks.md。下文中如出现"OpenVINO 2026.2"等版本号,均来自仓库当前 README,未在外部二次确认。 openvino_notebooks …
Kimi K3 是 Moonshot AI(MiniMax)推出的开源权重多模态 Agent 大模型,总参数量 2.8T(激活 104B),是全球首个开放的 3T 级开源模型。K3 基于两项自研架构:Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes),采用 MoE(MixtureofExperts…
Open Model Zoo 是 Intel 维护的预训练深度学习模型仓库,为 OpenVINO™ Toolkit 提供大量已优化模型和演示程序。包含 200+ 模型,覆盖目标检测、图像分类、图像分割、姿态估计、语音识别、文本转语音等主流 CV 任务,并配有可直接运行的 C++ / Python Demo 示例。 模型分为两大类: Intel 预训练模型(m…
torchao(即 pytorch/ao 仓库发布的 PyPI 包名)是 PyTorch 官方主推的 原生量化与稀疏化库,主打「训练推理一致」「一行代码改动即可接入」,覆盖从权重量化(int4/int8/fp8/NF4)、激活量化、2:4 稀疏、低比特 optimizer(4bit/8bit/fp8 AdamW)、量化感知训练(QAT),到 float8 预…
RapidMLX 是目前 Apple Silicon 上速度最快的本地 AI 推理引擎,专为 M 系列芯片优化,基于 Apple MLX 框架重写所有核心 kernel,纯 Metal GPU 加速,无任何 llama.cpp 回退或 Python 桥接层。相比同场景的 Ollama,吞吐量提升约 4.2 倍,首 token 时间(TTFT)可低至 0.08…
ultralytics/yolov3 是 YOLOv3(You Only Look Once version 3)目标检测模型的 Ultralytics 官方 PyTorch 实现。原始 YOLOv3 由 Joseph Redmon 和 Ali Farhadi 在 2018 年提出(arXiv:1804.02767),Ultralytics 在此基础上添加了…
RunAnywhere 是一个端侧 AI 推理 SDK 套件,让你在 iOS、Android、Flutter、React Native 和浏览器里直接跑 LLM、VLM、语音识别(TTS/STT)和语音合成,无需联网、数据不离设备。它用同一套 API 屏蔽了各平台的底层差异:Apple 设备走 Core ML / Metal,安卓走 llama.cpp 或高…
OpenLLM 是一个开源的 LLM 推理服务框架,让你用一条命令把任何开源大模型(Llama 3.3、Qwen2.5、Mistral、DeepSeek 等)启动为 OpenAI 兼容的 HTTP API,并自带一个 Web Chat UI。它基于 BentoML 构建,支持 Docker 部署和 BentoCloud 云端托管,适合需要自托管 LLM AP…
DataJuicer(简称 DJ)是一个为 foundation model 时代打造的数据操作系统,专注于将混乱的原始数据转化为 AI 可用的精炼数据。它把数据处理看成是可组合的基础设施,提供模块化的构建块来完成清洗、合成和分析,覆盖 AI 全生命周期的数据处理需求。 用大白话说:它是一个超大型数据处理工具箱,内置 200+ 算子(Operator),可以…
HappyLLM 是 Datawhale 团队推出的系统性大模型学习教程,定位介于"科普"和"科研"之间,目标是授之以鱼,更授之以渔。它从 NLP 基本研究方法讲起,沿着 LLM 的思路和原理逐层深入,最终带领读者用 PyTorch 从零实现一个 LLaMA2 模型,并完成预训练、有监督微调(SFT)和 LoRA/QLoRA 高效微调的全流程。 与其姐妹项目…
vLLMOmni 是 vLLM 社区推出的全模式(omnimodality)推理框架,将 vLLM 的高性能 LLM 推理能力扩展到任意到任意的多模态模型——不只是理解图像/视频/音频,而是能同时生成多种模态的输出(文本+图像+视频+音频)。 支持的输出类型: 一句话概括:vLLM 在多模态生成领域的扩展,让研究者和企业能用生产级性能跑 OmniModali…
内容待复核
josephmisiti/awesome-machine-learning · 上手攻略
awesomemachinelearning 是机器学习领域最老牌、最全的资源列表之一,由 Joseph Misiti 维护(Stars 73,273,周增 +112)。它按编程语言分类,收录了几乎所有主流机器学习框架、库和工具,堪称 ML 领域的"黄页"。 仓库不提供代码,仅做资源导航,是发现和调研 ML 工具的首选起点。 ⚠️ 注意(2026年4月维护者…
BentoML 是一个 Python 库,用于构建和部署 AI 模型推理服务。它将任意 AI/ML 模型的推理代码,通过几行装饰器注解,自动变成可扩展的 HTTP API,并支持 Docker 镜像打包、模型版本管理、动态批处理、多模型编排等生产级特性。 核心理念:"Build Model Inference APIs, Job queues, LLM ap…
SGLang 是一个高性能大语言模型(及多模态模型)推理 serving 框架,由 LMSYS 组织开发维护(Apache2.0 许可证)。它的核心定位是 vLLM 的直接竞争对手,在多项 benchmark 上展示出更高的吞吐量和更低的延迟。SGLang 底层基于 PyTorch,支持 RadixAttention(前缀缓存)、连续批处理(continuo…
vLLM 是一个高吞吐量、内存高效的 LLM 推理与服务引擎,最初由 UC Berkeley Sky Computing Lab 开发,现已成长为全球最活跃的开源 AI 基础设施项目之一,拥有来自 2000+ 贡献者的社区支持。 核心突破是 PagedAttention 技术——受操作系统虚拟内存分页启发,将 KV Cache 切分成小块动态管理,显著减少显…
LiteLLM 是一个统一调用 100+ 大模型 API 的 Python 库 + AI Gateway(代理服务器),用 OpenAI 格式作为统一接口,抹平各 provider(OpenAI、Anthropic、Gemini、Bedrock、Azure、HuggingFace、VLLM、NVIDIA NIM 等)的 API 差异,同时提供成本追踪、虚拟 …