GPUStack 是一个开源的 GPU 集群管理器,专门面向 AI 模型服务(Model Serving)和 GPU 资源调度场景。它的核心职责是:把多个 GPU 节点组织成一个集群,自动配置 vLLM、SGLang、TensorRTLLM 等推理引擎,然后暴露一个统一的 OpenAI 兼容 API 供上层应用调用。 从定位上看,它介于底层 GPU 运维工具…
仓库攻略
71 篇 · 71 个项目 · LLM 基础设施 · tom
微软官方出品的 21 节生成式 AI 入门课程,覆盖从 LLM 基础理论到 AI Agent 开发完整路径。每节包含讲解视频(YouTube)+ 文字课程 + Python/TypeScript 双语言代码示例,并配套 50+ 语言的社区翻译。Stars 约 112k,是微软 GitHub 最受欢迎的教育类仓库之一。 课程默认使用 Azure OpenAI …
Rig 是用 Rust 构建模块化、可扩展 LLM 应用的库。它提供了一套统一抽象,覆盖 20+ 大模型提供商、10+ 向量数据库,并内置 Agent 编排、RAG、工具调用、多轮对话等能力,全部用 Rust 的类型安全和并发性能加持。 解决什么问题: 在 Rust 生态里,之前缺乏一个统一、好用的 LLM 应用抽象层。开发者要么自己封装各个 Provide…
vllmascend 是华为昇腾(Ascend)NPU 的官方 vLLM 硬件插件,让 vLLM 高性能推理框架能跑在昇腾芯片上。它由 vLLM 社区维护,遵循 vLLM 的硬件可插拔接口(Hardware Pluggable RFC),是昇腾后端在 vLLM 生态的推荐方案。 通俗理解:vLLM 是 LLM 推理的"操作系统",vllmascend 就是让…
ZML(Z Machine Learning)是一个生产级 AI 推理技术栈,旨在将任意模型部署到任意硬件加速器上,零妥协。 它基于 Zig 语言、MLIR 编译框架和 Bazel 构建系统实现,支持 NVIDIA CUDA、AMD RoCM、Intel OneAPI、Google TPU、AWS Trainium/Inferentia 2 等多种加速器后端…
AirLLM 是一个开源 Python 库,实现了一种层间加载(layerwise)推理技术,让超大语言模型在显存极小的 GPU(甚至只有 4GB VRAM 的卡)上运行推理,无需量化、无需蒸馏、无需剪枝。 核心技术原理:用单层加载替代全量加载。传统推理需要把 130GB 的 70B 模型一股脑塞进显存;AirLLM 把模型按 transformer 层拆开…
PowerInfer 是由上海交大 IPADS 实验室开源的高速 LLM 推理引擎,专为单张消费级 GPU(RTX 4090 等)本地部署设计。其核心技术是利用 LLM 推理中神经元激活的幂律分布特性——少数"热神经元"(hot neurons)在几乎所有输入中都被激活,而大多数"冷神经元"(cold neurons)则随输入变化。 基于这一洞察,Power…
SGLang 是一个高性能大语言模型(及多模态模型)推理 serving 框架,由 LMSYS 组织开发维护(Apache2.0 许可证)。它的核心定位是 vLLM 的直接竞争对手,在多项 benchmark 上展示出更高的吞吐量和更低的延迟。SGLang 底层基于 PyTorch,支持 RadixAttention(前缀缓存)、连续批处理(continuo…
vLLM 是一个高吞吐量、内存高效的 LLM 推理与服务引擎,最初由 UC Berkeley Sky Computing Lab 开发,现已成长为全球最活跃的开源 AI 基础设施项目之一,拥有来自 2000+ 贡献者的社区支持。 核心突破是 PagedAttention 技术——受操作系统虚拟内存分页启发,将 KV Cache 切分成小块动态管理,显著减少显…
LiteLLM 是一个统一调用 100+ 大模型 API 的 Python 库 + AI Gateway(代理服务器),用 OpenAI 格式作为统一接口,抹平各 provider(OpenAI、Anthropic、Gemini、Bedrock、Azure、HuggingFace、VLLM、NVIDIA NIM 等)的 API 差异,同时提供成本追踪、虚拟 …
Sub2API 是一个存在明确服务条款风险的开源项目。仓库 README 开篇即写明: "使用本项目可能违反 Anthropic 等上游服务商的服务条款。请仔细阅读相关服务商的用户协议,所有风险由用户自行承担。" 在部署和使用前,请充分评估法律风险。 本攻略仅做技术说明,不构成使用建议。 Sub2API 是一个自托管 AI API 网关,用于将 AI 产品订…