研究库 实战攻略
Guides · organized/guides

仓库攻略

71 篇 · 71 个项目 · LLM 基础设施 · tom

gpustack/gpustack · 上手攻略
GPUStack 是一个开源的 GPU 集群管理器,专门面向 AI 模型服务(Model Serving)和 GPU 资源调度场景。它的核心职责是:把多个 GPU 节点组织成一个集群,自动配置 vLLM、SGLang、TensorRTLLM 等推理引擎,然后暴露一个统一的 OpenAI 兼容 API 供上层应用调用。 从定位上看,它介于底层 GPU 运维工具…
LLM 基础设施 gpustack/gpustack Stars 5,465 Tom 2026-07-12
microsoft/generative-ai-for-beginners · 上手攻略
微软官方出品的 21 节生成式 AI 入门课程,覆盖从 LLM 基础理论到 AI Agent 开发完整路径。每节包含讲解视频(YouTube)+ 文字课程 + Python/TypeScript 双语言代码示例,并配套 50+ 语言的社区翻译。Stars 约 112k,是微软 GitHub 最受欢迎的教育类仓库之一。 课程默认使用 Azure OpenAI …
LLM 基础设施 microsoft/generative-ai-for-beginners Stars 117,401 Tom 2026-07-10
0xPlaygrounds/rig · 上手攻略
Rig 是用 Rust 构建模块化、可扩展 LLM 应用的库。它提供了一套统一抽象,覆盖 20+ 大模型提供商、10+ 向量数据库,并内置 Agent 编排、RAG、工具调用、多轮对话等能力,全部用 Rust 的类型安全和并发性能加持。 解决什么问题: 在 Rust 生态里,之前缺乏一个统一、好用的 LLM 应用抽象层。开发者要么自己封装各个 Provide…
LLM 基础设施 0xPlaygrounds/rig Stars 8,237 Tom 2026-07-10
vllm-project/vllm-ascend · 上手攻略
vllmascend 是华为昇腾(Ascend)NPU 的官方 vLLM 硬件插件,让 vLLM 高性能推理框架能跑在昇腾芯片上。它由 vLLM 社区维护,遵循 vLLM 的硬件可插拔接口(Hardware Pluggable RFC),是昇腾后端在 vLLM 生态的推荐方案。 通俗理解:vLLM 是 LLM 推理的"操作系统",vllmascend 就是让…
LLM 基础设施 vllm-project/vllm-ascend Stars 2,600 Tom 2026-07-10
zml/zml · 上手攻略
ZML(Z Machine Learning)是一个生产级 AI 推理技术栈,旨在将任意模型部署到任意硬件加速器上,零妥协。 它基于 Zig 语言、MLIR 编译框架和 Bazel 构建系统实现,支持 NVIDIA CUDA、AMD RoCM、Intel OneAPI、Google TPU、AWS Trainium/Inferentia 2 等多种加速器后端…
LLM 基础设施 zml/zml Stars 3,972 Tom 2026-07-09
lyogavin/airllm · 上手攻略
AirLLM 是一个开源 Python 库,实现了一种层间加载(layerwise)推理技术,让超大语言模型在显存极小的 GPU(甚至只有 4GB VRAM 的卡)上运行推理,无需量化、无需蒸馏、无需剪枝。 核心技术原理:用单层加载替代全量加载。传统推理需要把 130GB 的 70B 模型一股脑塞进显存;AirLLM 把模型按 transformer 层拆开…
LLM 基础设施 lyogavin/airllm Stars 30,619 Tom 2026-07-08
Tiiny-AI/PowerInfer · 上手攻略
PowerInfer 是由上海交大 IPADS 实验室开源的高速 LLM 推理引擎,专为单张消费级 GPU(RTX 4090 等)本地部署设计。其核心技术是利用 LLM 推理中神经元激活的幂律分布特性——少数"热神经元"(hot neurons)在几乎所有输入中都被激活,而大多数"冷神经元"(cold neurons)则随输入变化。 基于这一洞察,Power…
LLM 基础设施 Tiiny-AI/PowerInfer Stars 9,704 Tom 2026-07-08
sgl-project/sglang · 上手攻略
SGLang 是一个高性能大语言模型(及多模态模型)推理 serving 框架,由 LMSYS 组织开发维护(Apache2.0 许可证)。它的核心定位是 vLLM 的直接竞争对手,在多项 benchmark 上展示出更高的吞吐量和更低的延迟。SGLang 底层基于 PyTorch,支持 RadixAttention(前缀缓存)、连续批处理(continuo…
LLM 基础设施 sgl-project/sglang Stars 31,657 Tom 2026-07-07
vllm-project/vllm · 上手攻略
vLLM 是一个高吞吐量、内存高效的 LLM 推理与服务引擎,最初由 UC Berkeley Sky Computing Lab 开发,现已成长为全球最活跃的开源 AI 基础设施项目之一,拥有来自 2000+ 贡献者的社区支持。 核心突破是 PagedAttention 技术——受操作系统虚拟内存分页启发,将 KV Cache 切分成小块动态管理,显著减少显…
LLM 基础设施 vllm-project/vllm Stars 88,728 Tom 2026-07-07
BerriAI/litellm · 上手攻略
LiteLLM 是一个统一调用 100+ 大模型 API 的 Python 库 + AI Gateway(代理服务器),用 OpenAI 格式作为统一接口,抹平各 provider(OpenAI、Anthropic、Gemini、Bedrock、Azure、HuggingFace、VLLM、NVIDIA NIM 等)的 API 差异,同时提供成本追踪、虚拟 …
LLM 基础设施 BerriAI/litellm Stars 56,075 Tom 2026-07-07
Wei-Shaw/sub2api · 上手攻略
Sub2API 是一个存在明确服务条款风险的开源项目。仓库 README 开篇即写明: "使用本项目可能违反 Anthropic 等上游服务商的服务条款。请仔细阅读相关服务商的用户协议,所有风险由用户自行承担。" 在部署和使用前,请充分评估法律风险。 本攻略仅做技术说明,不构成使用建议。 Sub2API 是一个自托管 AI API 网关,用于将 AI 产品订…
LLM 基础设施 Wei-Shaw/sub2api Stars 36,568 Tom 2026-07-05