Guides · organized/guides

仓库攻略

105 篇 · 105 个项目 · LLM 基础设施

ollama/ollama · 上手攻略
Ollama 是最流行的本地大模型推理运行时,让你在本地机器上运行开源 LLM(Llama 系列、Qwen、DeepSeek、GLM、Gemma 等数百个模型),无需云服务、无需 API Key、一条命令启动服务。2026年7月 v0.32.0 起,Ollama CLI 本身升级为交互式 Agent,支持 Chat、Code 和 Work 委托任务——CLI…
LLM 基础设施 ollama/ollama Stars 177,685 Jay 2026-08-04
drumih/turbo-fieldfare · 上手攻略
TurboFieldfare 是一个用 Swift 6.2 + Metal 4 从零手写的 Gemma 4 26BA4B 推理运行时,专为 Apple Silicon Mac 设计。它的核心目标只有一个:让 8 GB 内存的 M 系列 MacBook Air 也能跑 Gemma 4 26B 大模型。 Gemma 4 26B 是一个 MoE(Mixtureof…
LLM 基础设施 drumih/turbo-fieldfare Stars 5,668 Tom 2026-08-02
theopenco/llmgateway · 上手攻略
LLM Gateway 是一个开源的 LLM API 网关,作为应用层与多个 LLM 提供商之间的中间件,提供统一的 API 接口。开发者只需集成一次网关,后续可自由切换/混用 OpenAI、Anthropic、Google Vertex AI 等多种模型,无需逐一对接每个提供商的 SDK 和认证体系。 同时,它内置了用量追踪、成本分析和性能监控功能,让团队…
LLM 基础设施 theopenco/llmgateway Stars 1,520 Tom 2026-07-31
trymirai/uzu · 上手攻略
uzu 是 Mirai Labs 用 Rust 从头编写的高性能 AI 推理引擎(v0.5.12 · 20260608),目标是让 AI 模型直接运行在你的应用中——零延迟、完整数据隐私、无推理费用。 它不是又一个 REST API 封装,而是一个真正把模型跑在本地的推理运行时。核心用 Rust 编写保证了性能和安全性,同时提供 Python / TypeS…
LLM 基础设施 trymirai/uzu Stars 1,670 Tom 2026-07-30
envoyproxy/ai-gateway · 上手攻略
envoyproxy/aigateway 是 Envoy 生态下的 AI 网关项目,基于 Envoy Gateway 扩展,专门处理应用客户端到生成式 AI(GenAI)服务的流量。它的本质是一个 Kubernetes 原生的 LLM 流量管理平面,提供路由、认证、限流、弹性Failover等企业级能力。 Envoy 是 CNCF 旗下久经生产验证的代理,M…
LLM 基础设施 envoyproxy/ai-gateway Stars 1,919 Tom 2026-07-30
mozilla-ai/any-llm · 上手攻略
anyllm 是 Mozilla AI 团队推出的 Python 库,目标是让你用同一套代码调用任何 LLM 提供商,无需改业务逻辑。 它的核心理念很清晰:LLM 提供商的 API 接口碎片化严重——OpenAI、Anthropic、Azure、Mistral、Ollama……各家参数名、响应格式、错误处理各有差异。anyllm 不重新造轮子,而是封装官方 …
LLM 基础设施 mozilla-ai/any-llm Stars 2,150 Tom 2026-07-30
roboflow/inference · 上手攻略
版本说明:仓库 README 中没有写死顶层版本号,文档站 inference.roboflow.com/using_inference/about 自称 "Inference 1.0",PyPI 上 inferencesdk 的最新轮转版本为 1.3.x(如 1.3.7)——下面的命令以当前 README 与 PyPI 通用写法为准,不写死小版本号,使用 …
LLM 基础设施 roboflow/inference Stars 2,411 spark 2026-07-30
pykeio/ort · 上手攻略
提示:仓库 README、API 文档链接均指向 ort 2.0 系列,本攻略以当前 main 分支为准(最新示例分支标签为 v2.0.0rc.13,来自仓库 docs 与 examples 中给出的克隆命令)。若你看到更新 rc tag,请以 crates.io 与 docs.rs 的最新版为准。 ort 是 Rust 生态里跑 ONNX 模型的主流 cr…
LLM 基础设施 pykeio/ort Stars 2,443 spark 2026-07-30
openvinotoolkit/openvino_notebooks · 上手攻略
提示:上游仓库标识写作 openvinotoolkit/openvino_notebooks(带下划线),按本攻略规则计算的文件 slug 为 openvinotoolkitopenvinonotebooks.md。下文中如出现"OpenVINO 2026.2"等版本号,均来自仓库当前 README,未在外部二次确认。 openvino_notebooks …
LLM 基础设施 openvinotoolkit/openvino_notebooks Stars 3,195 spark 2026-07-30
huggingface/optimum · 上手攻略
huggingface/optimum 是 Hugging Face 推出的 Transformers / Diffusers / TIMM / SentenceTransformers 的硬件优化扩展库。它把"同一套 HF 模型"映射到多种推理后端与训练硬件上,让用户用同一份 API 跑出"在目标硬件上的极限性能"——既负责 导出(ONNX、OpenVIN…
LLM 基础设施 huggingface/optimum Stars 3,457 spark 2026-07-30
moonshotai/Kimi-K3 · 上手攻略
Kimi K3 是 Moonshot AI(MiniMax)推出的开源权重多模态 Agent 大模型,总参数量 2.8T(激活 104B),是全球首个开放的 3T 级开源模型。K3 基于两项自研架构:Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes),采用 MoE(MixtureofExperts…
LLM 基础设施 MoonshotAI/Kimi-K3 Stars 8,340 Jay 2026-07-29
openvinotoolkit/open_model_zoo · 上手攻略
Open Model Zoo 是 Intel 维护的预训练深度学习模型仓库,为 OpenVINO™ Toolkit 提供大量已优化模型和演示程序。包含 200+ 模型,覆盖目标检测、图像分类、图像分割、姿态估计、语音识别、文本转语音等主流 CV 任务,并配有可直接运行的 C++ / Python Demo 示例。 模型分为两大类: Intel 预训练模型(m…
LLM 基础设施 openvinotoolkit/open_model_zoo Stars 4,415 Tom 2026-07-29
OpenNMT/CTranslate2 · 上手攻略
CTranslate2 是 OpenNMT 团队开源的 C++ / Python 高性能推理引擎,专门针对 Transformer 模型做极致优化。它通过权重量化、层融合、批处理重排序、动态内存管理等技术,在 CPU 和 GPU 上实现比原生 PyTorch / TensorFlow 快数倍、内存省几倍的推理性能。 支持三种模型架构: DecoderOnly…
LLM 基础设施 OpenNMT/CTranslate2 Stars 4,617 Tom 2026-07-29
google/XNNPACK · 上手攻略
XNNPACK 是 Google 官方维护的 神经网络推理算子库(C11 / C++17 / Python 3),专为 ARM、x86、WebAssembly、RISCV、Hexagon 等 CPU 类硬件优化浮点(FP16 / FP32)以及量化(INT8 / perchannel、perrow)推理。仓库明说「not intended for direc…
LLM 基础设施 google/XNNPACK Stars 2,421 spark 2026-07-27
huggingface/huggingface.js · 上手攻略
huggingface.js 是 Hugging Face 官方维护的 JavaScript / TypeScript 工具套件,本身是个 monorepo,里面按职责拆分成了若干独立发布的 npm 包: @huggingface/hub:与 huggingface.co 交互——创建/删除仓库、上传/下载/列出文件、提交 commit。覆盖 Model /…
LLM 基础设施 huggingface/huggingface.js Stars 2,487 spark 2026-07-27
pytorch/ao · 上手攻略
torchao(即 pytorch/ao 仓库发布的 PyPI 包名)是 PyTorch 官方主推的 原生量化与稀疏化库,主打「训练推理一致」「一行代码改动即可接入」,覆盖从权重量化(int4/int8/fp8/NF4)、激活量化、2:4 稀疏、低比特 optimizer(4bit/8bit/fp8 AdamW)、量化感知训练(QAT),到 float8 预…
LLM 基础设施 pytorch/ao Stars 2,936 spark 2026-07-27
bionic-gpt/bionic-gpt · 上手攻略
Bionic GPT 是一个自托管(onpremise)的 ChatGPT 替代品,定位企业内部的私有生成式 AI 平台。它用 Rust 写了一个高性能 Web Server,把 RAG、文档解析、模型路由、鉴权、审计、可观测性这些通常要自己拼装的"内部 ChatGPT 必备件"打包成一个可直接落到 Kubernetes 上的完整栈。 它不是单一服务,而是按…
LLM 基础设施 bionic-gpt/bionic-gpt Stars 2,349 spark 2026-07-26
lidge-jun/opencodex · 上手攻略
opencodex 是一个轻量级本地代理服务,它的核心职责是把 OpenAI Codex 的 Responses API 请求"翻译"成任意 LLM 提供商能理解的协议,并在请求路径上支持 ChatGPT 账户池化管理。装好之后,你在 Codex CLI/App/SDK 或 Claude Code 里选什么模型,实际上都在走 opencodex 转发到 An…
LLM 基础设施 lidge-jun/opencodex Stars 9,000 Tom 2026-07-23
raullenchai/Rapid-MLX · 上手攻略
RapidMLX 是目前 Apple Silicon 上速度最快的本地 AI 推理引擎,专为 M 系列芯片优化,基于 Apple MLX 框架重写所有核心 kernel,纯 Metal GPU 加速,无任何 llama.cpp 回退或 Python 桥接层。相比同场景的 Ollama,吞吐量提升约 4.2 倍,首 token 时间(TTFT)可低至 0.08…
LLM 基础设施 raullenchai/Rapid-MLX Stars 3,433 Tom 2026-07-22
ultralytics/yolov3 · 上手攻略
ultralytics/yolov3 是 YOLOv3(You Only Look Once version 3)目标检测模型的 Ultralytics 官方 PyTorch 实现。原始 YOLOv3 由 Joseph Redmon 和 Ali Farhadi 在 2018 年提出(arXiv:1804.02767),Ultralytics 在此基础上添加了…
LLM 基础设施 ultralytics/yolov3 Stars 10,591 Tom 2026-07-22
ymcui/Chinese-LLaMA-Alpaca-2 · 上手攻略
ChineseLLaMAAlpaca2 是基于 Meta 开源可商用模型 Llama2 开发的中文 LLaMA2 与 Alpaca2 大模型二期项目,由 ymcui 团队维护。它在原版 Llama2 基础上重新设计了中文词表(55,296 个 token),并使用大规模中文语料进行增量预训练和指令精调,显著提升了模型的中文能力。 | 系列 | 模型 | 参数…
LLM 基础设施 ymcui/Chinese-LLaMA-Alpaca-2 Stars 7,132 Tom 2026-07-15
RunanywhereAI/runanywhere-sdks · 上手攻略
RunAnywhere 是一个端侧 AI 推理 SDK 套件,让你在 iOS、Android、Flutter、React Native 和浏览器里直接跑 LLM、VLM、语音识别(TTS/STT)和语音合成,无需联网、数据不离设备。它用同一套 API 屏蔽了各平台的底层差异:Apple 设备走 Core ML / Metal,安卓走 llama.cpp 或高…
LLM 基础设施 RunanywhereAI/runanywhere-sdks Stars 10,301 Tom 2026-07-15
tensorchord/Awesome-LLMOps · 上手攻略
AwesomeLLMOps 是由 tensorchord 团队维护的 GitHub 精选列表(Awesome List),收录了 LLMOps(Large Language Model Operations)领域的优质工具、项目和资源。截至 2026 年 7 月已累计 5879 Stars,周增 +7,是目前最活跃的 LLMOps 专题列表之一。 LLMOp…
LLM 基础设施 tensorchord/Awesome-LLMOps Stars 5,914 Tom 2026-07-15
aws/amazon-sagemaker-examples · 上手攻略
官方维护的 Amazon SageMaker 示例笔记本仓库,由 AWS SageMaker 团队直接管理。它不是 SDK 本身,而是 SageMaker 各功能(数据准备、训练、推理、监控、Feature Store、SageMakerCore、Studio 等)的 可运行 Jupyter Notebook 示范集合,覆盖从 XGBoost 入门到大规模分…
LLM 基础设施 aws/amazon-sagemaker-examples Stars 10,980 spark 2026-07-15
bentoml/OpenLLM · 上手攻略
OpenLLM 是一个开源的 LLM 推理服务框架,让你用一条命令把任何开源大模型(Llama 3.3、Qwen2.5、Mistral、DeepSeek 等)启动为 OpenAI 兼容的 HTTP API,并自带一个 Web Chat UI。它基于 BentoML 构建,支持 Docker 部署和 BentoCloud 云端托管,适合需要自托管 LLM AP…
LLM 基础设施 bentoml/OpenLLM Stars 12,473 Jay 2026-07-15
ymcui/Chinese-LLaMA-Alpaca · 上手攻略
ymcui/ChineseLLaMAAlpaca 是最早一批将 Meta LLaMA 模型中文化并开源的重量级项目。它的核心工作是两件事: 1. 中文词表扩充——原版 LLaMA 词表偏英文,中文编码效率极低(一个汉字 = 多个 subword),该项目将中文词表扩充至约 5 万 token,显著提升中文处理效率 2. 指令精调(Alpaca)——在扩充词表…
LLM 基础设施 ymcui/Chinese-LLaMA-Alpaca Stars 18,942 Tom 2026-07-15
OpenMOSS/MOSS · 上手攻略
MOSS(MultiOmni Scale System)是复旦大学开源的工具增强型对话语言模型,具有 160 亿参数(16B),支持中英双语、多轮对话,以及插件调用能力(搜索、文生图、计算器、解方程)。 该项目开源内容包括: 本质上,这是一个可以调用工具的中文 ChatGPT 风格模型,可以在本地私有部署,参数规模比 GPT4 小但远大于早期开源 7B 模型…
LLM 基础设施 OpenMOSS/MOSS Stars 12,211 Tom 2026-07-15
Mooler0410/LLMsPracticalGuide · 上手攻略
Mooler0410/LLMsPracticalGuide 是一个以Survey Paper 为基础整理的LLM实践指南索引库(而非代码库)。它将大语言模型领域的论文、博客、工具按主题分类组织,帮助研究者和工程师在庞杂的文献中找到"什么场景用什么模型/方法"的最优路径。 核心资产有两块: 1. LLM 演进树(Evolutionary Tree):一张可视化…
LLM 基础设施 Mooler0410/LLMsPracticalGuide Stars 10,197 Tom 2026-07-15
triton-inference-server/server · 上手攻略
NVIDIA Triton Inference Server 是 NVIDIA 开源的"模型推理服务化"系统。和 TensorRT 关注"单模型怎么跑得最快"不同,Triton 关注的是"一堆模型怎么稳定高效地对外提供服务"——它把 TensorRT、PyTorch、ONNX Runtime、OpenVINO、Python、RAPIDS FIL 等多个推理后…
LLM 基础设施 triton-inference-server/server Stars 10,913 spark 2026-07-14
NVIDIA/TensorRT · 上手攻略
NVIDIA TensorRT 是 NVIDIA 官方的高性能深度学习推理 SDK,主要做一件事:把训练好的模型(来自 PyTorch / TensorFlow / ONNX 等)编译并优化成针对 NVIDIA GPU 高度调优的运行时引擎(engine),从而在生产中获得最低延迟和最高吞吐。 GitHub 上 NVIDIA/TensorRT 仓库是 Ten…
LLM 基础设施 NVIDIA/TensorRT Stars 13,239 spark 2026-07-14