Ollama 是最流行的本地大模型推理运行时,让你在本地机器上运行开源 LLM(Llama 系列、Qwen、DeepSeek、GLM、Gemma 等数百个模型),无需云服务、无需 API Key、一条命令启动服务。2026年7月 v0.32.0 起,Ollama CLI 本身升级为交互式 Agent,支持 Chat、Code 和 Work 委托任务——CLI…
仓库攻略
105 篇 · 105 个项目 · LLM 基础设施
TurboFieldfare 是一个用 Swift 6.2 + Metal 4 从零手写的 Gemma 4 26BA4B 推理运行时,专为 Apple Silicon Mac 设计。它的核心目标只有一个:让 8 GB 内存的 M 系列 MacBook Air 也能跑 Gemma 4 26B 大模型。 Gemma 4 26B 是一个 MoE(Mixtureof…
LLM Gateway 是一个开源的 LLM API 网关,作为应用层与多个 LLM 提供商之间的中间件,提供统一的 API 接口。开发者只需集成一次网关,后续可自由切换/混用 OpenAI、Anthropic、Google Vertex AI 等多种模型,无需逐一对接每个提供商的 SDK 和认证体系。 同时,它内置了用量追踪、成本分析和性能监控功能,让团队…
uzu 是 Mirai Labs 用 Rust 从头编写的高性能 AI 推理引擎(v0.5.12 · 20260608),目标是让 AI 模型直接运行在你的应用中——零延迟、完整数据隐私、无推理费用。 它不是又一个 REST API 封装,而是一个真正把模型跑在本地的推理运行时。核心用 Rust 编写保证了性能和安全性,同时提供 Python / TypeS…
envoyproxy/aigateway 是 Envoy 生态下的 AI 网关项目,基于 Envoy Gateway 扩展,专门处理应用客户端到生成式 AI(GenAI)服务的流量。它的本质是一个 Kubernetes 原生的 LLM 流量管理平面,提供路由、认证、限流、弹性Failover等企业级能力。 Envoy 是 CNCF 旗下久经生产验证的代理,M…
anyllm 是 Mozilla AI 团队推出的 Python 库,目标是让你用同一套代码调用任何 LLM 提供商,无需改业务逻辑。 它的核心理念很清晰:LLM 提供商的 API 接口碎片化严重——OpenAI、Anthropic、Azure、Mistral、Ollama……各家参数名、响应格式、错误处理各有差异。anyllm 不重新造轮子,而是封装官方 …
版本说明:仓库 README 中没有写死顶层版本号,文档站 inference.roboflow.com/using_inference/about 自称 "Inference 1.0",PyPI 上 inferencesdk 的最新轮转版本为 1.3.x(如 1.3.7)——下面的命令以当前 README 与 PyPI 通用写法为准,不写死小版本号,使用 …
提示:仓库 README、API 文档链接均指向 ort 2.0 系列,本攻略以当前 main 分支为准(最新示例分支标签为 v2.0.0rc.13,来自仓库 docs 与 examples 中给出的克隆命令)。若你看到更新 rc tag,请以 crates.io 与 docs.rs 的最新版为准。 ort 是 Rust 生态里跑 ONNX 模型的主流 cr…
提示:上游仓库标识写作 openvinotoolkit/openvino_notebooks(带下划线),按本攻略规则计算的文件 slug 为 openvinotoolkitopenvinonotebooks.md。下文中如出现"OpenVINO 2026.2"等版本号,均来自仓库当前 README,未在外部二次确认。 openvino_notebooks …
huggingface/optimum 是 Hugging Face 推出的 Transformers / Diffusers / TIMM / SentenceTransformers 的硬件优化扩展库。它把"同一套 HF 模型"映射到多种推理后端与训练硬件上,让用户用同一份 API 跑出"在目标硬件上的极限性能"——既负责 导出(ONNX、OpenVIN…
Kimi K3 是 Moonshot AI(MiniMax)推出的开源权重多模态 Agent 大模型,总参数量 2.8T(激活 104B),是全球首个开放的 3T 级开源模型。K3 基于两项自研架构:Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes),采用 MoE(MixtureofExperts…
Open Model Zoo 是 Intel 维护的预训练深度学习模型仓库,为 OpenVINO™ Toolkit 提供大量已优化模型和演示程序。包含 200+ 模型,覆盖目标检测、图像分类、图像分割、姿态估计、语音识别、文本转语音等主流 CV 任务,并配有可直接运行的 C++ / Python Demo 示例。 模型分为两大类: Intel 预训练模型(m…
CTranslate2 是 OpenNMT 团队开源的 C++ / Python 高性能推理引擎,专门针对 Transformer 模型做极致优化。它通过权重量化、层融合、批处理重排序、动态内存管理等技术,在 CPU 和 GPU 上实现比原生 PyTorch / TensorFlow 快数倍、内存省几倍的推理性能。 支持三种模型架构: DecoderOnly…
XNNPACK 是 Google 官方维护的 神经网络推理算子库(C11 / C++17 / Python 3),专为 ARM、x86、WebAssembly、RISCV、Hexagon 等 CPU 类硬件优化浮点(FP16 / FP32)以及量化(INT8 / perchannel、perrow)推理。仓库明说「not intended for direc…
huggingface.js 是 Hugging Face 官方维护的 JavaScript / TypeScript 工具套件,本身是个 monorepo,里面按职责拆分成了若干独立发布的 npm 包: @huggingface/hub:与 huggingface.co 交互——创建/删除仓库、上传/下载/列出文件、提交 commit。覆盖 Model /…
torchao(即 pytorch/ao 仓库发布的 PyPI 包名)是 PyTorch 官方主推的 原生量化与稀疏化库,主打「训练推理一致」「一行代码改动即可接入」,覆盖从权重量化(int4/int8/fp8/NF4)、激活量化、2:4 稀疏、低比特 optimizer(4bit/8bit/fp8 AdamW)、量化感知训练(QAT),到 float8 预…
Bionic GPT 是一个自托管(onpremise)的 ChatGPT 替代品,定位企业内部的私有生成式 AI 平台。它用 Rust 写了一个高性能 Web Server,把 RAG、文档解析、模型路由、鉴权、审计、可观测性这些通常要自己拼装的"内部 ChatGPT 必备件"打包成一个可直接落到 Kubernetes 上的完整栈。 它不是单一服务,而是按…
opencodex 是一个轻量级本地代理服务,它的核心职责是把 OpenAI Codex 的 Responses API 请求"翻译"成任意 LLM 提供商能理解的协议,并在请求路径上支持 ChatGPT 账户池化管理。装好之后,你在 Codex CLI/App/SDK 或 Claude Code 里选什么模型,实际上都在走 opencodex 转发到 An…
RapidMLX 是目前 Apple Silicon 上速度最快的本地 AI 推理引擎,专为 M 系列芯片优化,基于 Apple MLX 框架重写所有核心 kernel,纯 Metal GPU 加速,无任何 llama.cpp 回退或 Python 桥接层。相比同场景的 Ollama,吞吐量提升约 4.2 倍,首 token 时间(TTFT)可低至 0.08…
ultralytics/yolov3 是 YOLOv3(You Only Look Once version 3)目标检测模型的 Ultralytics 官方 PyTorch 实现。原始 YOLOv3 由 Joseph Redmon 和 Ali Farhadi 在 2018 年提出(arXiv:1804.02767),Ultralytics 在此基础上添加了…
ChineseLLaMAAlpaca2 是基于 Meta 开源可商用模型 Llama2 开发的中文 LLaMA2 与 Alpaca2 大模型二期项目,由 ymcui 团队维护。它在原版 Llama2 基础上重新设计了中文词表(55,296 个 token),并使用大规模中文语料进行增量预训练和指令精调,显著提升了模型的中文能力。 | 系列 | 模型 | 参数…
RunAnywhere 是一个端侧 AI 推理 SDK 套件,让你在 iOS、Android、Flutter、React Native 和浏览器里直接跑 LLM、VLM、语音识别(TTS/STT)和语音合成,无需联网、数据不离设备。它用同一套 API 屏蔽了各平台的底层差异:Apple 设备走 Core ML / Metal,安卓走 llama.cpp 或高…
AwesomeLLMOps 是由 tensorchord 团队维护的 GitHub 精选列表(Awesome List),收录了 LLMOps(Large Language Model Operations)领域的优质工具、项目和资源。截至 2026 年 7 月已累计 5879 Stars,周增 +7,是目前最活跃的 LLMOps 专题列表之一。 LLMOp…
官方维护的 Amazon SageMaker 示例笔记本仓库,由 AWS SageMaker 团队直接管理。它不是 SDK 本身,而是 SageMaker 各功能(数据准备、训练、推理、监控、Feature Store、SageMakerCore、Studio 等)的 可运行 Jupyter Notebook 示范集合,覆盖从 XGBoost 入门到大规模分…
OpenLLM 是一个开源的 LLM 推理服务框架,让你用一条命令把任何开源大模型(Llama 3.3、Qwen2.5、Mistral、DeepSeek 等)启动为 OpenAI 兼容的 HTTP API,并自带一个 Web Chat UI。它基于 BentoML 构建,支持 Docker 部署和 BentoCloud 云端托管,适合需要自托管 LLM AP…
ymcui/ChineseLLaMAAlpaca 是最早一批将 Meta LLaMA 模型中文化并开源的重量级项目。它的核心工作是两件事: 1. 中文词表扩充——原版 LLaMA 词表偏英文,中文编码效率极低(一个汉字 = 多个 subword),该项目将中文词表扩充至约 5 万 token,显著提升中文处理效率 2. 指令精调(Alpaca)——在扩充词表…
MOSS(MultiOmni Scale System)是复旦大学开源的工具增强型对话语言模型,具有 160 亿参数(16B),支持中英双语、多轮对话,以及插件调用能力(搜索、文生图、计算器、解方程)。 该项目开源内容包括: 本质上,这是一个可以调用工具的中文 ChatGPT 风格模型,可以在本地私有部署,参数规模比 GPT4 小但远大于早期开源 7B 模型…
Mooler0410/LLMsPracticalGuide 是一个以Survey Paper 为基础整理的LLM实践指南索引库(而非代码库)。它将大语言模型领域的论文、博客、工具按主题分类组织,帮助研究者和工程师在庞杂的文献中找到"什么场景用什么模型/方法"的最优路径。 核心资产有两块: 1. LLM 演进树(Evolutionary Tree):一张可视化…
NVIDIA Triton Inference Server 是 NVIDIA 开源的"模型推理服务化"系统。和 TensorRT 关注"单模型怎么跑得最快"不同,Triton 关注的是"一堆模型怎么稳定高效地对外提供服务"——它把 TensorRT、PyTorch、ONNX Runtime、OpenVINO、Python、RAPIDS FIL 等多个推理后…
NVIDIA TensorRT 是 NVIDIA 官方的高性能深度学习推理 SDK,主要做一件事:把训练好的模型(来自 PyTorch / TensorFlow / ONNX 等)编译并优化成针对 NVIDIA GPU 高度调优的运行时引擎(engine),从而在生产中获得最低延迟和最高吞吐。 GitHub 上 NVIDIA/TensorRT 仓库是 Ten…