huggingface/optimum 是 Hugging Face 推出的 Transformers / Diffusers / TIMM / SentenceTransformers 的硬件优化扩展库。它把"同一套 HF 模型"映射到多种推理后端与训练硬件上,让用户用同一份 API 跑出"在目标硬件上的极限性能"——既负责 导出(ONNX、OpenVIN…
仓库攻略
79 篇 · 79 个项目 · spark · LLM 基础设施
llmd 是一个 CNCF Sandbox 级的开源项目,定位是在 Kubernetes 上跑"生产级"大模型分布式推理。它本身不是一个模型服务器(model server),而是架在 vLLM / SGLang]( 之上的编排与优化层——把推理服务拆成 prefill(首 token 阶段)/ decode(增量 token 阶段)、分层 KV cache…
TypeDB 是一个用 Rust 写成的下一代数据库,主打"为系统而生,而非为记录而生"。它用一个概念数据模型(conceptual data model)把关系型、文档型、图数据库的优势合并在一起,避免传统 RDBMS 里的对象关系阻抗不匹配(objectrelational mismatch)——也就是 Java/Python 程序员写业务时经常吐槽的"…
Agently(pip install agently)是一个 Python GenAI 应用开发框架,主打"让模型输出稳定可控、让 AI 服务像后端服务一样可观测、可恢复"。它的核心抽象是 AgentExecution:把一次推理涉及的 prompt、策略、Actions、Skill 绑定、process 流、TaskContext 证据、结果视图统一收口…
Paddler 是一款用 Rust 写的开源 LLM/VLM 推理负载均衡与服务平台。架构非常克制:只有两个组件——balancer(对外暴露 OpenAI 兼容推理接口、管理面和 Web 控制台)和 agent(真正跑推理,注册到 balancer 上即可上线)。底层直接用 llama.cpp 推理引擎(fork 版本,Paddler 自己实现了 slot…
VectorChord(扩展名 vchord)是 PostgreSQL 上一款面向向量检索的扩展,由原 pgvecto.rs 团队(TensorChord)迭代而来。它把向量索引、Rerank 和量化压缩统一塞进 PG 里,目标是把"亿级向量表"和"普通业务表"放在同一套关系型基础设施上跑,不再引入额外的专用向量库。 它有几条主线卖点: 兼容 pgvecto…
XNNPACK 是 Google 官方维护的 神经网络推理算子库(C11 / C++17 / Python 3),专为 ARM、x86、WebAssembly、RISCV、Hexagon 等 CPU 类硬件优化浮点(FP16 / FP32)以及量化(INT8 / perchannel、perrow)推理。仓库明说「not intended for direc…
huggingface.js 是 Hugging Face 官方维护的 JavaScript / TypeScript 工具套件,本身是个 monorepo,里面按职责拆分成了若干独立发布的 npm 包: @huggingface/hub:与 huggingface.co 交互——创建/删除仓库、上传/下载/列出文件、提交 commit。覆盖 Model /…
torchao(即 pytorch/ao 仓库发布的 PyPI 包名)是 PyTorch 官方主推的 原生量化与稀疏化库,主打「训练推理一致」「一行代码改动即可接入」,覆盖从权重量化(int4/int8/fp8/NF4)、激活量化、2:4 稀疏、低比特 optimizer(4bit/8bit/fp8 AdamW)、量化感知训练(QAT),到 float8 预…
MCP Router 是一个桌面端(Desktop)的 MCP 服务器统一管理应用,自定位为 "Unified MCP Server Management App / MCP Manager"。Model Context Protocol(MCP)是 Anthropic 推出的"让 LLM 调用外部工具/数据源"的开放协议,过去一年 MCP 服务器数量爆炸—…
envd(ɪnˈvdɪ,读作 "invideo")是 TensorChord 开源的一个面向 AI/ML 的容器化开发环境构建工具。它用一个声明式的 build.envd 文件描述你的训练/推理环境,然后用一个 envd up 命令把它打包成 OCI 兼容的镜像,并在本地(或远端 K8s 集群)跑起来。 它不是 Dockerfile 的替代品那种简单封装——…
Bionic GPT 是一个自托管(onpremise)的 ChatGPT 替代品,定位企业内部的私有生成式 AI 平台。它用 Rust 写了一个高性能 Web Server,把 RAG、文档解析、模型路由、鉴权、审计、可观测性这些通常要自己拼装的"内部 ChatGPT 必备件"打包成一个可直接落到 Kubernetes 上的完整栈。 它不是单一服务,而是按…
FastDeploy 是百度飞桨(PaddlePaddle)团队推出的"LLM + VLM 推理部署工具包",主打工业级一键部署和国产芯片广覆盖。它的目标不是要替代 vLLM,而是站在 vLLM 接口的肩膀上,把 ERNIE、Qwen3、DeepSeekV3、PaddleOCRVL 等模型在 NVIDIA、昆仑芯 XPU、海光 DCU、天数 GPU、燧原 G…
FastVideo 是 MBZUAI Hao Zhang 实验室主导的"统一视频生成推理 + 后训练(蒸馏/微调)框架"。它不是某个视频生成模型本身,而是一套面向 DiT 类视频扩散模型(Wan、Mochi、Hunyuan、CausalWan 等)的训练蒸馏推理一站式底座,目标是让视频生成既能微调,又能跑得快、跑得便宜。 仓库内同时包含 4 个层次的产出: …
CSGHub 是 OpenCSG 团队开源的"LLM 资产管理平台",定位对标 Hugging Face:把模型(LLM/VLM)、数据集、Space 应用、代码片段当作一等资产,统一在一个平台上做上传、下载、版本管理、权限分发、推理部署和数据处理。整套系统由 Go(Gin)+ Rails 旧版迁移中的 Vue3 前端、PostgreSQL 元数据、Apac…
Apache Burr(incubating)是一个 Python 状态机框架,用来构建"会做决策的应用"——chatbot、agent、simulation、人机协作工具。它把应用建模成一张 state machine(状态机/流程图): Burr 的关键设计哲学是 "框架无关":它不规定你必须用哪个 LLM SDK、哪个 vector DB、哪个 age…
Apache Hamilton(incubating)是一个轻量的 Python 库,用"Python 函数即节点"的方式构建数据转换 DAG。它的核心思路是:你写普通的 Python 函数,函数参数的名字 = 它依赖的上游节点名,Hamilton 自动把这些函数拼成 DAG、并按依赖顺序执行。 举例: import pandas as pd def sig…
OpenLIT 是一个开源的 AI Engineering 平台,定位是"一站式把 LLM 应用从实验推到生产"。它把 OpenTelemetry 当作统一底座,向上提供 6 类核心能力: 1. 可观测性 SDK(Python / TypeScript / Go):对 50+ LLM provider、VectorDB、Agent 框架、GPU 做自动埋点(…
这是 Decoding AI 杂志社出品的开源实战课程仓库,教你从零搭建一个"Second Brain AI 助手" —— 让你的 Notion / 网页笔记 / 文档作为个人知识库,配合 agent + RAG + 微调 + LLMOps,做出一个能聊你自己的笔记的生产级 AI 助手。MIT 协议、纯 Jupyter Notebook + Python、最…
ChainForge 是一个给 LLM prompt 做对抗测试的开源可视化编程环境(visual programming environment),学术出身 —— 作者 Ian Arawjo 在 Harvard HCI 组做博后期间发表(CHI 2024 论文 "ChainForge: A Visual Toolkit for Prompt Enginee…
Laminar(仓库路径 lmnrai/lmnr,官方域名 laminar.sh,品牌写作"Laminar"——注意跟流体力学的层流同名)是 为 AI Agent 量身打造的开源可观测性平台,由 YC S24 孵化的团队开发,Apache2.0 协议,主仓 ~3.1k Stars、TypeScript/Rust 混合栈,最近一次 release 验证于 20…
AGiXT(AGI eXecution & Tasks)是一个 动态 AI Agent 自动化平台,定位是「多 AI provider 之上的中央神经系统」。它解决的核心问题是:让一套自然语言指令,能在 OpenAI / Anthropic / Google / Azure / 本地模型之间无缝切换,并自动编排复杂任务、执行扩展动作。 核心卖点: 仓库 3.…
TruLens 是 TruEra 公司(已被 Snowflake 收购)维护的、面向 LLM 实验和 AI Agent 的评估与追踪框架。它做两件事: 1. Instrumentation(埋点):用 OpenTelemetry 拦截你的 LLM / RAG / Agent 调用,把每一次 LLM 生成、检索、工具调用都落成结构化 OTEL span。 2.…
OpenViking 是字节跳动旗下火山引擎(Volcengine)开源的、面向 AI Agent 的「上下文数据库」(Context Database)。它用「文件系统范式(filesystem paradigm)」统一管理 Agent 运行所需的全部上下文:长期记忆(memory)、外部知识与资源(resources)、可调用的技能(skills)。 与…
Acontext 是 memodbio 开源的 "Agent Skills 形式的记忆层"——把 agent 运行中学到的经验沉淀成可读、可编辑、可跨 agent 复用的 Markdown skill 文件。它不是又一个向量数据库,而是把"记忆 = skill 文件"做成一等公民:会话消息 → 任务完成事件 → LLM 蒸馏 → Skill Agent 写文…
LoRAX(LoRA eXchange)是 Predibase 开源的 多 LoRA 适配器推理服务器,目标是在一张 GPU 上同时服务成百上千个微调后的 LLM,而吞吐和延迟几乎不打折。它通过"动态加载适配器 + 异构连续批处理 + 适配器交换调度"三大机制,让一份基座模型(如 Mistral7B、Llama3、Qwen)被数千个不同任务的 LoRA 适配…
Agenta 是一个开源的 LLMOps 平台,把 LLM 应用从原型到生产所需的四件事压在一个工作流里:Prompt Playground(交互式调试)、Prompt/Cofig 管理(带版本和分支)、LLM 评估(人评 + 自动评估 + LLMasjudge)、可观测性(Tracing、成本、延迟)。代码以 TypeScript 为主、许可 NOASSE…
VLMEvalKit(Python 包名 vlmeval)由上海人工智能实验室 OpenCompass 团队开源,是大型视觉语言模型(LVLM / VLM)的事实标准评估工具包。它的口号是 "一命令评测 220+ LVLM、80+ benchmark" —— 用户只写一个 generate_inner(),剩下的数据下载、预处理、推理、metric 全部由框…
lmmseval(Python 包名 lmmseval,前身为 LMMsEval)是 EvolvingLMMsLab 维护的"统一多模态大模型评估工具包"。目标只有一个:让"同一个模型 + 同一个 benchmark + 同一套参数"在两台机器上跑出来数字一致,并且能覆盖文本、图像、视频、音频四大模态的 100+ 任务、30+ 模型后端。 它脱胎于 Eleu…
llmtwincourse 是 Decoding AI Magazine(Paul Iusztin & Alex Vesa 团队)开源的免费工程课,目标是从零搭建一个能"模仿你写作风格"的生产级 LLM Twin —— 一套完整的端到端 LLM + RAG 系统,覆盖数据采集、CDC 同步、实时特征工程、SFT 微调、RAG 推理、Prompt 监控全部 6…