MindPipe 是一个统一的 LLM/VLM 模型压缩评估框架,用单一 main.py CLI 驱动 11 种量化方法、7 种剪枝方法、压缩微调联合流程,以及 PPL / lmevalharness 零样本 / VLMEvalKit 多模态三类评估。核心设计理念是:一次配置,全流程可复现。 ⚠️ 注意:本仓库同时支持 NVIDIA GPU 和华为昇腾 NP…
仓库攻略
45 篇 · 45 个项目 · LLM 基础设施 · 工程化
RTPLLM(RealTime PrefillDecode LLM)是阿里巴巴大模型推理团队开发的高性能 LLM 推理加速引擎,脱胎于 FasterTransformer,在其基础上融合了 TensorRTLLM 的部分 CUDA kernel 实现,并参考了 vLLM 的 PagedAttention 等设计。该项目已在阿里内部广泛落地,支持淘宝问问、淘宝…
beta9 是 Beam 公司的开源 serverless GPU 运行时引擎,为 AI 工作负载提供极速冷启动(<1 秒)的容器化部署能力。它支持 GPU 推理、沙箱隔离执行和后台任务队列,底层通过自定义容器运行时(非标准 Docker)和分布式缓存实现亚秒级冷启动。 Beam 官方提供托管云服务(beam.cloud),同时 beta9 完全开源,支持自…
Krasis 是一个混合 LLM 推理运行时,专注于在消费级显存受限的 NVIDIA GPU 上高效运行数百亿参数级别的 MoE(Mixture of Experts)大模型。它的核心设计目标是:让一张或两张普通游戏显卡(如 RTX 5090 32 GB、RTX PRO 6000 96 GB)就能跑得动原本需要 H100/A100 才能加载的千亿参数模型。 …
NeMo Curator 是 NVIDIA 出品的大规模多模态数据预处理与清洗工具包,专门为 LLM(及其他基础模型)预训练数据构建可复用的 GPU 加速流水线。覆盖文本、图像、视频、音频四种模态,核心能力包括:质量过滤、去重(精确/模糊/子串)、语言检测、分类、合成数据生成(SDG)。它由 RAPIDS(cuDF/cuML/cuGraph)+ Ray 驱动…
binaryhusky/gpt_academic(GPT Academic)是一个为 GPT / GLM 等大语言模型打造的实用化交互界面,特别针对论文阅读、润色、翻译、写作场景深度优化。项目采用模块化插件设计,支持自定义快捷按钮、Python / C++ 项目剖析、ArXiv 论文翻译总结、LaTeX 全文翻译校对等30+ 功能,并行支持 ChatGPT、…
StarlightSearch/EmbedAnything 是一个用 Rust 构建的高性能、多模态 embedding 管道。它支持从文本、图片、音频、PDF、网站等多种来源生成向量嵌入,并与 Milvus、Weaviate、Elastic、SingleStore 等主流向量数据库无缝对接,核心卖点是零 PyTorch 依赖、低内存占用、流式索引,已在 E…
mlabonne/llmcourse 是由法国机器学习工程师 Maxime Labonne 维护的一套免费、开源的大语言模型(LLM)学习路径仓库,GitHub Stars 超过 81,000(2026年8月)。它不是传统意义上的"课程",而是一份精心编排的知识图谱——包含路线图(roadmap)、Colab Notebook 实践代码、配套博客文章,覆盖从…
MaxText 是 Google AIHypercomputer 团队开源的高性能、高可扩展 LLM 训练与后训练库,全部用纯 Python/JAX 编写,目标是 TPU 和 NVIDIA GPU 上的高效分布式训练与微调。官方于 20250915 发布 PyPI 包,当前稳定版本 0.2.3(2026 年初)。 MaxText 的定位是"LLM 项目发射台…
PromptEngineeringGuideChinese(Prompt 工程师指南中文版)是由 wangxuqi 维护的中文翻译项目,翻译自 DAIR.AI 的英文原版 dairai/PromptEngineeringGuide(Stars 77.3k+)。原版是目前最全面、最活跃的 Prompt 工程开源教程,涵盖从基础概念到高级技巧的完整知识体系。 本…
DecryptPrompt 是一个大模型提示词/Agent/RAG/LLM 全栈知识图谱,收录 Prompt 论文、开源模型、推理框架、SFT/RLHF 数据集、AIGC 应用案例等多个维度的资源。更重要的是,作者维护了一个持续更新的"解密Prompt"系列博客(65+ 篇),每篇包含论文串讲+代码实现,覆盖从 Prompt Tuning 到 RLHF、Ag…
humanizetext 是 lynoteai 维护的「AI 文本人类化」开源 Python 工具包。它本质上是把「让 AI 生成文本读起来更像人写的」这件事拆成两条路径: 4 套参考实现(v1.0 沉淀):翻译链、多轮 LLM 改写、检测器反馈循环、混合引擎翻译。 1 套标准流水线(v1.5.1 现行生产推荐版):把方法 1(翻译链)+ 方法 2(LLM …
AgentENV(简称 AENV)是 Kimi K3 模型背后用于大规模运行 Agent 执行环境的分布式平台,由 kvcacheai 团队开源。它的核心职责是:在大规模集群上同时调度成千上万个轻量级隔离沙盒(基于 Firecracker microVM),按需加载 OCI 镜像,让每个 Agent 任务在独立、可快启、可快停的环境中运行。 类比来说:如果 …
OptiLLM 是一个OpenAI API 兼容的推理优化代理(inference proxy),通过在推理时(inferencetime)应用 20+ 种推理优化技术,在不需要任何训练或微调的情况下,将 LLM 在数学、代码、逻辑推理任务上的准确率提升 210 倍。 它的核心思路是:在现有 API 调用层加一层代理,对请求进行后处理(优化推理路径),再转发…
2026 年 7 月 29 日,OpenAI 在官方博客披露了 GPT5.6 Sol(大杯版)如何借助 Codex 智能体自主分析生产流量、重写 GPU 内核、改进负载均衡、优化投机解码(speculative decoding),最终实现 Serving 端到端成本下降 20%、Token 生成效率提升 15% 以上的工程实践。 这不是概念演示,而是真实生…
版本说明:仓库 README 中没有写死顶层版本号,文档站 inference.roboflow.com/using_inference/about 自称 "Inference 1.0",PyPI 上 inferencesdk 的最新轮转版本为 1.3.x(如 1.3.7)——下面的命令以当前 README 与 PyPI 通用写法为准,不写死小版本号,使用 …
huggingface/optimum 是 Hugging Face 推出的 Transformers / Diffusers / TIMM / SentenceTransformers 的硬件优化扩展库。它把"同一套 HF 模型"映射到多种推理后端与训练硬件上,让用户用同一份 API 跑出"在目标硬件上的极限性能"——既负责 导出(ONNX、OpenVIN…
RunAnywhere 是一个端侧 AI 推理 SDK 套件,让你在 iOS、Android、Flutter、React Native 和浏览器里直接跑 LLM、VLM、语音识别(TTS/STT)和语音合成,无需联网、数据不离设备。它用同一套 API 屏蔽了各平台的底层差异:Apple 设备走 Core ML / Metal,安卓走 llama.cpp 或高…
AwesomeLLMOps 是由 tensorchord 团队维护的 GitHub 精选列表(Awesome List),收录了 LLMOps(Large Language Model Operations)领域的优质工具、项目和资源。截至 2026 年 7 月已累计 5879 Stars,周增 +7,是目前最活跃的 LLMOps 专题列表之一。 LLMOp…
官方维护的 Amazon SageMaker 示例笔记本仓库,由 AWS SageMaker 团队直接管理。它不是 SDK 本身,而是 SageMaker 各功能(数据准备、训练、推理、监控、Feature Store、SageMakerCore、Studio 等)的 可运行 Jupyter Notebook 示范集合,覆盖从 XGBoost 入门到大规模分…
OpenLLM 是一个开源的 LLM 推理服务框架,让你用一条命令把任何开源大模型(Llama 3.3、Qwen2.5、Mistral、DeepSeek 等)启动为 OpenAI 兼容的 HTTP API,并自带一个 Web Chat UI。它基于 BentoML 构建,支持 Docker 部署和 BentoCloud 云端托管,适合需要自托管 LLM AP…
Mooler0410/LLMsPracticalGuide 是一个以Survey Paper 为基础整理的LLM实践指南索引库(而非代码库)。它将大语言模型领域的论文、博客、工具按主题分类组织,帮助研究者和工程师在庞杂的文献中找到"什么场景用什么模型/方法"的最优路径。 核心资产有两块: 1. LLM 演进树(Evolutionary Tree):一张可视化…
NVIDIA Triton Inference Server 是 NVIDIA 开源的"模型推理服务化"系统。和 TensorRT 关注"单模型怎么跑得最快"不同,Triton 关注的是"一堆模型怎么稳定高效地对外提供服务"——它把 TensorRT、PyTorch、ONNX Runtime、OpenVINO、Python、RAPIDS FIL 等多个推理后…
llmaction 是一个中文大模型技术博客式知识库,由独立作者维护,系统整理了大模型从训练到推理、从微调到部署的全链路技术内容。仓库以 Markdown 文件为主,通过 GitHub + 知乎/掘金文章链接提供深度教程,涵盖 LLM 预训练、SFT、RLHF、分布式训练、推理优化、量化、评测等几乎所有核心环节。适合想系统了解大模型工程实战的工程师和研究人员…
cubestudio 是腾讯音乐(TME)开源的一站式云原生机器学习/深度学习/大模型 AI 平台,覆盖从数据标注、模型训练、任务编排、分布式推理到模型市场的 MLOps 全流程。 它是腾讯音乐内部多年沉淀的生产级平台首次对外开源,目标是为中大型团队提供一个开箱即用、功能全面的企业级 AI 基础设施,同时特别注重对国产硬件(昇腾 NPU)和国产软件生态的支持…
DataJuicer(简称 DJ)是一个为 foundation model 时代打造的数据操作系统,专注于将混乱的原始数据转化为 AI 可用的精炼数据。它把数据处理看成是可组合的基础设施,提供模块化的构建块来完成清洗、合成和分析,覆盖 AI 全生命周期的数据处理需求。 用大白话说:它是一个超大型数据处理工具箱,内置 200+ 算子(Operator),可以…
内容待复核
PlexPt/awesome-chatgpt-prompts-zh · 上手攻略
awesomechatgptpromptszh(ChatGPT 中文调教指南)是一个开源的中文 Prompt 收藏仓库,由作者 PlexPt 从 2023 年初开始维护。它收集了数百个精炼的中文提示词模板,涵盖学术写作、翻译、代码、面试、生活娱乐等数十个场景,用户将提示词粘贴进 ChatGPT 即可获得高质量输出。 本质上是场景化 Prompt 最佳实践的精…
poloclub/transformerexplainer 是佐治亚理工 Polo Club of Data Science 维护的交互式 Transformer 教学工具。在浏览器里跑一个完整的 GPT2 模型(@xenova/transformers v2.17.1 + onnxruntimeweb v1.23.0 + onnx),用户输入任意文本,工具…
Onyx 是 LLM 的应用层——一个功能丰富的开源 AI 平台,支持自托管。它让团队通过 RAG(检索增强生成)、深度研究、自定义 Agent、代码执行、Web 搜索、MCP 等高级能力,把 LLM 接入真实工作流。 核心定位:企业级 AI 平台(类 ChatGPT + RAG + Deep Research + Agents),可一键部署,适合需要数据隐…
Mooncake 是月之暗面(Moonshot AI)为旗下 Kimi 大模型服务开发的生产级 LLM Serving 平台,核心创新是 KVCache 中心化的 PrefillDecode 分离架构(PD 分离),将 LLM 推理的预填充(Prefill)和解码(Decode)阶段拆分到不同集群,并通过利用 GPU 集群中闲置的 CPU DRAM 和 SS…