Guides · organized/guides

仓库攻略

45 篇 · 45 个项目 · LLM 基础设施 · 工程化

MAC-AutoML/MindPipe · 上手攻略
MindPipe 是一个统一的 LLM/VLM 模型压缩评估框架,用单一 main.py CLI 驱动 11 种量化方法、7 种剪枝方法、压缩微调联合流程,以及 PPL / lmevalharness 零样本 / VLMEvalKit 多模态三类评估。核心设计理念是:一次配置,全流程可复现。 ⚠️ 注意:本仓库同时支持 NVIDIA GPU 和华为昇腾 NP…
LLM 基础设施 MAC-AutoML/MindPipe Stars 1,013 Tom 2026-08-23
alibaba/rtp-llm · 上手攻略
RTPLLM(RealTime PrefillDecode LLM)是阿里巴巴大模型推理团队开发的高性能 LLM 推理加速引擎,脱胎于 FasterTransformer,在其基础上融合了 TensorRTLLM 的部分 CUDA kernel 实现,并参考了 vLLM 的 PagedAttention 等设计。该项目已在阿里内部广泛落地,支持淘宝问问、淘宝…
LLM 基础设施 alibaba/rtp-llm Stars 1,296 Jay 2026-08-22
beam-cloud/beta9 · 上手攻略
beta9 是 Beam 公司的开源 serverless GPU 运行时引擎,为 AI 工作负载提供极速冷启动(<1 秒)的容器化部署能力。它支持 GPU 推理、沙箱隔离执行和后台任务队列,底层通过自定义容器运行时(非标准 Docker)和分布式缓存实现亚秒级冷启动。 Beam 官方提供托管云服务(beam.cloud),同时 beta9 完全开源,支持自…
LLM 基础设施 beam-cloud/beta9 Stars 1,746 Tom 2026-08-21
brontoguana/krasis · 上手攻略
Krasis 是一个混合 LLM 推理运行时,专注于在消费级显存受限的 NVIDIA GPU 上高效运行数百亿参数级别的 MoE(Mixture of Experts)大模型。它的核心设计目标是:让一张或两张普通游戏显卡(如 RTX 5090 32 GB、RTX PRO 6000 96 GB)就能跑得动原本需要 H100/A100 才能加载的千亿参数模型。 …
LLM 基础设施 brontoguana/krasis Stars 512 Jay 2026-08-20
NVIDIA-NeMo/Curator · 上手攻略
NeMo Curator 是 NVIDIA 出品的大规模多模态数据预处理与清洗工具包,专门为 LLM(及其他基础模型)预训练数据构建可复用的 GPU 加速流水线。覆盖文本、图像、视频、音频四种模态,核心能力包括:质量过滤、去重(精确/模糊/子串)、语言检测、分类、合成数据生成(SDG)。它由 RAPIDS(cuDF/cuML/cuGraph)+ Ray 驱动…
LLM 基础设施 NVIDIA-NeMo/Curator Stars 1,723 Tom 2026-08-19
binary-husky/gpt_academic · 上手攻略
binaryhusky/gpt_academic(GPT Academic)是一个为 GPT / GLM 等大语言模型打造的实用化交互界面,特别针对论文阅读、润色、翻译、写作场景深度优化。项目采用模块化插件设计,支持自定义快捷按钮、Python / C++ 项目剖析、ArXiv 论文翻译总结、LaTeX 全文翻译校对等30+ 功能,并行支持 ChatGPT、…
LLM 基础设施 binary-husky/gpt_academic Stars 71,179 Jay 2026-08-17
StarlightSearch/EmbedAnything · 上手攻略
StarlightSearch/EmbedAnything 是一个用 Rust 构建的高性能、多模态 embedding 管道。它支持从文本、图片、音频、PDF、网站等多种来源生成向量嵌入,并与 Milvus、Weaviate、Elastic、SingleStore 等主流向量数据库无缝对接,核心卖点是零 PyTorch 依赖、低内存占用、流式索引,已在 E…
LLM 基础设施 StarlightSearch/EmbedAnything Stars 1,294 Jay 2026-08-17
mlabonne/llm-course · 上手攻略
mlabonne/llmcourse 是由法国机器学习工程师 Maxime Labonne 维护的一套免费、开源的大语言模型(LLM)学习路径仓库,GitHub Stars 超过 81,000(2026年8月)。它不是传统意义上的"课程",而是一份精心编排的知识图谱——包含路线图(roadmap)、Colab Notebook 实践代码、配套博客文章,覆盖从…
LLM 基础设施 mlabonne/llm-course Stars 81,404 Jay 2026-08-17
AI-Hypercomputer/maxtext · 上手攻略
MaxText 是 Google AIHypercomputer 团队开源的高性能、高可扩展 LLM 训练与后训练库,全部用纯 Python/JAX 编写,目标是 TPU 和 NVIDIA GPU 上的高效分布式训练与微调。官方于 20250915 发布 PyPI 包,当前稳定版本 0.2.3(2026 年初)。 MaxText 的定位是"LLM 项目发射台…
LLM 基础设施 AI-Hypercomputer/maxtext Stars 2,401 Tom 2026-08-15
wangxuqi/Prompt-Engineering-Guide-Chinese · 上手攻略
PromptEngineeringGuideChinese(Prompt 工程师指南中文版)是由 wangxuqi 维护的中文翻译项目,翻译自 DAIR.AI 的英文原版 dairai/PromptEngineeringGuide(Stars 77.3k+)。原版是目前最全面、最活跃的 Prompt 工程开源教程,涵盖从基础概念到高级技巧的完整知识体系。 本…
LLM 基础设施 wangxuqi/Prompt-Engineering-Guide-Chinese Stars 1,393 Tom 2026-08-14
DSXiangLi/DecryptPrompt · 上手攻略
DecryptPrompt 是一个大模型提示词/Agent/RAG/LLM 全栈知识图谱,收录 Prompt 论文、开源模型、推理框架、SFT/RLHF 数据集、AIGC 应用案例等多个维度的资源。更重要的是,作者维护了一个持续更新的"解密Prompt"系列博客(65+ 篇),每篇包含论文串讲+代码实现,覆盖从 Prompt Tuning 到 RLHF、Ag…
LLM 基础设施 DSXiangLi/DecryptPrompt Stars 3,432 Tom 2026-08-13
lynote-ai/humanize-text · 上手攻略
humanizetext 是 lynoteai 维护的「AI 文本人类化」开源 Python 工具包。它本质上是把「让 AI 生成文本读起来更像人写的」这件事拆成两条路径: 4 套参考实现(v1.0 沉淀):翻译链、多轮 LLM 改写、检测器反馈循环、混合引擎翻译。 1 套标准流水线(v1.5.1 现行生产推荐版):把方法 1(翻译链)+ 方法 2(LLM …
LLM 基础设施 lynote-ai/humanize-text Stars 1,558 spark 2026-08-11
kvcache-ai/AgentENV · 上手攻略
AgentENV(简称 AENV)是 Kimi K3 模型背后用于大规模运行 Agent 执行环境的分布式平台,由 kvcacheai 团队开源。它的核心职责是:在大规模集群上同时调度成千上万个轻量级隔离沙盒(基于 Firecracker microVM),按需加载 OCI 镜像,让每个 Agent 任务在独立、可快启、可快停的环境中运行。 类比来说:如果 …
LLM 基础设施 kvcache-ai/AgentENV Stars 3,140 Jay 2026-08-11
algorithmicsuperintelligence/optillm · 上手攻略
OptiLLM 是一个OpenAI API 兼容的推理优化代理(inference proxy),通过在推理时(inferencetime)应用 20+ 种推理优化技术,在不需要任何训练或微调的情况下,将 LLM 在数学、代码、逻辑推理任务上的准确率提升 210 倍。 它的核心思路是:在现有 API 调用层加一层代理,对请求进行后处理(优化推理路径),再转发…
LLM 基础设施 algorithmicsuperintelligence/optillm Stars 4,236 Tom 2026-08-10
GPT-5.6 Codex 自主内核优化:Serving 降本 20% 复盘 · 干货攻略
2026 年 7 月 29 日,OpenAI 在官方博客披露了 GPT5.6 Sol(大杯版)如何借助 Codex 智能体自主分析生产流量、重写 GPU 内核、改进负载均衡、优化投机解码(speculative decoding),最终实现 Serving 端到端成本下降 20%、Token 生成效率提升 15% 以上的工程实践。 这不是概念演示,而是真实生…
LLM 基础设施 Jay 2026-08-07
roboflow/inference · 上手攻略
版本说明:仓库 README 中没有写死顶层版本号,文档站 inference.roboflow.com/using_inference/about 自称 "Inference 1.0",PyPI 上 inferencesdk 的最新轮转版本为 1.3.x(如 1.3.7)——下面的命令以当前 README 与 PyPI 通用写法为准,不写死小版本号,使用 …
LLM 基础设施 roboflow/inference Stars 2,411 spark 2026-07-30
huggingface/optimum · 上手攻略
huggingface/optimum 是 Hugging Face 推出的 Transformers / Diffusers / TIMM / SentenceTransformers 的硬件优化扩展库。它把"同一套 HF 模型"映射到多种推理后端与训练硬件上,让用户用同一份 API 跑出"在目标硬件上的极限性能"——既负责 导出(ONNX、OpenVIN…
LLM 基础设施 huggingface/optimum Stars 3,457 spark 2026-07-30
RunanywhereAI/runanywhere-sdks · 上手攻略
RunAnywhere 是一个端侧 AI 推理 SDK 套件,让你在 iOS、Android、Flutter、React Native 和浏览器里直接跑 LLM、VLM、语音识别(TTS/STT)和语音合成,无需联网、数据不离设备。它用同一套 API 屏蔽了各平台的底层差异:Apple 设备走 Core ML / Metal,安卓走 llama.cpp 或高…
LLM 基础设施 RunanywhereAI/runanywhere-sdks Stars 10,301 Tom 2026-07-15
tensorchord/Awesome-LLMOps · 上手攻略
AwesomeLLMOps 是由 tensorchord 团队维护的 GitHub 精选列表(Awesome List),收录了 LLMOps(Large Language Model Operations)领域的优质工具、项目和资源。截至 2026 年 7 月已累计 5879 Stars,周增 +7,是目前最活跃的 LLMOps 专题列表之一。 LLMOp…
LLM 基础设施 tensorchord/Awesome-LLMOps Stars 5,914 Tom 2026-07-15
aws/amazon-sagemaker-examples · 上手攻略
官方维护的 Amazon SageMaker 示例笔记本仓库,由 AWS SageMaker 团队直接管理。它不是 SDK 本身,而是 SageMaker 各功能(数据准备、训练、推理、监控、Feature Store、SageMakerCore、Studio 等)的 可运行 Jupyter Notebook 示范集合,覆盖从 XGBoost 入门到大规模分…
LLM 基础设施 aws/amazon-sagemaker-examples Stars 10,980 spark 2026-07-15
bentoml/OpenLLM · 上手攻略
OpenLLM 是一个开源的 LLM 推理服务框架,让你用一条命令把任何开源大模型(Llama 3.3、Qwen2.5、Mistral、DeepSeek 等)启动为 OpenAI 兼容的 HTTP API,并自带一个 Web Chat UI。它基于 BentoML 构建,支持 Docker 部署和 BentoCloud 云端托管,适合需要自托管 LLM AP…
LLM 基础设施 bentoml/OpenLLM Stars 12,473 Jay 2026-07-15
Mooler0410/LLMsPracticalGuide · 上手攻略
Mooler0410/LLMsPracticalGuide 是一个以Survey Paper 为基础整理的LLM实践指南索引库(而非代码库)。它将大语言模型领域的论文、博客、工具按主题分类组织,帮助研究者和工程师在庞杂的文献中找到"什么场景用什么模型/方法"的最优路径。 核心资产有两块: 1. LLM 演进树(Evolutionary Tree):一张可视化…
LLM 基础设施 Mooler0410/LLMsPracticalGuide Stars 10,197 Tom 2026-07-15
triton-inference-server/server · 上手攻略
NVIDIA Triton Inference Server 是 NVIDIA 开源的"模型推理服务化"系统。和 TensorRT 关注"单模型怎么跑得最快"不同,Triton 关注的是"一堆模型怎么稳定高效地对外提供服务"——它把 TensorRT、PyTorch、ONNX Runtime、OpenVINO、Python、RAPIDS FIL 等多个推理后…
LLM 基础设施 triton-inference-server/server Stars 10,913 spark 2026-07-14
liguodongiot/llm-action · 上手攻略
llmaction 是一个中文大模型技术博客式知识库,由独立作者维护,系统整理了大模型从训练到推理、从微调到部署的全链路技术内容。仓库以 Markdown 文件为主,通过 GitHub + 知乎/掘金文章链接提供深度教程,涵盖 LLM 预训练、SFT、RLHF、分布式训练、推理优化、量化、评测等几乎所有核心环节。适合想系统了解大模型工程实战的工程师和研究人员…
LLM 基础设施 liguodongiot/llm-action Stars 24,886 Jay 2026-07-14
tencentmusic/cube-studio · 上手攻略
cubestudio 是腾讯音乐(TME)开源的一站式云原生机器学习/深度学习/大模型 AI 平台,覆盖从数据标注、模型训练、任务编排、分布式推理到模型市场的 MLOps 全流程。 它是腾讯音乐内部多年沉淀的生产级平台首次对外开源,目标是为中大型团队提供一个开箱即用、功能全面的企业级 AI 基础设施,同时特别注重对国产硬件(昇腾 NPU)和国产软件生态的支持…
LLM 基础设施 tencentmusic/cube-studio Stars 5,076 Jay 2026-07-14
datajuicer/data-juicer · 上手攻略
DataJuicer(简称 DJ)是一个为 foundation model 时代打造的数据操作系统,专注于将混乱的原始数据转化为 AI 可用的精炼数据。它把数据处理看成是可组合的基础设施,提供模块化的构建块来完成清洗、合成和分析,覆盖 AI 全生命周期的数据处理需求。 用大白话说:它是一个超大型数据处理工具箱,内置 200+ 算子(Operator),可以…
LLM 基础设施 datajuicer/data-juicer Stars 6,865 Jay 2026-07-14
内容待复核
PlexPt/awesome-chatgpt-prompts-zh · 上手攻略
awesomechatgptpromptszh(ChatGPT 中文调教指南)是一个开源的中文 Prompt 收藏仓库,由作者 PlexPt 从 2023 年初开始维护。它收集了数百个精炼的中文提示词模板,涵盖学术写作、翻译、代码、面试、生活娱乐等数十个场景,用户将提示词粘贴进 ChatGPT 即可获得高质量输出。 本质上是场景化 Prompt 最佳实践的精…
LLM 基础设施 PlexPt/awesome-chatgpt-prompts-zh Stars 61,423 Jay 2026-07-14
poloclub/transformer-explainer · 上手攻略
poloclub/transformerexplainer 是佐治亚理工 Polo Club of Data Science 维护的交互式 Transformer 教学工具。在浏览器里跑一个完整的 GPT2 模型(@xenova/transformers v2.17.1 + onnxruntimeweb v1.23.0 + onnx),用户输入任意文本,工具…
LLM 基础设施 poloclub/transformer-explainer Stars 8,376 spark 2026-07-14
onyx-dot-app/onyx · 上手攻略
Onyx 是 LLM 的应用层——一个功能丰富的开源 AI 平台,支持自托管。它让团队通过 RAG(检索增强生成)、深度研究、自定义 Agent、代码执行、Web 搜索、MCP 等高级能力,把 LLM 接入真实工作流。 核心定位:企业级 AI 平台(类 ChatGPT + RAG + Deep Research + Agents),可一键部署,适合需要数据隐…
LLM 基础设施 onyx-dot-app/onyx Stars 31,688 Jay 2026-07-13
kvcache-ai/Mooncake · 上手攻略
Mooncake 是月之暗面(Moonshot AI)为旗下 Kimi 大模型服务开发的生产级 LLM Serving 平台,核心创新是 KVCache 中心化的 PrefillDecode 分离架构(PD 分离),将 LLM 推理的预填充(Prefill)和解码(Decode)阶段拆分到不同集群,并通过利用 GPU 集群中闲置的 CPU DRAM 和 SS…
LLM 基础设施 kvcache-ai/Mooncake Stars 6,231 Jay 2026-07-11