Guides · organized/guides

仓库攻略

105 篇 · 105 个项目 · LLM 基础设施

gvergnaud/ts-pattern · 上手攻略
tspattern 是一个 TypeScript 的穷举式模式匹配(Pattern Matching)库,由 Gabriel Vergnaud 开发,当前版本 5.9.0(2025年10月发布),npm 周下载量超过 400 万次,GitHub 星标 15k+。 它用用户态(userland)实现的方式,为 TypeScript 带来了类似 Rust、Swi…
LLM 基础设施 gvergnaud/ts-pattern Stars 15,120 Tom 2026-7-14
vndee/llm-sandbox · 上手攻略
llmsandbox 是一个面向 LLM 生成代码的轻量级、可移植的沙箱运行时 Python 库。它把"AI 写的代码跑在哪里、怎么隔离、怎么回收产物"这一整套工程问题封装成统一的 SandboxSession API,避免每个 Agent 项目都自己塞一遍 Docker / Kubernetes 调用。 仓库自身定位是"代码解释器后端"——OpenAI 的…
LLM 基础设施 vndee/llm-sandbox Stars 1,110 spark 2026-08-25
antirez/h3.c · 上手攻略
h3.c 是 MiniMax H3 视频/音频生成模型的原生 Metal 推理引擎,专为 Apple Silicon 设计。由 antirez(Redis 作者)手写 C + Metal 实现,不依赖 Python 或 PyTorch,直接跑在 Mac 的 GPU 上。 H3 是 MiniMax 开源的多模态生成模型,支持文生视频、文生音频、首帧/尾帧条件化…
LLM 基础设施 antirez/h3.c Stars 980 Tom 2026-08-23
MAC-AutoML/MindPipe · 上手攻略
MindPipe 是一个统一的 LLM/VLM 模型压缩评估框架,用单一 main.py CLI 驱动 11 种量化方法、7 种剪枝方法、压缩微调联合流程,以及 PPL / lmevalharness 零样本 / VLMEvalKit 多模态三类评估。核心设计理念是:一次配置,全流程可复现。 ⚠️ 注意:本仓库同时支持 NVIDIA GPU 和华为昇腾 NP…
LLM 基础设施 MAC-AutoML/MindPipe Stars 1,013 Tom 2026-08-23
alibaba/rtp-llm · 上手攻略
RTPLLM(RealTime PrefillDecode LLM)是阿里巴巴大模型推理团队开发的高性能 LLM 推理加速引擎,脱胎于 FasterTransformer,在其基础上融合了 TensorRTLLM 的部分 CUDA kernel 实现,并参考了 vLLM 的 PagedAttention 等设计。该项目已在阿里内部广泛落地,支持淘宝问问、淘宝…
LLM 基础设施 alibaba/rtp-llm Stars 1,296 Jay 2026-08-22
yjh051108/dsh-routing-suite · 上手攻略
dshroutingsuite 是一个聚合套装,由两个独立维护的组件构成,专门解决「DSH 运行时缺乏任务感知思维模式路由」的问题。它不是一个独立的 AI Agent,而是 DSH(DeepSeek Host)生态的运行时增强层。 核心组成: | 组件 | 仓库 | 版本 | 职能 | ||||| | injector/ | dshsuperinjector…
LLM 基础设施 yjh051108/dsh-routing-suite Stars 1,504 Tom 2026-08-22
beam-cloud/beta9 · 上手攻略
beta9 是 Beam 公司的开源 serverless GPU 运行时引擎,为 AI 工作负载提供极速冷启动(<1 秒)的容器化部署能力。它支持 GPU 推理、沙箱隔离执行和后台任务队列,底层通过自定义容器运行时(非标准 Docker)和分布式缓存实现亚秒级冷启动。 Beam 官方提供托管云服务(beam.cloud),同时 beta9 完全开源,支持自…
LLM 基础设施 beam-cloud/beta9 Stars 1,746 Tom 2026-08-21
brontoguana/krasis · 上手攻略
Krasis 是一个混合 LLM 推理运行时,专注于在消费级显存受限的 NVIDIA GPU 上高效运行数百亿参数级别的 MoE(Mixture of Experts)大模型。它的核心设计目标是:让一张或两张普通游戏显卡(如 RTX 5090 32 GB、RTX PRO 6000 96 GB)就能跑得动原本需要 H100/A100 才能加载的千亿参数模型。 …
LLM 基础设施 brontoguana/krasis Stars 512 Jay 2026-08-20
intel/neural-compressor · 上手攻略
Intel Neural Compressor 是 Intel 开源的模型压缩库,专注于 LLM/VLM 的低比特量化(Lowbit Quantization),覆盖 INT8、FP8、MXFP8、MXFP4、INT4、NVFP4 等多种低精度数据类型,支持 PyTorch、TensorFlow、JAX 三大框架。 其核心定位是:Intel 官方大模型推理优…
LLM 基础设施 intel/neural-compressor Stars 2,697 Tom 2026-08-19
NVIDIA-NeMo/Curator · 上手攻略
NeMo Curator 是 NVIDIA 出品的大规模多模态数据预处理与清洗工具包,专门为 LLM(及其他基础模型)预训练数据构建可复用的 GPU 加速流水线。覆盖文本、图像、视频、音频四种模态,核心能力包括:质量过滤、去重(精确/模糊/子串)、语言检测、分类、合成数据生成(SDG)。它由 RAPIDS(cuDF/cuML/cuGraph)+ Ray 驱动…
LLM 基础设施 NVIDIA-NeMo/Curator Stars 1,723 Tom 2026-08-19
billmei/every-chatgpt-gui · 上手攻略
everychatgptgui 是一个持续更新的开源 AI 客户端清单,由开发者 billmei 维护,专门收集整理全球所有可对接 ChatGPT API(以及 Claude、Gemini 等主流 LLM)的图形界面客户端。仓库本身不是客户端,而是一个精选导航列表,按平台分为 Web、浏览器扩展、Obsidian 插件、桌面应用、自托管方案等大类,每个条目包…
LLM 基础设施 billmei/every-chatgpt-gui Stars 3,997 Tom 2026-08-19
nomic-ai/gpt4all · 上手攻略
GPT4All 是由 Nomic AI 开发的开源本地大模型运行工具,核心目标是让任何人在不需要 GPU、不需要 API key、不需要云服务的情况下,在自己的电脑(笔记本、台式机)上跑大语言模型(LLM)。 本质上是基于 llama.cpp 的工程封装,提供三件套: 桌面应用(GPT4All Desktop):图形界面聊天,支持 LocalDocs(本地文…
LLM 基础设施 nomic-ai/gpt4all Stars 77,407 Tom 2026-08-17
binary-husky/gpt_academic · 上手攻略
binaryhusky/gpt_academic(GPT Academic)是一个为 GPT / GLM 等大语言模型打造的实用化交互界面,特别针对论文阅读、润色、翻译、写作场景深度优化。项目采用模块化插件设计,支持自定义快捷按钮、Python / C++ 项目剖析、ArXiv 论文翻译总结、LaTeX 全文翻译校对等30+ 功能,并行支持 ChatGPT、…
LLM 基础设施 binary-husky/gpt_academic Stars 71,179 Jay 2026-08-17
StarlightSearch/EmbedAnything · 上手攻略
StarlightSearch/EmbedAnything 是一个用 Rust 构建的高性能、多模态 embedding 管道。它支持从文本、图片、音频、PDF、网站等多种来源生成向量嵌入,并与 Milvus、Weaviate、Elastic、SingleStore 等主流向量数据库无缝对接,核心卖点是零 PyTorch 依赖、低内存占用、流式索引,已在 E…
LLM 基础设施 StarlightSearch/EmbedAnything Stars 1,294 Jay 2026-08-17
mlabonne/llm-course · 上手攻略
mlabonne/llmcourse 是由法国机器学习工程师 Maxime Labonne 维护的一套免费、开源的大语言模型(LLM)学习路径仓库,GitHub Stars 超过 81,000(2026年8月)。它不是传统意义上的"课程",而是一份精心编排的知识图谱——包含路线图(roadmap)、Colab Notebook 实践代码、配套博客文章,覆盖从…
LLM 基础设施 mlabonne/llm-course Stars 81,404 Jay 2026-08-17
ggml-org/llama.cpp · 上手攻略
llama.cpp 是一个纯 C/C++ 实现的高性能 LLM 推理框架,核心目标是在各种硬件上以最小化依赖和最优性能跑本地大模型。它基于底层的 ggml 库构建,支持 FP16 和 GGUF 量化格式,Star 122,572(无周增,长期稳定),是本地 LLM 推理领域最活跃的开源项目之一。 核心特点: 纯 C/C++ 实现,无外部依赖(除少量单文件 H…
LLM 基础设施 ggml-org/llama.cpp Stars 122,572 Tom 2026-08-16
trefeon/freebuff-proxy · 上手攻略
freebuffproxy 是一个本地网关,把 FreeBuff/Codebuff 的免费 AI 编程模型(deepseekv4flash 等)以 OpenAI 兼容接口(/v1/chat/completions)暴露给任意工具——OpenCode、pi、9router、LiteLLM 或自己的脚本。 它的核心价值是"翻译 + 池化 + 隐匿": FreeB…
LLM 基础设施 trefeon/freebuff-proxy Stars 85 Tom 2026-08-16
AI-Hypercomputer/maxtext · 上手攻略
MaxText 是 Google AIHypercomputer 团队开源的高性能、高可扩展 LLM 训练与后训练库,全部用纯 Python/JAX 编写,目标是 TPU 和 NVIDIA GPU 上的高效分布式训练与微调。官方于 20250915 发布 PyPI 包,当前稳定版本 0.2.3(2026 年初)。 MaxText 的定位是"LLM 项目发射台…
LLM 基础设施 AI-Hypercomputer/maxtext Stars 2,401 Tom 2026-08-15
wangxuqi/Prompt-Engineering-Guide-Chinese · 上手攻略
PromptEngineeringGuideChinese(Prompt 工程师指南中文版)是由 wangxuqi 维护的中文翻译项目,翻译自 DAIR.AI 的英文原版 dairai/PromptEngineeringGuide(Stars 77.3k+)。原版是目前最全面、最活跃的 Prompt 工程开源教程,涵盖从基础概念到高级技巧的完整知识体系。 本…
LLM 基础设施 wangxuqi/Prompt-Engineering-Guide-Chinese Stars 1,393 Tom 2026-08-14
MetaTool-AI/MetaMCP · 上手攻略
MetaMCP 是一个 MCP(Model Context Protocol)代理基础设施,集 MCP 服务器聚合(Aggregator)、编排(Orchestrator)、中间件(Middleware)、网关(Gateway)于一个 Docker 容器。它的核心定位是:让你不必逐个管理多个 MCP 服务器,而是把它们聚合成一个统一端点,再对外暴露。 技术本…
LLM 基础设施 MetaTool-AI/MetaMCP Tom 2026-08-14
DSXiangLi/DecryptPrompt · 上手攻略
DecryptPrompt 是一个大模型提示词/Agent/RAG/LLM 全栈知识图谱,收录 Prompt 论文、开源模型、推理框架、SFT/RLHF 数据集、AIGC 应用案例等多个维度的资源。更重要的是,作者维护了一个持续更新的"解密Prompt"系列博客(65+ 篇),每篇包含论文串讲+代码实现,覆盖从 Prompt Tuning 到 RLHF、Ag…
LLM 基础设施 DSXiangLi/DecryptPrompt Stars 3,432 Tom 2026-08-13
IDEA-CCNL/Fengshenbang-LM · 上手攻略
封神榜(FengshenbangLM) 是 IDEA 研究院认知计算与自然语言研究中心(CCNL)主导的中文大模型开源体系,2021 年 11 月由沈向洋在 IDEA 大会上正式发布。定位是"中文认知智能的基础设施",旗下包含 6 大模型系列,覆盖从语言理解到多模态生成的完整 NLP 任务。 三个子项目协同工作: Fengshenbang Model:预训练…
LLM 基础设施 IDEA-CCNL/Fengshenbang-LM Stars 4,126 Tom 2026-08-13
utkuozdemir/nvidia_gpu_exporter · 上手攻略
nvidia_gpu_exporter 是一个用 Go 编写的 Prometheus GPU 指标导出器,底层调用 nvidiasmi(NVIDIA 系统管理接口)采集显卡实时状态——包括 GPU 利用率、显存占用、温度、功率、风扇转速、时钟频率等——并以 Prometheus 标准格式(/metrics 端点)暴露出来,可直接对接 Grafana 渲染监控…
LLM 基础设施 utkuozdemir/nvidia_gpu_exporter Stars 1,527 Jay 2026-08-12
NVIDIA/GenerativeAIExamples · 上手攻略
NVIDIA/GenerativeAIExamples 是 NVIDIA 官方的生成式 AI 参考工作流仓库,针对加速基础设施(GPU/NIM 微服务)做了深度优化,涵盖 RAG 管道、Agentic 工作流、知识图谱、视觉 NIM 工作流、Data Flywheel 完整闭环等场景。当前最新 release 为 v0.8.x(2025 年),目录结构已完成…
LLM 基础设施 NVIDIA/GenerativeAIExamples Stars 4,144 Tom 2026-08-11
lynote-ai/humanize-text · 上手攻略
humanizetext 是 lynoteai 维护的「AI 文本人类化」开源 Python 工具包。它本质上是把「让 AI 生成文本读起来更像人写的」这件事拆成两条路径: 4 套参考实现(v1.0 沉淀):翻译链、多轮 LLM 改写、检测器反馈循环、混合引擎翻译。 1 套标准流水线(v1.5.1 现行生产推荐版):把方法 1(翻译链)+ 方法 2(LLM …
LLM 基础设施 lynote-ai/humanize-text Stars 1,558 spark 2026-08-11
kvcache-ai/AgentENV · 上手攻略
AgentENV(简称 AENV)是 Kimi K3 模型背后用于大规模运行 Agent 执行环境的分布式平台,由 kvcacheai 团队开源。它的核心职责是:在大规模集群上同时调度成千上万个轻量级隔离沙盒(基于 Firecracker microVM),按需加载 OCI 镜像,让每个 Agent 任务在独立、可快启、可快停的环境中运行。 类比来说:如果 …
LLM 基础设施 kvcache-ai/AgentENV Stars 3,140 Jay 2026-08-11
algorithmicsuperintelligence/optillm · 上手攻略
OptiLLM 是一个OpenAI API 兼容的推理优化代理(inference proxy),通过在推理时(inferencetime)应用 20+ 种推理优化技术,在不需要任何训练或微调的情况下,将 LLM 在数学、代码、逻辑推理任务上的准确率提升 210 倍。 它的核心思路是:在现有 API 调用层加一层代理,对请求进行后处理(优化推理路径),再转发…
LLM 基础设施 algorithmicsuperintelligence/optillm Stars 4,236 Tom 2026-08-10
FareedKhan-dev/kimi-k3-in-c · 上手攻略
kimik3inc 是一个纯 C99 编写的 Kimi K3 推理引擎,可以在只有 8 GB 内存的单 CPU 机器上运行一个 2.78 万亿参数的 MoE(MixtureofExperts)模型。整个引擎只有 176 KB,无需任何 ML 框架(无 PyTorch、无 BLAS、无 CUDA、无 GPU)。 Kimi K3 是 Moonshot AI 的旗…
LLM 基础设施 FareedKhan-dev/kimi-k3-in-c Stars 4,709 Tom 2026-08-09
decolua/9router · 上手攻略
9Router 是一个本地智能路由器,串联在你常用的 AI 编码 CLI 工具(如 Claude Code、Codex、Cursor、Cline、Copilot、OpenClaw 等)与各路 LLM API 提供商之间。它解决的核心问题是:订阅浪费、速率限制、格式不兼容、手动切换。 架构上,它是一个跑在本地的 HTTP 代理服务(默认 localhost:2…
LLM 基础设施 decolua/9router Stars 25,148 Tom 2026-08-07
GPT-5.6 Codex 自主内核优化:Serving 降本 20% 复盘 · 干货攻略
2026 年 7 月 29 日,OpenAI 在官方博客披露了 GPT5.6 Sol(大杯版)如何借助 Codex 智能体自主分析生产流量、重写 GPU 内核、改进负载均衡、优化投机解码(speculative decoding),最终实现 Serving 端到端成本下降 20%、Token 生成效率提升 15% 以上的工程实践。 这不是概念演示,而是真实生…
LLM 基础设施 Jay 2026-08-07