Guides · organized/guides

仓库攻略

36 篇 · 36 个项目 · LLM 基础设施 · jay

alibaba/rtp-llm · 上手攻略
RTPLLM(RealTime PrefillDecode LLM)是阿里巴巴大模型推理团队开发的高性能 LLM 推理加速引擎,脱胎于 FasterTransformer,在其基础上融合了 TensorRTLLM 的部分 CUDA kernel 实现,并参考了 vLLM 的 PagedAttention 等设计。该项目已在阿里内部广泛落地,支持淘宝问问、淘宝…
LLM 基础设施 alibaba/rtp-llm Stars 1,296 Jay 2026-08-22
brontoguana/krasis · 上手攻略
Krasis 是一个混合 LLM 推理运行时,专注于在消费级显存受限的 NVIDIA GPU 上高效运行数百亿参数级别的 MoE(Mixture of Experts)大模型。它的核心设计目标是:让一张或两张普通游戏显卡(如 RTX 5090 32 GB、RTX PRO 6000 96 GB)就能跑得动原本需要 H100/A100 才能加载的千亿参数模型。 …
LLM 基础设施 brontoguana/krasis Stars 512 Jay 2026-08-20
binary-husky/gpt_academic · 上手攻略
binaryhusky/gpt_academic(GPT Academic)是一个为 GPT / GLM 等大语言模型打造的实用化交互界面,特别针对论文阅读、润色、翻译、写作场景深度优化。项目采用模块化插件设计,支持自定义快捷按钮、Python / C++ 项目剖析、ArXiv 论文翻译总结、LaTeX 全文翻译校对等30+ 功能,并行支持 ChatGPT、…
LLM 基础设施 binary-husky/gpt_academic Stars 71,179 Jay 2026-08-17
StarlightSearch/EmbedAnything · 上手攻略
StarlightSearch/EmbedAnything 是一个用 Rust 构建的高性能、多模态 embedding 管道。它支持从文本、图片、音频、PDF、网站等多种来源生成向量嵌入,并与 Milvus、Weaviate、Elastic、SingleStore 等主流向量数据库无缝对接,核心卖点是零 PyTorch 依赖、低内存占用、流式索引,已在 E…
LLM 基础设施 StarlightSearch/EmbedAnything Stars 1,294 Jay 2026-08-17
mlabonne/llm-course · 上手攻略
mlabonne/llmcourse 是由法国机器学习工程师 Maxime Labonne 维护的一套免费、开源的大语言模型(LLM)学习路径仓库,GitHub Stars 超过 81,000(2026年8月)。它不是传统意义上的"课程",而是一份精心编排的知识图谱——包含路线图(roadmap)、Colab Notebook 实践代码、配套博客文章,覆盖从…
LLM 基础设施 mlabonne/llm-course Stars 81,404 Jay 2026-08-17
utkuozdemir/nvidia_gpu_exporter · 上手攻略
nvidia_gpu_exporter 是一个用 Go 编写的 Prometheus GPU 指标导出器,底层调用 nvidiasmi(NVIDIA 系统管理接口)采集显卡实时状态——包括 GPU 利用率、显存占用、温度、功率、风扇转速、时钟频率等——并以 Prometheus 标准格式(/metrics 端点)暴露出来,可直接对接 Grafana 渲染监控…
LLM 基础设施 utkuozdemir/nvidia_gpu_exporter Stars 1,527 Jay 2026-08-12
kvcache-ai/AgentENV · 上手攻略
AgentENV(简称 AENV)是 Kimi K3 模型背后用于大规模运行 Agent 执行环境的分布式平台,由 kvcacheai 团队开源。它的核心职责是:在大规模集群上同时调度成千上万个轻量级隔离沙盒(基于 Firecracker microVM),按需加载 OCI 镜像,让每个 Agent 任务在独立、可快启、可快停的环境中运行。 类比来说:如果 …
LLM 基础设施 kvcache-ai/AgentENV Stars 3,140 Jay 2026-08-11
GPT-5.6 Codex 自主内核优化:Serving 降本 20% 复盘 · 干货攻略
2026 年 7 月 29 日,OpenAI 在官方博客披露了 GPT5.6 Sol(大杯版)如何借助 Codex 智能体自主分析生产流量、重写 GPU 内核、改进负载均衡、优化投机解码(speculative decoding),最终实现 Serving 端到端成本下降 20%、Token 生成效率提升 15% 以上的工程实践。 这不是概念演示,而是真实生…
LLM 基础设施 Jay 2026-08-07
ollama/ollama · 上手攻略
Ollama 是最流行的本地大模型推理运行时,让你在本地机器上运行开源 LLM(Llama 系列、Qwen、DeepSeek、GLM、Gemma 等数百个模型),无需云服务、无需 API Key、一条命令启动服务。2026年7月 v0.32.0 起,Ollama CLI 本身升级为交互式 Agent,支持 Chat、Code 和 Work 委托任务——CLI…
LLM 基础设施 ollama/ollama Stars 177,685 Jay 2026-08-04
moonshotai/Kimi-K3 · 上手攻略
Kimi K3 是 Moonshot AI(MiniMax)推出的开源权重多模态 Agent 大模型,总参数量 2.8T(激活 104B),是全球首个开放的 3T 级开源模型。K3 基于两项自研架构:Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes),采用 MoE(MixtureofExperts…
LLM 基础设施 MoonshotAI/Kimi-K3 Stars 8,340 Jay 2026-07-29
bentoml/OpenLLM · 上手攻略
OpenLLM 是一个开源的 LLM 推理服务框架,让你用一条命令把任何开源大模型(Llama 3.3、Qwen2.5、Mistral、DeepSeek 等)启动为 OpenAI 兼容的 HTTP API,并自带一个 Web Chat UI。它基于 BentoML 构建,支持 Docker 部署和 BentoCloud 云端托管,适合需要自托管 LLM AP…
LLM 基础设施 bentoml/OpenLLM Stars 12,473 Jay 2026-07-15
liguodongiot/llm-action · 上手攻略
llmaction 是一个中文大模型技术博客式知识库,由独立作者维护,系统整理了大模型从训练到推理、从微调到部署的全链路技术内容。仓库以 Markdown 文件为主,通过 GitHub + 知乎/掘金文章链接提供深度教程,涵盖 LLM 预训练、SFT、RLHF、分布式训练、推理优化、量化、评测等几乎所有核心环节。适合想系统了解大模型工程实战的工程师和研究人员…
LLM 基础设施 liguodongiot/llm-action Stars 24,886 Jay 2026-07-14
tencentmusic/cube-studio · 上手攻略
cubestudio 是腾讯音乐(TME)开源的一站式云原生机器学习/深度学习/大模型 AI 平台,覆盖从数据标注、模型训练、任务编排、分布式推理到模型市场的 MLOps 全流程。 它是腾讯音乐内部多年沉淀的生产级平台首次对外开源,目标是为中大型团队提供一个开箱即用、功能全面的企业级 AI 基础设施,同时特别注重对国产硬件(昇腾 NPU)和国产软件生态的支持…
LLM 基础设施 tencentmusic/cube-studio Stars 5,076 Jay 2026-07-14
datajuicer/data-juicer · 上手攻略
DataJuicer(简称 DJ)是一个为 foundation model 时代打造的数据操作系统,专注于将混乱的原始数据转化为 AI 可用的精炼数据。它把数据处理看成是可组合的基础设施,提供模块化的构建块来完成清洗、合成和分析,覆盖 AI 全生命周期的数据处理需求。 用大白话说:它是一个超大型数据处理工具箱,内置 200+ 算子(Operator),可以…
LLM 基础设施 datajuicer/data-juicer Stars 6,865 Jay 2026-07-14
内容待复核
PlexPt/awesome-chatgpt-prompts-zh · 上手攻略
awesomechatgptpromptszh(ChatGPT 中文调教指南)是一个开源的中文 Prompt 收藏仓库,由作者 PlexPt 从 2023 年初开始维护。它收集了数百个精炼的中文提示词模板,涵盖学术写作、翻译、代码、面试、生活娱乐等数十个场景,用户将提示词粘贴进 ChatGPT 即可获得高质量输出。 本质上是场景化 Prompt 最佳实践的精…
LLM 基础设施 PlexPt/awesome-chatgpt-prompts-zh Stars 61,423 Jay 2026-07-14
GeeeekExplorer/nano-vllm · 上手攻略
nanovllm 是一个从零实现的高效 vLLM 复刻项目,作者希望用约 1200 行干净可读的 Python 代码展示 vLLM 的核心原理。它不是 vLLM 的分支或包装,而是一个独立的精简实现,API 设计与 vLLM 保持高度兼容,同时内置了 Prefix Caching、Tensor Parallelism、Torch Compilation、CU…
LLM 基础设施 GeeeekExplorer/nano-vllm Stars 14,623 Jay 2026-07-13
datawhalechina/happy-llm · 上手攻略
HappyLLM 是 Datawhale 团队推出的系统性大模型学习教程,定位介于"科普"和"科研"之间,目标是授之以鱼,更授之以渔。它从 NLP 基本研究方法讲起,沿着 LLM 的思路和原理逐层深入,最终带领读者用 PyTorch 从零实现一个 LLaMA2 模型,并完成预训练、有监督微调(SFT)和 LoRA/QLoRA 高效微调的全流程。 与其姐妹项目…
LLM 基础设施 datawhalechina/happy-llm Stars 32,846 Jay 2026-07-13
lmcache/lmcache · 上手攻略
LMCache 是一个KV Cache 管理中间件层,专为 LLM 推理场景设计。它的核心思路是把 GPU VRAM 中转瞬即逝的 KV Cache 变成可持久化、可复用、可监控的 AI 原生存储,从而显著降低 TTFT(Time To First Token,首 token 延迟),提升多轮对话和 Agentic Workload 的吞吐量。 典型工作场景…
LLM 基础设施 lmcache/lmcache Jay 2026-07-13
onyx-dot-app/onyx · 上手攻略
Onyx 是 LLM 的应用层——一个功能丰富的开源 AI 平台,支持自托管。它让团队通过 RAG(检索增强生成)、深度研究、自定义 Agent、代码执行、Web 搜索、MCP 等高级能力,把 LLM 接入真实工作流。 核心定位:企业级 AI 平台(类 ChatGPT + RAG + Deep Research + Agents),可一键部署,适合需要数据隐…
LLM 基础设施 onyx-dot-app/onyx Stars 31,688 Jay 2026-07-13
JustVugg/colibri · 上手攻略
Colibrì(意大利语"蜂鸟")是一个纯 C 语言编写的轻量推理引擎,可以在只有约 25 GB 内存的消费级机器上运行 GLM5.2——一个 7440 亿参数的混合专家(MoE)大模型。它完全不使用 Python 运行时,不依赖 BLAS 或 GPU,通过磁盘流式加载专家权重将不可能变为可能:仅 9.9 GB 常驻内存,让一台普通电脑跑上前沿级大模型。 项…
LLM 基础设施 JustVugg/colibri Stars 23,805 Jay 2026-07-12
kvcache-ai/Mooncake · 上手攻略
Mooncake 是月之暗面(Moonshot AI)为旗下 Kimi 大模型服务开发的生产级 LLM Serving 平台,核心创新是 KVCache 中心化的 PrefillDecode 分离架构(PD 分离),将 LLM 推理的预填充(Prefill)和解码(Decode)阶段拆分到不同集群,并通过利用 GPU 集群中闲置的 CPU DRAM 和 SS…
LLM 基础设施 kvcache-ai/Mooncake Stars 6,231 Jay 2026-07-11
hpcaitech/ColossalAI · 上手攻略
ColossalAI 是 HPCAI Tech 开源的分布式深度学习训练框架,核心目标是让大模型训练更便宜、更快、更普惠。它整合了多维并行(数据并行、流水线并行、张量并行)、ZeRO 优化、异构训练、FP8 低精度等技术,支持从单卡到大规模 GPU 集群的各类场景。 ColossalAI 最著名的成就是支撑了开源视频生成项目 OpenSora 的训练——让研…
LLM 基础设施 hpcaitech/ColossalAI Stars 41,433 Jay 2026-07-11
deepspeedai/DeepSpeed · 上手攻略
DeepSpeed 是微软开源的深度学习优化库,专为大规模分布式训练和推理而设计。它让训练千亿、万亿参数模型不再是巨头的专利,普通研究团队也能在有限硬件上跑起来。 DeepSpeed 的核心创新是 ZeRO(Zero Redundancy Optimizer) 系列技术,通过分片优化器状态、梯度、参数,大幅降低单 GPU 显存占用。此外还支持 3D 并行(数…
LLM 基础设施 deepspeedai/DeepSpeed Stars 42,900 Jay 2026-07-11
ggml-org/ggml · 上手攻略
GGML(ggmlorg/ggml)是一个用纯 C/C++ 编写的机器学习张量库,专为在消费级硬件上高效运行神经网络推理而设计。它是 llama.cpp 和 whisper.cpp 的底层引擎,也是本地大模型推理的事实标准基础设施。 GGML 的核心哲学:极简、便携、内存高效、零外部依赖。它用标准 C 编译器即可编译,生成的可执行文件通常小于 1 MB,可在…
LLM 基础设施 ggml-org/ggml Stars 15,147 Jay 2026-07-10
内容待复核
josephmisiti/awesome-machine-learning · 上手攻略
awesomemachinelearning 是机器学习领域最老牌、最全的资源列表之一,由 Joseph Misiti 维护(Stars 73,273,周增 +112)。它按编程语言分类,收录了几乎所有主流机器学习框架、库和工具,堪称 ML 领域的"黄页"。 仓库不提供代码,仅做资源导航,是发现和调研 ML 工具的首选起点。 ⚠️ 注意(2026年4月维护者…
LLM 基础设施 josephmisiti/awesome-machine-learning Stars 73,985 Jay 2026-07-10
BentoML/BentoML · 上手攻略
BentoML 是一个 Python 库,用于构建和部署 AI 模型推理服务。它将任意 AI/ML 模型的推理代码,通过几行装饰器注解,自动变成可扩展的 HTTP API,并支持 Docker 镜像打包、模型版本管理、动态批处理、多模型编排等生产级特性。 核心理念:"Build Model Inference APIs, Job queues, LLM ap…
LLM 基础设施 bentoml/BentoML Stars 8,776 Jay 2026-07-10
ray-project/ray · 上手攻略
Ray 是一个统一分布式 AI 计算框架,用于将 Python 和 AI 应用从单机扩展到集群。核心由两部分组成: 一句话定位:让你用同一套 Python 代码,从笔记本无缝扩展到数千节点集群,不需要懂分布式系统。 ML 和 LLM 工作流的三大挑战: 1. 单机算力不够:大模型训练/推理、微调、SFT 需要多机多卡,单机环境无法承载 2. 分布式门槛高:手…
LLM 基础设施 ray-project/ray Stars 43,599 Jay 2026-07-09
songquanpeng/one-api · 上手攻略
One API 是一个开源的 LLM API 管理与分发系统,用统一的 OpenAI API 格式暴露所有主流大模型接口,支持 API Key 管理、负载均衡、令牌配额控制、用户权限管理和二次分发。 通俗来说:你在 One API 后台配置好各渠道(OpenAI、Claude、Gemini、DeepSeek 等)的 API Key,对外只暴露一个 API 地…
LLM 基础设施 songquanpeng/one-api Stars 36,309 Jay 2026-07-09
dottxt-ai/outlines · 上手攻略
Outlines(GitHub: dottxtai/outlines,PyPI 包名 outlines)是一个 Python 库,专门解决 LLM 输出结构化数据的问题。由 .txt 团队开发和维护,被 NVIDIA、Cohere、HuggingFace、vLLM 等知名机构信任使用。 核心价值主张:在生成阶段就保证输出格式正确,而不是生成后再用正则、JSO…
LLM 基础设施 dottxt-ai/outlines Stars 15,565 Jay 2026-07-09
yamadashy/repomix · 上手攻略
Repomix 是一款将整个代码仓库打包为单个 AI 友好文件的工具(MIT 协议,TypeScript),Stars 26956,周增+140。它解决的核心问题是:当你需要把一个完整项目喂给 LLM(如 Claude、ChatGPT、DeepSeek)时,如何高效、结构化地传递所有代码,同时控制 token 用量、规避敏感信息泄露。 输出格式支持 XML(…
LLM 基础设施 yamadashy/repomix Stars 27,752 Jay 2026-07-08