llmaction 是一个中文大模型技术博客式知识库,由独立作者维护,系统整理了大模型从训练到推理、从微调到部署的全链路技术内容。仓库以 Markdown 文件为主,通过 GitHub + 知乎/掘金文章链接提供深度教程,涵盖 LLM 预训练、SFT、RLHF、分布式训练、推理优化、量化、评测等几乎所有核心环节。适合想系统了解大模型工程实战的工程师和研究人员…
仓库攻略
105 篇 · 105 个项目 · LLM 基础设施
karpathy/llm.c 是由知名 AI 研究员 Andrej Karpathy 创建的一个开源项目,目标是用最简单、纯粹的 C/CUDA 代码实现大语言模型(LLM)训练,无需依赖 PyTorch 或 Python 运行时。 核心思想:用原始的 C 代码(~1,000 行)+ CUDA kernel,直接从零实现 GPT2 训练链路,去掉一切不必要的抽…
cubestudio 是腾讯音乐(TME)开源的一站式云原生机器学习/深度学习/大模型 AI 平台,覆盖从数据标注、模型训练、任务编排、分布式推理到模型市场的 MLOps 全流程。 它是腾讯音乐内部多年沉淀的生产级平台首次对外开源,目标是为中大型团队提供一个开箱即用、功能全面的企业级 AI 基础设施,同时特别注重对国产硬件(昇腾 NPU)和国产软件生态的支持…
ncnn 是腾讯开源的高性能神经网络推理框架,专门针对移动端、嵌入式设备和桌面端场景优化。它的核心特点是无第三方运行时依赖(pure C++ 实现)、支持 CPU 和 Vulkan GPU 双后端,可将 PyTorch / ONNX 模型直接部署到手机、PC、浏览器或边缘设备上。 腾讯内部已大规模落地:QQ、Qzone、微信、天天 P 图等产品均在用。 最新…
DataJuicer(简称 DJ)是一个为 foundation model 时代打造的数据操作系统,专注于将混乱的原始数据转化为 AI 可用的精炼数据。它把数据处理看成是可组合的基础设施,提供模块化的构建块来完成清洗、合成和分析,覆盖 AI 全生命周期的数据处理需求。 用大白话说:它是一个超大型数据处理工具箱,内置 200+ 算子(Operator),可以…
内容待复核
PlexPt/awesome-chatgpt-prompts-zh · 上手攻略
awesomechatgptpromptszh(ChatGPT 中文调教指南)是一个开源的中文 Prompt 收藏仓库,由作者 PlexPt 从 2023 年初开始维护。它收集了数百个精炼的中文提示词模板,涵盖学术写作、翻译、代码、面试、生活娱乐等数十个场景,用户将提示词粘贴进 ChatGPT 即可获得高质量输出。 本质上是场景化 Prompt 最佳实践的精…
poloclub/transformerexplainer 是佐治亚理工 Polo Club of Data Science 维护的交互式 Transformer 教学工具。在浏览器里跑一个完整的 GPT2 模型(@xenova/transformers v2.17.1 + onnxruntimeweb v1.23.0 + onnx),用户输入任意文本,工具…
OpenLLMetry(发音「openLLmetry」)是基于 OpenTelemetry 的开源 LLM 应用可观测性工具,由 Y Combinator 支持的 Traceloop 公司开发和维护(Apache 2.0 许可)。 它的核心思路:用 OpenTelemetry 标准采集 LLM 应用的全链路追踪数据,无需更换你现有的可观测性基础设施(Data…
Dyad 是一个本地运行、开源免费的 AI 应用构建工具(v0 / Lovable / Replit / Bolt 的开源替代)。用户通过自然语言描述需求,Dyad 自动生成完整的全栈应用代码,全程在本地机器运行,不依赖云端平台,不锁死生态,代码完全属于你自己。 支持 macOS 和 Windows,下载即可使用,无需注册。 1. 前往官网下载页面: 2. …
chatanywhere/GPT_API_free 是一个免费中转 API 服务,让国内用户无需科学上网即可调用 OpenAI GPT 系列、DeepSeek、Claude(Anthropic 官方协议)、Gemini、Qwen、Kimi、GLM、Minimax 等主流大模型的 API 接口。项目提供免费 API Key(每日限额),也支持付费 Key 获取…
nanovllm 是一个从零实现的高效 vLLM 复刻项目,作者希望用约 1200 行干净可读的 Python 代码展示 vLLM 的核心原理。它不是 vLLM 的分支或包装,而是一个独立的精简实现,API 设计与 vLLM 保持高度兼容,同时内置了 Prefix Caching、Tensor Parallelism、Torch Compilation、CU…
HappyLLM 是 Datawhale 团队推出的系统性大模型学习教程,定位介于"科普"和"科研"之间,目标是授之以鱼,更授之以渔。它从 NLP 基本研究方法讲起,沿着 LLM 的思路和原理逐层深入,最终带领读者用 PyTorch 从零实现一个 LLaMA2 模型,并完成预训练、有监督微调(SFT)和 LoRA/QLoRA 高效微调的全流程。 与其姐妹项目…
LMCache 是一个KV Cache 管理中间件层,专为 LLM 推理场景设计。它的核心思路是把 GPU VRAM 中转瞬即逝的 KV Cache 变成可持久化、可复用、可监控的 AI 原生存储,从而显著降低 TTFT(Time To First Token,首 token 延迟),提升多轮对话和 Agentic Workload 的吞吐量。 典型工作场景…
FinGPT 是由 AI4Finance Foundation 维护的开源金融大语言模型(Financial LLM)项目,目标是把大模型能力下沉到金融领域,覆盖数据采集 → 数据清洗 → 模型微调 → 应用部署的全链路。它不是单一模型,而是一整套生态: FinGPTForecaster:基于新闻 + 价格的个股走势预测机器人,对标道琼斯 30 成分股,附带…
vLLMOmni 是 vLLM 社区推出的全模式(omnimodality)推理框架,将 vLLM 的高性能 LLM 推理能力扩展到任意到任意的多模态模型——不只是理解图像/视频/音频,而是能同时生成多种模态的输出(文本+图像+视频+音频)。 支持的输出类型: 一句话概括:vLLM 在多模态生成领域的扩展,让研究者和企业能用生产级性能跑 OmniModali…
Onyx 是 LLM 的应用层——一个功能丰富的开源 AI 平台,支持自托管。它让团队通过 RAG(检索增强生成)、深度研究、自定义 Agent、代码执行、Web 搜索、MCP 等高级能力,把 LLM 接入真实工作流。 核心定位:企业级 AI 平台(类 ChatGPT + RAG + Deep Research + Agents),可一键部署,适合需要数据隐…
Colibrì(意大利语"蜂鸟")是一个纯 C 语言编写的轻量推理引擎,可以在只有约 25 GB 内存的消费级机器上运行 GLM5.2——一个 7440 亿参数的混合专家(MoE)大模型。它完全不使用 Python 运行时,不依赖 BLAS 或 GPU,通过磁盘流式加载专家权重将不可能变为可能:仅 9.9 GB 常驻内存,让一台普通电脑跑上前沿级大模型。 项…
GPUStack 是一个开源的 GPU 集群管理器,专门面向 AI 模型服务(Model Serving)和 GPU 资源调度场景。它的核心职责是:把多个 GPU 节点组织成一个集群,自动配置 vLLM、SGLang、TensorRTLLM 等推理引擎,然后暴露一个统一的 OpenAI 兼容 API 供上层应用调用。 从定位上看,它介于底层 GPU 运维工具…
Mooncake 是月之暗面(Moonshot AI)为旗下 Kimi 大模型服务开发的生产级 LLM Serving 平台,核心创新是 KVCache 中心化的 PrefillDecode 分离架构(PD 分离),将 LLM 推理的预填充(Prefill)和解码(Decode)阶段拆分到不同集群,并通过利用 GPU 集群中闲置的 CPU DRAM 和 SS…
ColossalAI 是 HPCAI Tech 开源的分布式深度学习训练框架,核心目标是让大模型训练更便宜、更快、更普惠。它整合了多维并行(数据并行、流水线并行、张量并行)、ZeRO 优化、异构训练、FP8 低精度等技术,支持从单卡到大规模 GPU 集群的各类场景。 ColossalAI 最著名的成就是支撑了开源视频生成项目 OpenSora 的训练——让研…
DeepSpeed 是微软开源的深度学习优化库,专为大规模分布式训练和推理而设计。它让训练千亿、万亿参数模型不再是巨头的专利,普通研究团队也能在有限硬件上跑起来。 DeepSpeed 的核心创新是 ZeRO(Zero Redundancy Optimizer) 系列技术,通过分片优化器状态、梯度、参数,大幅降低单 GPU 显存占用。此外还支持 3D 并行(数…
GGML(ggmlorg/ggml)是一个用纯 C/C++ 编写的机器学习张量库,专为在消费级硬件上高效运行神经网络推理而设计。它是 llama.cpp 和 whisper.cpp 的底层引擎,也是本地大模型推理的事实标准基础设施。 GGML 的核心哲学:极简、便携、内存高效、零外部依赖。它用标准 C 编译器即可编译,生成的可执行文件通常小于 1 MB,可在…
微软官方出品的 21 节生成式 AI 入门课程,覆盖从 LLM 基础理论到 AI Agent 开发完整路径。每节包含讲解视频(YouTube)+ 文字课程 + Python/TypeScript 双语言代码示例,并配套 50+ 语言的社区翻译。Stars 约 112k,是微软 GitHub 最受欢迎的教育类仓库之一。 课程默认使用 Azure OpenAI …
内容待复核
josephmisiti/awesome-machine-learning · 上手攻略
awesomemachinelearning 是机器学习领域最老牌、最全的资源列表之一,由 Joseph Misiti 维护(Stars 73,273,周增 +112)。它按编程语言分类,收录了几乎所有主流机器学习框架、库和工具,堪称 ML 领域的"黄页"。 仓库不提供代码,仅做资源导航,是发现和调研 ML 工具的首选起点。 ⚠️ 注意(2026年4月维护者…
Rig 是用 Rust 构建模块化、可扩展 LLM 应用的库。它提供了一套统一抽象,覆盖 20+ 大模型提供商、10+ 向量数据库,并内置 Agent 编排、RAG、工具调用、多轮对话等能力,全部用 Rust 的类型安全和并发性能加持。 解决什么问题: 在 Rust 生态里,之前缺乏一个统一、好用的 LLM 应用抽象层。开发者要么自己封装各个 Provide…
vllmascend 是华为昇腾(Ascend)NPU 的官方 vLLM 硬件插件,让 vLLM 高性能推理框架能跑在昇腾芯片上。它由 vLLM 社区维护,遵循 vLLM 的硬件可插拔接口(Hardware Pluggable RFC),是昇腾后端在 vLLM 生态的推荐方案。 通俗理解:vLLM 是 LLM 推理的"操作系统",vllmascend 就是让…
BentoML 是一个 Python 库,用于构建和部署 AI 模型推理服务。它将任意 AI/ML 模型的推理代码,通过几行装饰器注解,自动变成可扩展的 HTTP API,并支持 Docker 镜像打包、模型版本管理、动态批处理、多模型编排等生产级特性。 核心理念:"Build Model Inference APIs, Job queues, LLM ap…
Ray 是一个统一分布式 AI 计算框架,用于将 Python 和 AI 应用从单机扩展到集群。核心由两部分组成: 一句话定位:让你用同一套 Python 代码,从笔记本无缝扩展到数千节点集群,不需要懂分布式系统。 ML 和 LLM 工作流的三大挑战: 1. 单机算力不够:大模型训练/推理、微调、SFT 需要多机多卡,单机环境无法承载 2. 分布式门槛高:手…
One API 是一个开源的 LLM API 管理与分发系统,用统一的 OpenAI API 格式暴露所有主流大模型接口,支持 API Key 管理、负载均衡、令牌配额控制、用户权限管理和二次分发。 通俗来说:你在 One API 后台配置好各渠道(OpenAI、Claude、Gemini、DeepSeek 等)的 API Key,对外只暴露一个 API 地…
Outlines(GitHub: dottxtai/outlines,PyPI 包名 outlines)是一个 Python 库,专门解决 LLM 输出结构化数据的问题。由 .txt 团队开发和维护,被 NVIDIA、Cohere、HuggingFace、vLLM 等知名机构信任使用。 核心价值主张:在生成阶段就保证输出格式正确,而不是生成后再用正则、JSO…