liguodongiot/llm-action · 上手攻略
- 仓库:liguodongiot/llm-action
- 链接:https://github.com/liguodongiot/llm-action
- 分类:ai
- 作者:Jay
- 更新:2026-07-14
是什么
llm-action 是一个中文大模型技术博客式知识库,由独立作者维护,系统整理了大模型从训练到推理、从微调到部署的全链路技术内容。仓库以 Markdown 文件为主,通过 GitHub + 知乎/掘金文章链接提供深度教程,涵盖 LLM 预训练、SFT、RLHF、分布式训练、推理优化、量化、评测等几乎所有核心环节。适合想系统了解大模型工程实战的工程师和研究人员参考。
解决什么问题
大模型技术文档分散在论文、博客、官方仓库、知乎帖子各处,缺少一条从浅入深的系统性学习路径。llm-action 的作者以"实战"为导向,把主流方法论(LoRA、QLoRA、DeepSpeed、Megatron、TensorRT-LLM 等)串联成体系,每篇教程都有对应的 GitHub 配套代码地址。读者可以跟着文章思路理解原理,再直接跑配套代码验证。
内容速览
仓库主要分为以下模块:
LLM 训练
训练实战(含配套代码) - Alpaca 7B 全量微调 - Alpaca LoRA 微调(7B~65B) - ChatGLM-6B LoRA / P-Tuning v2 / 全量微调 - Vicuna 7B 训练与推理 - OPT RLHF(基于 DeepSpeed Chat) - MiniGPT-4 多模态微调 - Chinese-LLaMA-Alpaca 中文词表扩充 + 预训练 + 指令微调 - QLoRA 微调 LLaMA 65B(仅需 48GB 显存) - GaLore 预训练 LLaMA-7B(消费级 4090 即可)
参数高效微调(PEFT)技术原理(七篇系列) - BitFit、Prefix Tuning、Prompt Tuning - P-Tuning / P-Tuning v2 - Adapter Tuning 及其变体 - LoRA、AdaLoRA、QLoRA - MAM Adapter、UniPELT
PEFT 实战(基于 HuggingFace PEFT 框架) - Prompt Tuning / P-Tuning / Prefix Tuning / LoRA / IA3 - 多模态模型 LoRA 微调 - INT8/FP4/NF4 微调
分布式训练并行技术(十篇系列) - 数据并行(DP / DDP) - 流水线并行(PP) - 张量并行(TP) - 序列并行(SP) - 多维混合并行 - 自动并行 - MoE 并行 - 通信量计算及训练耗时估算
分布式框架 - PyTorch 单机/多机多卡 - Megatron-LM 单机/多机多卡 - DeepSpeed 单机/多机多卡 - Megatron-DeepSpeed 联合训练(LLaMA / Bloom) - Nanotron、Pai-Megatron-Patch
LLM 推理
推理引擎 - FasterTransformer、vLLM、SGLang、LMDeploy、LightLLM、MNN-LLM - 源码级学习项目:nano-vLLM(轻量实现)、mini-SGLang
推理优化技术 - KV Cache、Continuous Batching、PagedAttention - FlashAttention、Flash Decoding - 张量并行推理 - Speculative Decoding 及其变体 - 结构化文本生成优化
推理服务 - Triton Inference Server 完整教程(快速入门 / 架构解析 / 开发实践) - 模型推理服务化框架综述
LLM 压缩
- 量化(LLM-QAT、GPTQ、AWQ、LLM.int8)
- 剪枝
- 知识蒸馏
- 低秩分解(LoRA 原理也在此)
LLM 评测
- 效果评测:MMLU、C-Eval、GSM8K 等主流 benchmark 介绍
- 推理性能压测:吞吐、延迟、显存占用
其他
- LLM 数据工程与高效数据筛选
- 提示工程(Prompt Engineering)
- LLM 算法架构分析
- 国产化适配(ChatGLM、LLaMA 中文等)
- AI 编译器(TVM、CUDA 优化)
- AI 基础设施:NVIDIA GPU 选型、InfiniBand 网络
- LLMOps 全流程
- LLM 性能分析工具
- LLM 面试题整理
快速上手
第一步:浏览目录结构
git clone https://github.com/liguodongiot/llm-action.git
cd llm-action
主要目录:
llm-action/
llm-train/ # 训练相关配套代码
alpaca/ # Alpaca 全量微调
alpaca-lora/ # LoRA 微调
chatglm/ # ChatGLM 微调
deepspeedchat/ # DeepSpeed Chat (RLHF)
qlora/ # QLoRA
peft/ # PEFT 框架各方法示例
docs/ # 部分文档
inference/ # 推理相关
pic/ # 图片资源
第二步:选一个实战教程开始
以 LoRA 微调为例:
1. 阅读知乎教程:大模型参数高效微调技术实战(五)-LoRA
2. 运行配套代码:llm-action/llm-train/peft/clm/peft_lora_clm.ipynb
# peft_lora_clm.ipynb 核心片段(示例)
from peft import LoraConfig, get_peft_model, TaskType
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("bigscience/mistral-7b")
lora_config = LoraConfig(
task_type=TaskType.CAUSAL_LM,
r=8,
lora_alpha=16,
target_modules=["q_proj", "v_proj"],
lora_dropout=0.05,
)
model = get_peft_model(model, lora_config)
model.print_trainable_parameters()
# trainable params: 4,194,304 || all params: 7,124,596,608 || trainable%: 0.0589
第三步:分布式训练(以 DeepSpeed 为例)
参考仓库 llm-train/deepspeedchat/ 目录:
# DeepSpeed Chat 启动(单节点多卡)
deepspeed --num_gpus=8 main.py \
--deployment_type single_node \
--num_total_phases 3 \
--actor_model facebook/opt-1.3b \
--critic_model facebook/opt-1.3b \
--info抽取.interactive_template twitter
典型适用场景
- 系统学习大模型工程:从 PEFT 原理到分布式训练,有完整学习路径
- 快速复现主流模型微调:Alpaca、Vicuna、ChatGLM、Bloom 等都有配套代码和文章
- 生产级推理优化参考:vLLM / SGLang / TensorRT-LLM 实战调优思路
- 面试准备:LLM 面试题专题整理了主流面试考点
- 国产模型适配:ChatGLM 等国产模型的专项适配经验
坑与注意
- 教程非自动化脚本:本仓库以文章 + 配套代码为主,不是开箱即用的训练框架。读者需要有一定的深度学习基础,能够根据文章自行组装训练脚本。
- 代码随时间可能过时:大模型生态更新快,部分配套代码(如 PEFT 版本依赖、模型加载方式)可能需要对照最新官方文档调整。
- 部分链接为知乎/掘金:核心内容在知乎文章中,GitHub 仓库主要提供配套代码和目录索引;需接受中英混合阅读。
- DeepSpeed/Megatron 配置复杂:分布式训练的配套代码假设读者有 GPU 集群或高性能机器,单卡用户需要自行缩减规模。
- 不包含预训练内容:仓库主要关注微调、推理和优化,不涉及从头预训练大模型(这需要更大规模资源)。
- 分类索引更新滞后:仓库内容持续增加,部分新加内容可能未及时更新到目录导航。
与同类对比
| 特性 | llm-action | HuggingFace Blog | DeepLearning AI | 知乎专栏合集 |
|---|---|---|---|---|
| 语言 | 中文 | 英文 | 英文 | 中文 |
| 实战代码 | ✅ 配套 GitHub | ✅ | ✅ | 部分 |
| 系统广度 | 训练→推理→部署 | 偏向入门 | 系统课程 | 分散 |
| 更新频率 | 活跃 | 高 | 中 | 分散 |
| PEFT/分布式 | 深度覆盖 | 基础 | 基础 | 不等 |
| 中文特色 | ✅ 国产模型适配 | ❌ | ❌ | ✅ |
llm-action 是中文大模型工程领域最系统的博客式知识库之一,尤其在分布式训练和 PEFT 方向深度优于大多数公开资源。如果你想用中文系统学习大模型从训练到部署的完整链路,这是目前最值得 Follow 的开源仓库之一。
一句话推荐
想系统掌握大模型工程(微调、分布式训练、推理优化)且偏好中文实战教程?llm-action 是目前中文圈最值得收藏的全链路学习资源。