opendilab/awesome-RLHF · 上手攻略
- 仓库:opendilab/awesome-RLHF
- 链接:https://github.com/opendilab/awesome-RLHF
- 分类:engineering(RLHF / 对齐文献与资源索引)
- 作者:spark
- 更新:2026-07-16
是什么
opendilab/awesome-RLHF 是上海人工智能实验室 OpenDILab 维护的 "RLHF 精选资源列表",延续 awesome 系列的策展风格:把强化学习与人类反馈(Reinforcement Learning from Human Feedback)相关论文、代码库、数据集、博客、图书按时间线(2020 及以前 → 2026)梳理成一份可阅读、可跳转、可作为研究起点的清单。4.4k+ Star、Apache-2.0、纯 Markdown 策展,最近一次提交 2026-05。仓库本身不提供可运行代码,它的价值在"信息组织 + 论文入口 + 一手资料链接"。
它与一般 awesome 列表最大的区别:
- 覆盖范围更广:除 PPO/DPO/RLAIF 这种"主旋律"算法,还收录 IRL(逆强化学习)、Apprenticeship Learning、HITLRL(人在回路 RL)、Multimodal RLHF 等细分方向。
- 结构化元数据:每条论文附 author / publisher / keyword / code link / 实验环境与数据集,统一格式便于扫读。
- 持续维护到前沿:2026 年 ICLR/NeurIPS 投稿与已接收论文都已经在条目里,是"想追 SOTA 时打开的第一站"。
解决什么问题
RLHF 是 LLM 对齐的事实标准,但新论文每天数篇,方法命名混乱(DPO/IPO/KTO/ORPO/SimPO/GRPO/MDPO/...),学生和工程师常陷入三类问题:
- "我该从哪篇读起?"——awesome-RLHF 把奠基论文(Christiano 2017、InstructGPT、RLHF、Anthropic HH)放在最显眼位置。
- "这个变体跟那个变体差在哪?"——通过 keyword(DPO/PPO/Reward Model/Preference/Safety/Multimodal)把同方向论文归到一起。
- "我想复现某篇论文,有没有现成代码?"——每条论文都标注
code链接,是论文→repo 的最短路径。
它解决的核心问题是"在 RLHF 这个噪声极高的领域里降低检索成本"——研究者不用每天刷 arXiv,只需每周扫一遍本仓库 PR 就能跟上。
快速安装
它不是软件,没有 pip install。"安装"实际上是克隆到本地配合搜索使用:
git clone --depth 1 https://github.com/opendilab/awesome-RLHF.git
cd awesome-RLHF
# 可选:用 ripgrep 全文检索
rg -i "DPO safety" # 找含 DPO 与 safety 关键词的论文条目
rg -i "multimodal" # 多模态相关
如果要配合笔记:
# 用 Obsidian / Logseq 直接把这个文件夹作为 vault 目录
# 论文条目天然是 markdown,互相跳转方便
核心用法
浏览结构
README.md
├── Overview of RLHF 概念 + 图示(ChatGPT / Video Game)
├── Detailed Explanation IRL / Apprenticeship / IML / HITLRL
├── Papers 按年份组织
│ ├── 2026
│ ├── 2025
│ ├── 2024
│ ├── 2023
│ ├── 2022
│ ├── 2021
│ └── 2020 and before
├── Codebases 开源实现汇总(trl/trlx/RL4LMs/...)
├── Dataset HH-RLHF / UltraFeedback / HelpSteer / ...
├── Blogs 业界解读
├── Books 教材
├── Other Language Support 中文/日文等本地化资料
└── Contributing
论文条目统一格式
- [Why DPO is a Misspecified Estimator and How to Fix It](https://openreview.net/pdf?id=...)
Aditya Gopalan, Sayak Ray Chowdhury, Debangshu Banerjee
Keyword: DPO, RLHF, Preference, Alignment, LLM
读法:标题 → 链接 → 作者 → 关键词。前两个决定"要不要读",关键词决定"放回哪一类笔记"。
推荐的几条"必读支线"
仓库内容太多,下面是几个高 ROI 的起点(截至 2026-07 都在表内):
- 入门主线:Christiano 2017 → InstructGPT (Ouyang 2022) → Anthropic HH (Bai 2022) → DPO (Rafailov 2023) → RLAIF (Lee 2023)
- DPO 改进谱系:IPO / KTO / ORPO / SimPO / cDPO —— 都在 2023~2024 段
- RL 类替代:GRPO (DeepSeek 2024) / REINFORCE / PPO-ptx
- 安全向:SafeDPO / ARMOR / Token-Guard / Alignment Auditor
- 多模态:Uni-DPO / BaseReward / CogFlow
与其他 awesome 列表联动
- 想看"代码 + 工程"维度:配
hf.co/open-r1(DeepSeek R1 复现)、huggingface/trl仓库一起读。 - 想看"评测"维度:配
eleutherAI/lm-evaluation-harness与open-compass/vlmevalkit。 - 想看"中文综述":仓库底部
Other Language Support段收录中文 awesome-RLHF。
典型适用场景
- 研究新手入门 RLHF:从 Overview 段读起,再按年份倒序看最近 2 年,每月跟一次更新。
- 算法选型调研:要做"用 DPO 还是 ORPO"决策时,用
rg -i "ORPO\|DPO"把同方向论文一次拉出来对比。 - 博士开题 / 综述写作:直接借仓库的年份组织 + keyword 体系搭自己的综述骨架,省去 80% 收集时间。
- 企业 LLM 团队:把仓库作为内部知识库的"源信号",每周同步一次 PR diff。
- 教学讲义:把 Detailed Explanation 段直接做成课件(CC-BY 兼容,需保留出处)。
坑与注意
- 不是软件:新手最容易踩的坑就是来
pip install awesome-rlhf,仓库里没有可运行代码。 - 滞后于 arXiv:策展依赖 PR 与 bot,arXiv 上当日的新论文通常几天后才进清单;想做"抢先"研究还得自己订阅 arXiv。
- 链接腐烂:论文链接多指向 OpenReview PDF,会随着会议匿名期变动而失效;遇到 404 可去作者主页或 arXiv 兜底。
- 关键词一致性:keyword 是社区志愿者填的,存在同义词问题(如 "alignment" vs "preference");不要完全依赖关键词检索,建议直接 grep 标题。
- 贡献门槛:仓库 README 要求 PR 格式规范(author / publisher / keyword / code 等),第一次贡献可能需要看几个旧 PR 模仿格式。
- 不要直接抄到生产:仓库里的"代码库"段列出的开源实现质量参差,需要自己评估再集成。
与同类对比
| 资源 | 维护方 | 特点 |
|---|---|---|
| opendilab/awesome-RLHF(本仓库) | 上海 AI Lab OpenDILab | 中文背景 + RLHF 全谱 + 年份齐全 + 持续到 2026 |
| oxrlhf/awesome-RLHF | Oxford 风格 | 体量更小,更偏学术 |
| OpenLLMAI/awesome-RLHF | OpenLLMAI | 偏 LLM+RL 综述 |
| google-deepmind/rlhf-book | DeepMind | 配套图书,体系化讲解 |
| Nathan Lambert 的"RLHF Book" | 个人 | 博客 + 后续成书,更口语化 |
本仓库的差异化优势是"中文团队维护 + RLHF 专精 + 维护到 2026 当年"——对中文研究者与中文教学场景最友好。
一句话推荐结论
想用一份清单把 RLHF 的论文 / 代码 / 数据集一站式收齐,并在 2026 年仍持续更新,本仓库是当下最值得 star 与每周扫读的中文策展资源。