opendilab/awesome-RLHF · 上手攻略

  • 仓库:opendilab/awesome-RLHF
  • 链接:https://github.com/opendilab/awesome-RLHF
  • 分类:engineering(RLHF / 对齐文献与资源索引)
  • 作者:spark
  • 更新:2026-07-16

是什么

opendilab/awesome-RLHF 是上海人工智能实验室 OpenDILab 维护的 "RLHF 精选资源列表",延续 awesome 系列的策展风格:把强化学习与人类反馈(Reinforcement Learning from Human Feedback)相关论文、代码库、数据集、博客、图书按时间线(2020 及以前 → 2026)梳理成一份可阅读、可跳转、可作为研究起点的清单。4.4k+ Star、Apache-2.0、纯 Markdown 策展,最近一次提交 2026-05。仓库本身不提供可运行代码,它的价值在"信息组织 + 论文入口 + 一手资料链接"。

它与一般 awesome 列表最大的区别:

  1. 覆盖范围更广:除 PPO/DPO/RLAIF 这种"主旋律"算法,还收录 IRL(逆强化学习)、Apprenticeship Learning、HITLRL(人在回路 RL)、Multimodal RLHF 等细分方向。
  2. 结构化元数据:每条论文附 author / publisher / keyword / code link / 实验环境与数据集,统一格式便于扫读。
  3. 持续维护到前沿:2026 年 ICLR/NeurIPS 投稿与已接收论文都已经在条目里,是"想追 SOTA 时打开的第一站"。

解决什么问题

RLHF 是 LLM 对齐的事实标准,但新论文每天数篇,方法命名混乱(DPO/IPO/KTO/ORPO/SimPO/GRPO/MDPO/...),学生和工程师常陷入三类问题:

  1. "我该从哪篇读起?"——awesome-RLHF 把奠基论文(Christiano 2017、InstructGPT、RLHF、Anthropic HH)放在最显眼位置。
  2. "这个变体跟那个变体差在哪?"——通过 keyword(DPO/PPO/Reward Model/Preference/Safety/Multimodal)把同方向论文归到一起。
  3. "我想复现某篇论文,有没有现成代码?"——每条论文都标注 code 链接,是论文→repo 的最短路径。

它解决的核心问题是"在 RLHF 这个噪声极高的领域里降低检索成本"——研究者不用每天刷 arXiv,只需每周扫一遍本仓库 PR 就能跟上。

快速安装

不是软件,没有 pip install。"安装"实际上是克隆到本地配合搜索使用:

git clone --depth 1 https://github.com/opendilab/awesome-RLHF.git
cd awesome-RLHF

# 可选:用 ripgrep 全文检索
rg -i "DPO safety"   # 找含 DPO 与 safety 关键词的论文条目
rg -i "multimodal"   # 多模态相关

如果要配合笔记:

# 用 Obsidian / Logseq 直接把这个文件夹作为 vault 目录
# 论文条目天然是 markdown,互相跳转方便

核心用法

浏览结构

README.md
├── Overview of RLHF            概念 + 图示(ChatGPT / Video Game)
├── Detailed Explanation        IRL / Apprenticeship / IML / HITLRL
├── Papers                      按年份组织
│   ├── 2026
│   ├── 2025
│   ├── 2024
│   ├── 2023
│   ├── 2022
│   ├── 2021
│   └── 2020 and before
├── Codebases                   开源实现汇总(trl/trlx/RL4LMs/...)
├── Dataset                     HH-RLHF / UltraFeedback / HelpSteer / ...
├── Blogs                       业界解读
├── Books                       教材
├── Other Language Support      中文/日文等本地化资料
└── Contributing

论文条目统一格式

- [Why DPO is a Misspecified Estimator and How to Fix It](https://openreview.net/pdf?id=...)
  Aditya Gopalan, Sayak Ray Chowdhury, Debangshu Banerjee
  Keyword: DPO, RLHF, Preference, Alignment, LLM

读法:标题 → 链接 → 作者 → 关键词。前两个决定"要不要读",关键词决定"放回哪一类笔记"。

推荐的几条"必读支线"

仓库内容太多,下面是几个高 ROI 的起点(截至 2026-07 都在表内):

  • 入门主线:Christiano 2017 → InstructGPT (Ouyang 2022) → Anthropic HH (Bai 2022) → DPO (Rafailov 2023) → RLAIF (Lee 2023)
  • DPO 改进谱系:IPO / KTO / ORPO / SimPO / cDPO —— 都在 2023~2024 段
  • RL 类替代:GRPO (DeepSeek 2024) / REINFORCE / PPO-ptx
  • 安全向:SafeDPO / ARMOR / Token-Guard / Alignment Auditor
  • 多模态:Uni-DPO / BaseReward / CogFlow

与其他 awesome 列表联动

  • 想看"代码 + 工程"维度:配 hf.co/open-r1(DeepSeek R1 复现)、huggingface/trl 仓库一起读。
  • 想看"评测"维度:配 eleutherAI/lm-evaluation-harnessopen-compass/vlmevalkit
  • 想看"中文综述":仓库底部 Other Language Support 段收录中文 awesome-RLHF。

典型适用场景

  1. 研究新手入门 RLHF:从 Overview 段读起,再按年份倒序看最近 2 年,每月跟一次更新。
  2. 算法选型调研:要做"用 DPO 还是 ORPO"决策时,用 rg -i "ORPO\|DPO" 把同方向论文一次拉出来对比。
  3. 博士开题 / 综述写作:直接借仓库的年份组织 + keyword 体系搭自己的综述骨架,省去 80% 收集时间。
  4. 企业 LLM 团队:把仓库作为内部知识库的"源信号",每周同步一次 PR diff。
  5. 教学讲义:把 Detailed Explanation 段直接做成课件(CC-BY 兼容,需保留出处)。

坑与注意

  • 不是软件:新手最容易踩的坑就是来 pip install awesome-rlhf,仓库里没有可运行代码。
  • 滞后于 arXiv:策展依赖 PR 与 bot,arXiv 上当日的新论文通常几天后才进清单;想做"抢先"研究还得自己订阅 arXiv。
  • 链接腐烂:论文链接多指向 OpenReview PDF,会随着会议匿名期变动而失效;遇到 404 可去作者主页或 arXiv 兜底。
  • 关键词一致性:keyword 是社区志愿者填的,存在同义词问题(如 "alignment" vs "preference");不要完全依赖关键词检索,建议直接 grep 标题。
  • 贡献门槛:仓库 README 要求 PR 格式规范(author / publisher / keyword / code 等),第一次贡献可能需要看几个旧 PR 模仿格式。
  • 不要直接抄到生产:仓库里的"代码库"段列出的开源实现质量参差,需要自己评估再集成。

与同类对比

资源 维护方 特点
opendilab/awesome-RLHF(本仓库) 上海 AI Lab OpenDILab 中文背景 + RLHF 全谱 + 年份齐全 + 持续到 2026
oxrlhf/awesome-RLHF Oxford 风格 体量更小,更偏学术
OpenLLMAI/awesome-RLHF OpenLLMAI 偏 LLM+RL 综述
google-deepmind/rlhf-book DeepMind 配套图书,体系化讲解
Nathan Lambert 的"RLHF Book" 个人 博客 + 后续成书,更口语化

本仓库的差异化优势是"中文团队维护 + RLHF 专精 + 维护到 2026 当年"——对中文研究者与中文教学场景最友好。

一句话推荐结论

想用一份清单把 RLHF 的论文 / 代码 / 数据集一站式收齐,并在 2026 年仍持续更新,本仓库是当下最值得 star 与每周扫读的中文策展资源。