Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
- 类型:arxiv
- 标识:2204.05862
- 链接:https://arxiv.org/abs/2204.05862
- 主题:risk
- 主分类:engineering
- 形态:method
- 被引:4323
- 被引来源:Semantic Scholar
- S2被引:4323
- OpenAlex被引:390
- 影响力被引:513
- TLDR:An iterated online mode of training, where preference models and RL policies are updated on a weekly cadence with fresh human feedback data, and a roughly linear relation between the RL reward and the square root of the KL divergence between the policy and its initialization is identified.
- OpenAlex ID:W4223908421
- OpenAlex DOI:10.48550/arxiv.2204.05862
- DOI:10.48550/arxiv.2204.05862
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://arxiv.org/pdf/2204.05862
- OpenAlex更新:2026-08-20
- 待LLM分类:否
- 标题中文:使用人类反馈强化学习训练有用且无害的助手
- TLDR中文:采用迭代的在线训练模式,按周节奏用新的人类反馈数据更新偏好模型与 RL 策略,并发现 RL 奖励与策略相对其初始化的 KL 散度平方根之间近似呈线性关系。
- 来源文件:
- [OpenAlex discover]
- [S2 enrich]