Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

  • 类型:arxiv
  • 标识:2204.05862
  • 链接:https://arxiv.org/abs/2204.05862
  • 主题:risk
  • 主分类:engineering
  • 形态:method
  • 被引:4323
  • 被引来源:Semantic Scholar
  • S2被引:4323
  • OpenAlex被引:390
  • 影响力被引:513
  • TLDR:An iterated online mode of training, where preference models and RL policies are updated on a weekly cadence with fresh human feedback data, and a roughly linear relation between the RL reward and the square root of the KL divergence between the policy and its initialization is identified.
  • OpenAlex ID:W4223908421
  • OpenAlex DOI:10.48550/arxiv.2204.05862
  • DOI:10.48550/arxiv.2204.05862
  • DOI来源:OpenAlex
  • 开放获取:green
  • 开放获取链接:https://arxiv.org/pdf/2204.05862
  • OpenAlex更新:2026-08-20
  • 待LLM分类:否
  • 标题中文:使用人类反馈强化学习训练有用且无害的助手
  • TLDR中文:采用迭代的在线训练模式,按周节奏用新的人类反馈数据更新偏好模型与 RL 策略,并发现 RL 奖励与策略相对其初始化的 KL 散度平方根之间近似呈线性关系。
  • 来源文件
  • [OpenAlex discover]
  • [S2 enrich]