Dylsimple60/RLHF_learn

  • 类型:github
  • 标识:Dylsimple60/RLHF_learn
  • 链接:https://github.com/Dylsimple60/RLHF_learn
  • 主题:llm-infra, risk
  • 主分类:engineering
  • 形态:app
  • 分类:ai
  • Stars:6
  • 周增:+0
  • 语言:Python
  • 最近提交:2026-08-22
  • 简介:🤖 Enhance reinforcement learning stability and efficiency with advanced algorithms like TRPO, PPO, DPO, GRPO, DAPO, and GSPO for optimized policy training.
  • 上次采集:2026-08-23
  • 首次采集:2026-08-11
  • 待LLM分类:否
  • 成熟度:experimental
  • 简介中文:🤖 利用 TRPO、PPO、DPO、GRPO、DAPO、GSPO 等先进算法提升强化学习的稳定性与效率,优化策略训练。
  • 来源文件
  • [GitHub Search]