Dylsimple60/RLHF_learn
- 类型:github
- 标识:Dylsimple60/RLHF_learn
- 链接:https://github.com/Dylsimple60/RLHF_learn
- 主题:llm-infra, risk
- 主分类:engineering
- 形态:app
- 分类:ai
- Stars:6
- 周增:+0
- 语言:Python
- 最近提交:2026-08-22
- 简介:🤖 Enhance reinforcement learning stability and efficiency with advanced algorithms like TRPO, PPO, DPO, GRPO, DAPO, and GSPO for optimized policy training.
- 上次采集:2026-08-23
- 首次采集:2026-08-11
- 待LLM分类:否
- 成熟度:experimental
- 简介中文:🤖 利用 TRPO、PPO、DPO、GRPO、DAPO、GSPO 等先进算法提升强化学习的稳定性与效率,优化策略训练。
- 来源文件:
- [GitHub Search]