从PPO到DPO的数学推导以及实现 前言 DPO的形式很简单,最终是在一个偏好对数据上进行直接训练 不再显式训练 Reward Model,也不需要 PPO 的强化学习过程,而是直接利用偏好数据优化语言模型。最终的优化目标为: 但这个式子怎么来的呢?实际上是从PPO中推导过来的 PPO 在 RL…
|
33
|
|
1421 字
|
6 分钟
RLHF中的PPO算法——TRL库的PPOTrainer源码分析 前言 上一次了解了RL中的PPO算法,这次我们去debug一个LLM训练框架的PPO算法是如何实现的,我们以hugging face的trl库中的PPOTrainer为例。看一下具体的PPO算法是如何实现的。 强化学习和监督学习的training loop的不…
|
54
|
|
2464 字
|
12 分钟