月度归档: 2026 年 9 月

2 篇文章

一言
弱水三千,我只取一瓢饮。——红楼梦·第九十一回
thumbnail
从PPO到DPO的数学推导以及实现
前言 DPO的形式很简单,最终是在一个偏好对数据上进行直接训练 不再显式训练 Reward Model,也不需要 PPO 的强化学习过程,而是直接利用偏好数据优化语言模型。最终的优化目标为: 但这个式子怎么来的呢?实际上是从PPO中推导过来的 PPO 在 RL…
thumbnail
RLHF中的PPO算法——TRL库的PPOTrainer源码分析
前言 上一次了解了RL中的PPO算法,这次我们去debug一个LLM训练框架的PPO算法是如何实现的,我们以hugging face的trl库中的PPOTrainer为例。看一下具体的PPO算法是如何实现的。 强化学习和监督学习的training loop的不…