原理预计 40 分钟
策略梯度:为什么能对「采样出来的东西」求梯度
RL 唯一绕不开的一段数学。这一节只推一个公式,但推完之后 GRPO 的代码你会觉得理所当然。
学完这节你能做到
- 解释 log-derivative trick:为什么梯度里出现了 log π
- 说清基线(baseline)为什么能降方差却不引入偏差
- 把 REINFORCE 的一行公式对应到代码里的 logprob * advantage
正文待编写以下是本节已定稿的小节大纲
- 1目标函数:最大化期望 reward
- 2log-derivative trick,一步一步推
- 3REINFORCE:最朴素的实现,以及它为什么方差大到不可用
- 4基线的作用:只关心「比平均好多少」
- 5优势函数 advantage 登场
- 6代码对照:这个公式在 PyTorch 里就是三行