RRLforge
完整主线 路线10 / 27 · L1 认料退出路线
原理预计 40 分钟

策略梯度:为什么能对「采样出来的东西」求梯度

RL 唯一绕不开的一段数学。这一节只推一个公式,但推完之后 GRPO 的代码你会觉得理所当然。

学完这节你能做到

  • 解释 log-derivative trick:为什么梯度里出现了 log π
  • 说清基线(baseline)为什么能降方差却不引入偏差
  • 把 REINFORCE 的一行公式对应到代码里的 logprob * advantage
正文待编写以下是本节已定稿的小节大纲
  1. 1目标函数:最大化期望 reward
  2. 2log-derivative trick,一步一步推
  3. 3REINFORCE:最朴素的实现,以及它为什么方差大到不可用
  4. 4基线的作用:只关心「比平均好多少」
  5. 5优势函数 advantage 登场
  6. 6代码对照:这个公式在 PyTorch 里就是三行

延伸资料