RRLforge
L1

认料

RL 与后训练的心智模型

用最少的数学把 RL 讲通:为什么能对采样结果求梯度、reward 从哪来、PPO 在防什么、GRPO 又砍掉了什么。这一阶段不写训练代码,但每个概念都对应后面手写代码里的一行。

5 节课 · 约 3 小时已完成 0/5
  1. 1

    RL 的最小心智模型:试、评、改

    原理25 分钟

    不讲马尔可夫决策过程。先用「模型自己生成一批答案,好的多学一点,坏的少学一点」把整件事说完。

    • 用一句话讲清 RL 与监督学习的根本区别:标签是自己采样出来的
    • 把 state / action / reward / policy 对应到 LLM 里的具体东西
    • 说出「为什么不能直接对 reward 做梯度下降」
  2. 2

    LLM 后训练全景:SFT、RM、RLHF、RLVR 各在什么位置

    原理30 分钟

    把你听过的一堆缩写排进一张流程图,知道 GRPO 训的是哪一段、前后各接什么。

    • 画出 预训练 → SFT → 偏好对齐 / 可验证奖励 的完整链路
    • 说清 RLHF 与 RLVR 的区别,以及为什么新手该从 RLVR 起步
    • 判断一个任务该用 SFT、DPO 还是 GRPO
  3. 3

    reward 从哪来:可验证奖励、模型打分、人标

    原理30 分钟仅大纲

    reward 设计是 RL 里唯一真正需要你想清楚的事情。写歪一个 reward,模型会精确地学会钻它的空子。

    • 给一个任务设计出可验证 reward,并预判它会被怎么钻空子
    • 说清格式奖励与正确性奖励为什么要分开给、怎么配权重
    • 识别 reward hacking 的早期信号
  4. 4

    策略梯度:为什么能对「采样出来的东西」求梯度

    原理40 分钟仅大纲

    RL 唯一绕不开的一段数学。这一节只推一个公式,但推完之后 GRPO 的代码你会觉得理所当然。

    • 解释 log-derivative trick:为什么梯度里出现了 log π
    • 说清基线(baseline)为什么能降方差却不引入偏差
    • 把 REINFORCE 的一行公式对应到代码里的 logprob * advantage
  5. 5

    从 PPO 到 GRPO:丢掉 critic 换来了什么

    原理40 分钟

    PPO 的四个模型对单卡是灾难。GRPO 用「组内比较」替掉 critic,这正是 5090 能玩 RL 的原因。

    • 说出 PPO 显存里的四个模型各干什么,以及 GRPO 去掉了哪个
    • 手算一组 reward 的 GRPO 优势值
    • 解释 clip 和 KL 两个约束各在防什么,以及去掉它们会怎样