RRLforge

在一张 5090 上把 RL 跑通

27 节课,终点是同一个:你自己手写一份 GRPO,在单卡 32GB 上把 Qwen3-0.6B 的数学题正确率训上去,然后换成 TRL 框架再跑一遍做对照。 先挑一条和你现在情况最接近的路线 —— 三条线共用同一份进度,随时可以切。

先把公式推明白,代码只是公式的转写13 节 · 约 8 小时 · 已完成 0/13

按概念的依赖顺序走:策略梯度 → 基线 → PPO → GRPO,每一步都落到具体公式。动手部分保留手写实现,因为那是验证你真的懂了的唯一方式;环境和框架的工程细节压后。

  • 独立推导策略梯度,说清基线为什么降方差不引偏差
  • 看到 GRPO 的损失函数,能逐项说出每一项在防什么
  • 读得懂 slime、Miles 这类框架文档里的算法参数
沿这条路线开始 · 第 1 这条路需要什么:一张 5090 和一份预期管理

这条线是挑着学的,没排进来的课不会消失 —— 切到「完整主线」就是按 L0–L4 通读的全部 27 节。三条路线共用同一份进度。