在一张 5090 上把 RL 跑通
27 节课,终点是同一个:你自己手写一份 GRPO,在单卡 32GB 上把 Qwen3-0.6B 的数学题正确率训上去,然后换成 TRL 框架再跑一遍做对照。 先挑一条和你现在情况最接近的路线 —— 三条线共用同一份进度,随时可以切。
先把公式推明白,代码只是公式的转写13 节 · 约 8 小时 · 已完成 0/13
按概念的依赖顺序走:策略梯度 → 基线 → PPO → GRPO,每一步都落到具体公式。动手部分保留手写实现,因为那是验证你真的懂了的唯一方式;环境和框架的工程细节压后。
- ✓独立推导策略梯度,说清基线为什么降方差不引偏差
- ✓看到 GRPO 的损失函数,能逐项说出每一项在防什么
- ✓读得懂 slime、Miles 这类框架文档里的算法参数
沿这条路线开始 · 第 1 节 这条路需要什么:一张 5090 和一份预期管理
先看清全局
3 节 · 75 分钟知道 RL 在整条后训练链路的哪一段
把数学推一遍
3 节 · 110 分钟这条线的主课,三节课从策略梯度推到 GRPO
用代码验证你的理解
4 节 · 195 分钟公式对不对,跑一遍就知道
看看工业界怎么做
3 节 · 115 分钟同样的算法,放大一千倍之后要解决什么
这条线是挑着学的,没排进来的课不会消失 —— 切到「完整主线」就是按 L0–L4 通读的全部 27 节。三条路线共用同一份进度。