RRLforge

在一张 5090 上把 RL 跑通

27 节课,终点是同一个:你自己手写一份 GRPO,在单卡 32GB 上把 Qwen3-0.6B 的数学题正确率训上去,然后换成 TRL 框架再跑一遍做对照。 先挑一条和你现在情况最接近的路线 —— 三条线共用同一份进度,随时可以切。

先让 5090 上真的训出点东西,原理边跑边补12 节 · 约 9 小时 · 已完成 0/12

把概念课压到最少,只留理解代码必需的那几节。路线是一条直线:装环境 → 算显存 → 手写 GRPO → 跑通 → 看曲线。中途会有你暂时不懂的地方,标注了「回头看哪一节」,不影响先跑完。

  • 在自己的 5090 上跑完一次完整 GRPO 训练,看到 reward 曲线上升
  • 手上有一份两百行、每行都看得懂的 RL 训练脚本
  • 训练炸了的时候,知道先看哪四条曲线
沿这条路线开始 · 第 1 Blackwell 的工具链地雷:sm_120 到底装什么版本

这条线是挑着学的,没排进来的课不会消失 —— 切到「完整主线」就是按 L0–L4 通读的全部 27 节。三条路线共用同一份进度。