在一张 5090 上把 RL 跑通
27 节课,终点是同一个:你自己手写一份 GRPO,在单卡 32GB 上把 Qwen3-0.6B 的数学题正确率训上去,然后换成 TRL 框架再跑一遍做对照。 先挑一条和你现在情况最接近的路线 —— 三条线共用同一份进度,随时可以切。
先让 5090 上真的训出点东西,原理边跑边补12 节 · 约 9 小时 · 已完成 0/12
把概念课压到最少,只留理解代码必需的那几节。路线是一条直线:装环境 → 算显存 → 手写 GRPO → 跑通 → 看曲线。中途会有你暂时不懂的地方,标注了「回头看哪一节」,不影响先跑完。
- ✓在自己的 5090 上跑完一次完整 GRPO 训练,看到 reward 曲线上升
- ✓手上有一份两百行、每行都看得懂的 RL 训练脚本
- ✓训练炸了的时候,知道先看哪四条曲线
沿这条路线开始 · 第 1 节 Blackwell 的工具链地雷:sm_120 到底装什么版本
先把环境和账算清楚
3 节 · 120 分钟这三节不跳,跳了后面全是 OOM 和玄学报错
手写并跑通
4 节 · 190 分钟这条线的主体,四节课拼出一个能跑的训练脚本
跑完之后
3 节 · 135 分钟看懂自己跑出来的东西,再上一次框架做对照
这条线是挑着学的,没排进来的课不会消失 —— 切到「完整主线」就是按 L0–L4 通读的全部 27 节。三条路线共用同一份进度。