RRLforge

实验与闯关

RL 是一门只能靠跑才能学会的手艺 —— 公式看懂了,第一次跑起来照样会 OOM、会不收敛。 这里把全部动手环节汇总在一起,你可以脱离课程顺序直接来练。

动手实验

需要一张 RTX 5090(或任意 ≥24GB 的卡),跟着步骤把训练真的跑起来。
L0 开炉40 分钟

Blackwell 的工具链地雷:sm_120 到底装什么版本

5090 是 sm_120,用错一个 wheel 就是「no kernel image is available」。这一节把环境一次装对,并留下验证命令。

L0 开炉35 分钟

第一次推理:把 vLLM 跑起来,量出你的 tok/s

RL 的墙钟时间大头在采样。先把推理引擎跑起来,测出这张卡的真实吞吐,后面所有时间估算都以它为基准。

L0 开炉35 分钟仅大纲

先量起点:数据集与评测基线

RL 只能证明「比训练前好」。所以第一件事是量出训练前的分数,否则后面所有曲线都没有意义。

L2 手锻45 分钟

写 rollout:让模型自己生成一批答案

训练数据不是给的,是采的。这一节把「一个 prompt 采 8 条回答」写出来,并处理好 token 对齐。

L2 手锻35 分钟

写 reward 函数:把「答对了」变成一个数

两个 reward:答案对不对、格式规不规范。加起来就是这一轮的分数。

L2 手锻50 分钟

GRPO 的核心 20 行:优势、ratio、clip、KL

整个算法真正的实现只有二十行。这一节逐行写出来,并用打印验证每个中间量。

L2 手锻60 分钟

拼成训练循环:第一次真正的 RL 训练

把 rollout、reward、loss 串起来,加上权重同步和显存管理,在 5090 上跑完第一次训练。

L2 手锻60 分钟仅大纲

把分数再往上推:三轮迭代实验

同一套代码,只改超参和 reward,做三轮对照实验,把 GSM8K 分数推到你能达到的最高点。

L3 上机50 分钟

TRL GRPOTrainer:5090 单卡实跑

把手写脚本换成 TRL,跑同一个任务、比同一个分数。这是本站唯一在 5090 上被验证过的框架路径。

L3 上机40 分钟

训推同卡:colocate 的显存怎么分

单卡上训练和推理抢同一块 32GB。这一节把 colocate 模式调稳,并知道它比多卡慢在哪。

L4 淬火40 分钟仅大纲

评测:别用训练集骗自己

把评测做成一条能重复执行的流水线,让每次实验的分数可比。

闯关

在模拟终端里接手一次出问题的训练,从日志和曲线里找出根因。

计算器

改参数看结果:显存装不装得下、一次实验要跑多久。