L0
开炉5090 环境与显存账本
在动手写一行 RL 代码之前,先把这张卡摸清楚:工具链装对、显存算得出、推理跑得起来、评测基线量得到。这一阶段的产出是一个「已知能跑」的环境和一张写下起点分数的纸。
0/6
- 1这条路需要什么:一张 5090 和一份预期管理先把话说清楚:单卡 32GB 能做什么、不能做什么,以及为什么这不影响你学会 RL。20 分
- 2Blackwell 的工具链地雷:sm_120 到底装什么版本5090 是 sm_120,用错一个 wheel 就是「no kernel image is available」。这一节把环境一次装对,并留下验证命令。实验40 分
- 3显存账本:32GB 到底放得下什么RL 训练要同时装下策略模型、优化器状态、参考模型和一个推理引擎。这一节把这笔账算清,用计算器验证。计算器45 分
- 4第一次推理:把 vLLM 跑起来,量出你的 tok/sRL 的墙钟时间大头在采样。先把推理引擎跑起来,测出这张卡的真实吞吐,后面所有时间估算都以它为基准。实验35 分
- 5先量起点:数据集与评测基线RL 只能证明「比训练前好」。所以第一件事是量出训练前的分数,否则后面所有曲线都没有意义。实验35 分
- 6token 与 chat template:新手翻车最密集的地方一半的「RL 不收敛」其实是模板拼错、EOS 没停、mask 错位。这一节把这些坑提前踩掉。30 分