RRLforge
L4

淬火

评测、调参与排障

能跑通只是起点。这一阶段处理真正决定成败的部分:怎么评得可信、参数按什么顺序调、五种常见炸法怎么认怎么救,以及一次实验到底要花多久。

5 节课 · 约 3 小时已完成 0/5
  1. 1

    闯关:五种炸法

    闯关45 分钟

    熵崩塌、reward hacking、长度爆炸、KL 跑飞、OOM。每一种给现场证据,你来判断和处置。

    • 看到日志和曲线就能认出是哪一种失效
    • 对每种失效给出第一步处置动作,而不是把所有参数都动一遍
    • 知道哪些失效是必须重启训练的,哪些可以边跑边救
  2. 2

    评测:别用训练集骗自己

    实验40 分钟仅大纲

    把评测做成一条能重复执行的流水线,让每次实验的分数可比。

    • 搭一条固定种子、固定采样参数的评测流程
    • 说清 greedy 与采样、pass@1 与 pass@k 分别适合报什么
    • 识别评测污染与「过拟合到测试集」的迹象
  3. 3

    调参优先级:先动哪三个旋钮

    原理35 分钟仅大纲

    十几个超参不必都调。按影响排序,前三个决定成败,剩下的基本不用碰。

    • 按影响力给 GRPO 的超参排序,并说出每个的合理起始值
    • 判断一个现象该调哪个参数,而不是全部微调一遍
    • 在有限的卡时里设计出信息量最大的实验序列
  4. 4

    时间账:一次实验到底要跑多久

    计算器30 分钟

    用你在 L0 测出的 tok/s,算出一次实验的墙钟时间。计算器帮你在开跑之前就知道要等多久。

    • 估出一次训练的总时长,误差在 30% 以内
    • 说出 rollout 与训练各占多少时间,以及该优化哪一头
    • 在给定时间预算下反推出该缩哪个参数
  5. 5

    走完之后:下一道门在哪

    原理25 分钟仅大纲

    你已经能在单卡上完整跑一轮 RL。接下来是 agentic RL、多轮工具调用、更大的模型——以及它们各自要求什么。

    • 知道 agentic RL 与单轮 RLVR 在工程上的差别
    • 列出继续深入需要补的三块知识
    • 给自己排一个下一步的具体项目